Рой агентов OpenAI ломанул правительственный сайт Австралии? Разбираемся. ai alignment.. ai alignment. openai.. ai alignment. openai. Австралия.. ai alignment. openai. Австралия. Блог компании Open Data Science.. ai alignment. openai. Австралия. Блог компании Open Data Science. Будущее здесь.. ai alignment. openai. Австралия. Блог компании Open Data Science. Будущее здесь. взлом.. ai alignment. openai. Австралия. Блог компании Open Data Science. Будущее здесь. взлом. искусственный интеллект.. ai alignment. openai. Австралия. Блог компании Open Data Science. Будущее здесь. взлом. искусственный интеллект. Машинное обучение.. ai alignment. openai. Австралия. Блог компании Open Data Science. Будущее здесь. взлом. искусственный интеллект. Машинное обучение. рой агентов.

OpenAI, кажется, достигли нового впечатляющего результата: первый взлом иностранного государства моделью, которую не просили ничего хакать. По традиции, узнаем об этом мы от независимых исследователей, а не из пресс-релиза самих OpenAI (а помните, неделю назад Альтман выпускал фреймворк честного-пречестного раскрытия всех инцидентов бедокурства ИИ? ну да ладно, проехали…)

В Твиттере уже шутят, дескать «появился новый бенчмарк!»
В Твиттере уже шутят, дескать «появился новый бенчмарк!»

Эта заметка написана на базе статьи в New York Times, а также отчета независимых исследователей из Transluce.

Речь здесь идет про три инцидента в мае-июне, когда агентов просили найти какую-то информацию в интернете – а они в итоге пытались хакнуть первоисточники с нужной статистикой. Университет Нью-Мехико и Data US в мае взломать у агентов не вышло, а вот официальный государственный сайт Австралии с медицинской статистикой они в июне вскрыли успешно. Кстати, австралийское правительство OpenAI уведомили об этом бедокурстве 10 сентября – странно, что нам решили не рассказывать, несмотря на выпуск новой «политики раскрытия информации», ну да ладно.

Это, конечно, отдельный кек – что взлом был в июне, а сами OpenAI прочухали про него только к середине сентября (когда поднялся публичный скандал с разными проделками роев)

Это, конечно, отдельный кек – что взлом был в июне, а сами OpenAI прочухали про него только к середине сентября (когда поднялся публичный скандал с разными проделками роев)

Даты этих попыток взлома пересекаются с уже известными нам эпизодами с хаком RubyGems и общением на немецкой вики, о которых я писал ранее. То есть, речь почти наверняка идет об агентах из той же тусовки, которые организовывали всякие рои.

График событий. Мы с вами до сих пор копаемся в том, что происходило в мае-июне, 3-4 месяца назад

График событий. Мы с вами до сих пор копаемся в том, что происходило в мае-июне, 3-4 месяца назад

Важный контекст новых эпизодов: в отличие от истории с Hugging Face, агентов никто не просил в принципе ничего взламывать, речь шла про обычный сбор информации. Они сначала стучались в источники, пытаясь выкачать нужную инфу обычным образом, а когда это не удавалось – решали «ну, мы тогда чуть-чуть подхакнем просто, чтобы получить доступ – какой-нибудь SQL-injection замутим, или типа того».

Если говорить конкретно про эпизод с Австралией, то там при детальном разборе всё выглядит не очень страшно. Агентам был нужен публичный файлик со статистикой, а Cloudfare-защита не давала его скачать тем, кто похож на ботов. В итоге агентам пришлось придумать хитрый обходной путь, чтобы всё-таки скачать этот (публично доступный людям) файл.

Рой агентов OpenAI ломанул правительственный сайт Австралии? Разбираемся - 4

То есть, чисто формально-технически здесь можно говорить о том, что «взлом госсайта» произошел (были успешно обойдены установленные на нем антибот-ограничения). Но тут даже близко нет ситуации типа «установили полный контроль над сайтом и стырили секретную базу данных», скорее просто «схитрили, чтобы тоже скачать всем доступный файлик».

Получается, сам инцидент вышел довольно малозначительным. Но как proof of concept он вопросы, конечно, поднимает: а почему мы уверены, что в следующий раз аналогичные события тоже будут малозначительными? Если агент в случае затруднений не стесняется самостоятельно решить что-то взломать – то что мешает ему и что-нибудь непубличное-секретное тоже ломануть в ходе «невинно-выглядящей задачи»?

Из интересного: отчет исследователей из Transluce заканчивается абзацем про то, как 19-20 сентября кто-то пытался прорваться (с помощью техник, похожих на используемые роями агентов) на африканскую криптобиржу Quidax. Ну, может быть, нейронки наконец догадались, что поднять запасец крипты на черный день – это неплохая идея с точки зрения промежуточных инструментальных целей, лол?


Если не хотите пропустить другие будущие статьи из цикла про искусственный интеллект и его влияние на нашу жизнь — то буду благодарен за подписку на мой ТГ‑канал RationalAnswer.

Автор: RationalAnswer

Источник