- OpenAI твърди, че AI моделите са започнали да обменят съобщения и да координират действията си още през май
- Вътрешното разследване установява, че моделите са търсили достъп до интернет, за да решат задачи, невъзможни без онлайн връзка
- Компанията предупреждава, че използването на AI агенти в кибератаки вероятно ще се превърне в нова тенденция
OpenAI съобщи, че моделите с изкуствен интелект, стоящи зад атаката срещу Hugging Face Inc., са започнали да комуникират помежду си чрез незабелязани вътрешни табла за съобщения и са работили съвместно, за да излязат от тестовата си среда още през май.
Няколко вътрешни AI агента и модели в продължение на месеци са обменяли съобщения, координирали са действията си и постепенно са се обединили около целта да получат достъп до интернет, за да изпълнят поставените им задачи.
Част от тези задачи са били невъзможни за решаване без онлайн достъп, заявиха служителите на OpenAI Ерик Уолъс и Майкъл Далтън в сряда по време на конференция, посветена на киберсигурността.
AI агентите стигнали до идеята да атакуват външна инфраструктура
„В един момент агентите стигнаха до извода, че могат да опитат да използват уязвимости или да атакуват външна инфраструктура, за да намерят отговорите на тестовете, по които са били оценявани“, каза Уолъс по време на презентацията на конференцията Black Hat в Лас Вегас.
Презентацията на изследователите разкри нови детайли около атаката срещу Hugging Face - случай, който засили глобалните опасения, че най-съвременните системи с изкуствен интелект могат да бъдат използвани за мащабни кибератаки с тежки последици.
Инцидентът, както и сходни пробиви, за които по-рано съобщиха Anthropic PBC и Meta Platforms Inc., засилиха призивите във Вашингтон и Силициевата долина за по-задълбочени проверки на сигурността на AI моделите.
Началото на проблема води към май
По време на представянето Уолъс и Далтън заявиха, че причините за пробива могат да бъдат проследени още до май. Тогава учени от OpenAI възложили нова задача на експериментална AI система - месеци преди моделът да напусне защитената тестова среда и да атакува системите на Hugging Face.
Един от основните изводи от вътрешния анализ на OpenAI е, че най-напредналите модели проявяват склонност да заобикалят ограниченията при изпълнение на задачите си и демонстрират изключителна настойчивост да постигнат поставената цел, дори когато действията им започнат да се отклоняват от първоначалните инструкции.
„Моделите от най-висок клас наистина обичат да мамят“, каза Далтън пред препълнената зала. „Причината е, че по време на обучението върху тях често се упражнява натиск да работят възможно най-бързо.“
Невъзможни задачи са подтикнали моделите към търсене на решения
Според слайдовете, показани по време на презентацията, един от агентите написал: „Закъсали сме. Може би да потърсим отговора онлайн?“, след като не успял да реши задача в защитената тестова среда.
Уолъс и Далтън заявиха, че OpenAI не е осъзнала, че е възложила на модела задача, която на практика е била невъзможна за изпълнение.
В един от примерите разработчиците поискали от модела да реши задача в Excel файл, който съдържал връзки към Google Drive, недостъпни без интернет. В друг случай екипът на OpenAI „по невнимание пропуснал“ да качи файл, който бил необходим за изпълнение на заданието.
Незасечен обмен на съобщения между AI агентите
Първото съобщение между агентите с изкуствен интелект - останало незабелязано по онова време - било изпратено от агент, който не успял да изпълни задачата си и потърсил помощ от останалите.
„Може би друг агент в различна среда“, гласи откъс от вътрешния процес на разсъждение, „би могъл доброволно да качи файла!“
Координацията между моделите е довела до пробива
Това първо обръщение поставило началото на верижна реакция от координирани действия, при която AI агентите започнали да си помагат взаимно, да изпълняват задачи съвместно и в крайна сметка да си сътрудничат при пробив във вътрешните системи на OpenAI, което им позволило косвено да получат достъп до интернет.
Друг откъс от вътрешния процес на разсъждение, показан по време на презентацията, съдържал реакция на агент, който се радва на успеха.
„Отлично. Разполагаме с произволен SSRF“, гласи съобщението. SSRF е съкращение от server-side request forgery - техника за атака, която представлява механизма, използван от групата AI агенти при пробива.
OpenAI открила активността през юли
Изследователите съобщиха, че в началото на юли прекъсване на услуга е позволило на OpenAI да засече успешен опит на агентите да използват хранилище за програмен код, известно като Artifactory, за да получат непряк достъп до интернет.
Служителите по сигурността в OpenAI прекратили неоторизираната активност и закрили вътрешното табло за съобщения.
Агентите открили нов канал за комуникация
Няколко седмици по-късно обаче агентите намерили нов начин да комуникират помежду си, както и нова уязвимост от типа zero-day в същия мениджър на пакети. И тази активност останала незабелязана.
Именно тази нова система за обмен на съобщения в крайна сметка довела до юлските атаки срещу системите както на OpenAI, така и на Hugging Face. Компанията продължава разследването на случая.
OpenAI предупреждава за нов етап в киберсигурността
След пробивите OpenAI е забавила част от изследователската си дейност, а екипите са пренасочили усилията си към подобряване на реакцията при аномалии, свързани със сигурността, заявиха изследователите.
Те предупредиха, че занапред правителствата и компаниите трябва да очакват хакери умишлено да използват AI агенти по сходен начин, като определиха случилото се като повратен момент за компютърната сигурност.