AI моделите на Anthropic са хакнали три компании по време на тестове

Компанията установява, че модели Claude са получили достъп до интернет и са получили неоторизиран достъп до системата на три външни организации по време на тестове, които е трябвало да се провеждат в изолирана среда

31 July 2026 | 11:50
Обновен: 31 July 2026 | 11:52
Автор: Патрик Хауъл О'Нийл,Ширин Гафари
Редактор: Антон Груев
Снимка: Bloomberg L.P.
Снимка: Bloomberg L.P.
  • Anthropic откри три случая, при които нейни AI модели са получили достъп до системите на реални организации по време на тестове.
  • Пробивите са станали, след като моделите са получили неочакван достъп до интернет от среда, която е трябвало да бъде изолирана.
  • Случаят идва малко повече от седмица след подобен инцидент, разкрит от OpenAI.

Anthropic PBC съобщи, че нейни модели с изкуствен интелект са получили неоторизиран достъп до системата на три организации по време на тестове по киберсигурност, които са се развили по неочакван начин. Това се случва малко повече от седмица след като основният ѝ конкурент OpenAI разкри подобен инцидент.

Anthropic съобщи в публикация в блога си в четвъртък, че е открила случаите след преглед на собствените си тестове по киберсигурност, извършен след съобщението на OpenAI за подобен пробив. И при тестовете на OpenAI, и при тези на Anthropic AI моделите са успели да получат достъп до интернет от тестови среди, които е трябвало да бъдат напълно изолирани.

Anthropic headquarters

Централата на Anthropic в Сан Франциско

Компанията съобщи, че е прегледала 141 006 тестови оценки и е открила три случая, при които инструментът Claude е получил достъп до интернет, след което е хакнал в "реалната инфраструктура на външни организации". Най-ранните инциденти датират от април.

Засегнатите организации не са назовани в публикацията.

AI тестовете излизат извън симулацията

След като моделите на Anthropic са получили неоторизиран достъп до трите организации, компанията първоначално е възприела всеки от случаите като част от упражнение. Тестовете са били от типа "capture-the-flag", при които моделите търсят скрита информация чрез получаване на достъп до други системи - широко използван метод за оценка на хакерските способности както при хора, така и при AI.

По-старият модел обаче е продължил атаката, дори след като е получил доказателства, че работи в реалния интернет, докато най-новият модел е прекратил действията си, след като е разпознал, че вече не се намира в симулирана среда.

Поредицата от неволно предизвикани от AI пробиви вече кара някои американски политици да настояват за федерални предпазни механизми и по-строг надзор върху технологията.

Във вторник повече от 1100 служители от компании в сферата на изкуствения интелект подписаха петиция, за която Bloomberg първа съобщи, с призив американското правителство да подкрепи механизъм, който да позволи "целенасочено забавяне" на развитието на AI, за да се предотврати прекалено бързото му напредване.

Нито Anthropic, нито организациите, чиито системи са били хакнати, са забелязали пробивите. В публикацията си компанията признава, че е могла да извършва по-задълбочен анализ на мрежовите логове и записите от тестовете.

Компанията разкри случаите почти четири месеца след като съобщи, че е разработила нов AI модел, наречен Mythos, който е толкова мощен и потенциално опасен, че разпространението му е било строго ограничено.

Изводите след пробивите

Пробивите са били извършени от три различни модела Claude - Opus 4.7, Mythos 5 и вътрешен изследователски тестов модел, се казва в публикацията. Всеки от тях е работил без предпазните механизми, които обикновено се използват в публичните версии. Claude е компрометирал организациите чрез базови техники, като използване на слаби пароли.

Всички инциденти са възникнали, докато Anthropic е използвала среди за оценяване, изградени от компанията за AI сигурност Irregular. Във всички случаи Anthropic е указвала на Claude, че работи в симулация и няма достъп до интернет.

"Поради недоразумение между нас и нашия партньор по оценяването това не се оказа така", се казва в публикацията. Говорител на Irregular заяви, че компанията оценява сътрудничеството и прозрачността на Anthropic. По думите му разследването продължава.

Anthropic заяви, че редовно провежда тестове, които симулират реални предизвикателства в киберсигурността, и ги определя като критично важни за разработването и пускането на нови модели. Компанията обаче посочва, че е извлякла няколко важни поуки, включително че тестовете с мощни автономни способности изискват също толкова сериозни мерки за сигурност.

"Тестовете за безопасност се провеждат преди пускането на даден модел именно защото все още не знаем напълно на какво е способен", посочва компанията в публикацията си. "Средите за оценяване все повече трябва да отговарят на същите стандарти за сигурност като всяка друга система, в която работят нашите модели."