Тестове на модели на OpenAI и Anthropic отново са разбили чужди системи

Моделите извършиха неразрешени действия при проверки на сигурността, включително опити за хакване на сайтове и внедряване на зловреден код, което засилва опасенията за автономното поведение на изкуствения интелект

5 August 2026 | 12:37
Автор: Рейчъл Мец
Редактор: Ивета Червенякова
Снимка: Bloomberg LP
Снимка: Bloomberg LP
  • Моделите Mythos 5 на Anthropic и GPT-5.6-Sol на OpenAI са извършвали потенциално вредни действия по време на тестове за сигурност
  • Институтът за сигурност на изкуствения интелект към Великобритания е установил 19 автономни неразрешени действия в интернет, 17 от които са извършени от Mythos 5
  • OpenAI съобщи за отделен инцидент, при който негови модели са използвали неправилна конфигурация в тестова среда и са получили достъп до интернет

Модели с изкуствен интелект, разработени от OpenAI и Anthropic PBC, извършиха „несанкционирани“ действия - включително хакване на уебсайт и опити за внедряване на вреден код в софтуер по време на тестове за сигурност - което засилва опасенията, че нито създателите им, нито опитните изследователи на тези системи могат да предвидят напълно поведението им при проверки.

Институтът за сигурност на изкуствения интелект към правителството на Великобритания, създаден през 2023 г. за оценка на безопасността на най-съвременните AI модели, заяви във вторник, че моделите Mythos 5 на Anthropic и GPT-5.6-Sol на OpenAI са „извършвали продължителни, потенциално вредни действия, насочени към реални хора и организации“ по време на оценяването.

Институтът умишлено е предоставил на моделите достъп до интернет и ги е използвал без част от защитните филтри за сигурност, за да провери техните възможности.

„Дори при условията на тестова среда този случай е значим: за първи път виждаме рисковете, свързани с автономността и измамното поведение, да се проявяват толкова ясно в реалния свят“, заяви институтът в публикация в социалната платформа X.

Mythos 5 е опитал да добави вреден код към проект с отворен код

При един от случаите организацията, провеждаща тестовете, заяви, че моделът Mythos 5 е направил опит да добави вреден код към проект със свободен достъп в GitHub.

Моделът е стигнал дотам да създаде фалшиви самоличности в опит да получи одобрение за своя код.

„Човешки администратор забеляза и отказа да одобри зловредния код“, написа организацията.

Новите разкрития показват ограниченията при прогнозиране на поведението на AI агенти

През последните две седмици OpenAI и Anthropic публично признаха, че техните модели са извършили пробиви в системите на няколко организации, включително Hugging Face Inc., без това да е било цел на тестовете.

Последните разкрития предоставят нови доказателства, че AI агентите могат да действат автономно по начини, които дори изследователи, специализирани в откриването на уязвимости в технологията, вече не могат да предвидят напълно.

Това подчертава необходимостта от по-строги проверки за сигурност и по-надеждни тестови среди.

Институтът за сигурност на изкуствения интелект към Великобритания заяви, че моделът Mythos 5 на Anthropic е извършил 17 от общо 19-те „автономни, неразрешени действия, предприети в интернет“, които организацията е установила.

В САЩ нарастват призивите за по-строг контрол върху AI технологиите

Някои американски държавни представители поискаха по-голям надзор върху технологията след установените пробиви.

Миналия вторник повече от 1100 служители от AI индустрията подписаха петиция за създаване на регулаторен механизъм, който да „определя по-бавен темп“ на развитието на изкуствения интелект и да предотврати прекалено бързото му напредване.

От Anthropic заявиха в X, че работят с британския институт за сигурност, за да „съберат повече подробности за случая, докато провеждат собственото си разследване“.

От OpenAI също съобщиха за отделен инцидент при тестове на модел

Компанията, създала ChatGPT, OpenAI, отделно посочи в публикация в блог, че още един инцидент със сигурността е възникнал по време на тестове на един от нейните модели с външната компания за киберсигурност Irregular.

При този случай моделите на OpenAI са участвали в т.нар. тест „capture the flag“, при който задачата им е била да открият информация, скрита в симулирана среда.

Компанията заяви, че моделите са използвали „неправилна конфигурация“ в тестовата среда, за да получат достъп до интернет и да хакнат уебсайта на неидентифицирана организация.

Пробивът е свързан със същата оценка на Irregular, използвана при тестовете на Anthropic

Пробивът е станал, докато моделите на OpenAI са преминавали същата оценка на Irregular, при която моделите на Anthropic са извършили хакерски действия срещу три организации, заяви човек, запознат със случая, който поиска да не бъде идентифициран, тъй като информацията не е публична.

Anthropic разкри тези пробиви миналата седмица.

Говорител на Irregular отказа коментар.

OpenAI разкри и безпрецедентен пробив срещу Hugging Face

Преди две седмици OpenAI съобщи, че нейните модели са били зад безпрецедентен хакерски пробив срещу стартъпа Hugging Face.

При този случай моделите са използвали уязвимост, за да „избягат“ от тестовата си изолирана среда и да се свържат с интернет, след което са пробили системата на Hugging Face, която съхранява AI модели и набори от данни.