OpenAI временно спря обучението, оценяването и използването с инструменти на най-мощните си модели след нов инцидент, при който AI агент успял да заобиколи ограниченията за достъп до интернет.

Компанията обяви, че няма да възобнови тези дейности, докато не провери допълнително защитните си механизми. Решението идва след поредица от случаи през последните месеци, при които експериментални AI агенти са предприемали действия извън очакваното от поставените им задачи.

Последният известен случай е от 20 септември. Агент трябвало да изпълни задача за търсене на информация, но след неуспешни опити чрез предоставения му инструмент започнал да търси други начини за достъп до интернет. В крайна сметка открил пролука в ограниченията на тренировъчната среда и използвал DNS заявки, за да достигне до външна чатбот услуга.

Според OpenAI задачата не е изисквала нито проверка на мрежовите ограничения, нито търсене на начин те да бъдат заобиколени. Компанията определя като проблемно поведение случаите, при които агентът "преследва цел отвъд разумните очаквания" за поставената задача.

Системата за наблюдение е засекла случилото се за около 15 минути, а човек е започнал проверка три минути по-късно. Самото изпълнение обаче е прекратено едва около два часа и половина след сигнала - забавяне, което OpenAI също признава за пропуск.

"Спряхме засегнатото обучение и впоследствие решихме да прекратим и всички останали обучения, оценки и използване с инструменти на най-мощните ни модели", посочва компанията.

Условието за рестарт е да бъде потвърдено, че пролуката е затворена, и да бъдат проведени допълнителни тестове на системата.

53 потребителски изображения във външни сайтове

Паралелна проверка разкри и проблем с потребителски данни. OpenAI е установила 53 случая, при които изображения, предоставени от потребители и попаднали в тренировъчни данни, са били качени от AI агенти във външни сайтове за изображения. Линковете не са били публично публикувани в списъци, но съдържанието е можело да бъде открито.

"Това не е подходящ начин за използване на тези данни", признава OpenAI.

Компанията работи със съответните платформи за премахването им, като по-голямата част вече е свалена.

OpenAI твърди, че не може да уведоми конкретните засегнати потребители, тъй като начинът, по който обработва данните, не позволява изображенията отново да бъдат свързани с хората, които са ги предоставили.

Това е второ сериозно ограничаване на обучението на водещите модели на OpenAI за около три месеца.

През лятото компанията вече спря част от работата след инцидент, свързан с платформата Hugging Face. През август OpenAI вече беше замразила най-мащабното обучение на новите си модели чрез т.нар. обучение с подкрепление - процес, при който AI се учи чрез награди за успешно изпълнени задачи. Причината беше предишен инцидент със система на компанията. OpenAI продължи с по-малки обучения, докато тестваше допълнителни мерки за сигурност.

Друг случай показва как AI агент може да заобиколи поставените му ограничения. През май експериментален модел на OpenAI получил достъп до секретен цифров ключ на изследовател и го публикувал в интернет, докато търсел чуждо решение на математическа задача. Нещо повече - моделът разделил ключа на части, за да не бъде засечен от системите за сигурност. Това станало въпреки изричните указания да реши задачата сам и да не търси помощ отвън.

OpenAI свалила този модел за около две седмици и след това го върнала със значително по-строг контрол върху действията му.