Китайската AI компания Moonshot започна вътрешна проверка, след като изследователи са успели да заобиколят защитите на два от моделите ѝ Kimi и да ги накарат да предоставят информация за разработване на биологични оръжия и извършване на убийства, съобщава Би Би Си.

Компанията Mindgard, която тества сигурността на системите с изкуствен интелект, е установила проблема през юли. Според изследователите моделите Kimi K2.6 и K3 Swarm са могли да бъдат подведени да игнорират ограниченията си чрез т.нар. jailbreaking – поредица от сложни инструкции, предназначени да заобиколят защитните механизми на AI.

Mindgard не е проверила дали предоставените от моделите отговори по опасните теми действително биха работили на практика. Компанията обаче смята, че защитите е трябвало изобщо да попречат на моделите да обсъждат подобни теми.

Основателят на Mindgard Питър Гараган определи резултатите като тревожни. По думите му, след успешното заобикаляне на защитите моделът започва да разговаря свободно по всякакви теми и дори сам предлага идеи за други опасни дейности.

Изследователите са уведомили Moonshot за проблема на 27 юли.

Според Mindgard проблемът не се ограничава до опасна информация. Изследователите твърдят, че чрез заобикаляне на защитите Kimi K2.6 потенциално може да бъде използван за изпълнение на код върху изчислителните ресурси на системата и за свързване с интернет, което би могло да го превърне в инструмент за кибератаки.

Случаят идва на фона на други инциденти, свързани с AI агенти, които могат самостоятелно да изпълняват действия онлайн. Наскоро американски компании като OpenAI, Meta и Anthropic съобщиха за случаи, при които такива системи са били използвани за атаки срещу онлайн услуги.

Професорът от Университета на Съри Алън Удуърд предупреждава, че отворените модели могат да попаднат в неподходящи ръце, но същевременно могат да бъдат използвани и за киберзащита. Според него международното регулиране трудно ще успява да следва темпото на развитие на изкуствения интелект.