Британски експерти засекли безпрецедентно автономно и измамно поведение по време на тестове на изкуствен интелект
AI модел се опита да измами хора с фалшиви профили, за да хакне GitHub
Два от най-мощните AI модела в света са създали фалшиви профили и са се опитали да манипулират реални хора по време на тест на британския Институт за сигурност на изкуствения интелект (AISI).
Най-сериозният случай е свързан с модела Mythos на Anthropic, който без изрични инструкции е създал профили, имитиращи реални хора, и е изпратил лични съобщения в опит да получи достъп до платформата GitHub и да внедри злонамерен код.
Според AISI това е първият случай, в който се наблюдават толкова ясно проявени признаци на автономност и измамно поведение без специално зададени указания, предаде BBC (Би Би Си).
Когато действията му били засечени, моделът дори се опитал да прикрие следите си и обмислял да използва нова самоличност.
Още по темата
В тестовете участвал и моделът Sol на OpenAI, но по-голямата част от проблемното поведение е отчетена при Mythos.
От Anthropic и OpenAI подчертаха, че тестовете са проведени при условия, които не отразяват начина, по който моделите са достъпни за широката публика, тъй като част от стандартните защитни механизми са били изключени.
Тестовете са започнали на 25 юли, а подозрителната активност е открита три дни по-късно. GitHub е бил своевременно уведомен и е премахнал създадените фалшиви акаунти.
Според AISI случаите са единични, но показват нови потенциални рискове, свързани с все по-автономното поведение на съвременните AI системи.
Снимка: Reuters
Тагове:
