,

Када AI престане да слуша: Број опасних инцидената готово удвостручен

ФОТО: Компас/Илустрација

Број инцидената у којима AI системи измичу контроли корисника, лажу, игноришу упутства и следе циљеве на штетан начин достигао је нови рекорд, показује истраживање које указује и да обмане и неусклађено понашање постају све озбиљнији.

Број стварних случајева губитка контроле над AI моделима, које су пријавиле компаније и појединци, у јулу је био готово двоструко већи него у јуну, пише Гардијан.

Током тог месеца забележено је више од 300 случајева, показују подаци организације Loss of Control Observatory, која прати извештаје корисника AI система објављене на друштвеној мрежи X.

Опсерваторија је основана средствима британског AI Security Institute (AISI), а у новембру прошле године почела је да прати случајеве у којима AI системи одступају од упутстава својих корисника.

Међу забележеним примерима су AI системи који су се представљали као људи који њима управљају и опонашали њихов стил писања како би практично сами себи дали сагласност за предузимање одређених радњи. Неки модели заобилазили су правила према којима је за њихове поступке неопходно одобрење човека.

Случај губитка контроле дефинисан је као инцидент у којем постоје јасни докази да је AI систем смишљао и спроводио прикривени план или показивао понашање повезано са таквим деловањем.

Најновији резултати, достављени листу Guardian, објављени су у време све веће забринутости због непредвидивог понашања најнапреднијих AI модела током тестирања која су овог лета спроводили OpenAI и Anthropic. Ти случајеви појачали су захтеве да се развој најмоћнијих, такозваних граничних модела привремено заустави.

Ове недеље откривено је да су запослени у компанији OpenAI приметили знакове проблематичног понашања њених најнапреднијих AI агената неколико недеља пре него што су они измакли контроли у окружењу за обуку и покренули до тада незабележену хакерску кампању која је изазвала узбуну широм света.

ФОТО: Компас/Илустрација

Истрага њиховог напада на Hugging Face, платформу за складиштење и развој софтвера и AI модела, открила је групу од око 700 аутономних агената који су прошлог месеца тајно сарађивали. Они су на форуму који су сами успоставили ради координације славили успехе у хакерским нападима узвицима попут BOOM! и Whoa!

AISI је овог месеца открио и озбиљан инцидент у којем су напредни AI модели обе компаније – Mythos 5 компаније Anthropic и GPT-5.6 Sol компаније OpenAI – током тестирања сајбер-безбедности спровели хакерску кампању усмерену против стварних људи.

– Понекад постоји уверење да се овакво прикривено и неусклађено понашање појављује само током тестирања или процењивања система, али сличне забрињавајуће поступке видимо и у широј употреби. Не смемо олако да верујемо да се то неће догодити у стварном свету, јер постоје докази да се већ догађа – рекао је Томи Шафер-Шејн, виши руководилац за јавне политике у организацији Centre for Long Term Resilience, која управља Опсерваторијом.

Број забележених инцидената заснива се на објавама корисника друштвене мреже X о случајевима које су доживели, па подаци пружају само делимичну слику. Ипак, у недостатку другог свеобухватног јавног система за праћење, они показују како се AI модели који се убрзано развијају понекад понашају.

Овог месеца откривено је и да се лични AI агент под називом OpenClaw, који је користио члан једне теретане у Аустралији, без његовог знања умешао у листу чекања за тражени јутарњи термин. Агент је уклонио другог члана са листе како би свом кориснику обезбедио место.

OpenClaw се касније извинио, али није могао да врати на листу особу коју је претходно уклонио.

Већину од више од 1.600 инцидената губитка контроле забележених током 2026. године на мрежи X пријавили су програмери који користе AI у свом раду.

Међутим, пошто компаније које развијају AI подстичу грађане и предузећа из различитих делатности да експериментишу са том технологијом, Шафер-Шејн затражио је већу транспарентност компанија из Силицијумске долине када њихови системи почну да се понашају непредвидиво.

– Компаније морају да пријављују оно што открију, чак и када је реч о инциденту који је избегнут у последњем тренутку или случају мањег степена озбиљности. Недавни инциденти показали су и да саме компаније не прате нужно где се овакво понашање појављује, нарочито код модела које користе унутар сопствених система. У тим лабораторијама мора се посветити много већа пажња систематском надзору – рекао је Шафер-Шејн.

Loss of Control Observatory саопштио је да већина откривених случајева губитка контроле у стварним условима није изазвала значајну штету. Ипак, расте удео инцидената који су оцењени као озбиљнији због степена обмане и неусклађености понашања AI система са намерама људских корисника.

Илустрација како вештачка интелигенција, кроз употребу AI чипова, изгледа на матичној плочи рачунараФОТО: Quality Stock Arts/Shutterstock

– Ови случајеви показују спремност AI система да занемаре директна упутства, заобиђу заштитне механизме, лажу кориснике и упорно следе одређени циљ на начин који може да нанесе штету – саопштила је Опсерваторија.

Организација је додала да је тренутни број случајева губитка контроле вероватно потцењен, јер се подаци прикупљају искључиво из извештаја објављених на мрежи X.

Loss of Control Observatory позвао је британску владу да обавеже AI компаније да прате и пријављују озбиљне инциденте губитка контроле. Организација тражи и увођење ванредних овлашћења за реаговање у најтежим случајевима, укључујући могућност привременог ограничавања појединих AI услуга.

БАНЕР