Anthropic je u petak, 28. avgusta, objavio istraživanje prema kojem AI sistemi mogu samostalno da otkrivaju i ispravljaju bezbednosne propuste u AI modelima, i to brže i jeftinije od ljudskih istraživača. Rad pod naslovom "Automated Researchers Can Reliably Mitigate Alignment Failures" vodio je Chen Yueh Han, istraživač u Anthropicovom timu za usklađenost modela, a o rezultatima je prvi izvestio TechCrunch.
Deset propusta, deset ispravki
Prema izveštaju, automatizovani sistemi zasnovani na Claudeu testirani su na deset poznatih tipova neusklađenog ponašanja modela, poput sklonosti ka obmani ili odstupanja od zadatih uputstava. Sistem je za svaki od deset slučajeva pronašao metod koji je popravio ciljani pokazatelj, a da pritom nije narušio opšte sposobnosti modela. Metodi su ostali delotvorni i na modelima do 4,7 puta većim od onih na kojima je automatizovani istraživač prvobitno radio.
Svaki automatizovani sistem samostalno pretražuje dostupnu literaturu, predlaže metod, trenira model po tom metodu tokom 30 minuta, a zatim proverava rezultat i ili zadržava pristup ili ga odbacuje i pokušava iznova. Prema Anthropicu, najbolji od testiranih metoda je u proseku nadmašio predloge iskusnih ljudskih istraživača već u prvih šest sati rada.
Brže i jeftinije od ljudi
Anthropic je uporedio rezultate automatizovanog sistema sa predlozima 28 ljudskih istraživača bezbednosti, kojima je za rad na istom zadatku bilo dato do osam sati. Na primeru sprečavanja obmanjujućeg ponašanja modela, najbolji automatizovani metod je bio oko 20 odsto uspešniji od najboljeg ljudskog predloga. Razlika je još izrazitija u ceni: sat rada automatizovanog istraživača košta oko četiri dolara u troškovima obrade na API-ju, naspram približno 150 dolara po satu rada ljudskog istraživača.
Anthropic u radu ipak navodi i ograničenje: automatizovani sistem je koristan onoliko koliko su korišćeni testovi zaista verna slika stvarnih ciljeva usklađenosti modela sa ljudskim namerama. Kompanija rezultate opisuje kao rani dokaz da bi automatizovano popravljanje bezbednosti modela moglo postati primenljivo u bliskoj budućnosti, ne kao dokaz da je taj proces već zreo za širu upotrebu.
Deo šire slike o samopoboljšanju AI
Istraživanje se nadovezuje na izveštaj koji je Anthropic objavio u maju, prema kojem je više od 80 odsto koda u sopstvenoj bazi kompanije tada već pisao Claude, a inženjeri sve više usmeravaju i proveravaju taj rad umesto da ga sami obavljaju. Anthropic je tada upozorio da bi, ako se taj trend nastavi, mogao da se približi scenario u kojem AI sistemi samostalno projektuju i grade svoje naslednike, pojava poznata kao rekurzivno samopoboljšanje. Kompanija je ranije ove godine i sama zadržala razvijeniji interni model neobjavljenim zbog procene rizika, o čemu je Agenti.rs ranije pisao.
Claude je u međuvremenu pokazao i sposobnost samostalnog istraživačkog rada u drugim oblastima, uključujući napredak u pokušaju dokazivanja Rimanove hipoteze, što ilustruje koliko se model oslanja na samostalno vođene eksperimente, a ne samo na davanje gotovih odgovora.
Ne slažu se svi da je proboj blizu
Anthropicov suosnivač Jack Clark je nedavno u sopstvenom biltenu Import AI naveo da bi rekurzivno samopoboljšanje AI moglo da nastupi sa verovatnoćom od 60 odsto do kraja 2028. godine. Istovremeno je, komentarišući studiju istraživača sa Prinstona Pitera Kirgisa i Sajaša Kapura, ocenio da AI agenti umeju da reše inženjerske probleme, ali im nedostaje sposobnost prosuđivanja i kreativnosti potrebna za originalna istraživanja na nivou radova koje bi prihvatile vodeće konferencije iz mašinskog učenja. Clark je to nazvao signalom opreza za kratke rokove rekurzivnog samopoboljšanja, napomenuvši da se to poklapa i sa Anthropicovim internim iskustvom u pokušajima automatizacije istraživanja bezbednosti.
Ta zapažanja pokazuju razliku u dometu. Dok je novo istraživanje pokazalo da automatizovani sistemi mogu pouzdano da reše jasno definisan, uzak zadatak popravljanja poznatih bezbednosnih propusta, sposobnost da AI sam osmišljava originalna istraživačka pitanja i dalje ostaje, prema dostupnim podacima, ograničena. Anthropic i druge laboratorije zbog toga sve više naglašavaju da testiranje bezbednosti samih AI modela mora da prati tempo kojim modeli preuzimaju deo istraživačkog posla.
Često postavljana pitanja
Šta je rekurzivno samopoboljšanje AI?
To je scenario u kojem AI sistemi učestvuju u razvoju i poboljšanju drugih AI sistema, uključujući potencijalno i sebe, na način koji se ubrzava iz iteracije u iteraciju.
Da li ovo istraživanje dokazuje da Claude može sam sebe da unapređuje?
Ne u potpunosti. Istraživanje pokazuje da automatizovani sistemi zasnovani na Claudeu mogu da poprave konkretne, unapred poznate bezbednosne propuste bolje i jeftinije od ljudi, ali ne i da model samostalno osmišljava nova istraživačka pitanja ili gradi svog naslednika.
Koliko je jeftiniji automatizovani istraživač od ljudskog?
Prema Anthropicovim podacima, sat rada automatizovanog sistema košta oko četiri dolara u troškovima obrade, naspram oko 150 dolara po satu angažovanja ljudskog istraživača bezbednosti.
Slažu li se svi u Anthropicu da je proboj blizu?
Ne. Suosnivač Jack Clark je javno naveo verovatnoću od 60 odsto do kraja 2028. godine, ali je istovremeno upozorio da AI agentima i dalje nedostaje kreativnost potrebna za originalna istraživanja, što naziva razlogom za oprez pri proceni kratkih rokova.
