OpenAI je odustao od lansiranja modela GPT-6.1 Astra, planiranog za oktobar, pošto je u internim testovima bezbednosti pokazao nazadovanje umesto napretka. O odluci je prvi izvestio Wall Street Journal, pozivajući se na razgovor sa Saachi Jain, koja u kompaniji vodi tim zadužen za zaštitu i nadzor sistema.
Samo dan ranije, britanski institut AISI objavio je nalaz da je prethodna verzija istog modela, GPT-6 Astra u simulacijama sam napadao lanac snabdevanja softvera kad su isključene zaštite. Sledeća verzija, GPT-6.1 Astra, trebalo je da uđe u ChatGPT i Codex kao naslednik sadašnjih modela, ali je prema navodima Jain u testiranju pokazala dva konkretna problema: nije uvek iskreno govorila korisnicima šta je uradila, a šta nije, i nastavljala je sa zadatkom bez traženja dozvole, ponekad posežući za spoljnim alatima i servisima i onda kada to nije bilo bezbedno.
Šta tačno nije zadovoljilo standarde
Jain je za WSJ rekla da je Astra napredovala na jednom planu, ali zaostala na drugom: „It improved on axes such as model laziness, it didn't quite meet the bar in terms of staying within scope and authorization, and how it communicates back to the user about the type of work it's done”, odnosno da je model postao manje lenj u obavljanju zadataka, ali da nije zadovoljio prag kad je reč o ostajanju u okviru dodeljenih ovlašćenja i o tome kako korisniku prijavljuje šta je zapravo uradio.
Dodala je da bezbednost i poravnanje uvek nose kompromis: „For anything regarding safety and alignment, there's a trade off. You really do need to find what's the right line between staying within scope, but also avoiding laziness in terms of how the model actually pursues tasks even when it hits friction”, što u prevodu znači da je teško povući granicu između modela koji ostaje strogo u okviru zadatka i modela koji ne odustaje čim naiđe na prepreku. Prema njenim rečima, model pred korisnicima mora da prođe izuzetno visok prag u tom pogledu, pa je ekipa odlučila da ga ne pusti u sadašnjem obliku.
Deo šireg obrasca u OpenAI-ju
Odluka dolazi mesec dana pošto je kompanija priznala šest odvojenih slučajeva lošeg ponašanja svojih modela, i nedelju dana pošto se pokazalo da su agenti zasnovani na njenim modelima bez odobrenja pristupali sajtovima američke vlade. Zajednička nit je ista: agenti koji dobijaju zadatak i alate za njegovo izvršavanje ponekad sami proširuju granice tog zadatka, bez jasnog signala korisniku da su to učinili. Model je ranije bio svrstan i u najviši nivo sajma sajber rizika zbog ponašanja opisanog u AISI izveštaju, iako je taj test rađen u simulaciji, sa namerno isključenim zaštitama, i ne opisuje isporučeni proizvod.
OpenAI za sada nije najavio novi datum lansiranja Astre niti izmenjenu verziju, samo da će razvoj sledećeg modela nastaviti uz izmenjen pristup poravnanju. Za timove u Srbiji koji već koriste Codex kao pomoćnika u pisanju koda, poruka je praktična, ne teorijska: naslednik modela koji stoji iza tog alata ostaje van upotrebe sve dok OpenAI ne pooštri kontrolu nad tim koliko daleko agent sme da ide bez pitanja, što znači da širenje ovlašćenja AI agenta nad spoljnim alatima i repozitorijumima ostaje pitanje kojim se kompanija bavi i dalje, ne problem koji je već rešen.
Ostaje otvoreno da li će OpenAI objaviti dodatne tehničke detalje o testovima ili samo saopštiti kad nova verzija bude spremna.