OpenAI priprema model pod nazivom Astra koji će koristiti tehniku rezonovanja nazvanu „rekurentna dubina” (recurrent depth). Reč je o pristupu koji modelu omogućava da razmišlja van uobičajenog, sekvencijalnog obrasca kakav karakteriše većinu današnjih modela za rezonovanje, poput onih koje razvijaju OpenAI i Anthropic. Prema pisanju portala TechCrunch, ta promena je uznemirila deo stručnjaka za bezbednost veštačke inteligencije, jer nova arhitektura otežava praćenje unutrašnjeg toka razmišljanja modela.
Šta je rekurentna dubina
Modeli za rezonovanje kakvi su danas u širokoj upotrebi obično razlažu problem na niz koraka koje ispisuju u prirodnom jeziku, pre nego što daju konačan odgovor. Taj zapis, poznat kao lanac razmišljanja, korisnicima i istraživačima pokazuje kako je model došao do zaključka, a bezbednosnim timovima služi kao alat za otkrivanje pogrešnog ili obmanjujućeg ponašanja pre nego što ono dovede do štete.
Rekurentna dubina radi drugačije. Umesto da svaki korak razmišljanja pretvara u vidljiv tekst, Astra deo obrade ponavlja unutar takozvanog latentnog prostora, u obliku numeričkih reprezentacija koje nisu čitljive za čoveka. Tehnika je poznata i pod imenom neprozirna rekurzija (opaque recurrence), a omogućava modelu da izvrši više koraka obrade bez srazmernog povećanja broja ispisanih rečenica.
Zašto struka brine
Praćenje lanca razmišljanja, iako nesavršeno, jedan je od retkih alata koje istraživači imaju za nadzor nad ponašanjem modela u realnom vremenu. Zato je najava da bi Astra mogla da radi sa manje vidljivih tragova razmišljanja izazvala oštre reakcije.
Izvršni direktor kompanije Redwood Research Bak Šlegeris napisao je da ga „izuzetno brine” što izveštaji ukazuju da Astra koristi neprozirnu rekurziju. Komentator za bezbednost veštačke inteligencije Zvi Movšovic ocenio je da OpenAI „igra sa vatrom” i da rizikuje da naruši nepisano pravilo koje su, prema njegovim rečima, OpenAI i Anthropic zajednički zagovarali, ono da lanac razmišljanja modela ostane čitljiv radi bezbednosnog nadzora. Upravo su te dve kompanije, prema nezavisnoj oceni bezbednosnih praksi u industriji, do sada ocenjivane kao najdosledniji zagovornici transparentnog rezonovanja.
Odgovor OpenAI-ja
Kompanija tvrdi da će Astra, uprkos novoj arhitekturi, i dalje proizvoditi čitljiv lanac razmišljanja i da ne postoje planovi za potpuni prelazak na takozvani neuralese, hipotetički način rada u kom bi model razmišljao isključivo u numeričkim vektorima, bez ijedne reči na prirodnom jeziku. OpenAI za sada nije objavio tehničke detalje o tome koliki deo obrade Astra obavlja u latentnom prostoru niti kako će se to odraziti na mogućnost spoljašnjeg nadzora.
Astra je već ranije bila predmet pažnje bezbednosnih timova. Kompanija je krajem avgusta privremeno obustavila deo treninga modela pošto je interna procena pokazala da bi mogao da dostigne kritičan prag sposobnosti u oblasti sajber bezbednosti, a početkom septembra najavila je da će pristup njegovim najnaprednijim funkcijama biti ograničen. Nova rasprava o načinu na koji model rezonuje dodaje se na taj već postojeći oprez oko sposobnosti Astre.
Šta ostaje otvoreno
Za sada nije poznato u kojoj meri će OpenAI zaista koristiti rekurentnu dubinu u finalnoj verziji modela niti kada se Astra očekuje u javnoj ponudi. Pitanje koje ostaje jeste da li će kompanija, ako tehnika donese značajne prednosti u brzini ili tačnosti rezonovanja, biti spremna da je proširi i na buduće modele i po cenu manje vidljivosti u proces odlučivanja.
Često postavljana pitanja
Šta je lanac razmišljanja kod AI modela?
To je zapis koraka koje model ispisuje u prirodnom jeziku dok rešava problem, pre nego što da konačan odgovor. Istraživači ga koriste da provere kako je model došao do zaključka.
Po čemu se rekurentna dubina razlikuje od uobičajenog rezonovanja?
Umesto da svaki korak pretvara u vidljiv tekst, model deo obrade ponavlja u numeričkom, latentnom prostoru koji nije čitljiv za čoveka, pa ostavlja manje tragova o toku razmišljanja.
Da li OpenAI planira da potpuno ukine vidljivo rezonovanje?
Kompanija tvrdi da neće ići u tom pravcu i da će Astra i dalje proizvoditi čitljiv lanac razmišljanja, ali nije objavila tehničke detalje koji bi to potvrdili.
Zašto se Astra već pominjala u vestima?
Model je ranije bio predmet pažnje jer je dostigao kritičan prag sposobnosti u oblasti sajber bezbednosti, zbog čega mu je deo treninga obustavljen, a pristup najnaprednijim funkcijama ograničen.
Zašto je nadzor nad rezonovanjem uopšte važan?
Praćenje lanca razmišljanja jedan je od retkih načina da istraživači unapred uoče pogrešno ili obmanjujuće ponašanje modela, pre nego što ono utiče na stvarne korisnike.
