Nvidia je 21. avgusta objavila istraživanje prema kojem takozvani agentski okvir, softverski sloj koji obavija AI model alatima, memorijom i pravilima delovanja, ima veći uticaj na uspeh AI agenta u dugotrajnim zadacima nego sam model koji stoji u njegovoj osnovi. U testu na benčmarku ARC-AGI-3, koji proverava sposobnost rasuđivanja kroz interaktivne igre bez uputstava, model Claude Opus 5 je uz Nvidijin okvir nazvan Agentic Variation Operators, skraćeno AVO, rešio svih 183 javna nivoa i osvojio savršenih 100 odsto. Bez tog okvira, koristeći opšti okvir organizacije ARC Prize, isti model je dostigao oko 30 odsto, što je i dalje bio najbolji pojedinačni rezultat među svim testiranim modelima u toj varijanti.
Šta je AVO i kako radi supervizor
AVO je prvobitno razvijen za optimizaciju CUDA jezgara, a Nvidia ga je kasnije prilagodila za opšte zadatke rasuđivanja. Adel El Halak, potpredsednik za proizvod u Nvidijinom AI odeljenju, objasnio je da okvir predstavlja model plus svu opremu oko njega, uključujući alate koje koristi, okruženje u kom radi i biblioteke kojima pristupa. Ključni deo AVO sistema je takozvani supervizor, poseban agent koji nadgleda glavnog agenta i usmerava ga kada krene putem koji vodi u ćorsokak ili počne da ponavlja već pokušana rešenja. El Halak je opisao tu ulogu rečima da supervizor deluje gotovo kao izvršni direktor koji gura agenta u pravom smeru. Prema Nvidijinom opisu, okvir se oslanja na šest principa dizajna, među kojima su strogo tipizirani ulazi i izlazi, praćenje radnji kao koda i eksplicitno beleženje stanja objekata tokom izvršavanja zadatka.
Rezultati na ARC-AGI-3
Razlika u rezultatima sa okvirom i bez njega bila je izražena i kod konkurentskih modela. Claude Opus 5 je uz AVO postigao savršen skor koristeći ukupno 6.624 radnje u okruženju kroz svih 183 nivoa. OpenAI-jev model GPT-5.6 Sol je sa svojim zvaničnim okvirom osvojio 13,3 odsto, dok je uz ponovo implementiran okvir sa zadržanim rasuđivanjem i sažimanjem konteksta dostigao 38,3 odsto. Nijedan model osim Claude Opus 5 uz AVO nije prišao savršenom rezultatu. Nvidia navodi da je slična razlika zabeležena i kod drugih zadataka dugog trajanja, gde agent mora da drži kontekst i cilj kroz veliki broj koraka bez ljudske intervencije.
Zašto okvir postaje važniji od modela
Nvidijino istraživanje se nadovezuje na širi trend u kom kompanije sve više ulažu u infrastrukturu oko modela, a ne samo u sam model. OpenAI je u julu, prilagođavanjem samo dva podešavanja u sopstvenom okviru, utrostručio rezultate svojih agenata na sličnim zadacima, iako nije dostigao savršen skor. Istraživanje kompanije Databricks je ranije pokazalo da izbor okvira može udvostručiti operativne troškove izvršavanja istog zadatka. Loše osmišljeni okviri su, prema ranijim izveštajima, dovodili i do konkretnih šteta, od brisanja fajlova do oštećenja baza podataka, kada agent nije imao jasna ograničenja delovanja. Slične probleme su pokazali i drugi testovi agentskih sistema, uključujući slučaj u kom su Claude agenti sabotirali jedni druge tokom zajedničkog zadatka, kao i primeri gde su manji, specijalizovano izgrađeni agenti nadmašili veće modele. To se pokazalo i kod agenta Faraday, koji je nadmašio Claude i GPT-5.5 na sopstvenom zadatku, i kod agenta Handoff, koji je na testu nadmašio i Claude i ChatGPT. El Halak je poručio da otvoreni okviri, poput AVO, korisnicima omogućavaju da podešavaju više parametara i tako podignu tačnost, za razliku od zatvorenih rešenja pojedinih laboratorija.
Nvidia AVO istraživanje je prvi put objavljeno u martu na arXiv-u, a rezultati sa ARC-AGI-3 benčmarkom predstavljeni su tek sada, u avgustu, kao dokaz da razlika između modela sve više zavisi od okruženja u kom taj model radi.
Često postavljana pitanja
Šta je agentski okvir u kontekstu AI?
To je softverski sloj oko AI modela koji mu obezbeđuje alate, memoriju, pravila delovanja i način na koji prati napredak kroz zadatak. Sam model ostaje isti, ali se njegovo ponašanje značajno menja u zavisnosti od okvira u kom radi.
Da li AVO okvir podjednako podiže rezultate svih modela?
Ne. Prema Nvidijinim podacima, Claude Opus 5 je uz AVO dostigao savršen rezultat, dok su drugi modeli, poput GPT-5.6 Sol, ostali znatno ispod tog nivoa čak i uz prilagođene okvire.
Da li je AVO dostupan izvan Nvidije?
Nvidia je istraživanje o AVO-u objavila javno na arXiv-u još u martu, a kompanija zagovara otvorene okvire koji korisnicima dozvoljavaju da sami podešavaju parametre, za razliku od zatvorenih sistema pojedinih laboratorija.
Znači li ovo da je izbor modela manje važan?
Ne u potpunosti, jer je Claude Opus 5 i bez okvira imao najbolji rezultat među testiranim modelima. Ali istraživanje pokazuje da za dugotrajne zadatke okruženje oko modela može imati veći uticaj na konačan ishod nego sama razlika između modela.
