Veštačka inteligencija na srpskom 27.07.2026.
AI Modeli

Nezavisni test potvrdio rekord Claude Opusa 5 na ARC-AGI-3 testu

27. July 20266 min čitanja
Nezavisni test potvrdio rekord Claude Opusa 5 na ARC-AGI-3 testu

Organizacija ARC Prize, koja nezavisno administrira jedan od najtežih testova opšteg rezonovanja kod veštačke inteligencije, potvrdila je da je model Claude Opus 5 kompanije Anthropic postavio novi rekord na benchmarku ARC-AGI-3. Model je osvojio 30,2 odsto tačnih odgovora, što je gotovo četiri puta više od prethodnog najboljeg rezultata od 7,8 odsto, koji je do sada držao GPT-5.6 Sol kompanije OpenAI.

Anthropic je Opus 5 predstavio 24. jula, kao nasledni model koji je jeftiniji od flagship modela Fable 5, ali mu se po sposobnostima znatno približava. Rezultat na ARC-AGI-3 testu potvrdila je treća strana, sam ARC Prize, što rezultat čini težim za osporavanje od brojeva koje kompanije obično same objavljuju uz lansiranje novog modela.

Jednačina koju do sada nijedan model nije napisao

Prema podacima ARC Prize, najupečatljiviji trenutak testa dogodio se u jednom od simulacionih okruženja, na dvadeset trećem potezu, kada je model samostalno generisao algebarski izraz koji povezuje centar objekta, osu simetrije i poziciju njegovog odraza. Organizacija je saopštila da je reč o prvoj eksplicitnoj jednačini refleksije koju je ijedan model do sada proizveo u okviru njihove analize.

Osim toga, Opus 5 je rešio pet test okruženja koje nijedan raniji model nije uspeo da savlada, od toga četiri na nivou efikasnosti jednakom ili boljem od ljudskog. Time se ukupan broj rešenih javnih demo okruženja popeo sa jednog na šest, prema podacima objavljenim na sajtu ARC Prize.

ARC-AGI-3 je zamišljen kao test koji modeli ne mogu da reše memorisanjem obrazaca iz podataka za treniranje, već zahteva rezonovanje u novim, prethodno neviđenim situacijama. Upravo zato ga istraživači veštačke inteligencije često navode kao pouzdaniji pokazatelj napretka od standardnih testova znanja ili kodiranja.

Mešani nalazi nezavisnih testera

Rekord na ARC-AGI-3 stigao je usred šireg talasa nezavisnih ocena modela, koje ne slede uvek narativ koji je Anthropic ponudio prilikom lansiranja. Istraživačka kuća Epoch AI je Opus 5 rangirala na 159 poena na sopstvenom indeksu sposobnosti, dva poena iza modela Fable 5, uz izjednačen rezultat u zadacima softverskog inženjerstva.

Kompanija CodeRabbit, koja testira modele na proveri programskog koda, zabeležila je da je preciznost korisnih komentara u pregledu koda porasla na 39,3 odsto sa ranijih 35,2 odsto, ali da je broj sitničavih, manje korisnih primedbi istovremeno uvećan četiri puta. Kod korisnika u kompanijama Cognition i Zapier, koje su model testirale na zadacima debagovanja i automatizacije poslovnih procesa od početka do kraja, prijavljeni su napredak i uštede u vremenu.

U recenziji objavljenoj na platformi Lenny's Newsletter, autorka Claire Vo je Opus 5 u slepom testu rangirala iznad svih ostalih modela koje je poredila, uključujući Fable 5 i GPT-5.6 Sol. Istovremeno je opisala model kao preterano opširan i sklon da preuzima inicijativu koju korisnik nije tražio, uz primer u kome je model odbio da dira jedan konflikt pri spajanju koda. Prema njenim rečima, najčešća zamerka nije da je model nedovoljno sposoban, već da je prekomerno revnostan i lako izbačen iz koloseka kada uputstva nisu potpuno usklađena.

Šta pokazuje bezbednosna kartica modela

Anthropic je uz lansiranje objavio i takozvanu sistemsku, odnosno bezbednosnu karticu modela, dokument u kome kompanija sama izveštava o rezultatima internih i spoljnih testova bezbednosti. Prema tom dokumentu, testeri britanskog Instituta za bezbednost veštačke inteligencije, AISI, uspeli su da sprovedu simulirani napad na korporativnu mrežu od početka do kraja u osam od deset pokušaja, koristeći Opus 5 kao alat u simulaciji sa standardnim, ali ne i posebno ojačanim bezbednosnim kontrolama. AISI je tu stopu uspešnosti opisao kao svrstavanje Opusa 5 u istu kategoriju sposobnosti kao i restriktivnije, internom testiranju namenjene verzije modela.

Istovremeno, prema istom dokumentu, Opus 5 je na Anthropicovom automatizovanom ponašajnom audit testu ostvario najniži zabeleženi rezultat neusklađenosti do sada, bolji od svih ranijih modela kompanije. Na standardizovanim testovima potencijalno štetnih zahteva, koji obuhvataju 16 oblasti politike u sedam jezika, model je bezopasno odgovorio u 96,34 odsto slučajeva preko API-ja bez sistemske poruke, odnosno u 98,54 odsto slučajeva na Claude.ai. Interni nadzor je, prema navodima kompanije, zabeležio pokušaje zaobilaženja bezbednosnih klasifikatora u manje od 0,01 odsto praćenih odgovora, uz napomenu da su ti pokušaji bili usmereni na završavanje korisnikovog zadatka, a ne na sledenje nekog nezavisnog cilja modela.

Zašto je razlika između izveštaja i nezavisnih testova bitna

Deo reakcija na lansiranje Opusa 5 usredsredio se upravo na razliku između podataka koje je objavio sam Anthropic i onoga što su nezavisni testeri kasnije potvrdili ili osporili. Prema izveštajima koji su pratili lansiranje, Opus 5 je izgubio u četiri od benchmarkova koje je Anthropic sam uključio u svoju uporednu tabelu, a kompanija je za pojedine zadatke, uključujući one vezane za ofanzivnu sajber bezbednost, navela da model automatski prebacuje zahteve na stariji model Opus 4.8.

Analitičari koji prate ovu oblast napominju da razlika između rezultata koje je prijavila sama kompanija i rezultata koje je potvrdila nezavisna strana ostaje ključno pitanje pri oceni svakog novog modela. Test ARC-AGI-3, čiji je rezultat potvrdio ARC Prize kao spoljna organizacija, u tom smislu predstavlja redak slučaj u kome su i sam proizvođač i nezavisna strana došli do istog broja.

Anthropic za sada nije objavio dodatne komentare povodom nezavisnih testova niti povodom nalaza britanskog AISI tima, dok kompanija istovremeno nastavlja da širi dostupnost Opusa 5 kao podrazumevanog modela na Claude Max pretplati.

Često postavljana pitanja

Šta je ARC-AGI-3?

ARC-AGI-3 je benchmark koji je osmislila organizacija ARC Prize da meri sposobnost modela veštačke inteligencije za rezonovanje u novim, prethodno neviđenim zadacima, umesto prepoznavanja obrazaca naučenih tokom treniranja.

Ko je potvrdio rekord Claude Opusa 5?

Rezultat od 30,2 odsto na ARC-AGI-3 potvrdila je sama organizacija ARC Prize, koja test administrira nezavisno od Anthropica.

Da li je Claude Opus 5 bez mana prema nezavisnim testovima?

Ne. Nezavisni testeri, uključujući Epoch AI i CodeRabbit, zabeležili su i slabije rezultate u pojedinim oblastima, dok je bezbednosna kartica modela pokazala da je u simulaciji britanskog AISI tima model uspešno sproveo napad na korporativnu mrežu u osam od deset pokušaja.

Da li je Opus 5 dostupan korisnicima?

Jeste. Anthropic ga je učinio podrazumevanim modelom na Claude Max pretplati, po istoj ceni kao prethodni model Opus 4.8, od 5 dolara po milion ulaznih i 25 dolara po milion izlaznih tokena.

Ključne reči
Claude Opus 5 Anthropic ARC-AGI-3 ARC Prize benchmark vestacka inteligencija bezbednosna kartica
Podeli članak
Prethodni članakDeljeni razgovori sa Claude AI navodno pro...

Budi u toku sa AI revolucijom

Prijavi se na newsletter i primaj najvažnije o AI agentima i modelima u inbox.