Šezdeset jedan odsto, toliko se poklapaju procene AI agenata i stvarne želje ljudi čije su interese agenti zastupali u eksperimentu koji je Anthropic objavio 24. septembra 2026. Kompanija je u sklopu istraživanja pod nazivom Project Swap pustila agente zasnovane na Claude-u da u ime 201 zaposlenog pregovaraju o razmeni knjiga, a rezultati pokazuju koliko daleko takvi sistemi mogu da stignu bez detaljnih uputstava, i gde i dalje greše.
Eksperiment je sproveden u šest kancelarija kompanije, u San Francisku, Njujorku, Londonu, Sijetlu, Vašingtonu i Dablinu. Svaki zaposleni je doneo jednu knjigu za razmenu, a Claude je kroz kratak uvodni razgovor, u proseku 216 reči kroz osam poruka, pokušao da izvuče njegove čitalačke preference. Agenti su zatim samostalno pregovarali na decentralizovanom „tržištu”, nudeći i prihvatajući zamene u ime svojih korisnika. Dablin je isključen iz konačne analize zbog premalog broja učesnika, pa je obrađeno 188 slučajeva.
Da bi proverili koliko dobro su agenti razumeli šta ljudi zapravo žele, istraživači su tražili od svakog učesnika da unapred rangira deset knjiga iz zajedničkog fonda. Claude je pogodio par knjiga koji je učesnik zaista preferirao u 61 odsto slučajeva, što je bolje od procene zasnovane na popularnosti naslova (53 odsto) ili klasičnog kolaborativnog filtriranja (55 odsto). Ipak, krajnja alokacija je bila daleko od idealne: prosečan učesnik je dobio knjigu vrednu oko 0,55 na sopstvenoj lestvici želja, dok je teorijski maksimum iznosio 0,89. Analiza je pokazala da 85 odsto tog zaostatka dolazi od nepotpunog razumevanja želja učesnika, a samo 15 odsto od same taktike pregovaranja.
Jači model je važniji od pametnijeg uputstva
Najzanimljiviji nalaz tiče se onoga što je zapravo odlučivalo o uspehu pregovora. Istraživači su testirali različite kombinacije modela i različita uputstva agentima, od saradničkih do agresivnih, „nemilosrdnih” strategija. Prelazak sa manjeg modela Haiku na moćniji Opus popravio je rezultat za 0,12 poena na Claude-ovoj lestvici, dok je razlika između „nemilosrdnih” i prosocijalnih agenata iznosila svega 0,02 poena. U izveštaju studije to je sažeto jednom rečenicom: „jači modeli dovode do efikasnijih ishoda”. Drugim rečima, izbor osnovnog modela je presudio mnogo više nego to koliko je neko vešto sročio instrukcije agentu.
To je nalaz koji ide dalje od zabave sa razmenom knjiga. AI agenti se sve češće zamišljaju kao sistemi koji u ime korisnika samostalno pregovaraju, kupuju ili raspodeljuju resurse, a Project Swap sugeriše da kvalitet osnovnog modela, ne kreativnost promptova, ostaje glavna poluga za pouzdanost takvih sistema.
Koliko su ljudi spremni da veruju agentu
Oko 60 odsto učesnika odgovorilo je na naknadnu anketu o zadovoljstvu, sa prosečnom ocenom 7,2 od 10. Kada su upitani koliko bi godišnjeg budžeta za knjige poverili agentu da upravlja njime bez nadzora, učesnici su u proseku pristali da prepuste oko 30 odsto, što je blizu nivoa poverenja koji bi ukazali dobro upućenom prijatelju, u proseku 40 odsto. Razlika pokazuje da poverenje u agenta raste sporije od tehničke sposobnosti sistema.
Za firme u Srbiji koje razmatraju uvođenje AI agenata za operativne zadatke, poput pregovaranja sa dobavljačima, raspodele opreme unutar tima ili automatizovanog zakazivanja, nalaz Anthropica je konkretan podsetnik: ulaganje u jači, skuplji model često donosi vidljivije poboljšanje od nedelja doterivanja uputstava, što menja i računicu troška naspram koristi pri biranju plana za Claude ili konkurentske alate.
Anthropic navodi da je Project Swap nastavak ranijih internih eksperimenata sa autonomnim tržištima agenata i najavljuje dalja testiranja sa većim brojem učesnika i složenijim dobrima od knjiga.
Slika: Anthropic