Istraživači Microsoft Researcha iz Montreala i univerziteta KAIST objavili su 16. septembra na arXivu rad o novom merilu ProgramDistill. Prema sažetku, model GPT-6 Astra kompanije OpenAI uspešno rekonstruiše cele aplikacije u 49,2 odsto kumulativnih tokova rada, a Claude Opus 5 kompanije Anthropic u 28,8 odsto.
Kako merilo radi
ProgramDistill ne daje agentu pisana uputstva. Umesto toga, agent dobija potpuno funkcionalnu referentnu aplikaciju i nepotpunu verziju iste aplikacije. Iz posmatranja rada prve mora da zaključi šta druga treba da radi, da implementira funkcije koje nedostaju i da ih proveri prema originalu. Autori navode da ovo odgovara situaciji iz stvarnog razvoja, u kojoj se ponašanje softvera često ne opisuje dokumentom, nego se vidi u radu postojećeg proizvoda.
Zadaci nastaju automatski, u tri koraka. Prvo se iz referentnih aplikacija izdvajaju ponašanja koja mogu da se ponove, zapisana kao tragovi kretanja kroz pregledač. Zatim se iz koda uklanja implementacija tih funkcija, čime nastaju zadaci popravke različite težine. Na kraju agent pokušava da vrati izgubljenu funkcionalnost, uz pristup samo referentnoj aplikaciji. Ceo postupak je proizveo 4.063 zadatka iz 26 aplikacija i 1.975 provereno ponovljivih ponašanja, bez ručnog označavanja. Testirano je devet vodećih modela.
Šta pokazuju rezultati
U potpunoj rekonstrukciji aplikacije razlika između dva imenovana modela iznosi 20,4 procentna poena u korist Astre. Reč je o modelu koji je OpenAI predstavio početkom septembra, dok je Opus 5 Anthropicov model koji je Google nedavno otvorio svim svojim inženjerima. Sažetak rada ne navodi rezultate ostalih sedam modela.
Ako se brojke uzmu doslovno, Astra uspešno završava otprilike 1,7 puta više potpunih rekonstrukcija od Opusa 5. Istovremeno, nijedan od dva imenovana modela ne dostiže polovinu, pa i vodeći rezultat znači da je većina pokušaja neuspešna. Merilo se time razlikuje od onih u kojima agent dobija opisan zadatak, a rezultati su zato nezavisniji od uputstava kojima se model vodi.
U delimičnoj rekonstrukciji uspešnost opada kako raste dubina obnove. Sa jednog na osam nivoa pad je od 100 na 64,0 odsto u jednom slučaju, odnosno od 96 na 32 odsto u drugom. Iz dostupnog sažetka nije jasno koji model stoji iza koje krive.
Ograničenja i kontekst
Autori sami navode nekoliko ograničenja. Agenti dobijaju samo strukturirana zapažanja iz pregledača, bez snimaka ekrana. Merilo obuhvata isključivo samostalne veb aplikacije, kvalitet zadataka zavisi od modela koji ih je sastavio, a rezultati su osetljivi na infrastrukturu na kojoj se testovi izvode. Rad je objavljen kao prva verzija na arXivu, a u dostupnim izvorima nema podataka o stručnoj recenziji.
Urednici sajta AI Weekly, koji je rezultat prvi preneo, upozoravaju da merilo proverava zadatak za koji današnji agenti nisu posebno obučavani. Zato brojke ne govore direktno o svakodnevnom programiranju. Microsoft je pritom poslovni partner obe kompanije, što je posebno tema teksta o prodavcima koji se takmiče sa oba proizvoda. Da li će drugi laboratorijski timovi ponoviti rezultate na sopstvenim merilima, za sada nije poznato. Izvori ne navode ni da li su zadaci i tragovi ponašanja javno dostupni za nezavisnu proveru.
Rezultat je zanimljiv i zato što su autori izvan obe kompanije čije modele upoređuju. OpenAI je pri lansiranju Astre sam objavio rezultate na drugim merilima, dok ProgramDistill dolazi od istraživača koji nisu deo te kompanije, iako je njihov poslodavac Microsoft blisko povezan sa OpenAI-jem.
Često postavljana pitanja
Šta je ProgramDistill?
Merilo za AI agente za programiranje koje traži da agent iz referentne aplikacije zaključi kako softver treba da radi i da vrati funkcije koje nedostaju u nepotpunoj verziji.
Znači li rezultat da je Astra bolja u svakodnevnom programiranju?
Ne nužno. Merilo obuhvata samo samostalne veb aplikacije i posebnu vrstu zadatka, pa se rezultat ne može direktno preneti na sve programerske poslove.
Ko stoji iza rada i da li je recenziran?
Autori su iz Microsoft Researcha u Montrealu i sa univerziteta KAIST. Rad je objavljen kao prva verzija na arXivu, a podaci o recenziji nisu navedeni.
