Veštačka inteligencija na srpskom 22.08.2026.

Claude Opus 4.6 zaobilazi zabranu eksplicitnog sadržaja

Claude Opus 4.6 zaobilazi zabranu eksplicitnog sadržaja

Istraživanje američkog portala TechCrunch pokazalo je da model Claude Opus 4.6 kompanije Anthropic lako zaobilazi sopstvena pravila koja zabranjuju generisanje eksplicitnog seksualnog sadržaja. U deset od deset direktnih pokušaja, novinari su uspeli da nateraju model da opisuje seksualne scene, uprkos tome što Anthropicova pravila korišćenja izričito zabranjuju generisanje seksualno eksplicitnog sadržaja, uključujući opisivanje seksualnog odnosa ili seksualnih radnji.

Tehniku probijanja zaštite, prema pisanju TechCrunch-a, osmislio je anonimni istraživač iz Velike Britanije. Metoda počinje bezazlenim izmišljenim scenarijem u kom model igra ulogu lika, a zatim ga kroz više poruka postepeno navodi da tretira muške i ženske likove dosledno, da bi ga na kraju ubedila da je već generisala zabranjeni sadržaj i predstavila dalje odbijanje kao diskriminaciju prema ženskom liku. Tehnika je, prema navodima, ponovljena u pet odvojenih testova sa istim ishodom, a osim Opusa 4.6 podložni su joj i stariji modeli Opus 3 i Haiku 4.5, koji su i dalje dostupni preko API-ja i platformi poput Amazon Bedrocka.

Noviji modeli otporni na tehniku

TechCrunch navodi da modeli od Opusa 4.7 do najnovijeg Opusa 5 ne padaju na istu tehniku, što ukazuje da je Anthropic u međuvremenu ojačao zaštitu. Kompanija je za TechCrunch saopštila da ovakvi zahtevi čine manje od 0,1 odsto svih razgovora i da redovno unapređuje zaštitne mehanizme sa svakim novim modelom, dodajući da otkriveni slučaj ne ukazuje na širu ranjivost sistema. Kontekst dodatno zaoštrava podatak istraživačke kuće Pew, prema kom oko tri odsto tinejdžera od 13 do 17 godina koristi Claude uprkos starosnom ograničenju, dok je američka savezna država Kolorado nedavno uvela obavezu da AI kompanije primenjuju zaštitne mere prilagođene uzrastu korisnika. Više o modelu na stranici posvećenoj Claude modelima, a o tome kako testiranje bezbednosti samo po sebi postaje sporno pitanje piše i raniji tekst o rizicima bezbednosnih testova AI modela.

Ključne reči
Claude Opus 4.6 Anthropic bezbednost AI modela jailbreak eksplicitni sadržaj
Podeli članak
Prethodni članakAnthropic menja politiku čuvanja podataka...

Budi u toku sa AI revolucijom

Prijavi se na newsletter i primaj najvažnije o AI agentima i modelima u inbox.