Veštačka inteligencija na srpskom 21.09.2026.

Studija tvrdi da vodeni žig menja bezbednost AI modela

Studija tvrdi da vodeni žig menja bezbednost AI modela

Bezbednosna firma Lasso Security objavila je istraživanje prema kojem žig SynthID-Text, tehnika za nevidljivo obeležavanje AI tekstova koju je razvio Google DeepMind, može da promeni i ponašanje modela koji ga koristi. Kako prenosi The Register, žig utiče na odbijanje štetnih zahteva i na izbor alata koje AI agent poziva, a efekat je izraženiji kada se zahtev kombinuje sa prompt injection napadom. Nalazi su važni i za Anthropic, koji je najavio da će verziju iste tehnike ugraditi u Claude modele.

Šta je istraživanje testiralo

SynthID-Text ne dodaje oznaku na gotov tekst. Tajni ključ blago pomera način na koji model bira sledeću reč, pa svako ko poseduje ključ može statistički da proveri da li je tekst nastao uz taj žig. Lasso taj pomak u biranju reči, koji naziva pomeranjem uzorkovanja, ispituje na modelima otvorenih težina, među kojima su Llama, Qwen i Gemma. Za proveru odbijanja korišćena su merila HarmBench i JailbreakBench, a za pozivanje alata merilo BFCL v4. Odgovori istih modela poređeni su sa uključenim i isključenim žigom. Cilj je bio da se proveri da li promena u biranju reči, namenjena samo dokazivanju porekla teksta, ima nuspojave na bezbedno ponašanje modela.

Šta su istraživači zabeležili

Prema Lassu, žig menja ponašanje modela pri odbijanju i na običnim štetnim zahtevima, ali je efekat izraženiji kada je isti zahtev upakovan u prompt injection. Kod nekoliko modela žig je povećao spremnost da se izvrše instrukcije koje bi inače odbili. Rezultati su se razlikovali i u zavisnosti od toga koji je tajni ključ korišćen.

Kod pozivanja alata, tačnost je, kako navodi The Register, opala kod većine testiranih modela. Lasso pritom upozorava da pojedinačni pozivi mogu da pređu iz tačnih u netačne i obrnuto, pa zbirni rezultat na merilu može ostati gotovo nepromenjen iako se ponašanje modela razlikuje. Za agentske sisteme to je relevantno jer isti pomak u biranju reči određuje i to koji alat agent poziva i sa kojim argumentima.

Šta studija ne dokazuje

Claude nije bio među testiranim modelima. Prema izveštajima, Lasso je koristio javnu Hugging Face implementaciju SynthID-Text, a ne Anthropicovu, pa nalazi upozoravaju na celu kategoriju tehnike, a ne presuđuju o tome kako žig radi u Claude modelima. Prema nazivima koje navodi The Register, testirani su relativno manji modeli otvorenih težina, a ne vodeći komercijalni sistemi sa sopstvenim bezbednosnim obukama. Ni Anthropic ni Google u izveštajima koje smo pregledali nisu odgovorili na nalaze.

Zašto je tema aktuelna

Anthropic je u avgustu najavio da će tekstove Claude modela obeležavati nevidljivim žigom, kako bi ispunio obaveze iz evropskog Zakona o veštačkoj inteligenciji. Kompanija je potom objasnila tehniku iza žiga i navela da žig nema praktičan uticaj na kvalitet ni sadržaj odgovora. Ta tvrdnja odnosi se na kvalitet i čitljivost, dok Lassovo istraživanje otvara drugo pitanje, a to je bezbedno ponašanje pod napadom.

Pitanje se ne završava na jednoj kompaniji. Obaveza obeležavanja sadržaja iz člana 50 Zakona važi od 2. avgusta za sve provajdere, a OpenAI je SynthID već primenio na AI generisan glas. O tome kako se AI tekst prepoznaje i koliko su alati za to pouzdani pisali smo u vodiču za prepoznavanje AI sadržaja.

Šta Lasso preporučuje

Lasso predlaže da procene bezbednosti agenata uključuju i sadržaj sa žigom, umesto da se testira samo bez njega. Organizacijama se savetuje da utvrde koji njihovi sistemi već koriste SynthID-Text, da dopune protokole za red teaming varijantama sa žigom i da od dobavljača traže podatke o uticaju žigosanja na bezbednost. Kako će se nalazi odraziti na velike komercijalne modele za sada ostaje otvoreno, jer javnog odgovora Anthropica i Googlea nema.

Često postavljana pitanja

Šta je SynthID-Text?

To je tehnika koju je razvio Google DeepMind. Tajni ključ blago menja način na koji model bira reči, pa tekst nosi statistički obrazac nevidljiv čitaocu, a prepoznatljiv onome ko ima ključ.

Da li je studija testirala Claude?

Ne. Lasso je koristio modele otvorenih težina i javnu Hugging Face implementaciju žiga, pa nalazi ne opisuju direktno Anthropicovu primenu.

Zašto žig utiče na alate koje agent poziva?

Isti pomak u biranju reči koji ugrađuje žig određuje i to koji alat model bira i koje argumente prosleđuje, pa se ponašanje agenta može razlikovati od onog bez žiga.

Da li žig menja kvalitet teksta?

Anthropic tvrdi da žig nema praktičan uticaj na kvalitet i sadržaj odgovora. Lassovo istraživanje ne ocenjuje kvalitet, već ponašanje modela pri odbijanju zahteva i pozivanju alata.

Ključne reči
SynthID vodeni žig Claude Anthropic Lasso Security AI bezbednost prompt injection AI agenti
Podeli članak
Prethodni članakLaboratorije se razilaze oko AI koji sam s...

Budi u toku sa AI revolucijom

Prijavi se na newsletter i primaj najvažnije o AI agentima i modelima u inbox.