Veštačka inteligencija na srpskom 02.09.2026.
Pojam

Multimodalni model

AI model koji razume i obrađuje više vrsta podataka, na primer tekst i slike zajedno.

Multimodalni model može da prima i kombinuje različite tipove ulaza, najčešće tekst i slike, a neki i zvuk, video ili dokumente. To mu omogućava da opiše fotografiju, pročita grafikon, protumači snimak ekrana ili odgovori na pitanje o skeniranom papiru.

Kako radi u praksi

Slika se ne šalje modelu kao slika, već se pretvara u niz brojeva koji se ubacuje u isti tok kao i tokeni teksta. Model tako u jednom kontekstu vidi i pitanje i sadržaj slike, pa može da ih poveže. Zbog toga slike i troše prostor u kontekstnom prozoru i ulaze u obračun cene, obično srazmerno rezoluciji.

Tipičan primer je snimak ekrana sa greškom u aplikaciji: model pročita poruku, prepozna gde je dugme koje ne radi i predloži šta da se proveri. U kancelarijskom radu isto se koristi za skenirane fakture i formulare, gde model iz slike izvuče stavke i upiše ih u tabelu, a u razvoju softvera za prevod skice ekrana u kod.

Zašto je bitno i gde se sreće

Veliki deo poslovnih podataka nikada nije bio uredan tekst: papiri, snimci ekrana, fotografije sa terena, grafikoni u prezentacijama. Multimodalni modeli te podatke otvaraju bez posebnih sistema za prepoznavanje teksta i bez ručnog prepisivanja. Vodeći modeli, uključujući Claude, danas su multimodalni, što proširuje opseg zadataka koje agenti mogu da obave, na primer da vide stanje aplikacije pre nego što kliknu.

U svakodnevnom radu to menja i način na koji se postavlja pitanje. Umesto opisivanja problema rečima, korisnik pošalje fotografiju uređaja, grafikon iz izveštaja ili snimak tabele, pa model radi nad onim što stvarno vidi. Kod terenskih poslova, od popisa opreme do kontrole kvaliteta, to skraćuje put od zapažanja do zapisa u sistemu.

Česta zabluda

Prva zabluda je da je svaki model koji „radi sa slikama" multimodalan na isti način. Razumevanje slike i generisanje slike su različite sposobnosti: mnogi asistenti sliku razumeju sami, a za crtanje pozivaju poseban model. Isto važi za govor, gde se često radi o prepisu zvuka u tekst pre nego što model uopšte vidi sadržaj.

Druga zabluda je da model iz slike čita jednako pouzdano kao čovek. Sitan tekst, gusta tabela, loše osvetljenje i rukopis i dalje prave greške, a model će pogrešno pročitan broj izgovoriti jednako sigurno kao i tačan. Zato se kod faktura i izveštaja rezultat proverava, ili se traži da model navede gde je na dokumentu pronašao podatak.

Za dalje čitanje

Svi pojmovi

Budi u toku sa AI revolucijom

Prijavi se na newsletter i primaj najvažnije o AI agentima i modelima u inbox.