Tehnika u kojoj model pre odgovora dohvata relevantne podatke iz spoljnog izvora i koristi ih u generisanju.
RAG (engl. Retrieval-Augmented Generation) spaja jezički model sa pretragom baze znanja. Pre nego što odgovori, sistem pronađe relevantne delove dokumenata i ubaci ih u kontekst, pa model odgovara oslanjajući se na te činjenice, a ne samo na ono što je zapamtio tokom obuke.
Kako radi u praksi
Priprema ide unapred: dokumenti se iseku na manje delove, svaki deo se pretvori u niz brojeva koji predstavlja njegovo značenje i sve se smesti u bazu za pretragu po sličnosti. Kada stigne pitanje, i ono se pretvori u isti oblik, iz baze se izvuče nekoliko najbližih delova i oni se zajedno sa pitanjem pošalju modelu uz uputstvo da odgovori samo na osnovu priloženog.
Primer: firma ima tri stotine strana internih procedura. Na pitanje „koliko dana unapred se prijavljuje godišnji odmor" sistem pronađe tačan pasus iz pravilnika i model odgovori uz navođenje dokumenta iz kog je uzeo podatak. Bez tog koraka model bi improvizovao odgovor koji zvuči razumno, jer interni pravilnik nikada nije video.
Zašto je bitno i gde se sreće
RAG je najbrži način da model progovori o podacima koje nije video: internoj dokumentaciji, katalogu proizvoda, tiketima podrške, ugovorima. Smanjuje halucinacije, daje izvore koje čovek može da proveri i omogućava da se znanje ažurira dodavanjem dokumenta, bez ikakvog diranja modela.
Zato je RAG danas standardni sastojak poslovnih AI rešenja i agenata: pretraga baze znanja je često prvi alat koji agent dobije. Isti pristup koriste i asistenti za podršku korisnicima, gde je važno da odgovor bude vezan za tačnu verziju uputstva.
Postavljanje ovakvog sistema po pravilu počinje od reda u dokumentima, a ne od tehnologije. Ako u firmi kruži pet verzija istog pravilnika, pretraga će vratiti bilo koju, pa model daje tačan odgovor na osnovu pogrešnog izvora. Zato se pre uvođenja najčešće čisti i označava građa, tako da se zna šta je važeće i od kada.
Česta zabluda
Najveća zabluda je da RAG sam po sebi ukida halucinacije. Ako pretraga izvuče pogrešan pasus ili ne nađe ništa, model će i dalje pokušati da odgovori, pa je kvalitet pretrage barem podjednako važan kao izbor modela. U praksi se najviše dobija na sitnicama: kako su dokumenti isečeni, da li se čuvaju naslovi i datumi i da li se model izričito uputi da kaže kada podatka nema.
Druga zabluda je da RAG zamenjuje fino podešavanje, ili obrnuto. RAG donosi činjenice, fino podešavanje uči stil i format odgovora. Ako model greši u podacima, treba mu bolja pretraga, ako greši u načinu na koji odgovara, treba mu bolji prompt ili obuka na primerima.
