Veštačka inteligencija na srpskom 21.09.2026.

Kako pokrenuti AI model lokalno na svom računaru

Kako pokrenuti AI model lokalno na svom računaru

Lokalni AI model radi na vašem računaru, a ne na serverima neke kompanije. Upiti i dokumenti ne napuštaju mašinu, alat funkcioniše i bez internet veze, a nema naplate po broju tokena. Cena je u hardveru i u kvalitetu: modeli koji staju na običan računar manji su od onih iza usluga kao što su ChatGPT, Claude ili Gemini. Ovaj vodič prolazi kroz dva najčešća načina, Ollamu i LM Studio, sa zahtevima i komandama preuzetim iz njihove zvanične dokumentacije (provereno 21. septembra 2026).

Šta je potrebno pre početka

Ollama za Mac traži macOS 14 Sonoma ili noviji. Na računarima sa Nvidia grafičkom karticom podržane su kartice sa računskim kapacitetom 5.0 ili višim i drajverom verzije 550 ili novijom, dok starije kartice iz opsega od 5.0 do 6.2 traže drajver 570 ili noviji. Podržane su i AMD kartice preko biblioteke ROCm. Uputstvo za brzi početak preporučuje 8 GB video ili objedinjene memorije na Macu za model gemma4:e2b, čije je preuzimanje veliko oko 7,2 GB.

LM Studio ima sopstvene zahteve:

  • Mac: samo Apple Silicon (M1, M2, M3, M4), macOS 14 ili noviji, preporučeno 16 GB RAM-a, a uz manje modele moguće i 8 GB. Intel Mac nije podržan.
  • Windows: x64 procesor sa AVX2 ili ARM (Snapdragon X Elite), preporučeno 16 GB RAM-a i 4 GB ili više namenske video memorije.
  • Linux: AppImage, Ubuntu 20.04 ili novije. Dokumentacija navodi da verzije novije od 22 nisu dobro testirane.

Sve ove brojke odnose se na memoriju koju model zauzima dok radi. Model mora da stane u video ili objedinjenu memoriju zajedno sa kontekstom razgovora, pa veći modeli traže srazmerno više.

Korak 1: izaberite alat

Ollama se pokreće iz komandne linije i izlaže lokalni API, zbog čega je pogodna za programere i za povezivanje sa drugim alatima. LM Studio je aplikacija sa grafičkim interfejsom u kojoj se modeli traže i preuzimaju preko Hugging Facea, a razgovor se vodi u samom prozoru. LM Studio podržava GGUF modele preko biblioteke llama.cpp, a na Apple Silicon računarima i MLX modele. Nijedan izbor ne isključuje drugi.

Korak 2: instalirajte Ollamu

  1. Otvorite ollama.com/download, preuzmite instalaciju za macOS, Windows ili Linux, pokrenite aplikaciju i prođite kroz uvodne korake.
  2. Na Linuxu, a na Macu kao alternativa DMG instalaciji, može se koristiti i skripta iz komandne linije:
curl -fsSL https://ollama.com/install.sh | sh

Korak 3: preuzmite i pokrenite model

Uputstvo koristi model gemma4:e2b iz porodice otvorenih modela Gemma 4, koju je razvio Google. Model se prvo preuzima, a zatim pokreće:

ollama pull gemma4:e2b
ollama run gemma4:e2b

Posle druge komande otvara se razgovor u terminalu. Biblioteka Ollame nudi Gemma 4 u više varijanti (E2B, E4B, 12B, 26B i 31B), a što je varijanta veća, potrebno je više memorije. Veličina preuzimanja navedena je na stranici svakog modela i vredi je proveriti pre preuzimanja.

Korak 4: proverite da li model koristi grafičku karticu

Komanda ollama ps ispisuje modele koji su trenutno učitani u memoriju i pokazuje da li rade na grafičkoj kartici, na procesoru ili podeljeno. Ako model radi na procesoru, odgovori su sporiji.

Prema FAQ-u, model po podrazumevanim podešavanjima ostaje u memoriji pet minuta posle poslednjeg upita. To se menja promenljivom okruženja OLLAMA_KEEP_ALIVE.

Korak 5: podesite dužinu konteksta

Prema dokumentaciji Ollame, podrazumevana veličina konteksta je 4096 tokena, što je dovoljno za kratke razgovore, ali ne i za duže dokumente. Može se promeniti pri pokretanju servera:

OLLAMA_CONTEXT_LENGTH=8192 ollama serve

Ako aplikacija već radi u pozadini, promenljivu treba podesiti na način koji FAQ opisuje za vaš operativni sistem. Duži kontekst troši više memorije. Dokumentacija navodi i da se pri paralelnoj obradi potrebna memorija množi brojem paralelnih zahteva i dužinom konteksta.

Korak 6: alternativa u LM Studiju

  1. Instalirajte LM Studio sa lmstudio.ai i pokrenite ga.
  2. U odeljku Getting Started izaberite opciju Download an LLM. Pretraga i preuzimanje idu preko Hugging Facea.
  3. Kada se model preuzme, učitajte ga i vodite razgovor u aplikaciji.
  4. Za pristup iz drugih programa, u kartici Developer može da se pokrene lokalni server sa OpenAI kompatibilnim krajnjim tačkama, dostupan na istom računaru ili u mreži.

Korak 7: povežite model sa drugim alatima

Ollama podrazumevano izlaže server na adresi http://localhost:11434. Prema dokumentaciji, podržani su njen izvorni format (/api/chat), OpenAI Chat Completions (/v1/chat/completions), OpenAI Responses (/v1/responses) i Anthropic Messages (/v1/messages). Zato se alati koji govore ove protokole mogu usmeriti na lokalni model umesto na oblak, a kvalitet rada zavisi od izabranog modela. U uputstvu za brzi početak pominje se i komanda ollama launch claude za pokretanje agenta za programiranje, a više o tom alatu nalazi se u temi o Claude Code-u. Kako se lokalni model kombinuje sa sopstvenim dokumentima, objašnjava tekst o tome kada firmi zaista treba AI nad dokumentima.

Korak 8: pripazite na mrežnu izloženost

Ollama se podrazumevano vezuje za adresu 127.0.0.1 i port 11434, pa je dostupna samo sa istog računara. Promenljiva OLLAMA_HOST menja tu adresu, a vrednost 0.0.0.0:11434 otvara servis svim uređajima u mreži. Takvo podešavanje treba raditi samo u mreži kojoj se veruje, jer svaki uređaj tada može da šalje upite modelu. Modeli se čuvaju u direktorijumu koji se menja promenljivom OLLAMA_MODELS, što je korisno kada glavni disk ima malo prostora.

Kada lokalni model ima smisla

Najjasniji slučaj su podaci koji ne smeju da napuste računar: interna dokumenta, prepiska sa klijentima ili izvorni kod pod ugovornom obavezom čuvanja. Drugi slučaj je rad bez stabilne internet veze. Treći je eksperimentisanje: lokalni API omogućava da se aplikacija ili skripta isprobaju bez troška po upitu, a da se kasnije, ako zatreba, pređe na jači model iz oblaka. Ako je cilj samo povremeno pitanje asistentu, usluga u oblaku je jednostavnija, jer ne traži ni instalaciju ni pripremu hardvera.

Realna očekivanja

Lokalni modeli rešavaju dva konkretna problema: podaci ostaju na računaru i nema mesečne naknade. Ne zamenjuju uvek velike modele iz oblaka. Manje varijante slabije rade na dugim i složenim zadacima, a brzina odgovora zavisi od memorije i grafičke kartice. Ko razmišlja o tome šta deli sa uslugama u oblaku, može da pročita i tekst o tome kako koristiti ChatGPT za posao bez rizika po podatke, a pregled opcija bez pretplate nalazi se u tekstu o besplatnim alternativama plaćenim AI alatima.

Često postavljana pitanja

Da li lokalni model šalje moje podatke na internet?

Ollama u dokumentaciji navodi da pri lokalnom radu ne vidi upite ni podatke korisnika. Internet je potreban za preuzimanje modela. Izuzetak su modeli koji se izvršavaju u Ollaminom oblaku, a u biblioteci nose oznaku cloud: oni se obrađuju na njenim serverima i nisu lokalni.

Da li je potrebna grafička kartica?

Ollama koristi Nvidia i AMD kartice kada su podržane, a komanda ollama ps pokazuje da li model radi na kartici, na procesoru ili podeljeno. Na Macu sa Apple Silicon čipom objedinjena memorija služi umesto video memorije.

Koliko memorije je potrebno?

Za model iz Ollaminog uputstva preporučeno je 8 GB. LM Studio preporučuje 16 GB RAM-a na Macu i Windowsu, a na Macu navodi da je uz manje modele moguće i 8 GB. Veći modeli traže više.

Ollama ili LM Studio?

Ollama je komandna linija sa lokalnim API-jem, a LM Studio je aplikacija sa grafičkim interfejsom. Oba mogu da izlože lokalni server drugim programima.

Šta ako model ne staje u memoriju?

Ako model ne staje u video memoriju, deo se prebacuje na procesor i komanda ollama ps to prikazuje kao podeljeno izvršavanje, uz sporije odgovore. Rešenje je manja varijanta istog modela, na primer E2B umesto većih verzija Gemma 4.

Može li lokalni model da zameni ChatGPT, Claude ili Gemini?

Zavisi od zadatka. Za kratke i privatne zadatke može da bude dovoljan, dok najzahtevniji zadaci često ostaju na većim modelima u oblaku. Kvalitet izabranog modela najpouzdanije se procenjuje na sopstvenim primerima zadataka.

Ključne reči
lokalni AI model Ollama LM Studio pokretanje AI modela lokalno Gemma 4 privatnost AI lokalni LLM vodič
Podeli članak
Prethodni članakGoogle objavio AX 0.3.0, orkestrator za AI...

Budi u toku sa AI revolucijom

Prijavi se na newsletter i primaj najvažnije o AI agentima i modelima u inbox.