Lokalna UI na prenosniku: tvoja prva osebna storitev

Model na prenosniku odgovori na vprašanje povsem brez internetne povezave. Nato, ne da bi karkoli spremenil, na isto vprašanje odgovori še drugi aplikaciji na istem prenosniku. V tem drugem koraku prenosnik, ki ga že uporabljaš, postane majhen osebni strežnik za UI: nanj se lahko obrnejo tudi druge aplikacije in skripti.

Tukaj preneseni model poganjaš, ne učiš. Če še nisi preveril, ali ima tvoj prenosnik za to dovolj RAM-a oziroma VRAM-a, najprej preberi, koliko RAM-a potrebuje prenosnik za lokalno UI. Če veš, da ustreza zahtevam, nadaljuj.

Štiri plasti vsake lokalne postavitve UI

Pri lokalni UI je dobro poznati štiri ločene plasti. Tako boš spodnjim korakom lažje sledil.

Uteži modela so v datoteki, ki jo preneseš, na primer v 3,4 GB veliki kvantizirani različici manjšega modela. Ta številka označuje velikost prenosa, ne pove pa, koliko RAM-a bo model potreboval med delovanjem.

Izvajalnik modela naloži uteži in odgovarja na zahteve. V tem vodiču je to Ollama z lastnim lokalnim API-jem prek HTTP. Ta plast omogoča, da model na prenosniku uporabljajo tudi druge aplikacije.

Odjemalec pošilja zahteve izvajalniku. To je lahko Ollamin vgrajeni klepet, kratek skript ali ločena aplikacija. Od odjemalca je odvisno, ali poziv ostane na prenosniku ali se pošlje drugam.

Izbirni indeks dokumentov modelu za klepet omogoča iskanje po tvojih datotekah. Uporablja ločen model za vektorske predstavitve in svoj prostor za shranjevanje. Ne nastane samodejno in ga ta vodič ne obravnava.

Na kratko: aplikacija ali skript pošlje zahtevo Ollami na naslovu 127.0.0.1:11434, ta pa naloži preneseni model. Če model izbrišeš, s tem ne izbrišeš zgodovine klepeta, ki jo je shranil odjemalec. Model in zgodovina sta shranjena ločeno.

Pred namestitvijo: je tvoj prenosnik podoben enemu od teh dveh?

Pred namestitvijo si vzemi dve minuti in zapiši, koliko RAM-a ima tvoj prenosnik, kateri operacijski sistem in procesor uporablja, ali ima namenski grafični pomnilnik (VRAM) ter koliko prostora je še na SSD-ju. Če te zanima, koliko RAM-a in VRAM-a potrebuje lokalna UI in zakaj, preberi vodič o tem, koliko RAM-a potrebuje prenosnik za lokalno UI.

Spodnja prenosnika sta trenutno na voljo na refurbed. Oba sta strokovno preizkušena, očiščena in obnovljena ter imata 12-mesečno garancijo. Prvi sodi v osnovni razred Applovih prenosnikov s čipi Apple Silicon, drugi pa je prenosnik z operacijskim sistemom Windows in namenskim grafičnim pomnilnikom. Z obema lahko izvedeš vse korake v tem vodiču.

Namesti Ollamo v sistemu macOS, Windows ali Linux

Za macOS ali Windows uporabi uradno aplikacijo Ollama, za Linux pa sledi njenim navodilom za namestitev. Po namestitvi jo odpri. V Linuxu zaženi ollama serve, če storitev še ne sprejema povezav.

Trenutna aplikacija ponuja delo z lokalnimi modeli in uporabo storitev v oblaku. Izberi oznako prenesenega lokalnega modela. Za lokalno izvajanje se ti sploh ni treba prijaviti.

Za ta vodič prenesi model z natančno to oznako: qwen3.5:4b-q4_K_M. Velikost prenosa je 3,4 GB. Natančna oznaka je pomembna, saj lahko splošna oznaka »latest« brez opozorila označuje precej večji model od tistega, ki si ga preizkusil. Teh 3,4 GB je velikost datoteke na disku, ne pa podatek o tem, koliko pomnilnika bo model potreboval med odgovarjanjem.

Prenesi prvi model in začni klepet

Za prvi pogovor z modelom potrebuješ le dva ukaza:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

Prvi prenese model, z drugim pa odpreš klepet. Namesto splošnega pozdrava daj modelu kratko, konkretno nalogo, na primer: »Iz teh treh zapiskov s sestanka sestavi seznam nalog. Ne izmišljaj si datumov.«

Klepet končaš z ukazom /bye.

Pošlji zahtevo prek API-ja: UI teče na tvojem prenosniku

Pri klepetu v terminalu odjemalec pošilja zahteve izvajalniku. Zdaj istemu izvajalniku pošlji zahtevo neposredno, kot bi mu jo poslala druga aplikacija.

V sistemu macOS ali Linux:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"V enem stavku pojasni lokalno izvajanje modela UI."}],"stream":false,"options":{"num_ctx":4096}}'

V sistemu Windows uporabi PowerShell:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"V enem stavku pojasni lokalno izvajanje modela UI."}],"stream":false,"options":{"num_ctx":4096}}'

V odgovoru poišči message.content. Če stream nastaviš na false, dobiš en celoten odgovor namesto odgovora po delih. Z num_ctx: 4096 nastaviš velikost konteksta za prvi preizkus precej pod najvišjo vrednost, navedeno za model.

Kaj še razkrije odgovor

Odgovor vsebuje več kot le besedilo modela. Poleg message.content Ollama vrne podatke o času in obdelavi, ki jih je vredno pogledati: load_duration, prompt_eval_count, prompt_eval_duration, eval_count in eval_duration.

Ti podatki ločijo čas nalaganja modela v pomnilnik od časa ustvarjanja odgovora. En sam podatek o »žetonih na sekundo« te razlike ne pokaže. Prva zahteva po zagonu Ollame je običajno najpočasnejša, ker je treba model najprej naložiti; pri naslednji zahtevi tega koraka ni.

Natančne številke so povsem odvisne od tvojega prenosnika, zato tu nobene ne navajamo kot značilne. Primerjaj podatke iz dveh preizkusov na istem prenosniku, namesto da se zaneseš na eno samo navedbo o hitrosti.

Kaj teče: ps, ls in sprostitev pomnilnika po mirovanju

Za osnovni pregled zadostujejo trije ukazi.

ollama ps pokaže, kateri model je trenutno naložen in kje teče. V stolpcu za procesor lahko piše 100% GPU ali 100% CPU, obremenitev pa je lahko tudi razdeljena med oba.

ollama ls izpiše vse modele, ki si jih prenesel.

ollama rm qwen3.5:4b-q4_K_M odstrani preneseni model, ki ga ne potrebuješ več.

Ollama model privzeto sprosti iz pomnilnika po petih minutah neaktivnosti. Če ollama ps ne pokaže naloženega modela, pošlji še eno zahtevo, preden skleneš, da je kaj narobe.

Z lokalnim API-jem, združljivim z OpenAI, poveži še drugo aplikacijo

Model na prenosniku lahko zdaj uporablja tudi druga aplikacija, ne le vgrajeni klepet. Aplikacijo namesto na storitev v oblaku usmeriš na svoj prenosnik.

Večina aplikacij, ki omogočajo nastavitev naslova API-ja, združljivega z OpenAI, zahteva tri podatke: osnovni URL, ime modela in ključ API. Za osnovni URL vnesi http://localhost:11434/v1/, za ime modela pa qwen3.5:4b-q4_K_M.

Pri ključu API lahko nastane zmeda. Nekatere aplikacije ne dovolijo, da bi polje zanj pustil prazno. Ollamina dokumentacija zato navaja nadomestno vrednost api_key='ollama' in pojasnjuje, da lokalni strežnik zahteva neprazno polje, njegovo vsebino pa prezre. Ta niz zgolj zapolni polje v obrazcu: ničesar ne preverja in ni geslo.

Združljivost ne zajema vseh funkcij posameznih API-jev. Preden računaš na določeno funkcijo, na primer vnos slik ali klicanje orodij, jo preizkusi v aplikaciji, ki jo uporabljaš.

Ponovi zahtevo brez povezave in preveri, kje teče model

Vse dosedanje zahteve bi se teoretično lahko neopazno pošiljale tudi prek interneta. To možnost lahko preveriš.

Ko se model do konca prenese, izklopi Wi-Fi na prenosniku ali odklopi omrežni kabel. Nato v klepetu ali prek API-ja ponovi isto zahtevo kot prej. Če model odgovori tudi brez kakršnekoli povezave, je to dokaz, da teče lokalno.

Za dokaz ne štejejo odgovor, ki ga dobiš le ob internetni povezavi, odgovor z naslova https://ollama.com namesto z localhost ali uporaba oznake modela v oblaku namesto prenesenega modela. Ollama lokalne zahteve obdela na tvojem prenosniku, za ločene modele v oblaku pa uporabi gostovano storitev.

Pomočnik UI brez povezave: na kaj pazi pri zasebnosti

Zasebnost ni samoumevna. Dobro je vedeti, kaj te pri tej postavitvi ščiti in česa ne.

Ollama privzeto posluša le na naslovu 127.0.0.1:11434, ki je dostopen samo s tvojega prenosnika. Te nastavitve ne spreminjaj. Ne nastavljaj OLLAMA_HOST=0.0.0.0 in vrat 11434 ne preusmerjaj na javni internet. Nadomestni ključ API iz prejšnjega razdelka ne preverja pristnosti. Če vrata odpreš internetu, omogočiš dostop, ne da bi ga zaščitil.

Če želiš Ollamine funkcije v oblaku povsem izklopiti, to lahko storiš, ni pa potrebno: s prenesenim lokalnim modelom že izbereš lokalno izvajanje. V datoteko ~/.ollama/server.json dodaj {"disable_ollama_cloud": true} ali nastavi OLLAMA_NO_CLOUD=1. V obeh primerih Ollamo ponovno zaženi, da sprememba začne veljati.

Dostop do te postavitve iz druge sobe ali z druge naprave je ločena, zahtevnejša tema. Vključuje zasebno omrežje in posredniški strežnik, ki pred Ollamo preverja pristnost. Tega tu ne obravnavamo; neposredno odpiranje vrat ni ustrezna rešitev.

Če se kje zatakne

Pri najpogostejših težavah najprej preveri naslednje.

Povezava je zavrnjena. Preveri, ali aplikacija Ollama oziroma ollama serve teče, nato poskusi znova.

Prvi odgovor je počasen, naslednji so hitrejši. Razlika je v času nalaganja modela, ne v hitrosti ustvarjanja odgovora. Preveri polja v odgovoru, opisana zgoraj.

Vse deluje precej počasneje, kot si pričakoval. Zaženi ollama ps: izpis lahko pokaže, da model teče samo na CPU-ju ali delno na CPU-ju in delno na GPU-ju. Preveri podporo za grafično kartico in njene gonilnike v svojem operacijskem sistemu.

Primanjkuje pomnilnika ali se program sesuva. Izberi manjši model, znižaj num_ctx in pred ponovnim poskusom zapri druge aplikacije, ki porabljajo veliko pomnilnika.

Na disku zmanjkuje prostora. Z ollama ls preveri, kateri modeli so preneseni, z ollama rm pa odstrani tiste, ki jih ne uporabljaš.

Če ti ta način dela ne ustreza, denimo ker želiš grafični pregledovalnik modelov ali natančnejši nadzor nad CPU-jem in GPU-jem, si lahko ogledaš LM Studio in llama.cpp. V tem primeru je smiselno zamenjati izvajalnik, ne pa uporabljati dveh postavitev hkrati.

Pogosta vprašanja o lokalni UI na prenosniku

Ali po začetni nastavitvi še potrebujem internet? Ne. Ko se model do konca prenese, lahko z njim klepetaš in uporabljaš njegov API povsem brez povezave.

Ali nadomestni ključ API ščiti dostop do lokalnega API-ja? Ne. Ollamin lokalni strežnik sprejme vsako neprazno vrednost, ne da bi jo preveril. Ključ, ki ga zahtevajo nekatere aplikacije, zato ni varnostni ukrep.

Ali moj poziv ostane na prenosniku? Da, če uporabljaš oznako prenesenega lokalnega modela. Ollama ponuja tudi ločene modele v oblaku, ki uporabljajo gostovano storitev. Odloča oznaka modela, ki jo izbereš, ne skrita privzeta nastavitev.

Ali potrebujem namensko grafično kartico? Ne. Tudi prenosnik, ki model izvaja samo na CPU-ju, lahko poganja manjši model, običajno počasneje. ollama ps pokaže, kako je bila obdelana posamezna zahteva.

Kaj pa, če želim večji ali drugačen model? V istih ukazih ollama pull in ollama run zamenjaj oznako modela, vendar najprej preveri RAM in VRAM. Podrobnosti najdeš v vodiču o tem, koliko RAM-a potrebuje prenosnik za lokalno UI.

Ali si bo model odslej zapomnil moje dokumente? Ne. Model za klepet si mape sam od sebe ne zapomni trajno. Za iskanje po svojih datotekah potrebuješ ločen indeks dokumentov. Ta korak je neobvezen in ga tu ne obravnavamo.

Zdaj si na vrsti: svojo storitev UI uporabi za pravo nalogo

Izberi eno konkretno nalogo in jo preizkusi v obeh odjemalcih, ki ju imaš zdaj na voljo: v vgrajenem klepetu in v drugi aplikaciji, ki si jo pravkar povezal. Lahko povzameš osebni zapisek, razvrstiš več datotek v poimenovane skupine ali prosiš za razumljivo razlago kratkega odlomka kode.

Karkoli izbereš, si zapiši natančno oznako modela, različico izvajalnika, nastavitev konteksta, URL in nalogo, ki si jo dal modelu. Tako boš lahko rezultat pozneje ponovil sam ali pa ga bo lahko ponovil kdo drug.

Če se izkaže, da ima tvoj prenosnik za to premalo RAM-a ali VRAM-a, je vredno razmisliti o prenosniku z večjo pomnilniško rezervo. Naslednji članek v tej seriji bo o tem, kako sestaviti majhen nabor modelov: enega za klepet, enega za kodo in enega za iskanje.

Obnovljen prenosnik, primeren za lokalno izvajanje UI, na voljo na refurbed

Prvič se prijavite na naše novice in prihranite 15 €!

Nikoli več ne zamudite ponudbe.

Informacije o uporabi osebnih podatkov najdete v naši Politiki zasebnosti.