qwen3.5:4b-q4_K_M, ki ga poznaš iz drugega dela serije, na običajnem prenosniku s 16 GB pomnilnika že piše besedila, razlaga in odgovarja na vsakdanja vprašanja, povsem brez povezave. Kot splošni pomočnik se dobro obnese. Za iskanje po tvojih datotekah ali programersko nalogo pa ni prava izbira. Če od enega prenesenega modela pričakuješ vse, ga preobremeniš, namesto da bi uporabljal tri manjše, vsakega za svojo nalogo.
Pri lokalni UI imaš nadzor, ko se zavestno odločiš, kateri model in programski pogon boš uporabljal, kaj dovoljuje licenca in kje ostanejo podatki. Če še nisi preveril RAM-a ali VRAM-a v svojem prenosniku, najprej preberi, koliko RAM-a potrebuje prenosnik za lokalno UI. Če še nimaš nameščene Ollame, ti vodnik za nastavitev prvega lokalnega ponudnika UI pokaže postopek. Tu predpostavljamo, da si oboje že uredil. Zdaj je na vrsti izbira modelov in preizkus, ali se obnesejo.
Za uporaben nabor lokalne UI potrebuješ modele za tri različne naloge, ne enega, ki bi moral opraviti vse.
Splošni pomočnik za vsakdanji klepet, osnutke in hitra vprašanja: qwen3.5:4b-q4_K_M. Prenos je velik 3,4 GB, oznako pa poznaš iz drugega dela serije.
Majhen specializirani model za ožjo nalogo, denimo pripravo izpisa v določeni obliki ali sklepanje z omejitvami: granite4.2:3b. Prenos je velik 2,2 GB. Model je izšel avgusta 2026 in ima licenco Apache 2.0. V 6. razdelku najdeš še modele za programiranje, matematiko, slike in prevajanje, zato lahko namesto njega izbereš tistega, ki ustreza tvoji nalogi.
Model za vektorske predstavitve za iskanje po lastnih dokumentih: embeddinggemma:300m (622 MB). Ta model ne klepeta, temveč besedilo pretvarja v vektorje, po katerih išče aplikacija. Podrobnosti so v 8. razdelku.
Vsi trije prenosi skupaj zavzamejo približno 6,2 GB prostora na disku. To ni njihova skupna poraba pomnilnika med delovanjem: če so vsi trije naloženi hkrati, lahko presežejo razpoložljivi pomnilnik prenosnika. Zato za posamezno nalogo naloži en model, preizkusi ga pri resničnem opravilu in odstrani tistega, ki ti ne koristi.
Razliko najlažje vidiš, če primerjaš različice iz iste družine modelov. Ollama za qwen3.5:9b-q4_K_M navaja prenos velik 6,6 GB, za qwen3.5:9b-q8_0 11 GB, za qwen3.5:9b-bf16 pa 19 GB. Uteži istega modela so zapisane s tremi različnimi natančnostmi, zato so različne tudi velikosti prenosov.
To so velikosti prenosov iz kataloga, ne zagotovljena poraba pomnilnika po nalaganju. Pri nižji natančnosti je datoteka manjša, pogosto pa model zasede tudi manj pomnilnika. Ali se zaradi tega poslabša kakovost odgovorov in za koliko, je odvisno od modela, načina kvantizacije in naloge. Ne predpostavljaj, da razlike ne bo ali da manjša datoteka nima vpliva na kakovost.
Pomnilnika ne zasedajo le naložene uteži. Prostor potrebujeta tudi kontekstno okno in njegov predpomnilnik ključev in vrednosti, poleg njiju pa še vse drugo, kar teče na prenosniku. Če s kvantizacijo sprostiš pomnilnik, to še ne zagotavlja, da bo vanj šel večji model. Pomeni le, da ga je smiselneje preizkusiti kot različico s polno natančnostjo.
V katalogu sta dve pasti pri oznakah, zaradi katerih lahko preneseš drug model, kot si ga nameraval preizkusiti.
Prva past. Google na kartici modela Gemma 4 E2B navaja 2,3 milijarde »efektivnih« jezikovnih parametrov. Po tem podatku bi morda pričakoval majhno datoteko, vendar je prenos v Ollami velik 7,2 GB, skoraj toliko kot različica Q4 modela gemma4:12b s 7,6 GB. Ko presojaš, kaj lahko shraniš na prenosnik, preveri velikost prenosa, ne le oznake s številom parametrov.
Druga past. Če za prenos navedeš samo ime družine, lahko neopazno dobiš napačno različico. Z oznako granite4.2 preneseš model 8B (5,3 GB), ne različice 3B (2,2 GB) iz 2. razdelka. Z oznako qwen3-embedding preneseš model 8B (4,7 GB), ne različice 0,6B (639 MB), uporabljene v 8. razdelku.
V obeh primerih velja isto: pri prenosu vedno navedi celotno, natančno oznako modela, ne samo imena družine. Preden skleneš, da si prenesel model, ki si ga želel preizkusiti, preveri še velikost prenesene datoteke.
Podatek o največ 128K ali 256K žetonih v katalogu pove, koliko jih model načeloma sprejme. Ne pove pa, ali ima tvoj prenosnik s 16 GB pomnilnika dovolj prostora za tako dolg kontekst.
Ollama privzeto nastavi kontekst na 4096 žetonov. Mejo lahko dvigneš, vendar poraba pomnilnika narašča tako z dolžino konteksta kot s številom vzporednih zahtev. Nastavitev num_ctx: 4096 iz drugega dela serije je prav ta previdna privzeta vrednost, ne poljubno izbrana okrogla številka.
Nov model začni preizkušati s 4.000 do 8.000 žetoni in le eno sejo naenkrat. Pri tem spremljaj porabo sistemskega pomnilnika. Kontekst podaljšaj šele, ko vidiš, da poraba ostaja stabilna, ne zgolj zato, ker katalog navaja višjo mejo.
En sam najboljši specializirani model ne obstaja. Izbira je odvisna od tvoje naloge; za vsako je vredno preizkusiti nekaj manjših modelov.
Programiranje: qwen2.5-coder:3b (1,9 GB) ali večji qwen2.5-coder:7b (4,7 GB). Oba imata licenco Apache 2.0.
Matematika ali logika z omejitvami: Microsoftov phi4-mini:3.8b (2,5 GB).
Vprašanja o slikah in zaslonskih posnetkih: gemma4:e2b (7,2 GB) ali gemma4:12b Q4 (7,6 GB). Oba imata licenco Apache 2.0, po podatkih v katalogu pa sprejemata besedilo in slike.
Večjezično pisanje ali prevajanje: aya-expanse:8b (5,1 GB), zasnovan za 23 jezikov.
Pri licencah velja opozoriti na pomembno omejitev: Aya Expanse 8B ima licenco CC-BY-NC-4.0 z dodatnimi pogoji za nekomercialno uporabo. Zato ga ne obravnavaj kot neomejeno privzeto izbiro ob zgornjih modelih z licenco Apache. Če nobena od teh štirih vrst nalog ni tvoja, ostaja granite4.2:3b iz 2. razdelka splošna izbira za sklepanje.
Preden se odločiš, kateri model boš obdržal, ga preizkusi pri svojem opravilu. V nabor sodi, če ti pri njem pomaga, ne zato, ker je prvi na tuji lestvici.
Pet kratkih preizkusov ti o modelu pove več kot stran v katalogu. Vse kandidate preizkusi z istimi petimi nalogami in s svojim gradivom.
1. Povzetek z oporo v besedilu. Modelu daj zapis, dolg 250 besed, in ga prosi, naj iz njega izlušči tri konkretne naloge. Pri vsaki naj navede stavek, iz katerega izhaja. Označi vse trditve, ki jih besedilo ne podpira.
2. Strukturirano izluščenje podatkov. Izmisli si pet sestankov z imeni in datumi. Zahtevaj zapis JSON z natanko tistimi polji, ki jih določiš, nato vseh pet vnosov primerjaj s svojimi podatki.
3. Popravek kode. Modelu daj kratko funkcijo, ki ne prestane testa, in ta test. Zabeleži, ali ga po modelovem popravku funkcija prestane. Pri vseh modelih, ki jih primerjaš, uporabi isti repozitorij in isti kontekst.
4. Jezikovni par. Nekdo, ki tekoče obvlada oba jezika, naj preveri, ali so se v prevodu realističnega odstavka ohranili imena, številke in pomenski odtenki. Večjezičnih zmožnosti ne ocenjuj samo z navodilom v angleščini.
5. Vprašanje o sliki, samo za modele, ki razumejo slike. Pokaži jim graf ali zaslonski posnetek, pri katerem lahko preveriš odgovor. Prepričaj se, da je model prejel sliko in ne le imena datoteke.
Pri vsakem preizkusu zabeleži pravilnost glede na odgovor, ki ga poznaš, upoštevanje navodil, morebitne izmišljene trditve, čas do prvega vidnega izpisa, skupni čas, število žetonov in podatek, ali je model tekel na CPU ali GPU. Uporabnost in hitrost oceni ločeno: model, ki pred odgovorom sklepa, lahko porabi čas tudi za žetone, ki jih ne vidiš.
Model za vektorske predstavitve iz 2. razdelka pretvarja besedilo v vektorje, po katerih lahko išče aplikacija. Sam na vprašanja ne odgovarja.
Vrstni red je pomemben: datoteke razdeliš na odseke, model za vektorske predstavitve vsak odsek pretvori v vektor, lokalna vektorska zbirka pa jih shrani. V vektor se pretvori tudi tvoje vprašanje. Aplikacija poišče najbližje odseke; šele nato klepetalni model na njihovi podlagi odgovori in jih navede kot vire.
Klepetalni model se ni učil na tvojih dokumentih. Ob vprašanju vidi le odseke, ki jih zanj najde aplikacija.
Za kratek preizkus ne potrebuješ veliko priprav: v indeks dodaj pet zapiskov, ki jih že imaš. Sestavi vprašanje, na katero je odgovor v enem od njih, in drugo, na katero ni odgovora v nobenem. Če sistem deluje, bo pri prvem našel pravi odlomek in ga navedel kot vir, pri drugem pa priznal, da nima dokazov, namesto da bi si jih izmislil. Uspešnost iskanja in končni odgovor oceni ločeno.
Pred prenosom preveri celotno oznako modela za vektorske predstavitve: embeddinggemma:300m ali qwen3-embedding:0.6b. Razlog je isti kot pri nepopolnih oznakah v 4. razdelku.
Pri modelu z oznako, kot je »26B A4B«, se pri ustvarjanju posameznega žetona uporabi le del parametrov. Vseh 26 milijard uteži pa je treba nekje shraniti ali jih od tam sproti brati. Manj aktivnih parametrov zato ne pomeni nujno manjše datoteke ali manjše porabe pomnilnika.
Za ta nabor nismo na novo izmerili nobenih rezultatov preizkusov zmogljivosti. Če navajamo podatek od drugod, denimo poročilo enega uporabnika o približno 18,5 žetona na sekundo pri neobičajni postavitvi modela 26B z mešanico ekspertov, starejšim procesorjem in grafično kartico s 6 GB pomnilnika, ga obravnavaj kot rezultat te ene konfiguracije na strojni opremi te osebe. Ne pričakuj enake hitrosti od vsakega modela s takšno oznako.
Ta nabor smo preizkusili na dveh konkretnih prenosnikih iz drugega dela serije: osnovnem prenosniku s čipom Apple Silicon in prenosni delovni postaji z Windows ter lastnim grafičnim pomnilnikom. Oba sta obnovljena (strokovno preizkušena, očiščena in prenovljena), pri refurbed zanju velja 12-mesečna garancija. Oba brez težav zmoreta ta nabor, en model naenkrat.
13-palčni MacBook Air (2026) s čipom M5 ima v osnovni različici 16 GB enotnega pomnilnika, na voljo pa je tudi konfiguracija z do 32 GB. Dell Precision 7730 ima 32 GB sistemskega pomnilnika in ločenih 6 GB pomnilnika VRAM za grafično kartico NVIDIA. Gre za dva ločena pomnilnika, ne za eno skupno količino.
Ne omenjamo ju zato, da bi ti ju prodali. Na njiju smo preverili ta vodnik, da lahko svoj prenosnik primerjaš s konkretnima napravama, ne le s podatki v oglaševalski tabeli.
Licenca velja za točno določen model, ne za vso družino. Qwen3.5 4B, Qwen2.5-Coder, Granite 4.2 3B in Gemma 4 E2B imajo licenco Apache 2.0. Za Aya Expanse 8B velja CC-BY-NC-4.0 z dodatnimi pogoji za nekomercialno uporabo, kot smo omenili že v 6. razdelku. Možnost prenosa uteži, avtorskopravno dovoljenje za njihovo uporabo in »lastništvo« osnovnega modela so tri različne stvari. Zato preveri aktualno kartico točno tistega modela, ki ga preneseš, ne le njegove družine.
Da nabor ostane majhen, ga moraš redno pregledovati; ena odločitev ni dovolj. Z ukazom ollama rm odstraniš preneseni model, ki ti ni prišel prav, na primer ollama rm aya-expanse:8b, ko veš, da ga ne boš uporabljal. ollama ls pokaže, kateri modeli so na disku, ollama ps pa, kateri so naloženi. Katalogi se spreminjajo, zato svoj izbor občasno preveri, namesto da bi se zanašal na odločitev izpred mesecev.
Tudi majhni modeli si lahko izmislijo odlomek, spregledajo pomenski odtenek v drugem jeziku ali napišejo kodo, ki je videti pravilna, a ne prestane testa. Vsako priporočilo tu vzemi kot predlog za lasten preizkus, ne kot nadomestilo za strokovni pregled pri pomembnih nalogah.
Ali lahko vse tri modele iz nabora uporabljam hkrati? Na prenosniku s 16 GB pomnilnika verjetno ne brez težav. Za vsako nalogo naloži en model in ga nato zamenjaj, namesto da bi splošnega pomočnika, specializirani model in model za vektorske predstavitve hkrati puščal v pomnilniku.
Ali model za vektorske predstavitve potrebuje grafični procesor? Ne. embeddinggemma:300m je dovolj majhen, da ga lahko preizkusiš samo na CPU, vendar izmeri čas delovanja, namesto da bi pričakoval takojšen rezultat.
Ali večji model vedno ponudi boljši odgovor? Ne. Ali se bolje odreže model 4B ali 9B, je odvisno od naloge. Zato je v 7. razdelku opisana metoda s petimi nalogami, ne le navedena številka z lestvice.
Ali je različica Q4 dovolj dobra? Odvisno od naloge. Če imaš dovolj pomnilnika za oba, pri treh svojih preizkusih primerjaj različici Q4 in Q8 istega modela, kot je opisano v 3. razdelku.
Ali lahko Aya Expanse uporabim v komercialnem projektu? Ne brez predhodnega preverjanja pogojev. Licenca CC-BY-NC-4.0 velja za nekomercialno uporabo, poleg tega veljajo dodatni pogoji. Preden sklepaš drugače, preveri aktualno kartico modela.
Ali model za vektorske predstavitve po prenosu potrebuje internet? Ne. Tako kot drugi modeli v tem naboru po shranitvi uteži na disk deluje brez povezave.
Na prenosnik, za katerega si v prvem delu ocenil potrebe po pomnilniku in ga v drugem pripravil za lokalno UI, namesti pomočnika 4B ter en specializirani model za svojo nalogo. Preizkusi ju s tremi lastnimi vprašanji po zgledu 7. razdelka. Obdrži model, ki ti pomaga, drugega pa odstrani z ukazom ollama rm. O nakupu več pomnilnika razmisli šele, ko ti resnična naloga, ne seznam specifikacij, pokaže, da je omejitev prav pomnilnik.
Tu se naša tridelna serija konča. Če se je izkazalo, da tvoj prenosnik najprej potrebuje več pomnilnika, si lahko za začetek ogledaš kategorijo prenosnikov.
Prvič se prijavite na naše novice in prihranite 15 €!
Nikoli več ne zamudite ponudbe.
Informacije o uporabi osebnih podatkov najdete v naši Politiki zasebnosti.
Potrdi registracijo
Skoraj končano: Poslali smo vam potrditveno e-sporočilo.