- Ollama elujõulisus sõltub eelkõige RAM-ist, GPU-st ja mudeli kvantimisest, mitte niivõrd rakendusest endast.
- 16 GB muutmälu ja 8–12 GB graafikaprotsessoriga saab 7B–13B kvantiseeritud mudeleid igapäevaseks kasutamiseks hästi käsitleda.
- Mudelite 30B–70B tegelikuks kasutuskõlblikkuseks on vaja 16–32 GB videomäluga ja vähemalt 32 GB muutmäluga graafikakaarti.
- Riistvara jaoks õige mudeli suuruse ja vormingu valimine hoiab ära krahhid ja võimaldab sujuvat ja privaatset kohalikku tehisintellekti.
Kui kaalute tehisintellekti mudelite käitamist oma arvutis, puutute paratamatult varem või hiljem kokku Ollamaga. Ja siin tekib suur küsimus: millised riistvaranõuded on vajalikud, et mudelid sujuvalt ja tõrgeteta töötaksid? Ei piisa sellest, et need lihtsalt käivituvad; oluline on, et neid saaks igapäevastes ülesannetes mugavalt kasutada, ja erinevat tüüpi arvutiriistvara mõistmine on hädavajalik.
Selles artiklis vaatleme üksikasjalikult, mida Llama teeb, mida erinevat tüüpi mudelid (7B, 13B, 70B jne) vajavad, kuidas protsessor, graafikakaart, muutmälu ja ketas jõudlust mõjutavad ning millised konfiguratsioonid on teie olukorras mõistlikud , olenemata sellest, kas soovite lihtsat tekstiassistenti või kavatsete käitada koletisi nagu Llama 3 kümnete miljardite parameetrite või nägemis- ja OCR-mudelitega.
Mis on Ollama ja miks riistvara nii oluline on?
Ollama on sisuliselt keelemudeli klient, mis võimaldab teil LLM-e lokaalselt teie arvutis käitada, ilma pilveteenuseid kasutamata. See kasutab järelduste tegemiseks selliseid mootoreid nagu llama.cpp ja koondab kogu keerukuse lihtsasse tööriista koos CLI ja REST API-ga, aidates teil mõista ka mudelite taga olevate tehisnärvivõrkude kontseptsioone .
Selle roll on olla „juhtimiskeskuseks“, kust saate alla laadida, hallata ja käitada mudeleid nagu Llama 3, Mistral, Gemma, Phi, Qwen, DeepSeek või multimodaalseid mudeleid nagu Llava . Nende ilu seisneb selles, et saate neid kasutada täiesti võrguühenduseta, hoides oma andmeid kohapeal ja ilma iga märgi eest maksmata, nagu see on pilvepõhiste API-de puhul.
Kuigi Ollama ise on kerge ja mittenõudlik, on selle käitatavad mudelid väga ressursimahukad . Iga LLM koosneb miljonitest või miljarditest parameetritest, mis tähendab gigabaite mälu ja salvestusruumi ning suurt koormust protsessorile ja kui see on olemas, ka graafikaprotsessorile.
Sellepärast, kui keegi proovib käivitada suurt mudelit (näiteks 70B Llama) võimsa protsessoriga, aga eraldi graafikakaardiga ja parajalt RAM-iga süsteemis, on tulemuseks tavaliselt, et "see töötab", aga on nii aeglane, et see on praktiliselt kasutu . Peamine on protsessori, graafikakaardi, RAM-i, kõvaketta ja mudeli tüübi õige tasakaal.
Ollama mudelitüübid ja kuidas need mõjutavad nõudeid
Ollama teegis näete mudeleid, mis on korraldatud perekondade ja suuruste kaupa: 1B, 2B, 4B, 7B, 13B, 30B, 65B, 70B, 405B… See arv (B miljardite asemel) näitab parameetrite ligikaudset arvu ja on üks teguritest, mis kõige enam määrab vajaliku riistvara.
Saame need üldiselt jagada nelja kategooriasse , mis aitavad oluliselt hinnata, millist masinat vajate iga mudelirühma ja kvantifitseerimise jaoks:
- Minimudelid (270M – 4B): mõeldud tagasihoidlikud seadmed (lihtsad sülearvutid, isegi mõned mobiiltelefonid või mini-PC-d). Kiire, aga väiksema arutlusvõimega.
- Väikesed mudelid (4B–14B)ideaalne kui tasakaalustatud „kodumaised” mudelidHea üldiseks vestluseks, kontoritöödeks, kergeks kodeerimiseks abiks jne.
- Keskmise suurusega mudelid (14B – 70B)Nad mängivad juba teises liigas; Nad vajavad võimsat riistvara., palju muutmälu ja võimalusel suure videomäluga graafikakaart.
- Suured mudelid (> 70B)Nad on loomad, kes on loodud selleks, et väga tõsised infrastruktuurid (Tipptasemel graafikaprotsessorid, mitu graafikakaarti, spetsiaalsed serverid, hästi kasutatav tipptasemel Mac jne).
Lisaks suurusele tuleb mängu ka kvantiseerimine : Ollamas näed järelliiteid nagu q4_K_M, q5_1, q3_K_S, q8_0, f16 jne. Need vormingud näitavad, kui tihedalt mudeli kaalud on kokku pakitud.
- FP16 / FP32 (f16, f32): vaevu kokku surutud, tippkvaliteet, aga jõhker mälukasutusFP16 7B mahutab üle 20 GB videomälu.
- 4. kvartal (4. kvartal_0, 4. kvartal_K…)4-bitine kvantiseerimine, suur suuruse vähendamine, millel on mõõdukas mõju kvaliteedileTavaliselt on nad "magus koht".
- Q3, Q2 (q3_K_S, q2_K…)agressiivsemad kvantiseerimised, väga väike suurus vastutasuks väikese täpsuse kao eestKasulik väga piiratud riistvara puhul.
- K5, K6, K8: tugeva kokkusurumise ja FP16 vahelised vaheetapid; Kõrgem kvaliteet, suurem tarbimine.
Praktiline tagajärg on selge: sama 7B mudel võib FP16-s hõivata umbes 26 GB või Q4-s umbes 4 GB . See kajastub otseselt vajalikus GPU videomälus ja töökoormust toetava RAM-i mahus.
Ollama minimaalsed ja soovitatavad riistvaranõuded kohalikus võrgus
Kui muretsed, kas su arvuti suudab Ollamaga hakkama saada, on vastus tavaliselt jaatav; küsimus on selles, millist mudelit sa tõrgeteta tööle saad panna . Vaatleme seda komponentide kaupa: RAM, protsessor, graafikakaart ja kõvaketas, pakkudes realistlikke soovitusi, mis põhinevad praktilisel kogemusel ja mitmete erialajuhendite dokumentatsioonil.
RAM: ülim kriitiline ressurss
Kohalike LLM-ide arutamisel on peamine kitsaskoht RAM . Üldiselt võime arvestada järgmiste vahemikega:
- 8 GB RAM: praktiline maapind. See võimaldab väikeseid mudeleid (1B, 3B, mõned 7B kõrgelt kvantiseeritud variandid)Siiski märkad piiranguid, eriti kui süsteem ja brauser juba palju mälu kasutavad. Tõenäoliselt töötab kõik veidi aeglaselt ja suurema viivitusega.
- 16 GB RAM: tänapäeva mõistlik standard. Ideaalne 7B ja isegi 13B mudelite jaoks, mis on kvantiseeritud Q4-sEriti kui kasutate graafikaprotsessoreid. Saate keerukate vestlustega töötada ilma, et süsteem aeglustuks.
- 32 GB RAM-i või rohkemSoovitatav, kui soovite keskmised mudelid (30B, 40B, 70B) või teha raskemaid asju, näiteks väga pikki kontekste, mitut mudelit paralleelselt, mitme kasutajaga servereid või Open WebUI-tüüpi graafilisi tööriistu Ollamal.
Pea meeles, et RAM-i ei kasuta ainult seade ise: seda tarbivad ka operatsioonisüsteem, brauser, IDE, Docker, Open WebUI ja muud rakendused . Kui soovid teatud olukordades mälu vabastada, saad teada, kuidas vähendada RAM-i kasutust sellistes rakendustes nagu brauser. Intensiivse kasutamise korral on praegu soovitatav miinimum 16 GB ja 32 GB on enam kui piisav.
Protsessor: kaasaegsed juhised ja tuumade arv
Ollama saab töötada ainult protsessoril, kuid kogemus varieerub protsessorist olenevalt oluliselt. Tuumade arvust olulisem on tugi täiustatud käskudele nagu AVX2 ja veelgi parem, AVX-512 , mis kiirendavad maatriksi- ja vektorioperatsioone, mida LLM-ides laialdaselt kasutatakse.
Mõistlik juhis oleks:
- Minimaalselt vastuvõetavKaasaegne neljatuumaline protsessor (näiteks uusima põlvkonna Intel i5 või samaväärne Ryzen protsessor) AVX2 toega. Teil on võimalik Käivita 7B mudeleid kannatlikult, eriti kui need on hästi kvantiseeritud.
- Recomendadouusima protsessori tüüp Intel 11. põlvkond või uuem või AMD Zen4, Mis 8 südamikku või rohkem ja AVX-512 tugi võimaluse korral. Nii saate paremad reageerimisajad ja vähem kitsaskohti isegi GPU-dega.
Kui plaanite kasutada väga suuri mudeleid (näiteks proovite 70B Llama 3 tagasihoidliku protsessori ja graafikaprotsessoriga), siis protsessoril on raskusi ja märkate väga pikki tokeni genereerimise aegu . Sellistel juhtudel on kõige mõistlikum valida väiksemad mudelid või investeerida sobivasse graafikaprotsessorisse.
Graafikakaart ja videomälu: millal on see oluline ja kui palju seda vaja on
Graafikaprotsessor (GPU) pole kohustuslik, aga sellel on tohutu tähtsus. Korralik graafikaprotsessor piisava videomäluga suudab aeglase kogemuse muuta täiesti kasutatavaks , eriti 7B kuni 13B kvantiseeritud mudelite puhul.
Väga kasuliku viitena võib kvantiseeritud mudelite (umbes Q4) puhul hinnata midagi sellist:
- 7B → ~4 GB videomälu
- 13B → ~8 GB videomälu
- 30B → ~16 GB videomälu
- 65–70B → ~32 GB videomälu
Need on ligikaudsed väärtused, kuid näitavad selgelt, et RTX 2060 SUPER GPU 8 GB videomäluga on enam kui võimeline 7B ja 13B jaoks, kuid jääb 70B-ga alla isegi i9 ja 64 GB muutmäluga. Sellisel juhul on süsteem sunnitud suure osa koormusest muutmälu ja protsessori vahel jaotama ning latentsus suureneb järsult.
Praktikas öeldes :
- koos 4–6 GB videomälu: keskenduge hästi kvantiseeritud 7B mudelidNeed sobivad väga hästi vestluseks, kirjutamiseks ja üldisteks ülesanneteks.
- koos 8–12 GB videomäluSaate mugavalt töötada 7B ja 13B ja isegi umbes 30B, kui oled nõus veidi aeglasemalt sõitma.
- koos 20–24 GB videomäluSa sisened nüüd territooriumile, 30B-40B mudelid, millel on märkimisväärne väärikusja mõned väga kvantiseeritud 70B, eriti kui teil on seda toetatud hea RAM-iga.
- koos 32 GB või rohkem videomälu: on siis, kui 70B hakkab tõesti mõistlik tunduma. interaktiivseks kasutamiseks, eeldusel, et ülejäänud meeskond kaasas on.
OCR-mudeli või muude spetsialiseeritud mudelite (nt nägemise) puhul on 20–24 GB videomäluga graafikakaart väga kindel alus sujuva jõudluse tagamiseks , eriti kui mudel hõlmab kümneid miljardeid parameetreid. Kergemate (2B–7B) OCR- või nägemisvariantide puhul peaks 8–12 GB olema täiesti piisav.
Kettaruum: kui palju ruumi mudelid võtavad
Mis puutub kettaruumi, siis Ollama rakendus ise võtab väga vähe ruumi; tegelikult võtavad ruumi mudelid. Põhi- või testkeskkonnas piisab umbes 50 GB-st , kuid kui hakata mudeleid koguma, suureneb ruum kiiresti.
Kvantiseeritud mudelite ligikaudse juhendina :
- Väikesed mudelid (1B-4B) → umbes 2 GB mudeli järgi.
- Keskmise suurusega mudelid (7B-13B) → tavaliselt 4 8-GB mudeli järgi vastavalt kvantifitseerimisele.
- Suured mudelid (30B-70B) → kergesti 16 40-GB igaüks
- Väga suured mudelid (> 100B) → võib ületada 200 GB mudeli järgi ja äärmuslikel juhtudel isegi ületada terabaite.
Ideaalis on mudeli kiiremaks esmaseks laadimiseks soovitatav kasutada kiiret SSD-d (võimalusel NVMe). Lisaks võimaldab Ollama teil muuta mudeli salvestuskohta keskkonnamuutuja OLLAMA_MODELS abil , nii et saate kasutada suurt teisest draivi ja vabastada ruumi oma põhidraivil. Lisateavet salvestusmahu ja draivitüüpide kohta leiate salvestusriistvara juhendist.
Ollama konkreetsete mudelite käitamise erinõuded
Kuigi igal mudelil on oma nüansid, saab praeguse Ollama ökosüsteemi põhjal anda tüüpiliste kasutuskategooriate jaoks mõned selged juhised : üldine vestlus, kodeerimine, nägemis-/OCR-mudelid ja hiiglaslikud 70B-tüüpi mudelid.
Üldised vestlusmallid (Llama, Mistral, Gemma, Qwen…)
Tüüpilise "kohaliku ChatGPT" kasutamiseks keskmise suurusega mudelitega nagu Llama 3.x 7B/8B, Mistral 7B, Gemma 2B/7B või Qwen oleks tänapäeval mõistlik seadistus midagi sellist:
- Soovitatav miinimum:
- Kaasaegne neljatuumaline protsessor AVX2-ga.
- 16 GB RAM.
- Ilma graafikakaartita või põhigraafikakaart 4–6 GB videomäluga.
- Vähemalt 50 GB SSD süsteemi jaoks + üks või kaks mudelit.
- Optimaalne konfiguratsioon rohke pearuumi tagamiseks 7B-13B-ga:
- 8 või enama südamikuga protsessor (kaasaegne i7/i9 või Ryzen 7/9).
- 32 GB RAM kui tahad palju asju avatuna hoida.
- Graafikakaart koos 8–12 GB videomälu (RTX 3060/3070 või samaväärne, AMD RX 6700 või uuem või Mac hästikasutatava M1/M2/M3 mälupulgaga).
- 1 TB SSD, kui kavatsed mudeleid koguda.
Nendes stsenaariumides toimivad Q4_K_M või Q5_K_M kvantiseerimisega 7B mudelid väga hästi ja pakuvad isiklikuks kasutamiseks, tehnilise dokumentatsiooni, õppeülesannete või kirjutamise toetamiseks enam kui küll kvaliteeti.
Kodeerimismudelid (DeepSeek, CodeLlama, koodile orienteeritud Phi)
Programmeerimisele spetsialiseerunud mudelitel on tavaliselt sarnased vajadused sama suurusega üldiste vestlusmudelitega , kuid kui kavatsete neid kasutada koos võimsa IDE ja paljude avatud projektidega , on soovitatav jätta veidi rohkem RAM-i ja VRAM-i varu .
Näiteks DeepSeek-Coderi (7B-8B) või sarnase suurusega CodeLlama kasutamiseks õigetes tingimustes oleks väga mõistlik kombinatsioon:
- Protsessor kaasaegsed 6-8 südamikku.
- 32 GB RAM kui töötate korraga mitme tööriistaga (IDE, vahekaartidega brauser, Docker jne).
- Graafikakaart vähemalt 8 GB videomäluga mudeli sujuvaks liigutamiseks.
See töötab ka vähem võimsa riistvaraga, kuid pikkade koodiplokkide genereerimisel või keerukate analüüside tegemisel märkad aeglasemat reageerimisaega . Kompaktsete mudelite, näiteks Phi-4 Mini, puhul on nõuded palju madalamad ja need toimivad hästi isegi 16 GB muutmälu ja kerge graafikaprotsessoriga süsteemides.
Visiooni- ja OCR-mudelid (võti, OCR-mudelid, multimodaalsed)
Kujutise töötlemise võimalustega (nägemine/OCR) mudelid, näiteks Llama või Llama 3.x multimodaalsed variandid, aga ka spetsiifilised OCR-mudelid lisavad veel ühe keerukusastme. Riistvara tasandil lähenevad need sama suurusega tekstimudeli nõuetele, kuid suurema eelisega on graafikaprotsessori (GPU) kasutamine.
Kui me räägime keskmise suurusega OCR-mudelist (näiteks 7B-13B vahemikus) ja soovite seda mugavalt lokaalselt dokumentide tuvastamiseks, skannitud piltide jms jaoks kasutada, on mõistlik kaaluda midagi sellist:
- Graafikaprotsessor 20–24 GB videomäluga olenemata sellest, kas mudel on tõesti suur või soovite peaaegu kogu töötlemise kaardile jätta.
- Graafikaprotsessor 8–12 GB videomäluga Kui valid kergemad ja hästi kvantiseeritud variandid, toimib see jätkuvalt hästi seni, kuni sa ei kasuta pildi suurust või hiiglaslikke kontekste üle.
- Vähemalt 16 GB RAM-i, kuigi 32 GB pakub intensiivseks kasutamiseks väga mugavat varu.
- kaasaegne protsessor, nii et see ei tekitaks GPU laadimisel kitsaskohta.
Tüüpilisele küsimusele „kas ma saan OCR-mudelit käitada graafikakaardil, millel on 20–24 GB videomälu?” on otsene vastus jah, see on suurepärane valik keskmise ja suure video-/OCR-mudeli jaoks Ollamas , eeldusel, et teil on ka piisavalt muutmälu ja korralik protsessor.
Hiiglaslikud mudelid (Llama 3:70B ja sarnased)
70KB Llama 3 käivitamine Windowsi keskkonnas väga võimsa protsessoriga (näiteks 11. põlvkonna i9) ja 64 GB muutmäluga, aga graafikakaardiga nagu 8 GB RTX 2060 SUPER, on suurepärane näide olukorrast "jah, aga ei". Mudel võib lõpuks laadida, aga:
- Osa mudelist ei mahu videomälusse ja sõltub suuresti muutmälust.
- Protsessor peab tegema palju järeldustööd.
- Žetooni kohta kuluv aeg kasvab hüppeliselt ja kogemus muutub praktiliselt kasutuskõlbmatuks..
Selleks, et 70B oleks kodu- või poolprofessionaalses keskkonnas mõistlik, vajate vähemalt midagi sellist:
- Baasmäluna 32 GB muutmälu, lisamäluvajaduse korral 64 GB.
- Graafikakaart vähemalt 24–32 GB videomäluga et laadida suurem osa mudelist mõistliku kvantisatsiooniga (Q4_K_M või sarnane).
- Võimas tipptasemel protsessor 8–16 südamikuga.
Kui te neid näitajaid ei täida, on palju praktilisem kasutada hästi kvantiseeritud 7B-13B mudeleid või kui teil on kvaliteedi tagamiseks tõesti vaja 70B, kaaluge spetsiaalset serverit (kohalikku või pilves), väga võimsat Maci või mitut paralleelselt töötavat graafikaprotsessorit.
Nõuded Ollama installimiseks VPS-ile või serverisse
Teine levinud võimalus on paigaldada Ollama VPS -ile või spetsiaalsele serverile ja sellele ligi pääseda API või veebiliidese kaudu (näiteks Open WebUI abil). See hõlmab lisaks ressurssidele ka operatsioonisüsteemi ja õigusi.
Selliste pakkujate nagu Hostinger juhendites soovitatakse Ollamale suunatud VPS-i jaoks järgmisi miinimumnõudeid :
- RAM: vähemalt 16 GB et väikesed/keskmised mudelid süsteemi üle ei koormaks.
- Protsessor: 4–8 virtuaaltuumasõltuvalt mudeli suurusest ja samaaegsete kasutajate arvust.
- Salvestusruum: vähemalt 12 GBPraktikas on aga soovitatav seada eesmärk suuremale (50–100 GB), kui kavatsete proovida mitut mudelit.
- Sistema operativo: ennekõike Linux, eelistades Ubuntu 22.04 või uuem või uuem stabiilne Debian.
- Juurjuurdepääs või sudo õigused sõltuvuste installimiseks, systemd seadistamiseks jne.
Kui teie VPS sisaldab NVIDIA GPU-d, peate installima ja konfigureerima CUDA või NVIDIA konteineri tööriistakomplekti, kui kasutate Dockerit. AMD puhul kasutatakse Linuxis tavaliselt ROCm-i ja Windowsis vastavaid Adrenalini draivereid. GPU-ta keskkondades tugineb server protsessorile ja muutmälule, seega ärge nende ressursside pealt kokku hoidke; kui vajate graafilist liidest, saate seda hallata ka kaugjuhtimise teel kaugtöölaua kaudu.
Konkreetsed riistvarastsenaariumid ja milliseid mudeleid kasutada
Selleks, et kõik eelnev ei jääks pelgalt teoreetiliseks, võib Ollama abil olla kasulik vaadata mõningaid tüüpilisi riistvarakombinatsioone ja seda, millised mudelid igal juhul hästi sobivad .
Tagasihoidlik lauaarvuti või keskmise suurusega sülearvuti
Kujutame ette tüüpilist meeskonda :
- Mõne aasta tagune i5 või Ryzen 5 protsessor (4-6 südamikku).
- 16 GB RAM.
- Integreeritud või spetsiaalne 4 GB graafikakaart.
- 512 GB SSD-ketas.
Sellisel juhul on mõistlik eesmärk seada järgmine :
- Kvantiseeritud 1B-3B mudelid (Gemma 2B, Phi-4 Mini, Llama 3.x 1B) maksimaalse voolavuse saavutamiseks.
- 7B mudelid neljandas kvartalis kui olete nõus veidi pikema vastamisajaga.
- Ollama kasutamine terminaliga ja kui soovite veebiliidest, avage WebUI ettevaatlikult, et mitte RAM-i üle koormata.
Sul võib olla oma kohalik tekstiassistent, millega saad teha kokkuvõtteid, teha analüüse ja kergeid programmeerimisülesandeid, aga see pole ideaalne keskkond 13B ja kõrgemate mudelite jaoks.
Keskmise ja tipptasemel seadmed, mis keskenduvad kohalikule tehisintellektile
Siin me räägime arvutitüübist :
- Moodne i7/i9 või Ryzen 7/9 protsessor, 8-16 südamikku.
- 32 GB RAM.
- Graafikaprotsessor 12–24 GB videomäluga (RTX 4070/4080, 3090, 4090, AMD ekvivalendid või sarnased).
- 1-2 TB SSD-ketas.
See konfiguratsioon laiendab oluliselt võimalusi :
- Mudelid 7B-13B neljandas/viiendas kvartalis vestluse, koodi, andmeanalüüsi jaoks… väga hea reageerimisajaga.
- 30B mudelid ja mõned 70B kvantiseeritud kui lepite veidi suurema latentsusajaga.
- Mudelid nägemine/OCR keskmise suurusega, kasutades ulatuslikult GPU-d.
See on masin, mille abil saab luua tõsise kohaliku tehisintellekti keskkonna, millel on mitu mudelit, veebiliides, integratsioon REST API kaudu ja professionaalne töövoog ilma välistest teenustest sõltumata.
"Beast" server või tööjaam
Ülemises otsas on keskkonnad, kus on:
- Mitu graafikakaarti, millel igaühel on 24–48 GB videomälu, või üks tipptasemel graafikakaart.
- 64–128 GB muutmälu.
- Paljude südamikega protsessorid, näiteks uuemad Threadripperi või Xeoni mudelid.
Siin hakkavad hiiglaslikud mudelid (>70B, MoE, visioonimahukad jne) realistlikuks muutuma, isegi mitme samaaegse kasutaja või keerukate integratsioonide korral. See on ilmselgelt kulukas stsenaarium, kuid see võimaldab teil ka omada mõningaid kommerts-API-sid sarnaseid võimalusi, pakkudes täielikku andmekontrolli oma infrastruktuuri sees.
Praktilised näpunäited Ollama riistvara maksimaalseks ärakasutamiseks
Lisaks suurema muutmälu või parema graafikakaardi ostmisele on mitmeid tavasid, mis aitavad teil olemasolevast maksimumi võtta ja Ollamaga suurte mudelite käitamisel üllatusi vältida.
Alustuseks on oluline valida õige mudel vastavalt oma kavandatud kasutusele : pole mõtet kasutada 70B-d lihtsate meilide kirjutamiseks, kui hästi häälestatud 7B-st piisab täiesti. Samamoodi pole 30B mõttekas, kui teie graafikakaardil on ainult 6 GB videomälu; 7B on neljandas kvartalis parem valik.
Teine oluline meede on katsetada käitusaja parameetreid (temperatuur, num_ctx, num_predict jne) kas Modelfile'is või CLI/API kaudu. Naljakalt suurte kontekstide ( num_ctx 32k või rohkem ) kasutamine vähese muutmälu või videomäluga aeglustab kogu süsteemi, pakkumata paljudel juhtudel erilist kasu.
Samuti on soovitatav jälgige, millised mudelid on laaditud ja millisel protsessoril kasutamine ollama psSeal näete, kas mudel töötab tegelikult graafikaprotsessoril või protsessoril ja kui suur on selle laaditud maht. Muutke muutujat. OLLAMA_KEEP_ALIVE See aitab mudelitel mälu tühjendada, kui neid ei kasutata, vabastades seeläbi ressursse.
Lõpuks pidage meeles, et kvantiseerimine on teie liitlane : originaalse FP16 mudeli Q4_K_M või Q5_K_M variantide loomine võimaldab teil ära kasutada palju tagasihoidlikumat riistvara, mille kvaliteedikaotus on reaalses kasutuses sageli peaaegu märkamatu.
Pärast kõike eelnevat arvesse võttes on kõige selgem järeldus see, et Ollama pole nõudlik osa; mudelid on . Suuruse, kvantimise, muutmälu ja videomälu omavahelise seose mõistmine võimaldab teil valida oma vajadustele vastava riistvara ja LLM-i kombinatsiooni: alates 16 GB mäluga sülearvutist, millel on kerge 7B protsessor, kuni tööjaamani, millel on 24 GB graafikaprotsessor, mis haldab võimsaid nägemis- ja OCR-mudeleid. Ootuste ja parameetrite hoolika kohandamise abil on täiesti võimalik omada võimsat ja privaatset tehisintellekti, mis töötab teie enda masinas ilma kuutasudeta.