Tikriausiai jau esate susipažinę su tokiais įrankiais kaip „ChatGPT“, „Claude“ ar „Gemini“. Nors jie nuostabūs, yra vienas trūkumas: jie veikia debesyje. Tai reiškia, kad kiekvienas jūsų įvestas žodis keliauja į įmonės serverius, o tai gali kelti rimtą privatumo riziką, jei tvarkote jautrius duomenis arba dirbate sektoriuose, kuriuose įstatymai draudžia informaciją palikti biurą.
Čia ir prasideda „Ollama“ – programa, kuri iš esmės paverčia jūsų kompiuterį dirbtinio intelekto centru . Pamirškite mėnesines prenumeratas ir priklausomybę nuo stabilaus interneto ryšio; naudodami šį įrankį galite atsisiųsti atvirojo kodo modelius ir paleisti juos tiesiai savo aparatinėje įrangoje, išlaikydami visišką savo duomenų kontrolę.
Kas tiksliai yra „Ollama“ ir kokie jos privalumai?
„Ollama“ yra atvirojo kodo programinė įranga, veikianti kaip klientas, skirtas dideliems kalbos modeliams (LLM) valdyti. Pagrindinis jos privalumas yra tas, kad ji supaprastina techninį sudėtingumą , tvarko GPU optimizavimą ir atminties valdymą, todėl jums tereikia vykdyti komandą ir pradėti bendrauti.
Privalumai akivaizdūs. Pirma, privatumas yra absoliutus, nes niekas nepalieka jūsų kompiuterio. Antra, sutaupote API žetonų išlaidų arba mėnesinių mokesčių už „Plus“ planus. Ir trečia, kai šablonas yra jūsų standžiajame diske, galite jį naudoti visiškai neprisijungę prie interneto , o tai idealiai tinka skrydžiams ar vietoms, kuriose prastas tinklo ryšys.
Tačiau ne viskas šviečia saulė ir vaivorykštės. Pagrindinis trūkumas yra tas, kad reikia galingos aparatinės įrangos . Jei bandysite paleisti didžiulį modelį kompiuteryje su mažai RAM, reakcija bus tokia lėta, kad spėsite pasidaryti kavos, kol jis baigs savo sakinį. Be to, dirbtinis intelektas žino tik tai, ką išmoko iki savo mokymo datos, todėl neturi prieigos prie naujienų realiuoju laiku.
Sistemos reikalavimai ir rekomenduojama aparatinė įranga
Kad išvengtumėte nemalonių pojūčių, turėtumėte peržiūrėti savo komponentus. Svarbiausias išteklius yra jūsų vaizdo plokštės RAM ir VRAM . Paprastai 1.5B modelis užima maždaug 1 GB vietos, tačiau jam reikia daugiau atminties, kad jis veiktų sklandžiai.
- Mini modeliai (nuo 270M iki 4B): Idealiai tinka mažai arba mobiliai įrangai.
- Maži modeliai (nuo 4B iki 14B): Subalansuotas pasirinkimas namų vartotojui.
- Vidutinio dydžio modeliai (nuo 14B iki 70B): Čia reikia rimtos įrangos.
- Dideli modeliai (virš 70B): Tik mašinoms su milžiniškais ištekliais.
Kalbant apie GPU, NVIDIA vaizdo plokštė su CUDA, AMD vaizdo plokštė su ROCm arba „Mac“ kompiuteris su „Apple Metal“ turi didžiulį skirtumą, nes teksto generavimas pagreitėja 5–10 kartų, palyginti su tuo, jei naudojamas tik procesorius. Jei ketinate pirkti įrangą, ieškokite vaizdo plokščių su bent 16 GB VRAM, kad greitai nepritrūktų atminties.
Žingsnis po žingsnio diegimo vadovas
„Ollama“ įdiegimas yra stebėtinai paprastas ir gali būti atliktas per kelias minutes, priklausomai nuo naudojamos operacinės sistemos:
„Windows“ sistemoje tiesiog atsisiųskite .exe failą iš oficialios svetainės. Paprastai jis bus įdiegtas vartotojo „AppData“ aplanke. Tiems, kurie pageidauja konteinerių, jį taip pat galima įdiegti naudojant „Docker Desktop“ , terminale paleidus oficialią diegimo komandą.
Vartotojams LinuxGreičiausias būdas yra naudoti terminalą su komanda curl -fsSL https://ollama.com/install.sh | shĮdiegus paslaugą, ji paprastai veikia fone. Jei reikia pakeisti modelių saugojimo vietą, kad neužpildytumėte pagrindinio disko, galite redaguoti aplinkos kintamąjį. ORKAITIŲ_MODELIAI „systemd“ paslaugos konfigūracijos faile.
En macOSDiegimas yra paprastas naudojant atsisiųstą diegimo programą arba netgi naudojant brew install ollamaSistema automatiškai pasinaudos tuo, kad Metalo pagreitis „Apple Silicon“ lustų.
Kaip valdyti ir vykdyti dirbtinio intelekto modelius
Kai „Ollama“ serveris bus aktyvus (jį matysite užduočių juostos piktogramoje), galėsite pradėti atsisiųsti modelius. Pagrindinė komanda yra ollama pull [nombre-del-modelo]nors jei naudosite ollama run, sistema modelis bus automatiškai atsisiųstas jei dar neturite.
Priklausomai nuo jūsų poreikių, yra įvairių modelių kategorijų:
- Pokalbis: „Llama 3“ arba „Mistral“ čia yra karaliai dėl savo kokybės ir greičio pusiausvyros.
- Programavimas: „CodeLlama“ arba „DeepSeek-Coder“ idealiai tinka kodo derinimui arba funkcijų generavimui.
- Multimodalinis (vizijos): Tokie modeliai kaip LLaVA leidžia įkelti vaizdus ir paprašyti dirbtinio intelekto juos aprašyti.
- Samprotavimas (mąstymas): Modeliai, skirti procesams žingsnis po žingsnio paaiškinti.
Norėdami bendrauti, tiesiog naudokite ollama run llama3 ir įvesite interaktyvų raginimą. Šio seanso metu galite naudoti tokias komandas kaip /? pagalbos arba /bye Norėdami išeiti. Jei norite pamatyti, ką įdiegėte, ollama list Jame bus pateiktas visas sąrašas ir ollama ps Galite patikrinti, ar modelis yra įkelta į GPU arba CPU.
Išplėstiniai nustatymai ir pritaikymas
Jei esate kūrėjas, „Ollama“ yra aukso kasykla, nes ji teikia REST API 11434 prievade. Tai leidžia prijungti vietinį dirbtinį intelektą prie bet kurios programos. Jis suderinamas su „OpenAI“ formatu, todėl galite jį integruoti į „VS Code“ per „GitHub Copilot“ (naudodami BYOK parinktį) arba naudoti agentus, tokius kaip „OpenCode“.
Dar viena galinga funkcija yra „ Modelfile“ . Jis panašus į „Dockerfile“, bet skirtas dirbtiniam intelektui. Jis leidžia sukurti pritaikytą modelio versiją, apibrėžiant konkretų sistemos raginimą (pavyzdžiui, paverčiant Lamą Ispanijos teisės ekspertu), pakoreguojant temperatūrą, kad ji būtų kūrybiškesnė ar tikslesnė, ir išsaugojant šią konfigūraciją pasirinktiniu pavadinimu.
Tiems, kurie ieško vizualinės sąsajos, panašesnės į „ChatGPT“, rekomenduojame įdiegti „Open WebUI“ . Ji prisijungia prie „Ollama“ kaip serverio ir suteikia visavertę žiniatinklio patirtį su pokalbių istorija ir dokumentų valdymu, visa tai vyksta jūsų vietiniame tinkle.
Optimizavimo ir našumo patarimai
Pastebėjus, kad dirbtinis intelektas veikia lėtai, pirmiausia reikia patikrinti kvantizavimą . Šis procesas sumažina modelio svorių tikslumą (pavyzdžiui, nuo 16 bitų iki 4 arba 8 bitų), o tai smarkiai sumažina reikalingos RAM kiekį neprarandant per daug kokybės. Q4_K_M modelis paprastai yra optimalus našumo ir tikslumo derinys.
Kad „Ollama“ neeikvotų išteklių, kai nenaudojamas, galite išjungti automatinį paleidimą „Windows“ užduočių tvarkytuvėje. Taip pat naudinga stebėti VRAM naudojimą realiuoju laiku, kad nustatytumėte, ar modelis neapkrauna sistemos RAM, o tai labai sulėtina našumą.
Vietinės infrastruktūros valdymas demokratizuoja dirbtinio intelekto naudojimą, panaikina ekonomines prenumeratų kliūtis ir debesijos saugumo riziką. Sujungus tokių modelių kaip „Llama 3“ ar „Mistral“ galią su „Ollama“ valdymo paprastumu, bet kuris entuziastas ar įmonė gali sukurti savo privačią dirbtinio intelekto ekosistemą , optimizuodamas turimą aparatinę įrangą ir pritaikydamas modelio elgseną naudodamas integruotus modelių failus ir API.


