Tõenäoliselt oled juba tuttav selliste tööriistadega nagu ChatGPT, Claude või Gemini. Kuigi need on hämmastavad, on neil üks konks: nad töötavad pilves. See tähendab, et iga sinu sisestatud sõna liigub ettevõtte serveritesse, mis võib kujutada endast tõsist privaatsusriski, kui tegeled tundlike andmetega või töötad sektorites, kus seadus keelab teabe kontorist lahkumise.
Siin tulebki mängu Ollama – rakendus, mis muudab teie arvuti sisuliselt tehisintellekti närvikeskuseks . Unustage igakuised tellimused ja stabiilse internetiühenduse vajalikkuse; selle tööriistaga saate alla laadida avatud lähtekoodiga mudeleid ja käitada neid otse oma riistvaral, säilitades täieliku kontrolli oma andmete üle.
Mis täpselt on Ollama ja millised on selle eelised?
Ollama on avatud lähtekoodiga tarkvara, mis toimib kliendina suurte keelemudelite (LLM) haldamiseks. Selle peamine eelis on see, et see lihtsustab tehnilist keerukust , käsitleb GPU optimeerimist ja mäluhaldust, nii et peate vaid käsu täitma ja vestluse alustama.
Eelised on selged. Esiteks on privaatsus absoluutne, kuna teie arvutist ei lahku midagi. Teiseks säästate API tokeni kulude või Plus-pakettide kuutasude pealt. Ja kolmandaks, kui mall on teie kõvakettal, saate seda kasutada täiesti võrguühenduseta , mis on ideaalne lennukis või kohtades, kus on halb võrguühendus.
Siiski pole kõik ainult päike ja vikerkaar. Peamine puudus on see, et vaja läheb võimast riistvara . Kui proovid hiiglaslikku mudelit käitada vähese muutmäluga arvutis, on reageering nii aeglane, et sul on aega kohvi teha enne lause lõpetamist. Lisaks teab tehisintellekt ainult seda, mida ta õppis kuni treeningkuupäevani, seega pole tal reaalajas juurdepääsu värsketele uudistele.
Süsteeminõuded ja soovitatav riistvara
Pettumuse vältimiseks peaksite oma komponente üle vaatama. Kõige olulisem ressurss on teie graafikakaardi RAM ja VRAM . Üldreeglina võtab 1.5B mudel umbes 1 GB ruumi, kuid sujuvaks tööks vajab see rohkem mälu.
- Minimudelid (270M kuni 4B): Ideaalne tagasihoidliku või mobiilse varustuse jaoks.
- Väikesed mudelid (4B kuni 14B): Tasakaalustatud valik kodukasutajale.
- Keskmise suurusega mudelid (14B kuni 70B): Siin on vaja tõsist riistvara.
- Suured mudelid (üle 70B): Ainult hiiglaslike ressurssidega masinate jaoks.
Mis puutub graafikaprotsessorisse, siis NVIDIA kaart CUDA-ga, AMD kaart ROCm-iga või Mac Apple Metaliga muudab oluliselt teksti genereerimist 5–10 korda võrreldes ainult protsessori kasutamisega. Kui kavatsed seadmeid osta, otsi graafikakaarte, millel on vähemalt 16 GB videomälu, et see kiiresti otsa ei saaks.
Samm-sammult paigaldusjuhend
Ollama installimine on üllatavalt lihtne ja olenevalt teie kasutatavast operatsioonisüsteemist võtab see aega vaid paar minutit:
Windowsi puhul laadige lihtsalt ametlikult veebisaidilt alla .exe-fail. Tavaliselt installitakse see kasutaja AppData kausta. Konteinerite eelistajad saavad selle installida ka Docker Desktopi abil, käivitades terminalis ametliku installikäsu.
Kasutajate jaoks LinuxKiireim viis on kasutada terminali käsuga curl -fsSL https://ollama.com/install.sh | shPärast installimist töötab teenus tavaliselt taustal. Kui peate oma põhiketta täitmise vältimiseks muutma mudelite salvestuskohta, saate keskkonnamuutujat muuta. AHJUMUDELID systemd teenuse konfiguratsioonifailis.
En macOSPaigaldamine on lihtne, kasutades allalaaditud installijat või isegi brew install ollamaSüsteem kasutab automaatselt ära Metalli kiirendus Apple Silicon kiibidest.
Kuidas hallata ja käitada tehisintellekti mudeleid
Kui Ollama server on aktiivne (näete seda tegumiriba ikoonil), saate hakata mudeleid alla laadima. Põhikäsk on ollama pull [nombre-del-modelo]kuigi kui sa kasutad ollama run, süsteem laadib mudeli automaatselt alla kui sul seda veel pole.
Sõltuvalt teie vajadustest on olemas mitut tüüpi mudeleid:
- Vestluslik: Llama 3 ehk Mistral on siin kuningad tänu oma kvaliteedi ja kiiruse tasakaalule.
- Programmeerimine: CodeLlama või DeepSeek-Coder sobivad ideaalselt koodi silumiseks või funktsioonide genereerimiseks.
- Multimodaalne (visioon): Mudelid nagu LLaVA võimaldavad teil pilte üles laadida ja paluda tehisintellektil neid kirjeldada.
- Mõtlemine (arutluskäik): Mudelid, mis on loodud protsesside samm-sammult selgitamiseks.
Suhtlemiseks kasutage lihtsalt ollama run llama3 ja sisestate interaktiivse viiba. Selle seansi jooksul saate kasutada selliseid käske nagu /? abi saamiseks või /bye Väljumiseks. Kui soovite näha, mis teil installitud on, ollama list See annab teile täieliku nimekirja ja koos ollama ps Saate kontrollida, kas mudel on laaditud GPU-le või CPU-le.
Täpsemad seaded ja kohandamine
Kui oled arendaja, on Ollama kullaauk, kuna see pakub REST API-t pordil 11434. See võimaldab sul ühendada kohaliku tehisintellekti mis tahes rakendusega. See ühildub OpenAI vorminguga, nii et saad selle integreerida VS Code'i GitHub Copiloti kaudu (kasutades BYOK valikut) või kasutada agente nagu OpenCode.
Teine võimas funktsioon on Modelfile . See sarnaneb Dockerfile'iga, aga on mõeldud tehisintellektile. See võimaldab teil luua mudeli kohandatud versiooni, määrates konkreetse süsteemiviiba (näiteks muutes Llama Hispaania õiguse eksperdiks), reguleerides temperatuuri, et muuta see loomingulisemaks või täpsemaks, ja salvestades selle konfiguratsiooni kohandatud nime all.
Neile, kes otsivad ChatGPT-ga sarnasemat visuaalset liidest, soovitame installida Open WebUI . See ühendub Ollamaga taustsüsteemina ja pakub täielikku veebikogemust vestlusajaloo ja dokumendihaldusega, mis kõik töötab teie enda kohalikus võrgus.
Optimeerimise ja toimivuse näpunäited
Kui märkate, et tehisintellekt töötab aeglaselt, on esimene samm kvantiseerimise kontrollimine . See protsess vähendab mudeli kaalude täpsust (näiteks 16 bitilt 4 või 8 bitile), mis vähendab drastiliselt vajaliku RAM-i hulka, ohverdamata liiga palju kvaliteeti. Q4_K_M mudel on tavaliselt magus punkt jõudluse ja täpsuse vahel.
Selleks, et Ollama ei tarbiks ressursse mittekasutamise ajal, saate Windowsi tegumihalduris automaatse käivitamise keelata . Samuti on kasulik jälgida videomälu kasutamist reaalajas, et teha kindlaks, kas mudel koormab süsteemi muutmälu maha , mis aeglustab oluliselt jõudlust.
Kohaliku infrastruktuuri kontrolli omamine demokratiseerib tehisintellekti kasutamist, kõrvaldades tellimustega seotud majanduslikud takistused ja pilve turvariskid. Kombineerides selliste mudelite nagu Llama 3 või Mistral võimsuse Ollama haldamise lihtsusega, saab iga entusiast või ettevõte luua oma privaatse tehisintellekti ökosüsteemi , optimeerides saadaolevat riistvara ja kohandades mudeli käitumist integreeritud mudelfailide ja API-de abil.


