Jūs droši vien jau esat iepazinušies ar tādiem rīkiem kā ChatGPT, Claude vai Gemini. Lai gan tie ir lieliski, tiem ir viens neliels trūkums: tie darbojas mākonī. Tas nozīmē, ka katrs jūsu ierakstītais vārds nonāk uzņēmuma serveros, kas var radīt nelielas problēmas. nopietna privātuma problēma ja jūs apstrādājat konfidenciālus datus vai strādājat nozarēs, kurās likums aizliedz informācijas izplatīšanos ārpus biroja robežām.
Šeit noder Ollama — lietojumprogramma, kas būtībā pārvērš jūsu datoru par Mākslīgā intelekta nervu centrsAizmirstiet par ikmēneša abonementiem un paļaušanos uz stabilu interneta savienojumu; ar šo rīku varat lejupielādēt atvērtā koda veidnes un palaist tās tieši savā aparatūrā, saglabājot absolūtu kontroli pār saviem datiem.
Kas īsti ir Ollama un kādas ir tā priekšrocības?
Ollama ir atvērtā pirmkoda programmatūra, kas darbojas kā klients plašu valodu modeļu (LLM) pārvaldībai. Tās galvenā priekšrocība ir tā, ka vienkāršo tehnisko sarežģītību, rūpējoties par GPU optimizāciju un atmiņas pārvaldību, lai jums būtu jāizpilda tikai viena komanda un jāsāk tērzēt.
Priekšrocības ir acīmredzamas. Pirmkārt, Privātums ir pilnīgs Tā kā nekas nepamet jūsu datoru. Otrkārt, jūs ietaupāt uz API tokena izmaksām vai ikmēneša Plus plāna maksām. Un, treškārt, tiklīdz modelis ir jūsu cietajā diskā, jūs varat to izmantot. pilnīgi bezsaistēIdeāli piemērots lidmašīnā vai vietās ar sliktu pārklājumu.
Tomēr ne viss ir saulains un rožains. Galvenais trūkums ir tas, ka Jums ir nepieciešama jaudīga aparatūraJa mēģināsiet palaist milzīgu modeli datorā ar mazu RAM, reakcija būs tik lēna, ka jums būs laiks pagatavot kafiju, pirms tas pabeigs teikumu. Turklāt mākslīgais intelekts zina tikai to, ko tas ir iemācījies līdz apmācības datumam, tāpēc tam nav piekļuves jaunākajām ziņām reāllaikā.
Sistēmas prasības un ieteicamā aparatūra
Lai izvairītos no nepatīkamas pieredzes, jums vajadzētu apskatīt savas sastāvdaļas. Vissvarīgākais resurss ir RAM un VRAM grafikas kartes. Parasti 1.5 B modelis aizņem aptuveni 1 GB vietas, taču tam ir nepieciešams vairāk atmiņas, lai darbotos nevainojami.
- Mini modeļi (no 270M līdz 4B): Ideāli piemērots nelielam vai mobilam aprīkojumam.
- Mazie modeļi (no 4B līdz 14B): Sabalansēta izvēle mājas lietotājam.
- Vidējie modeļi (no 14B līdz 70B): Šeit jums ir nepieciešama nopietna aparatūra.
- Lieli modeļi (virs 70 B): Tikai mašīnām ar gigantiskiem resursiem.
Runājot par GPU, NVIDIA ar CUDA, AMD ar ROCm vai Mac ar Apple Metal izmantošana ievērojami paātrina teksta ģenerēšanu. no 5 līdz 10 reizēm Attiecībā uz tikai centrālā procesora izmantošanu: ja plānojat iegādāties aprīkojumu, meklējiet grafikas kartes ar vismaz 16 GB videoatmiņu, lai tā ātri nepietrūktu.
Soli pa solim instalēšanas rokasgrāmata
Ollama instalēšana ir pārsteidzoši vienkārša un to var paveikt dažu minūšu laikā atkarībā no izmantotās operētājsistēmas:
En WindowsVienkārši lejupielādējiet .exe failu no oficiālās vietnes. Tas parasti tiks instalēts lietotāja AppData mapē. Tiem, kas dod priekšroku konteineriem, to var arī izvietot, izmantojot Docker darbvirsma, palaižot oficiālo instalēšanas komandu terminālī.
Lietotājiem LinuxĀtrākais veids ir izmantot termināli ar komandu curl -fsSL https://ollama.com/install.sh | shPēc instalēšanas pakalpojums parasti darbojas fonā. Ja vēlaties mainīt modeļu glabāšanas vietu, lai neaizpildītu galveno disku, varat rediģēt vides mainīgo. CEPEŠKRĀSNIS_MODEĻI systemd pakalpojuma konfigurācijas failā.
En macOSInstalēšana ir vienkārša, izmantojot lejupielādēto instalētāju vai pat izmantojot brew install ollamaSistēma automātiski izmantos priekšrocības, ko sniedz Metāla paātrinājums Apple Silicon mikroshēmu.
Kā pārvaldīt un palaist mākslīgā intelekta modeļus
Kad Ollama serveris ir aktīvs (to redzēsiet uzdevumjoslas ikonā), varat sākt modeļu lejupielādi. Pamatkomanda ir ollama pull [nombre-del-modelo]lai gan, ja jūs izmantojat ollama run, sistēma modelis tiks lejupielādēts automātiski ja jums tā vēl nav.
Atkarībā no jūsu vajadzībām ir pieejamas dažādas modeļu kategorijas:
- Sarunvalodas: Lama 3 jeb Mistral šeit ir karaļi, pateicoties to kvalitātes un ātruma līdzsvaram.
- Programmēšana: CodeLlama vai DeepSeek-Coder ir ideāli piemēroti koda atkļūdošanai vai funkciju ģenerēšanai.
- Multimodāls (redze): Tādi modeļi kā LLaVA ļauj augšupielādēt attēlus un lūgt mākslīgajam intelektam tos aprakstīt.
- Spriešana (domāšana): Modeļi, kas izstrādāti, lai soli pa solim izskaidrotu procesus.
Lai mijiedarbotos, vienkārši izmantojiet ollama run llama3 un jūs ievadīsiet interaktīvu uzvedni. Šajā sesijā varat izmantot tādas komandas kā /? pēc palīdzības vai /bye Lai izietu. Ja vēlaties redzēt, kas ir instalēts, ollama list Tas sniegs jums pilnu sarakstu un ollama ps Varat pārbaudīt, vai modelis ir ielādēts GPU vai CPU.
Papildu iestatījumi un pielāgošana
Ja esat izstrādātājs, Ollama ir zelta raktuve, jo tā atklāj REST API 11434. portāTas ļauj savienot lokālo mākslīgo intelektu ar jebkuru lietojumprogrammu. Tas ir saderīgs ar OpenAI formātu, tāpēc to var integrēt VS Code, izmantojot GitHub Copilot (izmantojot BYOK opciju), vai izmantot aģentus, piemēram, OpenCode.
Vēl viena spēcīga funkcija ir ModelfailsTas ir līdzīgs Dockerfile, bet paredzēts mākslīgajam intelektam. Tas ļauj izveidot pielāgotu modeļa versiju, definējot Sistēmas uzvedne specifisks (piemēram, padarot Lamu par Spānijas tiesību ekspertu), pielāgojiet temperatūru, lai padarītu to radošāku vai precīzāku, un saglabājiet šo konfigurāciju ar atbilstošu nosaukumu.
Tiem, kas meklē vizuālo saskarni, kas ir līdzīgāka ChatGPT, ieteicams instalēt Atveriet WebUITas izveido savienojumu ar Ollama kā aizmugursistēmu un piedāvā pilnīgu tīmekļa pieredzi ar tērzēšanas vēsturi un dokumentu pārvaldību, kas viss darbojas jūsu lokālajā tīklā.
Optimizācijas un veiktspējas padomi
Kad pamanāt, ka mākslīgais intelekts darbojas lēni, pirmais solis ir pārbaudīt kvantēšanaŠis process samazina modeļa svaru precizitāti (piemēram, no 16 bitiem līdz 4 vai 8 bitiem), kas ievērojami samazina nepieciešamo operatīvo atmiņu, neupurējot pārāk daudz kvalitātes. Q4_K_M Tas parasti ir optimālais līmenis starp veiktspēju un precizitāti.
Lai neļautu Ollama patērēt resursus, kad to nelietojat, varat atspējot šo funkciju. automātiska palaišana Windows uzdevumu pārvaldniekā. Ir arī noderīgi reāllaikā uzraudzīt VRAM izmantošanu, lai redzētu, vai modelis veic izkraušana sistēmas RAM, kas ievērojami palēnina reakciju.
Lokālās infrastruktūras kontrole demokratizē mākslīgā intelekta izmantošanu, novēršot abonēšanas ekonomiskos šķēršļus un mākoņa drošības riskus. Apvienojot tādu modeļu kā Llama 3 vai Mistral jaudu ar Ollama pārvaldības vienkāršību, jebkurš entuziasts vai uzņēmums var izveidot savu. privāta mākslīgā intelekta ekosistēma, optimizējot pieejamo aparatūru un pielāgojot modeļu darbību, izmantojot Modelfiles un integrētus API.


