Malamang pamilyar ka na sa mga tool tulad ng ChatGPT, Claude, o Gemini. Bagama't kahanga-hanga ang mga ito, may isang maliit na disbentaha: tumatakbo ang mga ito sa cloud. Nangangahulugan ito na ang bawat salitang tina-type mo ay papunta sa mga server ng isang kumpanya, na maaaring maging medyo abala. malubhang isyu sa privacy kung ikaw ay humahawak ng kumpidensyal na datos o nagtatrabaho sa mga sektor kung saan ipinagbabawal ng batas ang paglabas ng impormasyon sa opisina.
Dito pumapasok ang Ollama, isang application na karaniwang ginagawang Sentro ng nerbiyos ng AIKalimutan ang buwanang subscription at ang pag-asa sa isang matatag na koneksyon sa internet; gamit ang tool na ito, maaari kang mag-download ng mga open-source na template at direktang patakbuhin ang mga ito sa iyong sariling hardware, habang pinapanatili ang ganap na kontrol sa iyong data.
Ano nga ba ang Ollama at ano ang mga bentaha nito?
Ang Ollama ay isang open-source software na nagsisilbing client para sa pamamahala ng mga extensive language model (LLM). Ang pangunahing kalakasan nito ay pinapasimple ang teknikal na pagiging kumplikado, inaasikaso ang pag-optimize ng GPU at pamamahala ng memorya para isang command lang ang kailangan mong patakbuhin at magsimulang makipag-chat.
Malinaw ang mga bentaha. Una, ang Ang privacy ay ganap Dahil walang lumalabas sa iyong makina. Pangalawa, makakatipid ka sa mga gastos sa API token o buwanang bayarin sa Plus plan. At pangatlo, kapag ang modelo ay nasa iyong hard drive na, maaari mo na itong gamitin. ganap na offlineMainam kapag nasa eroplano ka o sa mga lugar na may hindi magandang coverage.
Gayunpaman, hindi lahat ay sikat ng araw at rosas. Ang pangunahing disbentaha ay Kailangan mo ng malakas na hardwareKung susubukan mong patakbuhin ang isang malaking modelo sa isang PC na may maliit na RAM, ang tugon ay magiging napakabagal kaya magkakaroon ka ng oras para magtimpla ng kape bago nito matapos ang pangungusap. Bukod pa rito, ang alam lamang ng AI ay kung ano ang natutunan nito hanggang sa petsa ng pagsasanay nito, kaya wala itong access sa mga breaking news sa real time.
Mga kinakailangan sa system at inirerekomendang hardware
Para maiwasan ang isang nakakadismayang karanasan, dapat mong tingnan ang iyong mga bahagi. Ang pinakamahalagang mapagkukunan ay ang RAM at VRAM ng iyong graphics card. Bilang pangkalahatang tuntunin, ang isang 1.5B na modelo ay kumukuha ng humigit-kumulang 1GB na espasyo, ngunit nangangailangan ng mas maraming memorya upang gumana nang maayos.
- Mga Mini Modelo (270M hanggang 4B): Mainam para sa katamtaman o madaling dalhing kagamitan.
- Maliliit na Modelo (4B hanggang 14B): Ang balanseng opsyon para sa isang gumagamit ng bahay.
- Mga Katamtamang Modelo (14B hanggang 70B): Dito kailangan mo ng seryosong hardware.
- Malalaking Modelo (mahigit sa 70B): Para lamang sa mga makinang may napakalaking mapagkukunan.
Kung tungkol naman sa GPU, ang pagkakaroon ng NVIDIA na may CUDA, AMD na may ROCm, o Mac na may Apple Metal ay malaki ang naitutulong, dahil mas mabilis itong makakagawa ng teksto. sa pagitan ng 5 at 10 beses Tungkol sa paggamit lamang ng CPU: Kung bibili ka ng kagamitan, maghanap ng mga graphics card na may kahit 16GB na VRAM para hindi ka mabilis maubusan.
Hakbang-hakbang na gabay sa pag-install
Ang pag-install ng Ollama ay nakakagulat na simple at maaaring gawin sa loob lamang ng ilang minuto depende sa operating system na iyong ginagamit:
En WindowsI-download lamang ang .exe file mula sa opisyal na website. Karaniwan itong mai-install sa AppData folder ng user. Para sa mga mas gusto ang mga container, maaari rin itong i-deploy gamit ang DockerDesktop, pagpapatakbo ng opisyal na utos sa pag-install sa terminal.
Para sa mga gumagamit ng LinuxAng pinakamabilis na paraan ay ang paggamit ng terminal gamit ang utos curl -fsSL https://ollama.com/install.sh | shKapag na-install na, ang serbisyo ay karaniwang tumatakbo sa background. Kung kailangan mong baguhin kung saan nakaimbak ang mga modelo upang maiwasan ang pagpuno sa iyong pangunahing disk, maaari mong i-edit ang environment variable. OVEN_MODELS sa file ng pagsasaayos ng serbisyo ng systemd.
En MacOSMadali lang ang pag-install gamit ang na-download na installer o kahit gamit ang brew install ollamaAwtomatikong sasamantalahin ng sistema ang Pagpapabilis ng metal ng mga Apple Silicon chip.
Paano pamahalaan at patakbuhin ang mga modelo ng AI
Kapag aktibo na ang Ollama server (makikita mo ito sa taskbar icon), maaari mo nang simulan ang pag-download ng mga modelo. Ang pangunahing utos ay ollama pull [nombre-del-modelo]kahit na kung gagamitin mo ollama run, ang sistema awtomatikong ida-download ang modelo kung wala ka pa.
Mayroong iba't ibang kategorya ng mga modelo depende sa iyong mga pangangailangan:
- Pakikipag-usap: Ang Llama 3 o Mistral ang mga hari rito dahil sa kanilang balanse sa pagitan ng kalidad at bilis.
- Programming: Ang CodeLlama o DeepSeek-Coder ay mainam para sa pag-debug ng code o pagbuo ng mga function.
- Multimodal (Pananaw): Ang mga modelong tulad ng LLaVA ay nagbibigay-daan sa iyong mag-upload ng mga larawan at hilingin sa AI na ilarawan ang mga ito.
- Pangangatwiran (Pag-iisip): Mga modelong idinisenyo upang ipaliwanag ang mga proseso nang paunti-unti.
Para makipag-ugnayan, gamitin lamang ang ollama run llama3 at papasok ka sa isang interactive na prompt. Sa loob ng sesyon na ito, maaari mong gamitin ang mga utos tulad ng /? para sa tulong o /bye Para lumabas. Kung gusto mong makita kung ano ang iyong na-install, ollama list Ibibigay nito sa iyo ang kumpletong listahan, at kasama ang ollama ps Maaari mong suriin kung ang modelo ay naka-load sa GPU o CPU.
Mga advanced na setting at pagpapasadya
Kung ikaw ay isang developer, ang Ollama ay isang minahan ng ginto dahil inilalantad nito ang isang REST API sa port na 11434Nagbibigay-daan ito sa iyo na ikonekta ang lokal na AI sa anumang aplikasyon. Tugma ito sa format na OpenAI, kaya maaari mo itong i-integrate sa VS Code sa pamamagitan ng GitHub Copilot (gamit ang opsyong BYOK) o gumamit ng mga ahente tulad ng OpenCode.
Isa pang makapangyarihang katangian ay ang ModelfileIto ay katulad ng isang Dockerfile ngunit para sa AI. Pinapayagan ka nitong lumikha ng isang pasadyang bersyon ng isang modelo sa pamamagitan ng pagtukoy ng isang System Prompt espesipiko (halimbawa, paggawa kay Llama bilang isang eksperto sa batas Espanyol), ayusin ang temperatura upang gawin itong mas malikhain o mas tumpak, at i-save ang konpigurasyong iyon sa ilalim ng isang pansariling pangalan.
Para sa mga naghahanap ng visual interface na mas katulad ng ChatGPT, ang rekomendasyon ay i-install ang Buksan ang WebUIKumokonekta ito sa Ollama bilang backend at nag-aalok sa iyo ng kumpletong karanasan sa web na may chat history at pamamahala ng dokumento, lahat ay tumatakbo sa iyong sariling lokal na network.
Mga tip sa pag-optimize at pagganap
Kapag napansin mong mabagal ang AI, ang unang hakbang ay suriin ang quantizationBinabawasan ng prosesong ito ang katumpakan ng mga timbang ng modelo (mula 16 bits hanggang 4 o 8 bits, halimbawa), na lubhang nagpapababa sa kinakailangang RAM nang hindi isinasakripisyo ang labis na kalidad. Q4_K_M Kadalasan, ito ang pinakamagandang lugar sa pagitan ng performance at precision.
Para maiwasan ang paggamit ni Ollama ng mga resources kapag hindi mo ito ginagamit, maaari mong i-disable ang awtomatikong pagsisimula sa Windows Task Manager. Kapaki-pakinabang din na subaybayan ang paggamit ng VRAM nang real time upang makita kung ang modelo ay gumagawa offloading sa RAM ng system, na lubhang nagpapabagal sa tugon.
Ang pagkakaroon ng kontrol sa lokal na imprastraktura ay nagpapa-demokratiko sa paggamit ng artificial intelligence, na nag-aalis ng mga hadlang sa ekonomiya ng mga subscription at mga panganib sa seguridad ng cloud. Sa pamamagitan ng pagsasama-sama ng kapangyarihan ng mga modelo tulad ng Llama 3 o Mistral sa kadalian ng pamamahala ng Ollama, sinumang mahilig o kumpanya ay maaaring magtayo ng sarili nilang kumpanya. pribadong ekosistema ng AI, pag-optimize sa magagamit na hardware at pagpapasadya ng gawi ng mga modelo sa pamamagitan ng mga Modelfile at pinagsamang mga API.


