Si të instaloni dhe konfiguroni Ollama për të ekzekutuar modele të inteligjencës artificiale në kompjuterin tuaj

Përditësimi i fundit: 25 gusht 2026

Brenda një PC me performancë të lartë me një kartë grafike NVIDIA GeForce RTX, ideale për të ekzekutuar modele lokale të IA-së.

Me shumë mundësi jeni të njohur me mjete si ChatGPT, Claude ose Gemini. Ndërsa janë të mrekullueshme, ka një pengesë: ato funksionojnë në cloud. Kjo do të thotë që çdo fjalë që shkruani udhëton në serverat e një kompanie, gjë që mund të paraqesë një rrezik serioz për privatësinë nëse trajtoni të dhëna të ndjeshme ose punoni në sektorë ku ligji ndalon që informacioni të dalë nga zyra.

Këtu hyn në lojë Ollama, një aplikacion që në thelb e kthen kompjuterin tuaj në qendrën nervore të inteligjencës artificiale . Harrojeni abonimet mujore dhe mbështetjen në një lidhje të qëndrueshme interneti; me këtë mjet, ju mund të shkarkoni modele me burim të hapur dhe t'i ekzekutoni ato direkt në harduerin tuaj, duke ruajtur kontroll të plotë mbi të dhënat tuaja.

Çfarë është saktësisht Ollama dhe cilat janë avantazhet e saj?

Ekran kompjuteri me një ikonë dryni dhe fjalën 'I sigurt', që përfaqëson privatësinë e të dhënave në mjediset lokale.

Ollama është një program me burim të hapur që vepron si klient për menaxhimin e modeleve të mëdha gjuhësore (LLM). Avantazhi i tij kryesor është se thjeshton kompleksitetin teknik , duke trajtuar optimizimin e GPU-së dhe menaxhimin e memories, kështu që ju vetëm duhet të ekzekutoni një komandë dhe të filloni të bisedoni.

Avantazhet janë të qarta. Së pari, privatësia është absolute pasi asgjë nuk del nga kompjuteri juaj. Së dyti, kurseni në kostot e tokenëve API ose tarifat mujore për planet Plus. Dhe së treti, pasi shablloni të jetë në hard diskun tuaj, mund ta përdorni plotësisht jashtë linje , ideale kur jeni në aeroplan ose në vende me mbulim të dobët të rrjetit.

Megjithatë, nuk është gjithçka vetëm diell e ylber. Disavantazhi kryesor është se ju nevojitet harduer i fuqishëm . Nëse përpiqeni të ekzekutoni një model të madh në një PC me pak RAM, përgjigja do të jetë aq e ngadaltë sa do të keni kohë të bëni një kafe para se të përfundojë fjalinë e tij. Për më tepër, IA di vetëm atë që ka mësuar deri në datën e trajnimit, kështu që nuk ka qasje në lajmet e fundit në kohë reale.

  Burimet më të mira të uebit për SQL Server: Një udhëzues i plotë

Kërkesat e sistemit dhe pajisjet e rekomanduara

Mjedis zhvillimi profesional me monitorë të shumtë që shfaqin kodin dhe cilësimet e API-t.

Për të shmangur një përvojë frustruese, duhet t'i hidhni një sy komponentëve tuaj. Burimi më i rëndësishëm është RAM dhe VRAM i kartës suaj grafike . Si rregull i përgjithshëm, një model 1.5B zë afërsisht 1GB hapësirë, por i duhet më shumë memorie për të funksionuar pa probleme.

  • Modele Mini (270M deri në 4B): Ideale për pajisje modeste ose të lëvizshme.
  • Modele të vogla (4B deri në 14B): Opsioni i ekuilibruar për një përdorues shtëpiak.
  • Modele të Mesme (14B deri në 70B): Këtu keni nevojë për pajisje serioze.
  • Modele të mëdha (mbi 70B): Vetëm për makina me burime gjigante.

Sa i përket GPU-së, të kesh një kartë NVIDIA me CUDA, një kartë AMD me ROCm ose një Mac me Apple Metal bën një ndryshim të madh, duke përshpejtuar gjenerimin e tekstit me 5 deri në 10 herë krahasuar me përdorimin vetëm të CPU-së. Nëse do të blesh pajisje, kërko karta grafike me të paktën 16 GB VRAM në mënyrë që të mos të mbarojë shpejt.

Udhëzues instalimi hap pas hapi

Instalimi i Ollama është çuditërisht i thjeshtë dhe mund të bëhet brenda pak minutash në varësi të sistemit operativ që përdorni:

Windows , thjesht shkarkoni skedarin .exe nga faqja zyrtare e internetit. Zakonisht instalohet në dosjen AppData të përdoruesit. Për ata që preferojnë kontejnerët, mund të instalohet edhe duke përdorur Docker Desktop duke ekzekutuar komandën zyrtare të instalimit në terminal.

Për përdoruesit e LinuxMënyra më e shpejtë është të përdorni terminalin me komandën curl -fsSL https://ollama.com/install.sh | shPasi instalohet, shërbimi zakonisht funksionon në sfond. Nëse duhet të ndryshoni vendin ku ruhen modelet për të shmangur mbushjen e diskut kryesor, mund të modifikoni variablin e mjedisit. MODELET_E_FURRËS në skedarin e konfigurimit të shërbimit systemd.

  Burimet më të mira të internetit për .NET

En MacOSInstalimi është i thjeshtë duke përdorur instaluesin e shkarkuar ose edhe duke përdorur brew install ollamaSistemi do të përfitojë automatikisht nga Përshpejtimi i metaleve të çipave të silikonit Apple.

Si të menaxhoni dhe ekzekutoni modelet e inteligjencës artificiale

Pasi serveri Ollama të jetë aktiv (do ta shihni në ikonën e shiritit të detyrave), mund të filloni shkarkimin e modeleve. Komanda themelore është ollama pull [nombre-del-modelo]edhe nëse përdorni ollama run, sistemi do ta shkarkojë modelin automatikisht nëse nuk e keni akoma

Ekzistojnë kategori të ndryshme modelesh në varësi të nevojave tuaja:

  • Bisedë: Llama 3 ose Mistral janë mbretërit këtu për shkak të ekuilibrit të tyre midis cilësisë dhe shpejtësisë.
  • Programimi: CodeLlama ose DeepSeek-Coder janë ideale për debugging të kodit ose gjenerimin e funksioneve.
  • Multimodal (Vizioni): Modele si LLaVA ju lejojnë të ngarkoni imazhe dhe t'i kërkoni inteligjencës artificiale t'i përshkruajë ato.
  • Arsyetimi (Të menduarit): Modele të dizajnuara për të shpjeguar proceset hap pas hapi.

Për të bashkëvepruar, thjesht përdorni ollama run llama3 dhe do të futni një kërkesë interaktive. Brenda kësaj seance, mund të përdorni komanda të tilla si /? për ndihmë ose /bye Për të dalë. Nëse doni të shihni se çfarë keni instaluar, ollama list Do t'ju japë listën e plotë, dhe me ollama ps Mund të kontrolloni nëse modeli është i ngarkuar në GPU ose CPU.

Cilësime të avancuara dhe personalizim

Nëse jeni zhvillues, Ollama është një minierë ari sepse ekspozon një API REST në portin 11434. Kjo ju lejon të lidhni IA lokale me çdo aplikacion. Është i pajtueshëm me formatin OpenAI, kështu që mund ta integroni atë në VS Code nëpërmjet GitHub Copilot (duke përdorur opsionin BYOK) ose të përdorni agjentë si OpenCode.

Një tjetër veçori e fuqishme është Modelfile . Është i ngjashëm me një Dockerfile, por për IA. Ju lejon të krijoni një version të personalizuar të një modeli duke përcaktuar një Njoftim specifik të Sistemit (për shembull, duke e shndërruar Llamën në një ekspert në ligjin spanjoll), duke rregulluar temperaturën për ta bërë atë më krijues ose më të saktë dhe duke e ruajtur atë konfigurim nën një emër të personalizuar.

  Si të përdorni Inteligjencën Artificiale pa krijuar një llogari

Për ata që kërkojnë një ndërfaqe vizuale më të ngjashme me ChatGPT, ne rekomandojmë instalimin e Open WebUI . Ai lidhet me Ollama si një backend dhe ofron një përvojë të plotë në internet me historikun e bisedave dhe menaxhimin e dokumenteve, të gjitha që funksionojnë në rrjetin tuaj lokal.

Këshilla për optimizimin dhe performancën

Kur vini re se inteligjenca artificiale po funksionon ngadalë, hapi i parë është të kontrolloni kuantizimin . Ky proces zvogëlon saktësinë e peshave të modelit (nga 16 bit në 4 ose 8 bit, për shembull), gjë që zvogëlon në mënyrë drastike RAM-in e kërkuar pa sakrifikuar shumë cilësinë. Një model Q4_K_M është zakonisht pika ideale midis performancës dhe saktësisë.

Për të parandaluar që Ollama të konsumojë burime kur nuk është në përdorim, mund të çaktivizoni nisjen automatike në Windows Task Manager. Është gjithashtu e dobishme të monitoroni përdorimin e VRAM në kohë reale për të përcaktuar nëse modeli po shkarkon RAM-in e sistemit, gjë që ngadalëson ndjeshëm performancën.

Kontrolli i infrastrukturës lokale demokratizon përdorimin e inteligjencës artificiale, duke eliminuar barrierat ekonomike të abonimeve dhe rreziqet e sigurisë së cloud-it. Duke kombinuar fuqinë e modeleve si Llama 3 ose Mistral me lehtësinë e menaxhimit të Ollama-s, çdo entuziast ose kompani mund të ndërtojë ekosistemin e vet privat të IA-së , duke optimizuar harduerin e disponueshëm dhe duke personalizuar sjelljen e modelit përmes Modelfiles dhe API-ve të integruara.