Az Ollama telepítése és konfigurálása AI-modellek futtatásához a számítógépen

Utolsó frissítés: 25 augusztus 2026

Egy nagy teljesítményű, NVIDIA GeForce RTX grafikus kártyával ellátott PC belsejében, amely ideális helyi AI-modellek futtatásához.

Valószínűleg már ismersz olyan eszközöket, mint a ChatGPT, a Claude vagy a Gemini. Bár ezek nagyszerűek, van egy bökkenőjük: a felhőben futnak. Ez azt jelenti, hogy minden beírt szó eljut a cég szervereire, ami komoly adatvédelmi kockázatot jelenthet , ha érzékeny adatokat kezelsz, vagy olyan szektorban dolgozol, ahol a törvény tiltja, hogy az információk elhagyják az irodát.

Itt jön képbe az Ollama, egy alkalmazás, amely lényegében a számítógépedet a mesterséges intelligencia idegközpontjává változtatja . Felejtsd el a havi előfizetéseket és a stabil internetkapcsolatra való támaszkodást; ezzel az eszközzel letölthetsz nyílt forráskódú modelleket, és közvetlenül a saját hardvereden futtathatod őket, így teljes mértékben kézben tarthatod az adataid feletti ellenőrzést.

Mi is pontosan az Ollama, és mik az előnyei?

Számítógép képernyője lakat ikonnal és a „Biztonságos” szóval, amely a helyi telephelyen érvényes adatvédelmet jelzi.

Az Ollama egy nyílt forráskódú szoftver, amely kliensként működik a nagy nyelvi modellek (LLM) kezeléséhez. Fő előnye, hogy leegyszerűsíti a technikai bonyolultságot , kezeli a GPU-optimalizálást és a memóriakezelést, így csak egy parancsot kell végrehajtani, és máris elkezdhet csevegni.

Az előnyök egyértelműek. Először is, az adatvédelem abszolút, mivel semmi sem hagyja el a gépedet. Másodszor, megspórolhatod az API token költségeit vagy a Plus csomagok havi díjait. Harmadszor pedig, miután a sablon a merevlemezeden van, teljesen offline is használhatod , ami ideális repülőgépen vagy gyenge hálózati lefedettségű helyeken.

Azonban nem csupa ragyogás és szivárvány. A fő hátránya, hogy erős hardverre van szükség . Ha egy hatalmas modellt kevés RAM-mal rendelkező PC-n próbálsz futtatni, a válaszidő olyan lassú lesz, hogy lesz időd főzni egy kávét, mielőtt befejezné a mondatot. Továbbá a mesterséges intelligencia csak azt tudja, amit a betanítási dátumáig tanult, így nem fér hozzá valós időben a legfrissebb hírekhez.

  A legjobb webes források az SQL Serverhez: Teljes útmutató

Rendszerkövetelmények és ajánlott hardverek

Professzionális fejlesztőkörnyezet több monitorral, amelyeken a kód és az API-beállítások jelennek meg.

A frusztráló élmény elkerülése érdekében érdemes átnézni az alkatrészeket. A legfontosabb erőforrás a grafikus kártya RAM és VRAM memóriája . Általános szabály, hogy egy 1.5 GB-os modell körülbelül 1 GB helyet foglal el, de a zökkenőmentes működéshez több memóriára van szüksége.

  • Mini modellek (270M-től 4B-ig): Ideális kisebb vagy mobil eszközökhöz.
  • Kis modellek (4B-től 14B-ig): Kiegyensúlyozott választás otthoni felhasználók számára.
  • Közepes modellek (14B-től 70B-ig): Itt komoly hardver kell.
  • Nagy modellek (70B felett): Csak gigantikus erőforrásokkal rendelkező gépekhez.

Ami a GPU-t illeti, egy CUDA-val rendelkező NVIDIA, egy ROCm-mel rendelkező AMD vagy egy Apple Metal processzorral rendelkező Mac óriási különbséget jelent, mivel 5-10-szer gyorsabbá teszi a szöveggenerálást , mint ha csak a CPU-t használnánk. Ha felszerelést vásárolunk, legalább 16 GB VRAM-mal rendelkező grafikus kártyát keressünk, hogy ne fogyjon el gyorsan a memória.

Lépésről lépésre telepítési útmutató

Az Ollama telepítése meglepően egyszerű, és percek alatt elvégezhető a használt operációs rendszertől függően:

Windows rendszeren egyszerűen töltse le az .exe fájlt a hivatalos weboldalról. Általában a felhasználó AppData mappájába települ. Azok számára, akik a konténereket részesítik előnyben, a Docker Desktop segítségével is telepíthető a hivatalos telepítési parancs futtatásával a terminálban.

A felhasználók számára LinuxA leggyorsabb módszer a terminál használata a következő paranccsal: curl -fsSL https://ollama.com/install.sh | shA telepítés után a szolgáltatás általában a háttérben fut. Ha módosítania kell a modellek tárolási helyét a fő lemez megtöltésének elkerülése érdekében, szerkesztheti a környezeti változót. SÜTŐMODELLEK a systemd szolgáltatás konfigurációs fájljában.

  A legjobb webes források .NET-hez

En MacOSA telepítés egyszerű a letöltött telepítővel, vagy akár a brew install ollamaA rendszer automatikusan kihasználja a Fémgyorsulás Apple Silicon chipekből.

MI-modellek kezelése és futtatása

Miután az Ollama szerver aktív (a tálcán látható ikonon), elkezdheti a modellek letöltését. Az alapvető parancs a következő: ollama pull [nombre-del-modelo]bár ha használod ollama run, a rendszer automatikusan letölti a modellt ha még nincs meg.

Az igényektől függően többféle modellkategória létezik:

  • Társalgó: A Llama 3 vagy a Mistral a királyok itt, mivel egyensúlyt teremtenek a minőség és a sebesség között.
  • Programozás: A CodeLlama vagy a DeepSeek-Coder ideális kód hibakereséséhez vagy függvények generálásához.
  • Multimodális (vízió): Az olyan modellek, mint az LLaVA, lehetővé teszik képek feltöltését, és a mesterséges intelligencia leírását.
  • Gondolkodás (érvelés): Modellek, amelyek lépésről lépésre elmagyarázzák a folyamatokat.

Az interakcióhoz egyszerűen használja ollama run llama3 és egy interaktív parancssorba lépsz be. Ebben a munkamenetben olyan parancsokat használhatsz, mint például /? segítségért vagy /bye Kilépéshez. Ha látni szeretné, hogy mit telepített, ollama list Megadja a teljes listát, és vele együtt ollama ps Ellenőrizheted, hogy a modell megfelelő-e a GPU-ra vagy a CPU-ra töltve.

Speciális beállítások és testreszabás

Ha fejlesztő vagy, az Ollama egy aranybánya, mert egy REST API-t tesz elérhetővé a 11434-es porton. Ez lehetővé teszi a helyi mesterséges intelligencia csatlakoztatását bármilyen alkalmazáshoz. Kompatibilis az OpenAI formátummal, így integrálhatod a VS Code-ba a GitHub Copiloton keresztül (a BYOK opció használatával), vagy használhatsz olyan ügynököket, mint az OpenCode.

Egy másik hatékony funkció a Modelfile . Hasonló a Dockerfile-hoz, de mesterséges intelligenciára épül. Lehetővé teszi a modell testreszabott verziójának létrehozását egy adott rendszerkérdés meghatározásával (például Llamát spanyol jogi szakértővé alakítva), a hőmérséklet módosításával, hogy kreatívabb vagy pontosabb legyen, és a konfigurációt egyéni néven mentheti.

  Hogyan használjuk a mesterséges intelligenciát fiók létrehozása nélkül?

Azoknak, akik a ChatGPT-hez hasonló vizuális felületet keresnek, az Open WebUI telepítését javasoljuk . Ez backendként csatlakozik az Ollama-hoz, és teljes webes élményt nyújt a csevegési előzményekkel és a dokumentumkezeléssel, mindezt a saját helyi hálózatodon futtatva.

Optimalizálási és teljesítménynövelési tippek

Amikor azt észleljük, hogy a mesterséges intelligencia lassan fut, az első lépés a kvantálás ellenőrzése . Ez a folyamat csökkenti a modell súlyainak pontosságát (például 16 bitről 4 vagy 8 bitre), ami drasztikusan csökkenti a szükséges RAM mennyiségét a minőség túlzott feláldozása nélkül. A Q4_K_M modell általában az optimális egyensúlyt képviseli a teljesítmény és a pontosság között.

Annak megakadályozása érdekében, hogy az Ollama használaton kívül erőforrásokat fogyasztson, letilthatja az automatikus indítást a Windows Feladatkezelőben. Hasznos a VRAM-használat valós idejű figyelése is, hogy megállapítsa, a modell tehermentesíti- e a rendszermemóriát, ami jelentősen lelassítja a teljesítményt.

A helyi infrastruktúra feletti ellenőrzés demokratizálja a mesterséges intelligencia használatát, kiküszöböli az előfizetések gazdasági akadályait és a felhő biztonsági kockázatait. A Llama 3 vagy a Mistral modellek erejének és az Ollama könnyű kezelhetőségének kombinálásával bármely rajongó vagy vállalat kiépítheti saját privát MI-ökoszisztémáját , optimalizálva a rendelkezésre álló hardvereket és testreszabva a modell viselkedését az integrált Modelfile-ok és API-k segítségével.