Valószínűleg már ismersz olyan eszközöket, mint a ChatGPT, a Claude vagy a Gemini. Bár nagyszerűek, van egy apró bökkenőjük: a felhőben futnak. Ez azt jelenti, hogy minden beírt szó a cég szervereire kerül, ami kissé macerás lehet. komoly adatvédelmi probléma ha bizalmas adatokat kezel, vagy olyan szektorban dolgozik, ahol a törvény tiltja, hogy az információk elhagyják az irodát.
Itt jön képbe az Ollama, egy alkalmazás, ami gyakorlatilag a számítógépedet a MI idegközpontFelejtsd el a havi előfizetéseket és a stabil internetkapcsolatra való támaszkodást; ezzel az eszközzel letölthetsz nyílt forráskódú sablonokat, és közvetlenül a saját hardvereden futtathatod őket, így teljes mértékben kézben tarthatod az adataid feletti ellenőrzést.
Mi is pontosan az Ollama, és mik az előnyei?
Az Ollama egy nyílt forráskódú szoftver, amely kliensként működik a kiterjedt nyelvi modellek (LLM) kezeléséhez. Fő erőssége, hogy leegyszerűsíti a technikai bonyolultságot, gondoskodva a GPU optimalizálásáról és a memóriakezelésről, így csak egyetlen parancsot kell futtatnod, és máris elkezdhetsz csevegni.
Az előnyök egyértelműek. Először is, a Az adatvédelem teljes Mivel semmi sem hagyja el a gépedet. Másodszor, API token költségeket vagy havi Plusz csomagdíjakat takaríthatsz meg. Harmadszor pedig, miután a modell a merevlemezeden van, használhatod. teljesen offlineIdeális repülőgépen utazva vagy rossz lefedettségű helyeken.
Azonban nem csupa napsütés és rózsa. A fő hátránya, hogy Erős hardverre van szükségedHa egy hatalmas modellt egy kevés RAM-mal rendelkező PC-n próbálsz futtatni, a válaszidő olyan lassú lesz, hogy lesz időd főzni egy kávét, mielőtt befejezné a mondatot. Ráadásul a mesterséges intelligencia csak azt tudja, amit a betanítási dátumáig tanult, így nem fér hozzá valós időben a legfrissebb hírekhez.
Rendszerkövetelmények és ajánlott hardverek
A frusztráló élmény elkerülése érdekében érdemes átnézni az alkatrészeket. A legfontosabb erőforrás a RAM és VRAM a grafikus kártyádról. Általános szabályként egy 1.5 GB-os modell körülbelül 1 GB helyet foglal, de a zökkenőmentes működéshez több memóriára van szüksége.
- Mini modellek (270M-től 4B-ig): Ideális kisebb vagy mobil eszközökhöz.
- Kis modellek (4B-től 14B-ig): Kiegyensúlyozott választás otthoni felhasználók számára.
- Közepes modellek (14B-től 70B-ig): Itt komoly hardver kell.
- Nagy modellek (70B felett): Csak gigantikus erőforrásokkal rendelkező gépekhez.
Ami a GPU-t illeti, egy CUDA-val rendelkező NVIDIA, egy ROCm-mel rendelkező AMD vagy egy Apple Metal-lal rendelkező Mac hatalmas különbséget jelent, felgyorsítva a szöveggenerálást. 5 és 10 között A CPU használatával kapcsolatban: Ha felszerelést vásárolsz, legalább 16 GB VRAM-mal rendelkező grafikus kártyát keress, hogy ne fogyjon el gyorsan.
Lépésről lépésre telepítési útmutató
Az Ollama telepítése meglepően egyszerű, és percek alatt elvégezhető a használt operációs rendszertől függően:
En WindowsEgyszerűen töltse le az .exe fájlt a hivatalos weboldalról. Általában a felhasználó AppData mappájába települ. Azok számára, akik a konténereket részesítik előnyben, a következővel is telepíthető: Docker Asztal, a hivatalos telepítési parancs futtatásával a terminálban.
A felhasználók számára LinuxA leggyorsabb módszer a terminál használata a következő paranccsal: curl -fsSL https://ollama.com/install.sh | shA telepítés után a szolgáltatás általában a háttérben fut. Ha módosítania kell a modellek tárolási helyét a fő lemez megtöltésének elkerülése érdekében, szerkesztheti a környezeti változót. SÜTŐMODELLEK a systemd szolgáltatás konfigurációs fájljában.
En MacOSA telepítés egyszerű a letöltött telepítővel, vagy akár a brew install ollamaA rendszer automatikusan kihasználja a Fémgyorsulás Apple Silicon chipekből.
MI-modellek kezelése és futtatása
Miután az Ollama szerver aktív (a tálcán látható ikonon), elkezdheti a modellek letöltését. Az alapvető parancs a következő: ollama pull [nombre-del-modelo]bár ha használod ollama run, a rendszer automatikusan letölti a modellt ha még nincs meg.
Az igényektől függően többféle modellkategória létezik:
- Társalgó: A Llama 3 vagy a Mistral a királyok itt, mivel egyensúlyt teremtenek a minőség és a sebesség között.
- Programozás: A CodeLlama vagy a DeepSeek-Coder ideális kód hibakereséséhez vagy függvények generálásához.
- Multimodális (vízió): Az olyan modellek, mint az LLaVA, lehetővé teszik képek feltöltését, és a mesterséges intelligencia leírását.
- Gondolkodás (érvelés): Modellek, amelyek lépésről lépésre elmagyarázzák a folyamatokat.
Az interakcióhoz egyszerűen használja ollama run llama3 és egy interaktív parancssorba lépsz be. Ebben a munkamenetben olyan parancsokat használhatsz, mint például /? segítségért vagy /bye Kilépéshez. Ha látni szeretné, hogy mit telepített, ollama list Megadja a teljes listát, és vele együtt ollama ps Ellenőrizheted, hogy a modell megfelelő-e a GPU-ra vagy a CPU-ra töltve.
Speciális beállítások és testreszabás
Ha fejlesztő vagy, az Ollama egy aranybánya, mert leleplez egy... REST API a 11434-es portonEz lehetővé teszi a helyi mesterséges intelligencia bármilyen alkalmazáshoz való csatlakoztatását. Kompatibilis az OpenAI formátummal, így integrálható a VS Code-ba a GitHub Copiloton keresztül (a BYOK opció használatával), vagy olyan ügynököket használhat, mint az OpenCode.
Egy másik erőteljes tulajdonsága a ModellfájlHasonló egy Dockerfile-hoz, de mesterséges intelligenciára épül. Lehetővé teszi egy modell egyéni verziójának létrehozását egy Rendszer prompt specifikus (például Láma spanyol jogi szakértővé alakítása), módosítsa a hőmérsékletet, hogy kreatívabb vagy pontosabb legyen, és mentse el ezt a konfigurációt egy tulajdonnév alatt.
Azoknak, akik a ChatGPT-hez hasonló vizuális felületet keresnek, a következő telepítése ajánlott: Nyissa meg a WebUI-tHáttérrendszerként csatlakozik az Ollama-hoz, és teljes webes élményt kínál csevegési előzményekkel és dokumentumkezeléssel, mindezt a saját helyi hálózatodon futtatva.
Optimalizálási és teljesítménynövelési tippek
Amikor azt veszed észre, hogy a mesterséges intelligencia lassú, az első lépés az ellenőrzése. kvantálásEz a folyamat csökkenti a modell súlyozásának pontosságát (például 16 bitről 4 vagy 8 bitre), ami drasztikusan csökkenti a szükséges RAM mennyiségét a minőség túlzott feláldozása nélkül. Q4_K_M Ez általában az optimális egyensúly a teljesítmény és a pontosság között.
Annak megakadályozása érdekében, hogy az Ollama erőforrásokat fogyasztson, amikor nem használod, letilthatod a automatikus indítás a Windows Feladatkezelőben. Hasznos a VRAM-használat valós idejű figyelése is, hogy lássa, a modell működik-e kirakodás a rendszer RAM-jához, ami jelentősen lelassítja a válaszidőt.
A helyi infrastruktúra feletti ellenőrzés demokratizálja a mesterséges intelligencia használatát, kiküszöbölve az előfizetések gazdasági akadályait és a felhő biztonsági kockázatait. A Llama 3 vagy a Mistral modellek erejének és az Ollama könnyű kezelhetőségének kombinálásával bármely lelkes rajongó vagy vállalat létrehozhatja a sajátját. privát mesterséges intelligencia ökoszisztéma, optimalizálva a rendelkezésre álló hardvert és testreszabva a modellek viselkedését Modelfiles és integrált API-k segítségével.


