Hoe installeer en configureer je Ollama om AI-modellen op je pc uit te voeren?

Laatste update: 25 augustus 2026

Binnenin een krachtige pc met een NVIDIA GeForce RTX grafische kaart, ideaal voor het uitvoeren van lokale AI-modellen.

Je bent waarschijnlijk al bekend met tools zoals ChatGPT, Claude of Gemini. Hoewel ze fantastisch zijn, is er een nadeel: ze draaien in de cloud. Dit betekent dat elk woord dat je typt naar de servers van een bedrijf wordt verzonden, wat een ernstig privacyrisico kan vormen als je met gevoelige gegevens werkt of in sectoren werkt waar het wettelijk verboden is om informatie buiten het kantoor te verspreiden.

Hier komt Ollama in beeld, een applicatie die je computer in feite verandert in het zenuwcentrum van AI . Vergeet maandelijkse abonnementen en de afhankelijkheid van een stabiele internetverbinding; met deze tool kun je open-source modellen downloaden en direct op je eigen hardware uitvoeren, met volledige controle over je data.

Wat is Ollama precies en wat zijn de voordelen ervan?

Computerscherm met een hangslotpictogram en het woord 'Beveiligd', wat staat voor gegevensbescherming op locatie.

Ollama is open-source software die fungeert als client voor het beheren van grote taalmodellen (LLM). Het belangrijkste voordeel is dat het de technische complexiteit vereenvoudigt door GPU-optimalisatie en geheugenbeheer af te handelen, zodat je alleen een commando hoeft uit te voeren om te kunnen communiceren.

De voordelen zijn duidelijk. Ten eerste is de privacy absoluut, omdat er niets van uw computer wordt opgeslagen. Ten tweede bespaart u op API-tokenkosten of de maandelijkse kosten voor Plus-abonnementen. En ten derde kunt u, zodra de sjabloon op uw harde schijf staat, deze volledig offline gebruiken , ideaal voor in het vliegtuig of op plaatsen met een slechte netwerkdekking.

Het is echter niet allemaal rozengeur en zonneschijn. Het grootste nadeel is dat je krachtige hardware nodig hebt . Als je een groot model probeert te draaien op een pc met weinig RAM, zal de reactie zo traag zijn dat je tijd hebt om koffie te zetten voordat het zijn zin heeft afgemaakt. Bovendien weet de AI alleen wat het tot aan de trainingsdatum heeft geleerd, dus heeft het geen toegang tot het laatste nieuws in realtime.

  Beste webbronnen voor SQL Server: een complete gids

Systeemvereisten en aanbevolen hardware

Professionele ontwikkelomgeving met meerdere beeldschermen waarop code en API-instellingen worden weergegeven.

Om een ​​frustrerende ervaring te voorkomen, is het verstandig om je componenten te controleren. De belangrijkste componenten zijn het RAM-geheugen en het VRAM-geheugen van je grafische kaart . Over het algemeen neemt een 1.5B-model ongeveer 1 GB aan ruimte in beslag, maar heeft meer geheugen nodig om soepel te functioneren.

  • Mini-modellen (270M tot 4B): Ideaal voor bescheiden of mobiele apparatuur.
  • Kleine modellen (4B tot en met 14B): De ideale, evenwichtige optie voor thuisgebruikers.
  • Middelgrote modellen (14B tot 70B): Hier heb je serieuze hardware nodig.
  • Grote modellen (groter dan 70B): Alleen voor machines met gigantische rekenkracht.

Wat de GPU betreft, maakt een NVIDIA-kaart met CUDA, een AMD-kaart met ROCM of een Mac met Apple Metal een enorm verschil. Tekstgeneratie wordt hierdoor 5 tot 10 keer sneller dan wanneer alleen de CPU wordt gebruikt. Als je apparatuur gaat kopen, zoek dan naar grafische kaarten met minimaal 16 GB VRAM, zodat je niet snel zonder komt te zitten.

Stap voor stap installatiehandleiding

Het installeren van Ollama is verrassend eenvoudig en kan, afhankelijk van het besturingssysteem dat u gebruikt, binnen enkele minuten worden gedaan:

Op Windows kunt u het .exe-bestand eenvoudig downloaden van de officiële website. Het wordt doorgaans geïnstalleerd in de AppData-map van de gebruiker. Voor degenen die de voorkeur geven aan containers, kan het ook worden geïmplementeerd met Docker Desktop door het officiële installatiecommando in de terminal uit te voeren.

Voor gebruikers van LinuxDe snelste manier is om de terminal te gebruiken met het commando. curl -fsSL https://ollama.com/install.sh | shNa installatie draait de service doorgaans op de achtergrond. Als u de opslaglocatie van de modellen wilt wijzigen om te voorkomen dat uw hoofdschijf vol raakt, kunt u de omgevingsvariabele aanpassen. OVEN_MODELLEN in het configuratiebestand van de systemd-service.

  Beste webbronnen voor .NET

En macOSDe installatie is eenvoudig met behulp van het gedownloade installatieprogramma of zelfs via brew install ollamaHet systeem zal automatisch gebruikmaken van de Metaalversnelling van Apple Silicon-chips.

Hoe AI-modellen te beheren en uit te voeren

Zodra de Ollama-server actief is (u ziet het aan het pictogram in de taakbalk), kunt u modellen downloaden. Het belangrijkste commando is ollama pull [nombre-del-modelo]hoewel als je gebruikt ollama run, het systeem Het model wordt automatisch gedownload. als je die nog niet hebt.

Er zijn verschillende categorieën modellen, afhankelijk van uw behoeften:

  • Gespreksvorm: Llama 3 of Mistral zijn hier de koningen vanwege hun evenwicht tussen kwaliteit en snelheid.
  • programmering: CodeLlama of DeepSeek-Coder zijn ideaal voor het debuggen van code of het genereren van functies.
  • Multimodaal (Visie): Met modellen zoals LLaVA kun je afbeeldingen uploaden en AI vragen om ze te beschrijven.
  • Redeneren (Denken): Modellen die zijn ontworpen om processen stap voor stap uit te leggen.

Om te communiceren, gebruik je gewoon ollama run llama3 en u komt in een interactieve prompt terecht. Binnen deze sessie kunt u commando's gebruiken zoals /? voor hulp of /bye Om af te sluiten. Als u wilt zien wat u hebt geïnstalleerd, ollama list Het geeft je de complete lijst, en met ollama ps Je kunt controleren of het model geladen op de GPU of CPU.

Geavanceerde instellingen en aanpassingsmogelijkheden

Als ontwikkelaar is Ollama een goudmijn, omdat het een REST API beschikbaar stelt op poort 11434. Hiermee kun je lokale AI verbinden met elke applicatie. Het is compatibel met het OpenAI-formaat, dus je kunt het integreren in VS Code via GitHub Copilot (met de BYOK-optie) of agents zoals OpenCode gebruiken.

Een andere krachtige functie is het Modelfile . Het is vergelijkbaar met een Dockerfile, maar dan voor AI. Hiermee kun je een aangepaste versie van een model maken door een specifieke systeemprompt te definiëren (bijvoorbeeld om van Llama een expert in Spaans recht te maken), de temperatuur aan te passen om het creatiever of preciezer te maken, en die configuratie op te slaan onder een aangepaste naam.

  Hoe gebruik je kunstmatige intelligentie zonder een account aan te maken?

Voor wie een visuele interface zoekt die meer lijkt op ChatGPT, raden we aan Open WebUI te installeren . Deze applicatie maakt verbinding met Ollama als backend en biedt een complete webervaring met chatgeschiedenis en documentbeheer, allemaal draaiend op uw eigen lokale netwerk.

Tips voor optimalisatie en prestatieverbetering

Als je merkt dat de AI traag werkt, is de eerste stap het controleren van de kwantisering . Dit proces verlaagt de precisie van de gewichten van het model (bijvoorbeeld van 16 bits naar 4 of 8 bits), waardoor het benodigde RAM-geheugen drastisch afneemt zonder al te veel kwaliteitsverlies. Een Q4_K_M -model is meestal de ideale balans tussen prestatie en precisie.

Om te voorkomen dat Ollama systeembronnen verbruikt wanneer het niet in gebruik is, kunt u automatisch opstarten uitschakelen in Taakbeheer van Windows. Het is ook nuttig om het VRAM-gebruik in realtime te controleren om te bepalen of het model systeem-RAM ontlast , wat de prestaties aanzienlijk kan vertragen.

Door de controle over de lokale infrastructuur wordt het gebruik van kunstmatige intelligentie gedemocratiseerd, waardoor de economische drempels van abonnementen en de beveiligingsrisico's van de cloud worden weggenomen. Door de kracht van modellen zoals Llama 3 of Mistral te combineren met het gebruiksgemak van Ollama, kan elke liefhebber of elk bedrijf zijn eigen private AI-ecosysteem bouwen , de beschikbare hardware optimaliseren en het gedrag van modellen aanpassen via geïntegreerde modelbestanden en API's.