Sådan installerer og konfigurerer du Ollama til at køre AI-modeller på din pc

Sidste ændring: 25 August 2026
Forfatter: TecnoDigital

Inde i en højtydende pc med et NVIDIA GeForce RTX-grafikkort, ideel til at køre lokale AI-modeller.

Du er sikkert allerede bekendt med værktøjer som ChatGPT, Claude eller Gemini. Selvom de er fantastiske, er der en hage ved dem: de kører i skyen. Det betyder, at hvert ord, du skriver, når en virksomheds servere, hvilket kan udgøre en alvorlig privatlivsrisiko, hvis du håndterer følsomme data eller arbejder i sektorer, hvor loven forbyder, at oplysninger forlader kontoret.

Det er her, Ollama kommer ind i billedet, en applikation, der i bund og grund forvandler din computer til nervecentret for AI . Glem månedlige abonnementer og en stabil internetforbindelse; med dette værktøj kan du downloade open source-modeller og køre dem direkte på din egen hardware, samtidig med at du bevarer fuld kontrol over dine data.

Hvad er Ollama egentlig, og hvad er dens fordele?

Computerskærm med et hængelåsikon og ordet 'Sikker', der repræsenterer databeskyttelse på lokale lokaler.

Ollama er open source-software, der fungerer som en klient til håndtering af store sprogmodeller (LLM). Dens største fordel er, at den forenkler den tekniske kompleksitet , håndterer GPU-optimering og hukommelsesstyring, så du kun behøver at udføre en kommando og begynde at chatte.

Fordelene er klare. For det første er privatlivets fred absolut, da intet forlader din maskine. For det andet sparer du på API-tokenomkostninger eller de månedlige gebyrer for Plus-abonnementer. Og for det tredje, når skabelonen er på din harddisk, kan du bruge den helt offline , ideelt når du er på et fly eller på steder med dårlig netværksdækning.

Det er dog ikke kun solskin og regnbuer. Den største ulempe er, at du har brug for kraftig hardware . Hvis du forsøger at køre en kæmpe model på en pc med lidt RAM, vil responsen være så langsom, at du når at lave en kop kaffe, før den er færdig med sin sætning. Desuden ved AI'en kun, hvad den har lært op til sin træningsdato, så den har ikke adgang til breaking news i realtid.

  Bedste webressourcer til SQL Server: En komplet vejledning

Systemkrav og anbefalet hardware

Professionelt udviklingsmiljø med flere skærme, der viser kode og API-indstillinger.

For at undgå en frustrerende oplevelse bør du kigge på dine komponenter. Den vigtigste ressource er dit grafikkorts RAM og VRAM . Som hovedregel optager en 1.5B-model cirka 1 GB plads, men den kræver mere hukommelse for at fungere problemfrit.

  • Minimodeller (270M til 4B): Ideel til beskedent eller mobilt udstyr.
  • Små modeller (4B til 14B): Den afbalancerede løsning for en hjemmebruger.
  • Mellemstore modeller (14B til 70B): Her har du brug for seriøst hardware.
  • Store modeller (over 70B): Kun for maskiner med gigantiske ressourcer.

Hvad angår GPU'en, gør det en kæmpe forskel at have et NVIDIA-kort med CUDA, et AMD-kort med ROCm eller en Mac med Apple Metal, da det fremskynder tekstgenereringen med 5 til 10 gange sammenlignet med kun at bruge CPU'en. Hvis du skal købe udstyr, så kig efter grafikkort med mindst 16 GB VRAM, så du ikke løber tør hurtigt.

Trin-for-trin installationsvejledning

Installation af Ollama er overraskende simpelt og kan gøres på få minutter afhængigt af det operativsystem, du bruger:

Windows skal du blot downloade .exe-filen fra den officielle hjemmeside. Den installeres typisk i brugerens AppData-mappe. For dem, der foretrækker containere, kan den også implementeres ved hjælp af Docker Desktop ved at køre den officielle installationskommando i terminalen.

For brugere af LinuxDen hurtigste måde er at bruge terminalen med kommandoen curl -fsSL https://ollama.com/install.sh | shNår tjenesten er installeret, kører den normalt i baggrunden. Hvis du har brug for at ændre, hvor modellerne er gemt, for at undgå at fylde din primære disk, kan du redigere miljøvariablen. OVNMODELLER i systemd-tjenestekonfigurationsfilen.

  Bedste webressourcer til .NET

En MacOSInstallationen er ligetil ved hjælp af det downloadede installationsprogram eller endda ved hjælp af brew install ollamaSystemet vil automatisk udnytte Metalacceleration af Apples siliciumchips.

Sådan administrerer og kører du AI-modeller

Når Ollama-serveren er aktiv (du kan se den på ikonet på proceslinjen), kan du begynde at downloade modeller. Den grundlæggende kommando er ollama pull [nombre-del-modelo]selvom hvis du bruger ollama run, systemet vil downloade modellen automatisk hvis du ikke har det endnu.

Der findes forskellige kategorier af modeller afhængigt af dine behov:

  • Samtale: Llama 3 eller Mistral er kongerne her på grund af deres balance mellem kvalitet og hastighed.
  • programmering: CodeLlama eller DeepSeek-Coder er ideelle til fejlfinding af kode eller generering af funktioner.
  • Multimodal (Vision): Modeller som LLaVA giver dig mulighed for at uploade billeder og bede AI om at beskrive dem.
  • Ræsonnement (Tænkning): Modeller designet til at forklare processer trin for trin.

For at interagere skal du blot bruge ollama run llama3 og du vil indtaste en interaktiv prompt. I denne session kan du bruge kommandoer som f.eks. /? for hjælp eller /bye For at afslutte. Hvis du vil se, hvad du har installeret, ollama list Den vil give dig den komplette liste, og med ollama ps Du kan tjekke om modellen er indlæst på GPU'en eller CPU'en.

Avancerede indstillinger og tilpasning

Hvis du er udvikler, er Ollama en guldgrube, fordi den eksponerer en REST API på port 11434. Dette giver dig mulighed for at forbinde lokal AI til enhver applikation. Den er kompatibel med OpenAI-formatet, så du kan integrere den i VS Code via GitHub Copilot (ved hjælp af BYOK-indstillingen) eller bruge agenter som OpenCode.

En anden kraftfuld funktion er Modelfile . Den ligner en Dockerfile, men er til AI. Den giver dig mulighed for at oprette en tilpasset version af en model ved at definere en specifik systemprompt (for eksempel ved at gøre Llama til en ekspert i spansk jura), justere temperaturen for at gøre den mere kreativ eller mere præcis og gemme konfigurationen under et brugerdefineret navn.

  Sådan bruger du kunstig intelligens uden at oprette en konto

For dem, der søger en visuel brugerflade, der minder mere om ChatGPT, anbefaler vi at installere Open WebUI . Den opretter forbindelse til Ollama som backend og giver en komplet weboplevelse med chathistorik og dokumenthåndtering, alt sammen kørende på dit eget lokale netværk.

Tips til optimering og ydeevne

Når du bemærker, at AI'en kører langsomt, er det første skridt at kontrollere kvantiseringen . Denne proces reducerer præcisionen af ​​modellens vægte (f.eks. fra 16 bit til 4 eller 8 bit), hvilket drastisk reducerer den nødvendige RAM uden at ofre for meget kvalitet. En Q4_K_M- model er normalt det optimale mellem ydeevne og præcision.

For at forhindre Ollama i at bruge ressourcer, når den ikke er i brug, kan du deaktivere automatisk opstart i Windows Jobliste. Det er også nyttigt at overvåge VRAM-forbruget i realtid for at afgøre, om modellen aflaster system-RAM, hvilket sænker ydeevnen betydeligt.

Kontrol over lokal infrastruktur demokratiserer brugen af ​​kunstig intelligens, hvilket eliminerer de økonomiske barrierer ved abonnementer og sikkerhedsrisici ved skyen. Ved at kombinere kraften i modeller som Llama 3 eller Mistral med den nemme administration af Ollama kan enhver entusiast eller virksomhed opbygge deres eget private AI-økosystem , optimere tilgængelig hardware og tilpasse modeladfærd gennem integrerede Modelfiler og API'er.