Segurament ja estiguis familiaritzat amb eines com ChatGPT, Claude o Gemini. Encara que són al·lucinants, hi ha un petit detall: funcionen al núvol. Això significa que cada paraula que escrius viatja fins als servidors d'una empresa, cosa que pot ser un problema greu de privadesa si maneges dades confidencials o treballes en sectors on la llei prohibeix que la informació surti de l'oficina.
Aquí és on entra en joc Ollama, una aplicació que bàsicament converteix el teu ordinador en el centre neuràlgic de la IA . Oblida't de les subscripcions mensuals i de dependre d'una connexió a internet estable; amb aquesta eina pots baixar models de codi obert i fer que corrin directament al teu maquinari, mantenint el control absolut de les teves dades.
Què és exactament Ollama i quins són els seus avantatges?
Ollama és un programari de codi obert que actua com a client per gestionar models de llenguatge extensos (LLM). El seu gran mèrit és que simplifica la complexitat tècnica , encarregant-se de l'optimització de la GPU i la gestió de la memòria perquè tu només hagis d'executar una ordre i començar a xatejar.
Els avantatges són clars. Primer, la privadesa és total ja que res surt de la teva màquina. Segon, t'estalvies els costos de les API per token o les quotes mensuals dels plans Plus. I tercer, una vegada que el model està al teu disc dur, pots utilitzar completament offline , ideal per quan estàs en un avió o en llocs amb una cobertura nefasta.
Això sí, no tot és color de rosa. El principal desavantatge és que requereixes maquinari potent . Si intentes córrer un model enorme en un PC amb poca RAM, la resposta serà tan lenta que et donarà temps a fer-te un cafè abans que s'acabi la frase. A més, la IA només sap què va aprendre fins a la data d'entrenament, per la qual cosa no té accés a notícies d'última hora en temps real.
Requisits del sistema i maquinari recomanat
Perquè l'experiència no sigui frustrant, has de donar un cop d'ull als teus components. El recurs més crític és la memòria RAM i la VRAM de la targeta gràfica. Com a regla general, un model de 1.5B paràmetres ocupa aproximadament 1GB despai, però necessita més memòria per operar amb fluïdesa.
- Models Mini (270M a 4B): Ideals per a equips modestos o mòbils.
- Models Petits (4B a 14B): Lopció equilibrada per a un usuari domèstic.
- Models Mitjos (14B a 70B): Aquí ja necessites un maquinari seriós.
- Models Grans (més de 70B): Només per a màquines amb recursos gegantins.
Pel que fa a la GPU, tenir una NVIDIA amb CUDA, una AMD amb ROCm o un Mac amb Apple Metall marca una diferència abismal, accelerant la generació de text entre 5 i 10 vegades respecte a utilitzar només la CPU. Si vas a comprar equip, busca targetes amb almenys 16GB de VRAM per no quedar curt ràpidament.
Guia d'instal·lació pas a pas
Instal·lar Ollama és sorprenentment senzill i es pot fer en qüestió de minuts depenent del sistema operatiu que utilitzis:
A Windows , només cal descarregar l'executable .exe des de la web oficial. S'instal·larà habitualment a la carpeta d'AppData de l'usuari. Per als que prefereixen contenidors, també és possible desplegar-lo mitjançant Docker Desktop , executant l'ordre d'instal·lació oficial a la terminal.
Per als usuaris de Linux, la via més ràpida és fer servir la terminal amb l'ordre curl -fsSL https://ollama.com/install.sh | sh. Un cop instal·lat, el servei sol quedar corrent en segon pla. Si necessiteu canviar on es desen els models per no omplir el disc principal, podeu editar la variable d'entorn OLLAMA_MODELS al fitxer de configuració del servei systemd.
En macOS, la instal·lació és directa mitjançant l'instal·lador descarregat o fins i tot usant brew install ollama. El sistema aprofitarà automàticament la acceleració de Metall dels xips Apple Silicon.
Com gestionar i executar models d'IA
Quan el servidor d'Ollama està actiu (ho veuràs a la icona de la barra de tasques), pots començar a baixar models. La comanda fonamental és ollama pull [nombre-del-modelo], encara que si uses ollama run, El sistema descarregarà el model automàticament si encara no el tens.
Hi ha diverses categories de models segons el que necessitis:
- Conversacionals: Flama 3 o Mistral són els reis aquí pel seu equilibri entre qualitat i velocitat.
- programació: CodeLlama o DeepSeek-Coder són ideals per depurar codi o generar funcions.
- Multimodals (Vision): Models com LLaVA permeten pujar imatges i demanar-li a la IA que les descrigui.
- Raonament (Thinking): Models dissenyats per explicar processos pas a pas.
Per interactuar, simplement utilitza ollama run llama3 i entraràs en un prompt interactiu. Dins d'aquesta sessió, podeu utilitzar comandes com /? per ajuda o /bye per sortir. Si vols veure què tens instal·lat, ollama list et donarà la llista completa, i amb ollama ps podràs comprovar si el model està carregat a la GPU o la CPU.
Configuracions avançades i personalització
Si ets desenvolupador, Ollama és una mina d'or perquè exposa una API REST al port 11434 . Això permet connectar la IA local amb qualsevol aplicació. És compatible amb el format d'OpenAI, per la qual cosa pots integrar-lo a VS Code a través de GitHub Copilot (usant l'opció BYOK) o fer servir agents com OpenCode.
Una altra funció potent és el Modelfile . És similar a un Dockerfile però per a IA. Et permet crear una versió personalitzada d'un model definint un System Prompt específic (per exemple, convertir Flama en un expert en lleis espanyoles), ajustar la temperatura perquè sigui més creatiu o més precís, i guardar aquesta configuració sota un nom propi.
Per als que busquen una interfície visual més semblant a ChatGPT, la recomanació és instal·lar Open WebUI . Es connecta a Ollama com a backend i t'ofereix una experiència web completa amb historial de xats i gestió de documents, tot corrent a la teva pròpia xarxa local.
Optimització i trucs de rendiment
Quan notes que la IA va lenta, el primer pas és revisar la quantització . Aquest procés redueix la precisió dels pesos del model (de 16 bits a 4 o 8 bits, per exemple), cosa que disminueix dràsticament la memòria RAM necessària sense perdre gaire qualitat. Un model Q4_K_M sol ser el punt dolç entre rendiment i precisió.
Per evitar que Ollama consumeixi recursos quan no l'utilitzeu, podeu desactivar l' inici automàtic a l'Administrador de Tasques de Windows. També és útil monitoritzar el consum de VRAM en temps real per saber si el model està fent offloading a la RAM del sistema, la qual cosa alenteix la resposta significativament.
Tenir el control de la infraestructura local permet democratitzar l'ús de la intel·ligència artificial i eliminar les barreres econòmiques de les subscripcions i els riscos de seguretat del núvol. En combinar la potència de models com Flama 3 o Mistral amb la senzillesa de gestió d'Ollama, qualsevol entusiasta o empresa pot muntar el seu propi ecosistema de IA privada , optimitzant el maquinari disponible i personalitzant el comportament dels models mitjançant Modelfiles i APIs integrades.


