- Ollama permite ejecutar modelos de lenguaje avanzados de forma local, garantizando privacidad total y funcionamiento sin internet.
- El rendimiento depende directamente del hardware, siendo la VRAM de la GPU el factor crítico para la velocidad de respuesta.
- La herramienta ofrece una API compatible con OpenAI y la posibilidad de crear modelos personalizados mediante Modelfiles.

Seguramente ya estés familiarizado con herramientas como ChatGPT, Claude o Gemini. Aunque son alucinantes, hay un pequeño detalle: funcionan en la nube. Esto significa que cada palabra que escribes viaja hasta los servidores de una empresa, algo que puede ser un problema grave de privacidad si manejas datos confidenciales o trabajas en sectores donde la ley prohíbe que la información salga de la oficina.
Aquí es donde entra en juego Ollama, una aplicación que básicamente convierte tu ordenador en el centro neurálgico de la IA. Olvídate de las suscripciones mensuales y de depender de una conexión a internet estable; con esta herramienta puedes bajar modelos de código abierto y hacer que corran directamente en tu propio hardware, manteniendo el control absoluto de tus datos.
¿Qué es exactamente Ollama y cuáles son sus ventajas?
Ollama es un software de código abierto que actúa como cliente para gestionar modelos de lenguaje extensos (LLM). Su gran mérito es que simplifica la complejidad técnica, encargándose de la optimización de la GPU y la gestión de la memoria para que tú solo tengas que ejecutar un comando y empezar a chatear.
Las ventajas son claras. Primero, la privacidad es total ya que nada sale de tu máquina. Segundo, te ahorras los costes de las APIs por token o las cuotas mensuales de los planes Plus. Y tercero, una vez que el modelo está en tu disco duro, puedes usarlo completamente offline, ideal para cuando estás en un avión o en sitios con una cobertura nefasta.
Eso sí, no todo es color de rosa. La principal desventaja es que requieres hardware potente. Si intentas correr un modelo enorme en un PC con poca RAM, la respuesta será tan lenta que te dará tiempo a hacerte un café antes de que termine la frase. Además, la IA solo sabe lo que aprendió hasta su fecha de entrenamiento, por lo que no tiene acceso a noticias de última hora en tiempo real.
Requisitos del sistema y hardware recomendado
Para que la experiencia no sea frustrante, debes echar un ojo a tus componentes. El recurso más crítico es la memoria RAM y la VRAM de tu tarjeta gráfica. Como regla general, un modelo de 1.5B parámetros ocupa aproximadamente 1GB de espacio, pero necesita más memoria para operar con fluidez.
- Modelos Mini (270M a 4B): Ideales para equipos modestos o móviles.
- Modelos Pequeños (4B a 14B): La opción equilibrada para un usuario doméstico.
- Modelos Medianos (14B a 70B): Aquí ya necesitas un hardware serio.
- Modelos Grandes (más de 70B): Solo para máquinas con recursos gigantescos.
En cuanto a la GPU, tener una NVIDIA con CUDA, una AMD con ROCm o un Mac con Apple Metal marca una diferencia abismal, acelerando la generación de texto entre 5 y 10 veces respecto a usar solo la CPU. Si vas a comprar equipo, busca tarjetas con al menos 16GB de VRAM para no quedarte corto rápidamente.
Guía de instalación paso a paso
Instalar Ollama es sorprendentemente sencillo y se puede hacer en cuestión de minutos dependiendo del sistema operativo que utilices:
En Windows, basta con descargar el ejecutable .exe desde la web oficial. Se instalará habitualmente en la carpeta de AppData del usuario. Para quienes prefieren contenedores, también es posible desplegarlo mediante Docker Desktop, ejecutando el comando de instalación oficial en la terminal.
Para los usuarios de Linux, la vía más rápida es usar la terminal con el comando curl -fsSL https://ollama.com/install.sh | sh. Una vez instalado, el servicio suele quedar corriendo en segundo plano. Si necesitas cambiar dónde se guardan los modelos para no llenar el disco principal, puedes editar la variable de entorno OLLAMA_MODELS en el archivo de configuración del servicio systemd.
En macOS, la instalación es directa mediante el instalador descargado o incluso usando brew install ollama. El sistema aprovechará automáticamente la aceleración de Metal de los chips Apple Silicon.
Cómo gestionar y ejecutar modelos de IA
Una vez que el servidor de Ollama está activo (lo verás en el icono de la barra de tareas), puedes empezar a bajar modelos. El comando fundamental es ollama pull [nombre-del-modelo], aunque si usas ollama run, el sistema descargará el modelo automáticamente si aún no lo tienes.
Existen diversas categorías de modelos según lo que necesites:
- Conversacionales: Llama 3 o Mistral son los reyes aquí por su equilibrio entre calidad y velocidad.
- Programación: CodeLlama o DeepSeek-Coder son ideales para depurar código o generar funciones.
- Multimodales (Vision): Modelos como LLaVA permiten subir imágenes y pedirle a la IA que las describa.
- Razonamiento (Thinking): Modelos diseñados para explicar procesos paso a paso.
Para interactuar, simplemente usa ollama run llama3 y entrarás en un prompt interactivo. Dentro de esta sesión, puedes usar comandos como /? para ayuda o /bye para salir. Si quieres ver qué tienes instalado, ollama list te dará la lista completa, y con ollama ps podrás comprobar si el modelo está cargado en la GPU o la CPU.
Configuraciones avanzadas y personalización
Si eres desarrollador, Ollama es una mina de oro porque expone una API REST en el puerto 11434. Esto permite conectar la IA local con cualquier aplicación. Es compatible con el formato de OpenAI, por lo que puedes integrarlo en VS Code a través de GitHub Copilot (usando la opción BYOK) o usar agentes como OpenCode.
Otra función potente es el Modelfile. Es similar a un Dockerfile pero para IA. Te permite crear una versión personalizada de un modelo definiendo un System Prompt específico (por ejemplo, convertir a Llama en un experto en leyes españolas), ajustar la temperatura para que sea más creativo o más preciso, y guardar esa configuración bajo un nombre propio.
Para quienes buscan una interfaz visual más parecida a ChatGPT, la recomendación es instalar Open WebUI. Se conecta a Ollama como backend y te ofrece una experiencia web completa con historial de chats y gestión de documentos, todo corriendo en tu propia red local.
Optimización y trucos de rendimiento
Cuando notas que la IA va lenta, el primer paso es revisar la cuantización. Este proceso reduce la precisión de los pesos del modelo (de 16 bits a 4 u 8 bits, por ejemplo), lo que disminuye drásticamente la memoria RAM necesaria sin perder demasiada calidad. Un modelo Q4_K_M suele ser el punto dulce entre rendimiento y precisión.
Para evitar que Ollama consuma recursos cuando no lo usas, puedes desactivar el inicio automático en el Administrador de Tareas de Windows. También es útil monitorizar el consumo de VRAM en tiempo real para saber si el modelo está haciendo offloading a la RAM del sistema, lo cual ralentiza la respuesta significativamente.
Tener el control de la infraestructura local permite democratizar el uso de la inteligencia artificial, eliminando las barreras económicas de las suscripciones y los riesgos de seguridad de la nube. Al combinar la potencia de modelos como Llama 3 o Mistral con la sencillez de gestión de Ollama, cualquier entusiasta o empresa puede montar su propio ecosistema de IA privada, optimizando el hardware disponible y personalizando el comportamiento de los modelos mediante Modelfiles y APIs integradas.

