Guía Completa para Ejecutar LLM en Raspberry Pi

Última actualización: 31 de julio de 2026
  • Análisis de las capacidades de hardware tanto en Raspberry Pi 4 como en el potente modelo 5.
  • Exploración de aceleradores externos como el AI HAT+ 2 para optimizar la inferencia generativa.
  • Comparativa entre el uso de modelos locales cuantizados y el apoyo en infraestructuras de API externas.
  • Metodologías de implementación utilizando herramientas como Ollama, llama.cpp y entornos de Python.

Inteligencia Artificial en Raspberry Pi

Si alguna vez has soñado con tener un asistente inteligente al estilo de JARVIS funcionando en tu propia casa, sin depender de la nube y con total privacidad, probablemente te hayas planteado si una pequeña placa como la Raspberry Pi es capaz de soportarlo. La respuesta corta es que sí, aunque la experiencia varía enormemente dependiendo de si usas el hardware básico o si decides añadirle «músculo» mediante aceleradores especializados.

Ejecutar modelos de lenguaje extensos (LLM) en el llamado Edge Computing permite que el procesamiento ocurra directamente en el dispositivo. Esto no solo elimina las cuotas mensuales de los servicios en la nube, sino que garantiza que tus datos no salgan de tu hogar, algo fundamental para quienes valoran la seguridad en la red doméstica e IoT y quieren experimentar con la IA sin restricciones externas.

dispositivos inteligentes Raspberry Pi
Related article:
Dispositivos inteligentes con Raspberry Pi y domótica avanzada

Hardware y capacidades: De la Pi 4 a la Pi 5

Para empezar, es vital entender que no todas las placas son iguales. En una Raspberry Pi 4, es posible ejecutar modelos ligeros, pero el rendimiento es modesto. Utilizando herramientas como Ollama, se pueden cargar modelos como tinydolphin, que permiten chatear a través de la terminal. Aunque el arranque inicial puede llevar unos minutos y la máquina puede tardar un tiempo en «reflexionar» antes de responder, una vez que empieza a escribir, lo hace con una velocidad aceptable para tareas sencillas.

  Cómo crear tu logo con inteligencia artificial: guía completa y ejemplos

Dando el salto a la Raspberry Pi 5, la situación mejora gracias a su arquitectura ARM más potente. Aquí, la memoria RAM se vuelve el factor crítico; se recomienda encarecidamente contar con la versión de 8 GB de RAM. Para optimizar el espacio, se utilizan técnicas de cuantización (como int4 o 4 bits), que reducen el peso del modelo permitiendo que encajen en la memoria sin perder demasiada precisión en las respuestas.

Para los más exigentes, ha llegado el Raspberry Pi AI HAT+ 2. Este complemento es un cambio de juego absoluto ya que integra el acelerador Hailo-10H. Mientras que la versión anterior del HAT se centraba en la visión artificial (detección de objetos o segmentación de escenas), el nuevo modelo está diseñado específicamente para cerrar la brecha de la IA generativa, ofreciendo 40 TOPS de rendimiento de inferencia y 8 GB de RAM dedicados exclusivamente al acelerador.

raspberry pi proyectos smart home
Related article:
Guía Completa de Proyectos de Domótica con Raspberry Pi

Implementación técnica y software

Si decides ir por la vía del software puro en una Pi 5, llama.cpp es la herramienta estándar. A través de bindings de Python, se pueden cargar modelos en formato GGUF (como Orca-Mini-3B). El flujo de trabajo implica crear un entorno virtual, instalar llama-cpp-python y configurar un script que gestione los hilos del procesador y los prompts del usuario. Para monitorizar que la placa no colapse, es muy útil usar mprof, que permite analizar el pico de memoria RAM consumido durante la ejecución.

En el caso de quienes adquieren el AI HAT+ 2, la arquitectura se vuelve más robusta. El camino ideal consiste en instalar el driver del kernel de Hailo y su runtime correspondiente. Para que el sistema sea práctico, se recomienda configurar hailo-ollama como un servicio de sistema (systemd) que arranque automáticamente al encender la placa, exponiendo una API compatible con Ollama en el puerto 8000.

  Últimos Avances en Robótica e Inteligencia Artificial

Para no tener que lidiar siempre con la línea de comandos, se puede instalar Open WebUI. Esta interfaz web transforma la Raspberry Pi en un servidor de chat profesional, accesible desde cualquier navegador de la red local. Configurando el OLLAMA_BASE_URL correctamente, tenemos una interfaz fluida que se comunica con el hardware de Hailo, permitiendo usar modelos como Qwen2 o Qwen2.5-Coder para tareas de programación y traducción de forma local.

Related article:
Qué es Clawdbot y por qué está revolucionando los agentes de IA

Modelos recomendados y optimización

Es fundamental ser realistas: un modelo de 1 a 7 billones de parámetros corriendo en una Pi no va a competir en conocimientos generales con un GPT-4 o un Claude, que tienen billones de parámetros. Sin embargo, los modelos pequeños son excelentes si se realiza un ajuste fino (fine-tuning). El AI HAT+ 2 permite el uso de LoRA (Low-Rank Adaptation), lo que significa que puedes personalizar el modelo para una tarea muy específica sin necesidad de reentrenar todo el sistema.

  • TinyDolphin: Ideal para Raspberry Pi 4 por su bajísimo consumo.
  • Orca-Mini-3B: Un equilibrio sólido para la Pi 5 usando llama.cpp.
  • Qwen2 / Qwen2.5: Optimizados para el ecosistema Hailo-10H, ideales para código y chat.
  • VLMs (Vision-Language Models): Capaces de describir imágenes capturadas por la cámara de la Pi en tiempo real.

Si el rendimiento local sigue siendo insuficiente para una aplicación de producción, existe una alternativa híbrida. Se puede desarrollar localmente pero delegar la inferencia a APIs externas como SiliconFlow. Esto permite mantener la lógica en la Raspberry Pi pero obtener respuestas instantáneas mediante la nube, con costes extremadamente bajos por millón de tokens, evitando así que el dispositivo se caliente o se ralentice.

  Algoritmos de Inteligencia Artificial: Concepto y Aplicaciones

Configurar un nodo de IA en el borde requiere paciencia, especialmente con las dependencias del kernel en distribuciones como Ubuntu Server. A menudo, usar los repositorios oficiales de Raspberry Pi resulta más estable que compilar todo desde cero. Aunque el ecosistema aún se siente algo inmaduro y hay desfases entre las versiones de los paquetes de GenAI y la documentación oficial, el resultado final es un sistema silencioso, privado y sumamente versátil que convierte a la placa en un cerebro autónomo para la automatización del hogar.

mejoras para el hogar inteligente
Related article:
Guía Completa de Mejoras para el Hogar Inteligente y Domótica