Guia Completa per Executar LLM a Raspberry Pi

Darrera actualització: 31 de juliol de 2026
  • Anàlisi de les capacitats de maquinari tant a Raspberry Pi 4 com al potent model 5.
  • Exploració d'acceleradors externs com l'AI HAT+2 per optimitzar la inferència generativa.
  • Comparativa entre lús de models locals quantitzats i el suport en infraestructures dAPI externes.
  • Metodologies d'implementació utilitzant eines com Ollama, flama.cpp i entorns de Python.

Intel·ligència Artificial a Raspberry Pi

Si alguna vegada has somiat tenir un assistent intel·ligent a l'estil de JARVIS funcionant a casa teva, sense dependre del núvol i amb total privadesa, probablement t'hagis plantejat si una petita placa com la Raspberry Pi és capaç de suportar-lo. La resposta curta és que sí, encara que l'experiència varia enormement depenent de si utilitzes el maquinari bàsic o si decideixes afegir-hi «múscul» mitjançant acceleradors especialitzats.

Executar models de llenguatge extensos (LLM) a l'anomenat Informàtica de vores permet que el processament passi directament al dispositiu. Això no només elimina les quotes mensuals dels serveis al núvol, sinó que garanteix que les teves dades no surtin de casa teva, una cosa fonamental per als que valoren la seguretat a la xarxa domèstica i IoT i volen experimentar amb la IA sense restriccions externes.

dispositius intel·ligents Raspberry Pi
Article relacionat:
Dispositius intel·ligents amb Raspberry Pi i domòtica avançada

Maquinari i capacitats: De la Pi 4 a la Pi 5

Per començar, és vital entendre que no totes les plaques són iguals. En una Raspberry Pi 4 és possible executar models lleugers, però el rendiment és modest. Utilitzant eines com Ollama, es poden carregar models com tinydolphin, que permeten xatejar a través de la terminal. Tot i que l'arrencada inicial pot trigar uns minuts i la màquina pot trigar un temps a «reflexionar» abans de respondre, una vegada que comença a escriure, ho fa amb una velocitat acceptable per a tasques senzilles.

  Microsoft Copilot: com es fa servir i tot el que pots fer amb ell

Fent el salt a la Raspberry Pi 5, la situació millora gràcies a la seva arquitectura ARM més potent. Aquí, la memòria RAM es torna el factor crític; es recomana encaridament comptar amb la versió de 8 GB de RAM. Per optimitzar l'espai, s'utilitzen tècniques de quantització (com int4 o 4 bits), que redueixen el pes del model permetent que encaixin a la memòria sense perdre massa precisió en les respostes.

Per als més exigents, ha arribat el Raspberry Pi AI HAT+ 2. Aquest complement és un canvi de joc absolut, ja que integra l'accelerador Hailo-10H. Mentre que la versió anterior del HAT se centrava en la visió artificial (detecció d'objectes o segmentació d'escenes), el nou model està dissenyat específicament per tancar l'escletxa de la IA generativa, oferint 40 TOPS de rendiment d'inferència i 8 GB de RAM dedicats exclusivament a l'accelerador.

raspberry pi projectes smart home
Article relacionat:
Guia Completa de Projectes de Domòtica amb Raspberry Pi

Implementació tècnica i programari

Si decideixes anar per la via del programari pur en una Pi 5, truca.cpp és l'eina estàndard. A través de bindings de Python, es poden carregar models en format GGUF (com Orca-Mini-3B). El flux de treball implica crear un entorn virtual, instal·lar llama-cpp-python i configurar un script que gestioni els fils del processador i els prompts de lusuari. Per monitoritzar que la placa no col·lapsi, és molt útil fer servir mprof, que permet analitzar el bec de memòria RAM consumit durant l'execució.

En el cas dels qui adquireixen l'AI HAT+ 2, l'arquitectura esdevé més robusta. El camí ideal consisteix a instal·lar el driver del nucli de Hailo i el seu runtime corresponent. Perquè el sistema sigui pràctic, es recomana configurar hailo-ollama com un servei de sistema (systemd) que arrenqui automàticament en engegar la placa, exposant una API compatible amb Ollama al port 8000.

  Gemini Code Assist: l'assistent d'IA per a programadors ja està disponible de franc

Per no haver de bregar sempre amb la línia d'ordres, es pot instal·lar Obriu WebUI. Aquesta interfície web transforma la Raspberry Pi en un servidor de xat professional, accessible des de qualsevol navegador de la xarxa local. Configurant el OLLAMA_BASE_URL correctament, tenim una interfície fluida que es comunica amb el maquinari de Hailo, permetent utilitzar models com Qwen2 o Qwen2.5-Coder per a tasques de programació i traducció de forma local.

Article relacionat:
Què és Clawdbot i per què revoluciona els agents d'IA

Models recomanats i optimització

És fonamental ser realistes: un model de 1 a 7 bilions de paràmetres corrent en una Pi no competirà en coneixements generals amb un GPT-4 o un Claude, que tenen bilions de paràmetres. No obstant això, els models petits són excel·lents si es realitza un ajust fi (fine-tuning). L'AI HAT+ 2 permet l'ús de LoRA (adaptació de baix rang), el que significa que pots personalitzar el model per a una tasca molt específica sense necessitat de reentrenar tot el sistema.

  • TinyDolphin: Ideal per a Raspberry Pi 4 pel seu baixíssim consum.
  • Orca-Mini-3B: Un equilibri sòlid per a la Pi 5 usant flama.cpp.
  • Qwen2 / Qwen2.5: Optimitzats per a l'ecosistema Hailo-10H, ideals per a codi i xat.
  • VLMs (Vision-Language Models): Capaços de descriure imatges capturades per la càmera de la Pi en temps real.

Si el rendiment local continua sent insuficient per a una aplicació de producció, hi ha una alternativa híbrida. Es pot desenvolupar localment però delegar la inferència a APIs externes com SiliconFlow. Això permet mantenir la lògica a la Raspberry Pi però obtenir respostes instantànies mitjançant el núvol, amb costos extremadament baixos per milió de tokens, evitant així que el dispositiu s'escalfi o s'alenteixi.

  Gemini per a Android: Una revolució en intel·ligència artificial i productivitat mòbil

Configurar un node d'IA a la vora requereix paciència, especialment amb les dependències del nucli en distribucions com Ubuntu Server. Sovint, fer servir els repositoris oficials de Raspberry Pi resulta més estable que compilar-ho tot des de zero. Tot i que l'ecosistema encara se sent una mica immadur i hi ha desfasaments entre les versions dels paquets de GenAI i la documentació oficial, el resultat final és un sistema silenciós, privat i summament versàtil que converteix la placa en un cervell autònom per a l'automatització de la llar.

millores per a la llar intel·ligent
Article relacionat:
Guia Completa de Millores per a la Llar Intel·ligent i Domòtica