Guide complet pour exécuter LLM sur Raspberry Pi

Dernière mise à jour: 31 de julio de 2026
  • Analyse des capacités matérielles du Raspberry Pi 4 et du puissant modèle 5.
  • Exploration d'accélérateurs externes tels que AI HAT+ 2 pour optimiser l'inférence générative.
  • Comparaison entre l'utilisation de modèles quantifiés locaux et la prise en charge par les infrastructures d'API externes.
  • Méthodologies de mise en œuvre utilisant des outils tels que Ollama, llama.cpp et les environnements Python.

Intelligence artificielle sur Raspberry Pi

Si vous avez déjà rêvé d'un assistant intelligent de type JARVIS fonctionnant chez vous, sans dépendre du cloud et en toute confidentialité, vous vous êtes probablement demandé si une petite carte comme le Raspberry Pi pouvait s'en charger. La réponse est oui, même si l'expérience varie considérablement selon que vous utilisiez le matériel de base ou que vous choisissiez d'ajouter de la puissance avec des accélérateurs spécialisés.

L'exécution de modèles de langage étendus (LLM) en périphérie de réseau permet un traitement direct sur l'appareil. Ceci élimine non seulement les frais mensuels de service cloud, mais garantit également que vos données restent à domicile – un point crucial pour ceux qui privilégient la sécurité de leur réseau domestique et de leurs objets connectés et qui souhaitent expérimenter l'IA sans contraintes externes.

appareils intelligents Raspberry Pi
Article connexe:
Appareils intelligents avec Raspberry Pi et domotique avancée

Matériel et fonctionnalités : du Pi 4 au Pi 5

Pour commencer, il est essentiel de comprendre que toutes les cartes ne se valent pas. Sur un Raspberry Pi 4, il est possible d'exécuter des modèles légers, mais les performances restent modestes. Grâce à des outils comme Ollama , vous pouvez charger des modèles tels que tinydolphin , qui vous permet de discuter via le terminal. Bien que le démarrage initial puisse prendre quelques minutes et que la machine puisse mettre un certain temps à « réfléchir » avant de répondre, une fois lancée, la vitesse de frappe est acceptable pour les tâches simples.

  Comment appliquer le Deep Work et maximiser votre concentration

Avec le Raspberry Pi 5, la situation s'améliore grâce à son architecture ARM plus puissante. La RAM devient alors un facteur déterminant ; la version 8 Go est fortement recommandée . Pour optimiser l'espace mémoire, des techniques de quantification (comme int4 ou 4 bits) sont utilisées , ce qui réduit la taille du modèle et permet de le faire tenir en mémoire sans trop sacrifier la précision.

Pour les utilisateurs les plus exigeants, le Raspberry Pi AI HAT+ 2 est arrivé . Ce module complémentaire révolutionne l'IA en intégrant l' accélérateur Hailo-10H . Alors que le précédent HAT était axé sur la vision par ordinateur (détection d'objets ou segmentation de scènes), le nouveau modèle est spécifiquement conçu pour combler le fossé en matière d'IA générative, offrant une puissance d'inférence de 40 TOPS et 8 Go de RAM dédiés exclusivement à l'accélérateur.

Projets de maison intelligente avec Raspberry Pi
Article connexe:
Guide complet des projets de domotique avec Raspberry Pi

Mise en œuvre technique et logiciel

Si vous décidez d'opter pour une solution purement logicielle sur un Pi 5, lama.cpp Il s'agit de l'outil standard. Grâce aux liaisons Python, il est possible de charger des modèles au format GGUF (tels que Orca-Mini-3B). Le processus consiste à créer un environnement virtuel et à l'installer. llama-cpp-python et configurer un script pour gérer les threads du processeur et les invites utilisateur. Pour s'assurer que la carte ne plante pas, il est très utile d'utiliser mprof, ce qui vous permet d'analyser la consommation maximale de mémoire RAM pendant l'exécution.

Pour les acquéreurs de l'AI HAT+ 2, l'architecture est renforcée. L'idéal est d'installer le pilote noyau Hailo et son environnement d'exécution. Pour plus de simplicité, il est recommandé de configurer hailo-ollama comme un service système (systemd) qui démarre automatiquement à la mise sous tension de la carte, exposant ainsi une API compatible Ollama sur le port 8000.

  LEGO SMART Play : Voici à quoi ressemblent les nouvelles pièces intelligentes.

Pour éviter d'avoir à utiliser constamment la ligne de commande, vous pouvez installer Ouvrir l'interface utilisateur WebCette interface web transforme le Raspberry Pi en un serveur de chat professionnel, accessible depuis n'importe quel navigateur du réseau local. La configuration du OLLAMA_BASE_URL En effet, nous disposons d'une interface fluide qui communique avec le matériel Hailo, permettant l'utilisation de modèles tels que Codeur Qwen2 ou Qwen2.5 pour les tâches de programmation et de traduction locales.

Article connexe:
Qu'est-ce que Clawdbot et pourquoi révolutionne-t-il les agents IA ?

Modèles recommandés et optimisation

Il est essentiel d'être réaliste : un modèle comportant 1 à 7 milliards de paramètres et exécuté sur un Raspberry Pi ne pourra pas rivaliser en connaissances générales avec un GPT-4 ou un Claude, qui possèdent des milliards de paramètres. Cependant, les petits modèles sont excellents une fois finement paramétrés . L'AI HAT+ 2 permet l'utilisation de LoRA (Low-Rank Adaptation) , ce qui signifie que vous pouvez personnaliser le modèle pour une tâche très spécifique sans avoir à réentraîner l'ensemble du système.

  • TinyDolphin : Idéal pour le Raspberry Pi 4 grâce à sa très faible consommation d'énergie.
  • Orca-Mini-3B : Un équilibre solide pour le Pi 5 utilisant llama.cpp.
  • Qwen2 / Qwen2.5 : Optimisé pour l'écosystème Hailo-10H, idéal pour le code et le chat.
  • Modèles vision-langage (VLM) : Capable de décrire en temps réel les images capturées par la caméra du Pi.

Si les performances locales restent insuffisantes pour une application en production, une alternative hybride existe. Vous pouvez développer localement tout en déléguant l'inférence à des API externes comme SiliconFlow . Cela vous permet de conserver la logique sur le Raspberry Pi tout en obtenant des réponses instantanées via le cloud, à un coût extrêmement bas par million de jetons, évitant ainsi la surchauffe ou le ralentissement de l'appareil.

  DeepL Clarify : la fonctionnalité qui révolutionne la traduction interactive avec l'IA

Configurer un nœud d'IA en périphérie demande de la patience, notamment en raison des dépendances du noyau sur des distributions comme Ubuntu Server. Utiliser les dépôts officiels Raspberry Pi est souvent plus stable que de tout compiler soi-même. Bien que l'écosystème paraisse encore un peu immature et qu'il existe des divergences entre les versions des paquets GenAI et la documentation officielle, le résultat est un système discret, privé et extrêmement polyvalent qui transforme la carte en un véritable cerveau autonome pour la domotique.

améliorations de la maison intelligente
Article connexe:
Guide complet des améliorations et de l'automatisation de la maison intelligente