- Analiza hardverskih mogućnosti Raspberry Pi 4 i moćnog Modela 5.
- Istraživanje vanjskih akceleratora poput AI HAT+ 2 za optimizaciju generativnog zaključivanja.
- Usporedba korištenja lokalnih kvantiziranih modela i podrške u vanjskim API infrastrukturama.
- Metodologije implementacije korištenjem alata kao što su Ollama, llama.cpp i Python okruženja.

Ako ste ikada sanjali o pametnom asistentu u stilu JARVIS-a koji radi u vašem domu, bez oslanjanja na oblak i s potpunom privatnošću, vjerojatno ste se pitali može li mala ploča poput Raspberry Pi-ja to podnijeti. Kratak odgovor je da, iako se iskustvo uvelike razlikuje ovisno o tome koristite li osnovni hardver ili odlučite dodati dodatnu snagu sa specijaliziranim akceleratorima.
Pokretanje opsežnih jezičnih modela (LLM) na rubnom računarstvu omogućuje obradu izravno na uređaju. To ne samo da eliminira mjesečne naknade za usluge u oblaku, već i osigurava da vaši podaci ostanu unutar vašeg doma - što je ključno za one koji cijene sigurnost kućne mreže i IoT- a te žele eksperimentirati s umjetnom inteligencijom bez vanjskih ograničenja.
Hardver i mogućnosti: Od Pi 4 do Pi 5
Za početak, važno je shvatiti da nisu sve ploče jednake. Na Raspberry Pi 4 moguće je pokretati lagane modele, ali performanse su skromne. Pomoću alata poput Ollame možete učitati modele poput tinydolphina , koji vam omogućuju chat putem terminala. Iako početni proces pokretanja može potrajati nekoliko minuta i računalu može trebati neko vrijeme da "razmisli" prije nego što odgovori, nakon što počne tipkati, to čini brzinom prihvatljivom za jednostavne zadatke.
Prijelazom na Raspberry Pi 5, situacija se poboljšava zahvaljujući njegovoj snažnijoj ARM arhitekturi. Ovdje RAM postaje ključni faktor; verzija s 8 GB RAM- a se toplo preporučuje . Za optimizaciju prostora koriste se tehnike kvantizacije (kao što su int4 ili 4-bit) , koje smanjuju veličinu modela, omogućujući mu da stane u memoriju bez žrtvovanja prevelike točnosti.
Za najzahtjevnije korisnike stigao je Raspberry Pi AI HAT+ 2. Ovaj dodatak mijenja pravila igre, integrirajući Hailo-10H akcelerator . Dok se prethodni HAT fokusirao na računalni vid (detekcija objekata ili segmentacija scene), novi model je posebno dizajniran za premošćivanje jaza u generativnoj umjetnoj inteligenciji, nudeći 40 TOPS performansi zaključivanja i 8 GB RAM-a posvećenog isključivo akceleratoru.
Tehnička implementacija i softver
Ako se odlučite za čisto softverski put na Pi 5, poziv.cpp To je standardni alat. Putem Python povezivanja mogu se učitati modeli u GGUF formatu (kao što je Orca-Mini-3B). Tijek rada uključuje stvaranje virtualnog okruženja i instaliranje llama-cpp-python i konfigurirati skriptu za upravljanje nitima procesora i korisničkim upitima. Za praćenje da se ploča ne ruši, vrlo je korisno koristiti mprof, što vam omogućuje analizu vršne potrošnje RAM memorije tijekom izvršavanja.
Za one koji kupe AI HAT+ 2, arhitektura postaje robusnija. Idealan pristup je instalirati Hailo kernel drajver i njegov odgovarajući runtime. Radi praktičnosti, preporučuje se konfigurirati hailo-ollama kao sistemsku uslugu (systemd) koja se automatski pokreće kada se ploča uključi, otkrivajući Ollama-kompatibilan API na portu 8000.
Kako biste izbjegli stalno korištenje naredbenog retka, možete instalirati Otvori web sučeljeOvo web sučelje pretvara Raspberry Pi u profesionalni chat server, dostupan iz bilo kojeg preglednika na lokalnoj mreži. Konfiguriranje OLLAMA_BASE_URL Točno, imamo fluidno sučelje koje komunicira s Hailo hardverom, omogućujući korištenje modela kao što su Qwen2 ili Qwen2.5-koder za lokalne zadatke programiranja i prevođenja.
Preporučeni modeli i optimizacija
Ključno je biti realan: model s 1 do 7 milijardi parametara koji se izvodi na Raspberry Piju neće se natjecati u općem znanju s GPT-4 ili Claude modelima, koji imaju milijarde parametara. Međutim, mali modeli su izvrsni ako se fino podese . AI HAT+ 2 omogućuje korištenje LoRA-e (Low-Rank Adaptation) , što znači da možete prilagoditi model za vrlo specifičan zadatak bez potrebe za ponovnim obučavanjem cijelog sustava.
- TinyDolphin: Idealan za Raspberry Pi 4 zbog vrlo niske potrošnje energije.
- Orca-Mini-3B: Čvrsta ravnoteža za Pi 5 korištenjem llama.cpp.
- Qwen2 / Qwen2.5: Optimizirano za Hailo-10H ekosustav, idealno za kodiranje i chat.
- VLM-ovi (modeli vizualnog jezika): Sposoban je opisati slike snimljene Pi-jevom kamerom u stvarnom vremenu.
Ako lokalne performanse ostanu nedovoljne za produkcijsku aplikaciju, postoji hibridna alternativa. Možete razvijati lokalno, ali delegirati zaključivanje vanjskim API-jima poput SiliconFlowa . To vam omogućuje da zadržite logiku na Raspberry Piju, ali dobijete trenutne odgovore putem oblaka, uz izuzetno niske troškove po milijun tokena, čime se sprječava pregrijavanje ili usporavanje uređaja.
Postavljanje AI čvora na rubu mreže zahtijeva strpljenje, posebno s ovisnostima kernela na distribucijama poput Ubuntu Servera. Korištenje službenih repozitorija Raspberry Pi često je stabilnije od kompajliranja svega od nule. Iako se ekosustav još uvijek čini pomalo nezrelim i postoje razlike između verzija GenAI paketa i službene dokumentacije, krajnji rezultat je tih, privatan i vrlo svestran sustav koji ploču pretvara u samostalni mozak za kućnu automatizaciju.