Kumpletong Gabay sa Pagpapatakbo ng LLM sa Raspberry Pi

Huling pag-update: 31 de julio de 2026
May-akda: TecnoDigital
  • Pagsusuri ng mga kakayahan ng hardware ng parehong Raspberry Pi 4 at ng makapangyarihang Model 5.
  • Paggalugad ng mga panlabas na accelerator tulad ng AI HAT+ 2 upang ma-optimize ang generative inference.
  • Paghahambing sa pagitan ng paggamit ng mga lokal na quantized na modelo at suporta sa mga panlabas na imprastraktura ng API.
  • Mga metodolohiya sa implementasyon gamit ang mga kagamitang tulad ng Ollama, llama.cpp at mga kapaligirang Python.

Artipisyal na Katalinuhan sa Raspberry Pi

Kung napanaginipan mo na ang pagkakaroon ng isang JARVIS-style na smart assistant na tumatakbo sa sarili mong tahanan, nang hindi umaasa sa cloud at may kumpletong privacy, malamang ay napaisip ka na kung kakayanin ito ng isang maliit na board tulad ng Raspberry Pi. Ang maikling sagot ay oo, bagama't ang karanasan ay lubhang nag-iiba depende sa kung gagamit ka ng pangunahing hardware o magpasya kang magdagdag ng karagdagang lakas gamit ang mga espesyal na accelerator.

Ang pagpapatakbo ng malawakang mga modelo ng wika (LLM) sa edge computing ay nagbibigay-daan sa pagproseso na maganap nang direkta sa device. Hindi lamang nito inaalis ang buwanang bayarin sa serbisyo ng cloud kundi tinitiyak din nito na mananatili ang iyong data sa loob ng iyong tahanan —mahalaga para sa mga nagpapahalaga sa seguridad ng home network at IoT at gustong mag-eksperimento sa AI nang walang mga panlabas na paghihigpit.

Mga smart device na Raspberry Pi
Kaugnay na artikulo:
Mga smart device na may Raspberry Pi at advanced home automation

Hardware at mga kakayahan: Mula sa Pi 4 hanggang sa Pi 5

Upang magsimula, mahalagang maunawaan na hindi lahat ng board ay pantay-pantay. Sa isang Raspberry Pi 4, posibleng magpatakbo ng mga magaan na modelo, ngunit katamtaman lamang ang performance. Gamit ang mga tool tulad ng Ollama , maaari kang mag-load ng mga modelo tulad ng tinydolphin , na nagbibigay-daan sa iyong makipag-chat sa pamamagitan ng terminal. Bagama't ang unang proseso ng boot ay maaaring tumagal ng ilang minuto at ang makina ay maaaring magtagal bago "mag-isip" bago tumugon, kapag nagsimula na itong mag-type, ginagawa nito ito sa bilis na katanggap-tanggap para sa mga simpleng gawain.

  Paano mag-apply ng Deep Work at i-maximize ang iyong konsentrasyon

Pagdating sa Raspberry Pi 5, bumubuti ang sitwasyon dahil sa mas malakas na arkitektura ng ARM nito. Dito, ang RAM ang nagiging kritikal na salik; ang bersyong 8GB RAM ay lubos na inirerekomenda . Upang ma-optimize ang espasyo, ginagamit ang mga pamamaraan ng quantization (tulad ng int4 o 4-bit) , na nagpapaliit sa laki ng modelo, na nagbibigay-daan dito upang magkasya sa memorya nang hindi isinasakripisyo ang labis na katumpakan.

Para sa mga pinaka-demanding na gumagamit, dumating na ang Raspberry Pi AI HAT+ 2. Ang add-on na ito ay isang game-changer, na isinasama ang Hailo-10H accelerator . Habang ang nakaraang HAT ay nakatuon sa computer vision (object detection o scene segmentation), ang bagong modelo ay partikular na idinisenyo upang tulay ang agwat sa generative AI, na nag-aalok ng 40 TOPS ng inference performance at 8 GB ng RAM na eksklusibong nakatuon sa accelerator.

Mga proyekto sa matalinong tahanan ng Raspberry Pi
Kaugnay na artikulo:
Kumpletong Gabay sa mga Proyekto sa Home Automation gamit ang Raspberry Pi

Teknikal na pagpapatupad at software

Kung magpasya kang gamitin ang purong software sa isang Pi 5, call.cpp Ito ang karaniwang kagamitan. Sa pamamagitan ng mga Python binding, maaaring i-load ang mga modelo sa format na GGUF (tulad ng Orca-Mini-3B). Kasama sa daloy ng trabaho ang paglikha ng isang virtual na kapaligiran at pag-install llama-cpp-python at mag-configure ng script para pamahalaan ang mga thread ng processor at mga prompt ng user. Para masubaybayan na hindi nagka-crash ang board, lubhang kapaki-pakinabang na gamitin ito mprof, na nagbibigay-daan sa iyong suriin ang pinakamataas na natupok na RAM memory habang isinasagawa.

Para sa mga bibili ng AI HAT+ 2, mas magiging matatag ang arkitektura nito. Ang mainam na paraan ay ang pag-install ng Hailo kernel driver at ang kaukulang runtime nito. Para sa praktikalidad, inirerekomenda na i-configure ang hailo-ollama bilang isang system service (systemd) na awtomatikong magsisimula kapag naka-on ang board, na maglalantad ng Ollama-compatible API sa port 8000.

  LEGO SMART Play: Ganito ang mga bagong smart piece.

Para maiwasan ang palaging paghawak sa command line, maaari mong i-install Buksan ang WebUIBinabago ng web interface na ito ang Raspberry Pi tungo sa isang propesyonal na chat server, na maa-access mula sa anumang browser sa lokal na network. Pag-configure ng OLLAMA_BASE_URL Tama, mayroon tayong fluid interface na nakikipag-ugnayan sa Hailo hardware, na nagpapahintulot sa paggamit ng mga modelo tulad ng Qwen2 o Qwen2.5-Coder para sa mga lokal na gawain sa pagprograma at pagsasalin.

Kaugnay na artikulo:
Ano ang Clawdbot at bakit nito binabago ang mga AI agent?

Mga inirerekomendang modelo at pag-optimize

Mahalagang maging makatotohanan: ang isang modelo na may 1 hanggang 7 bilyong parameter na tumatakbo sa isang Raspberry Pi ay hindi makakalaban sa pangkalahatang kaalaman ng isang GPT-4 o isang Claude, na may bilyun-bilyong parameter. Gayunpaman, ang maliliit na modelo ay mahusay kung pino-fine-tune . Pinapayagan ng AI HAT+ 2 ang paggamit ng LoRA (Low-Rank Adaptation) , na nangangahulugang maaari mong i-customize ang modelo para sa isang napaka-espesipikong gawain nang hindi kinakailangang sanayin muli ang buong sistema.

  • TinyDolphin: Mainam para sa Raspberry Pi 4 dahil sa napakababang konsumo ng kuryente nito.
  • Orca-Mini-3B: Isang matibay na balanse para sa Pi 5 gamit ang llama.cpp.
  • Qwen2 / Qwen2.5: Na-optimize para sa Hailo-10H ecosystem, mainam para sa code at chat.
  • Mga VLM (Mga Modelo ng Wikang Pananaw): May kakayahang ilarawan ang mga imaheng nakuha ng kamera ng Pi sa totoong oras.

Kung ang lokal na pagganap ay hindi pa rin sapat para sa isang aplikasyon sa produksyon, mayroong alternatibong hybrid. Maaari kang bumuo nang lokal ngunit magtalaga ng hinuha sa mga panlabas na API tulad ng SiliconFlow . Nagbibigay-daan ito sa iyong panatilihin ang lohika sa Raspberry Pi ngunit makakuha ng mga agarang tugon sa pamamagitan ng cloud, sa napakababang gastos bawat milyong token, kaya pinipigilan ang device na mag-overheat o bumagal.

  DeepL Clarify: Ang tampok na nagbabago ng interactive na pagsasalin gamit ang AI

Ang pag-set up ng AI node sa edge ay nangangailangan ng pasensya, lalo na sa mga kernel dependencies sa mga distribution tulad ng Ubuntu Server. Ang paggamit ng mga opisyal na Raspberry Pi repository ay kadalasang mas matatag kaysa sa pag-compile ng lahat mula sa simula. Bagama't medyo hindi pa rin gaanong luma ang ecosystem at may mga pagkakaiba sa pagitan ng mga bersyon ng GenAI package at ng opisyal na dokumentasyon, ang resulta ay isang tahimik, pribado, at lubos na maraming gamit na sistema na nagbabago sa board tungo sa isang self-contained na utak para sa home automation.

mga pagpapabuti sa matalinong tahanan
Kaugnay na artikulo:
Kumpletong Gabay sa mga Pagpapabuti ng Smart Home at Home Automation