- Fullständig integration av Tensor ML SDK med LiteRT för att optimera distributionen av AI-modeller på Pixel-enheter.
- Tillgång till en modellträdgård med över 100 modeller optimerade för Google Tensor TPU.
- Avancerat stöd för multimodala språk- och visionsmodeller genom Gemma 4-arkitekturen.
- Möjlighet att utföra höghastighetsinferenser och sekretess tack vare Tensor G5-hårdvaran.

Om du gillar apputveckling och artificiell intelligens har du förmodligen märkt att spelet håller på att förändras. Google har beslutat att frigöra potentialen hos sin mest kraftfulla hårdvara med Tensor ML SDK , ett utvecklingsverktyg som gör det möjligt för utvecklare att fullt ut utnyttja tensorprocessorenheten (TPU) i Pixel-enheter, vilket gör att AI kan köras direkt på enheten, snarare än att förlita sig på molnet.
Det mest spännande är att detta SDK har gått bortom sin experimentella fas och in i betafas . Det betyder att det inte längre bara är för ett fåtal utvalda; vilken programmerare som helst kan nu börja skapa interaktiva, privata och framför allt otroligt snabba AI-upplevelser genom att utnyttja Googles Tensor SoC-arkitektur för att utföra uppgifter som tidigare verkade omöjliga att göra lokalt.
Ett enhetligt arbetsflöde tack vare LiteRT

För att förhindra att utvecklare fastnar i komplexa konfigurationer har Google integrerat Tensor SDK med LiteRT . Detta ramverk fungerar som ett abstraktionslager, vilket eliminerar behovet av att hantera leverantörsspecifika SDK:er eller komplicerade kompilatorer och tillhandahåller ett förenklat och konsekvent API för att distribuera maskininlärningsmodeller vid kanten.
Processen är i grunden uppdelad i tre huvudsteg. Först sker modellkompilering , där du kan omvandla dina PyTorch- eller TFLite-baserade projekt till optimerade binärfiler med hjälp av LiteRT Torch. Därefter sker distribution , med hjälp av Play Feature Delivery och AI Packs för att effektivt distribuera de kompilerade biblioteken och modellerna inom applikationen.
Slutligen kommer vi till utförandet av inferensen. Tack vare LiteRT Runtime kan du få din modell att köras på TPU:n med bara några få rader kod. Bäst av allt är att systemet är intelligent: om TPU:n av någon anledning inte är tillgänglig kan du konfigurera reservmekanismer för att automatiskt flytta belastningen till CPU:n eller GPU:n, vilket säkerställer att appen aldrig hänger sig.
Modellträdgården: En katalog över möjligheter
Det finns ingen anledning att börja från början, eftersom Beta SDK innehåller en imponerande Model Garden . Detta bibliotek innehåller över 100 modeller, både klassisk ML och generativ AI, inklusive Gemma 3 1B -versioner , samt ett stort antal färdiga modeller som du kan ladda ner direkt från Hugging Face-communityn på LiteRT.
Om du vill skapa textfunktioner kan små språkmodeller som Function Gemma utföra lokala åtgärder i appen, medan EmbeddingGemma lägger till avancerade semantiska funktioner. På den visuella sidan låter SDK:n dig implementera objektdetektering och djupmappning , vilket är ovärderligt för kameraapplikationer som behöver reagera på användarens miljö i realtid.
De har inte heller glömt bort ljud och tillgänglighet. End-to-end-taligenkänning är nu möjligt , vilket garanterar transkriptioner med extremt låg latens och översättningsverktyg som fungerar offline, vilket bibehåller datasekretessen eftersom ingenting lämnar telefonen.
Teknisk optimering och hårdvarusupport
För att få ut det mesta av det är det viktigt att veta vilken hårdvara som stöds. För närvarande är ekosystemet centrerat kring Pixel 10- familjen , inklusive modellerna Pro, Pro XL och Pro Fold, alla utrustade med Google Tensor G5 SoC . För att säkerställa att AI fungerar smidigt rekommenderar Google att man använder specifika optimeringsflaggor under byggprocessen.
Till exempel, i LiteRT Python-flödet är det mycket vanligt att använda flaggan `google_tensor_truncation_type="half"` för att finjustera prestanda och resursanvändning. För stora språkmodeller (LLM) kräver export detaljerade parametrar, såsom att konfigurera ` quantization_recipe` och aktivera stöd för stora modeller via AOT-konfigurationsordlistan.
Det är viktigt att nämna att även om NNAPI existerade tidigare, har det varit föråldrat sedan Android 15. Den nuvarande metoden är att skicka allt genom LiteRT-delegater, där stöd för Pixel TPU har blivit centralt för att ersätta äldre implementeringar och uppnå större energieffektivitet.
Gemma 4-revolutionen och multimodal AI
Låt oss prata om det senaste: ankomsten av Gemma 4 12B . Till skillnad från andra modeller som kopplar en bildkodare till en språkmodell, bearbetar Gemma 4 bilder direkt. Denna förenklade arkitektur minskar inte bara VRAM-förbrukningen utan möjliggör också mycket smidigare och mer konsekvent tvärmodalt resonemang.
Med ett kontextfönster på 256 000 tokens kan den här modellen hantera långa konversationer med flera bilder utan att tappa greppet. Dessutom, eftersom den distribueras under Apache 2.0- licensen , är den extremt flexibel för kommersiell användning och omdistribution, vilket gör att multimodal AI kan köras på moderna bärbara datorer med 4- eller 8-bitars kvantisering.
Googles mål är tydligt: de vill att utvecklare ska använda deras öppna viktningsmodeller för att dominera ekosystemet. Genom att göra AI lokal och kraftfull minskar de beroendet av externa API:er och skapar en sammanhängande gemenskap kring Tensor-hårdvara och LiteRT-programvara.
Pixel-utvecklingsekosystemet har tagit ett kvalitativt språng genom att kombinera Tensor G5- hårdvaran med mångsidigheten hos LiteRT och kraften hos modeller som Gemma 4. Tack vare övergången till Beta av SDK:et och tillgången till en massiv katalog av föroptimerade modeller är det nu en tillgänglig verklighet för alla programmerare att skapa applikationer som bearbetar syn, tal och språk privat och ultrasnabbt.
