- Tích hợp hoàn toàn Tensor ML SDK với LiteRT để tối ưu hóa việc triển khai các mô hình AI trên thiết bị Pixel.
- Truy cập vào Kho mô hình với hơn 100 mô hình được tối ưu hóa cho Google Tensor TPU.
- Hỗ trợ nâng cao cho các mô hình ngôn ngữ và thị giác đa phương thức thông qua kiến trúc Gemma 4.
- Khả năng thực hiện suy luận tốc độ cao và bảo mật thông tin nhờ phần cứng Tensor G5.

Nếu bạn đam mê phát triển ứng dụng và trí tuệ nhân tạo, chắc hẳn bạn đã nhận thấy rằng cuộc chơi đang thay đổi. Google đã quyết định khai thác tiềm năng của phần cứng mạnh mẽ nhất của mình với Tensor ML SDK , một công cụ phát triển cho phép các nhà phát triển tận dụng tối đa bộ xử lý tensor (TPU) của các thiết bị Pixel, cho phép AI chạy trực tiếp trên thiết bị, thay vì phụ thuộc vào điện toán đám mây.
Điều thú vị nhất là bộ SDK này đã vượt qua giai đoạn thử nghiệm và bước vào giai đoạn Beta . Điều này có nghĩa là nó không còn chỉ dành cho một số ít người được chọn; bất kỳ lập trình viên nào giờ đây cũng có thể bắt đầu tạo ra những trải nghiệm AI tương tác, riêng tư và trên hết là cực kỳ nhanh chóng bằng cách tận dụng kiến trúc Tensor SoC của Google để thực hiện các tác vụ mà trước đây dường như không thể thực hiện được trên máy tính cá nhân.
Quy trình làm việc thống nhất nhờ LiteRT

Để tránh việc các nhà phát triển bị sa lầy vào các cấu hình phức tạp, Google đã tích hợp Tensor SDK với LiteRT . Khung công tác này hoạt động như một lớp trừu tượng, loại bỏ nhu cầu phải xử lý các SDK dành riêng cho nhà cung cấp hoặc các trình biên dịch phức tạp, đồng thời cung cấp API đơn giản và nhất quán để triển khai các mô hình học máy ở biên.
Về cơ bản, quy trình được chia thành ba giai đoạn chính. Đầu tiên là biên dịch mô hình , nơi bạn có thể chuyển đổi các dự án dựa trên PyTorch hoặc TFLite của mình thành các tệp nhị phân được tối ưu hóa bằng LiteRT Torch. Tiếp theo là triển khai , sử dụng Play Feature Delivery và AI Packs để phân phối hiệu quả các thư viện và mô hình đã biên dịch trong ứng dụng.
Cuối cùng, chúng ta đến phần thực thi suy luận. Nhờ có LiteRT Runtime , bạn có thể chạy mô hình của mình trên TPU chỉ với một vài dòng mã. Điều tuyệt vời nhất là hệ thống rất thông minh: nếu vì bất kỳ lý do nào mà TPU không khả dụng, bạn có thể cấu hình các cơ chế dự phòng để tự động chuyển tải sang CPU hoặc GPU, đảm bảo ứng dụng không bao giờ bị treo.
Vườn Mẫu: Danh mục các khả năng
Không cần phải bắt đầu từ đầu, vì SDK Beta đã bao gồm một Model Garden ấn tượng . Thư viện này chứa hơn 100 mô hình, cả học máy cổ điển và trí tuệ nhân tạo tạo sinh, bao gồm các phiên bản Gemma 3 1B , cũng như một số lượng lớn các mô hình được xây dựng sẵn mà bạn có thể tải xuống trực tiếp từ cộng đồng Hugging Face trên LiteRT.
Nếu bạn muốn tạo các hàm xử lý văn bản, các mô hình ngôn ngữ nhỏ như Function Gemma cho phép bạn thực hiện các hành động cục bộ trong ứng dụng, trong khi EmbeddingGemma bổ sung thêm các khả năng ngữ nghĩa nâng cao. Về mặt hình ảnh, SDK cho phép bạn triển khai tính năng phát hiện đối tượng và lập bản đồ độ sâu , điều này rất có giá trị đối với các ứng dụng camera cần phản ứng với môi trường của người dùng trong thời gian thực.
Họ cũng không quên về âm thanh và khả năng truy cập. Nhận dạng giọng nói đầu cuối giờ đây đã khả thi , đảm bảo bản ghi có độ trễ cực thấp và các công cụ dịch thuật hoạt động ngoại tuyến, duy trì quyền riêng tư dữ liệu vì không có gì rời khỏi điện thoại.
Tối ưu hóa kỹ thuật và hỗ trợ phần cứng
Để tận dụng tối đa khả năng của nó, điều cần thiết là phải biết phần cứng nào được hỗ trợ. Hiện tại, hệ sinh thái tập trung vào dòng Pixel 10 , bao gồm các mẫu Pro, Pro XL và Pro Fold, tất cả đều được trang bị SoC Google Tensor G5 . Để đảm bảo AI hoạt động mượt mà, Google khuyến nghị sử dụng các cờ tối ưu hóa cụ thể trong quá trình biên dịch.
Ví dụ, trong quy trình LiteRT Python, việc sử dụng cờ `google_tensor_truncation_type="half"` rất phổ biến để tinh chỉnh hiệu suất và mức sử dụng tài nguyên. Đối với các mô hình ngôn ngữ lớn (LLM), việc xuất khẩu yêu cầu các tham số chi tiết, chẳng hạn như cấu hình ` quantization_recipe` và bật hỗ trợ cho các mô hình lớn thông qua từ điển cấu hình AOT.
Điều quan trọng cần đề cập là, mặc dù NNAPI đã tồn tại trước đây, nhưng nó đã bị loại bỏ kể từ Android 15. Phương pháp hiện tại là chuyển mọi thứ thông qua các delegate của LiteRT, trong đó hỗ trợ cho Pixel TPU đã trở thành yếu tố cốt lõi để thay thế các triển khai cũ hơn và đạt được hiệu quả năng lượng cao hơn.
Cuộc cách mạng Gemma 4 và Trí tuệ nhân tạo đa phương thức
Hãy cùng bàn về những phát triển mới nhất: sự ra mắt của Gemma 4 12B . Không giống như các mô hình khác gắn bộ mã hóa hình ảnh vào mô hình ngôn ngữ, Gemma 4 xử lý hình ảnh một cách trực tiếp. Kiến trúc đơn giản này không chỉ giảm mức tiêu thụ VRAM mà còn cho phép suy luận đa phương thức mượt mà và nhất quán hơn nhiều.
Với cửa sổ ngữ cảnh 256 token , mô hình này có thể xử lý các cuộc hội thoại dài với nhiều hình ảnh mà không bị mất dấu. Hơn nữa, được phân phối theo giấy phép Apache 2.0 , nó cực kỳ linh hoạt cho mục đích thương mại và phân phối lại, cho phép trí tuệ nhân tạo đa phương thức chạy trên các máy tính xách tay hiện đại sử dụng lượng tử hóa 4 hoặc 8 bit.
Mục tiêu của Google rất rõ ràng: họ muốn các nhà phát triển áp dụng các mô hình trọng số mở của mình để thống trị hệ sinh thái. Bằng cách làm cho AI trở nên mạnh mẽ và có tính cục bộ , họ giảm sự phụ thuộc vào các API bên ngoài và tạo ra một cộng đồng gắn kết xung quanh phần cứng Tensor và phần mềm LiteRT.
Hệ sinh thái phát triển Pixel đã có một bước tiến vượt bậc nhờ sự kết hợp giữa phần cứng Tensor G5 với tính linh hoạt của LiteRT và sức mạnh của các mô hình như Gemma 4. Nhờ việc chuyển sang phiên bản Beta của SDK và sự sẵn có của một kho tàng khổng lồ các mô hình đã được tối ưu hóa sẵn, việc tạo ra các ứng dụng xử lý hình ảnh, giọng nói và ngôn ngữ một cách riêng tư và cực nhanh giờ đây đã trở thành hiện thực dễ dàng đối với bất kỳ lập trình viên nào.
