- Mô hình đa phương thức gốc với văn bản, hình ảnh, âm thanh và video, cùng khả năng phát trực tuyến theo thời gian thực.
- SOTA trong 22/36 chuẩn âm thanh/video và đa ngôn ngữ (119/19/10 ngôn ngữ).
- Kiến trúc Thinker–Talker với MoE, độ trễ thấp và khả năng kiểm soát nhắc nhở hệ thống.
- Khuyến nghị triển khai với vLLM/Transformers, Docker và các tiện ích chính thức.
Sự xuất hiện của Qwen3-Omni đã làm thay đổi cục diện của trí tuệ nhân tạo: một mô hình gốc duy nhất có khả năng hiểu và phản hồi văn bản, hình ảnh, âm thanh và video , với phản hồi tức thì cả bằng văn bản và lời nói. Chúng ta không nói về các "mảnh ghép" đa phương thức, mà là một kiến trúc được thiết kế cơ bản để tích hợp các phương thức với độ trễ thấp và khả năng kiểm soát hành vi được tinh chỉnh.
Trong thời điểm hầu hết mọi người đang thử nghiệm chatbot và trợ lý ảo, Qwen3-Omni xuất hiện với tham vọng lớn: nó hỗ trợ 119 ngôn ngữ thông qua văn bản, nhận dạng giọng nói bằng 19 ngôn ngữ và nói được bằng 10 ngôn ngữ, hiểu được các đoạn âm thanh dài (lên đến 30 phút), và tự hào với điểm số cao trong hàng chục bài kiểm tra. Hơn nữa, thiết kế Thinker-Talker và phương pháp Mixture of Experts của nó hướng đến tốc độ phản hồi và chất lượng lập luận trong các tình huống thực tế.
Qwen3-Omni là gì và nó cung cấp những gì?
Qwen3-Omni là một họ các mô hình đa ngôn ngữ cơ bản, đa phương thức và toàn diện được thiết kế để xử lý văn bản, hình ảnh, âm thanh và video, với đầu ra cả dạng văn bản và giọng nói tự nhiên. Điểm mấu chốt không chỉ nằm ở sự đa dạng của đầu vào và đầu ra mà còn ở chức năng truyền tải dữ liệu liên tục với các lượt hội thoại trôi chảy và khả năng phản hồi tức thì.
Nhóm nghiên cứu đã giới thiệu một số cải tiến về kiến trúc để nâng cao hiệu suất và hiệu quả: huấn luyện sơ bộ "ưu tiên văn bản" kết hợp với huấn luyện đa phương thức hỗn hợp, và thiết kế với mô hình "Hỗn hợp các chuyên gia" (MoE) giúp duy trì hiệu suất xử lý văn bản và hình ảnh đồng thời tăng cường hiệu suất xử lý âm thanh và video. Nhờ những cải tiến này, mô hình đạt được vị trí dẫn đầu (SOTA) trong 22 trên 36 bài kiểm tra âm thanh/video và vị trí dẫn đầu mã nguồn mở (open-source SOTA) trong 32 trên 36 bài kiểm tra, với kết quả tương đương với Gemini 2.5 Pro trong nhận dạng giọng nói tự động (ASR), hiểu âm thanh và hội thoại.

Các khả năng và phương thức chính
Qwen3-Omni sẵn sàng cho các ứng dụng âm thanh, hình ảnh và nghe nhìn thực tế, với khả năng hỗ trợ đa ngôn ngữ rộng rãi: 119 ngôn ngữ văn bản, 19 ngôn ngữ nhập liệu bằng giọng nói và 10 ngôn ngữ xuất liệu bằng giọng nói . Các ngôn ngữ nhập liệu bằng giọng nói bao gồm tiếng Anh, tiếng Trung, tiếng Hàn, tiếng Nhật, tiếng Đức, tiếng Nga, tiếng Ý, tiếng Pháp, tiếng Tây Ban Nha, tiếng Bồ Đào Nha, tiếng Mã Lai, tiếng Hà Lan, tiếng Indonesia, tiếng Thổ Nhĩ Kỳ, tiếng Việt, tiếng Quảng Đông, tiếng Ả Rập và tiếng Urdu; và các ngôn ngữ xuất liệu bao gồm tiếng Anh, tiếng Trung, tiếng Pháp, tiếng Đức, tiếng Nga, tiếng Ý, tiếng Tây Ban Nha, tiếng Bồ Đào Nha, tiếng Nhật và tiếng Hàn, cùng nhiều ngôn ngữ khác.
Bộ sách hướng dẫn chính thức minh họa phạm vi ứng dụng rộng lớn của nó. Về âm thanh, nó thể hiện khả năng nhận dạng giọng nói đa ngôn ngữ và âm thanh dài (ASR) , chuyển đổi giọng nói thành văn bản và giọng nói sang giọng nói, phân tích âm nhạc (phong cách, nhịp điệu, thể loại), mô tả hiệu ứng âm thanh và phụ đề cho bất kỳ âm thanh nào . Nó cũng hỗ trợ phân tích hỗn hợp các bản nhạc có giọng nói, âm nhạc và âm thanh môi trường.
Về mặt thị giác, nó cung cấp khả năng nhận dạng ký tự quang học "cứng" cho các hình ảnh phức tạp, phát hiện và định vị đối tượng , kiểm tra chất lượng hình ảnh, giải toán trên hình ảnh (nơi mô hình Tư duy tỏa sáng), mô tả video, điều hướng dựa trên video góc nhìn thứ nhất và phân tích chuyển cảnh . Trong các kịch bản nghe nhìn, nó thể hiện khả năng kiểm tra chất lượng âm thanh-video với căn chỉnh thời gian, tương tác có hướng dẫn với đầu vào AV và hội thoại với hành vi trợ lý ảo.
Là một tác nhân, nó nổi bật nhờ khả năng thực hiện cuộc gọi từ âm thanh , mở ra các quy trình làm việc bằng giọng nói kích hoạt các công cụ, và trong các tác vụ phái sinh, có một Omni-Captioner để tạo phụ đề với độ chi tiết cao, chứng tỏ tính tổng quát của nền tảng cơ bản.
Kiến trúc và Thiết kế Người suy nghĩ-Người nói chuyện với MoE
Một trong những điểm khác biệt chính là sự phân tách trách nhiệm: Người suy nghĩ tạo ra văn bản (với các biến thể bao gồm cả lập luận chuỗi suy nghĩ rõ ràng), và Người nói tạo ra âm thanh theo thời gian thực . Sự tách biệt này cho phép cuộc hội thoại bằng giọng nói tự nhiên trong khi hệ thống vẫn duy trì mức độ hiểu và lập kế hoạch văn bản cao.
Cơ sở dữ liệu MoE phân bổ khối lượng công việc giữa các chuyên gia và dựa vào quá trình huấn luyện trước AuT để tạo ra các biểu diễn tổng quát mạnh mẽ. Hơn nữa, việc sử dụng mã hóa đa lớp trong kênh âm thanh giúp giảm độ trễ xuống mức tối thiểu, điều này rất quan trọng đối với các cuộc gọi hoặc trợ lý ảo, nơi mà từng phần trăm giây đều có ý nghĩa.
Hiệu suất và tiêu chuẩn: văn bản, hình ảnh, âm thanh và nghe nhìn
Qwen3-Omni duy trì hiệu năng hiển thị văn bản và hình ảnh tiên tiến mà không hề suy giảm so với các mẫu Qwen có kích thước tương tự chỉ tập trung vào một chế độ duy nhất, trong khi về hiệu năng âm thanh và hình ảnh, nó dẫn đầu trong hầu hết các bài kiểm tra . Trong bộ 36 bài kiểm tra hiệu năng âm thanh và hình ảnh, nó đạt được vị trí dẫn đầu (SOTA) trong các hệ thống mã nguồn mở ở 32 bài và vị trí dẫn đầu tuyệt đối (SOTA) ở 22 bài, vượt trội hơn Gemini 2.5 Pro và GPT-4 ở một số điểm.
Một số cột mốc đáng chú ý trong kiểm thử văn bản: trong AIME25, biến thể Flash-Instruct đạt khoảng 65,9 điểm; trong ZebraLogic, Instruct đạt 90 điểm, và trong MultiPL-E, nó đạt được các chỉ số cạnh tranh so với GPT-4. Trong các nhiệm vụ so khớp như IFEval và WritingBench, các mô hình Instruct và Thinking cho thấy điểm số cao và ổn định.
Về âm thanh, kết quả nhận dạng giọng nói tự động (ASR) cho tiếng Trung và tiếng Anh rất xuất sắc: trong WenetSpeech và LibriSpeech, nó giảm đáng kể tỷ lệ lỗi từ, với các con số gần 1,22/2,48 trong LibriSpeech clean/other, và trong các bộ dữ liệu như FLEURS (đa ngôn ngữ), nó cho tỷ lệ rất thấp. Trong VoiceBench, các chỉ số như AlpacaEval, CommonEval và WildVoice cho thấy Qwen3-Omni ngang hàng với các hệ thống tham chiếu khép kín, và nó vượt trội trong khả năng suy luận âm thanh trong MMAU v05.15.25.
Trong các ứng dụng nghe nhìn, chỉ số được trích dẫn thường xuyên nhất là WorldSense (khoảng 54,1 ), vượt trội hơn Gemini-2.5-Flash. Hơn nữa, trong các bộ ứng dụng như DailyOmni và VideoHolmes, biến thể Thinking đạt được những cải tiến so với các ứng dụng mã nguồn mở tiên tiến trước đây. Trong lĩnh vực xử lý hình ảnh thuần túy, nó vượt trội trong MMMU, MathVista, MathVision và khả năng hiểu tài liệu (AI2D, ChartQA), với điểm số rất tốt trong việc đếm (CountBench) và hiểu video (Video-MME, MLVU).
Khả năng tạo giọng nói không cần huấn luyện cũng được đo lường: so với các hệ máy như CosyVoice và Seed-TTS, Qwen3-Omni cho thấy tính nhất quán nội dung tốt hơn trên nhiều ngôn ngữ và độ tương đồng người nói cao . Trong phần đa ngôn ngữ, bảng "Tính nhất quán nội dung" và "Độ tương đồng người nói" cho thấy Qwen3-Omni 30B-A3B rất cạnh tranh ở tiếng Trung và tiếng Anh, và ổn định ở tiếng Đức, tiếng Ý, tiếng Bồ Đào Nha, tiếng Tây Ban Nha, tiếng Nhật, tiếng Hàn, tiếng Pháp và tiếng Nga. Trong TTS đa ngôn ngữ , nó đạt được WER/tính nhất quán tốt hơn trên một số cặp (ví dụ: zh→en, ja→en, ko→zh) so với CosyVoice 2/3.
Các mô hình có sẵn và mục đích sử dụng của từng mô hình
Dòng sản phẩm Qwen3-Omni bao gồm ba thành phần chính, mỗi thành phần được thiết kế cho một mục đích sử dụng cụ thể: Hướng dẫn , Tư duy và Phụ đề . Tất cả đều bắt nguồn từ cùng một lõi nhưng với các khả năng khác nhau được kích hoạt hoặc tinh chỉnh cho các nhiệm vụ cụ thể.
Qwen3-Omni-30B-A3B- Instruct tích hợp Thinker và Talker, chấp nhận âm thanh, video và văn bản , đồng thời trả về cả văn bản và âm thanh. Đây là lựa chọn phù hợp nếu bạn muốn tương tác đầy đủ và kết quả nói theo thời gian thực, và được khuyến nghị sử dụng cho các bản demo bằng giọng nói hoặc video .
Qwen3-Omni-30B-A3B- Thinking tập trung vào khả năng tư duy logic theo chuỗi , hỗ trợ âm thanh, video và văn bản với đầu ra dạng văn bản. Ứng dụng này hữu ích cho việc phân tích chuyên sâu, giải quyết các vấn đề phức tạp, toán học trực quan hoặc các quy trình làm việc không cần đầu ra giọng nói nhưng cần khả năng tư duy có cấu trúc tốt nhất.
Qwen3-Omni-30B-A3B- Captioner là một phiên bản cải tiến của phần mềm phụ đề âm thanh có độ chính xác cao và ít gây nhiễu . Nó là mã nguồn mở, hỗ trợ nhiều loại âm thanh với độ chi tiết cao và lấp đầy khoảng trống trong hệ sinh thái mã nguồn mở: phụ đề đáng tin cậy và phong phú cho âm thanh đa năng.
Độ trễ, thời gian thực và kiểm soát hành vi
Hệ thống được tối ưu hóa cho tương tác tức thời, với thời gian phản hồi khoảng 211 ms cho âm thanh và 507 ms cho âm thanh-video . Bên cạnh việc truyền phát trực tuyến, hệ thống chú trọng vào các lượt hội thoại tự nhiên và chất lượng giọng nói ổn định, được hỗ trợ bởi vai trò rõ ràng của Người suy nghĩ (văn bản) và Người nói (giọng nói).
Để tinh chỉnh, bạn có thể tùy chỉnh kiểu bằng các lời nhắc hệ thống . Trong các kịch bản nghe nhìn mà âm thanh video được sử dụng để tham khảo, nhóm đề xuất một lời nhắc hệ thống duy trì khả năng suy luận của Người suy nghĩ đồng thời cung cấp văn bản dễ đọc và mang tính hội thoại hơn, giúp Người nói dễ dàng nói trôi chảy hơn . Cũng nên giữ tham số `use_audio_in_video` nhất quán trong suốt cuộc hội thoại nhiều lượt.
Trong quá trình đánh giá, có những hướng dẫn cụ thể: không thiết lập lời nhắc hệ thống , tuân theo định dạng ChatML của từng tiêu chuẩn và, khi không có lời nhắc, sử dụng mặc định các tùy chọn sau: nhận dạng giọng nói tiếng Trung (“请将这段中文语音转换为纯文本。”), nhận dạng giọng nói các ngôn ngữ khác (“Chuyển ngữ âm thanh thành văn bản.”), chuyển ngữ thành văn bản ( S2TT ) (“Nghe giọng nói <ngôn ngữ nguồn> được cung cấp…”), và lời bài hát (“ Chuyển ngữ lời bài hát” … không có dấu câu, các dòng được phân cách bằng dấu xuống dòng”).
Triển khai, yêu cầu và công cụ
Để có trải nghiệm cục bộ hoàn chỉnh, nhóm khuyến nghị sử dụng Hugging Face Transformers và xem xét các giai đoạn kỹ thuật phần mềm , nhưng cần lưu ý: do là kiến trúc MoE, nó có thể chạy chậm với suy luận HF; đối với các ứng dụng sản xuất hoặc có độ trễ thấp , họ khuyên nên sử dụng vLLM hoặc API DashScope , và thậm chí cung cấp ảnh Docker bao gồm môi trường cho cả hai. Mã Transformers đã được hợp nhất, nhưng gói PyPI vẫn chưa được phát hành và phải được cài đặt từ mã nguồn.
Chúng cung cấp các tiện ích để xử lý âm thanh và hình ảnh/video (base64, URL, đầu vào xen kẽ), và khuyến nghị sử dụng FlashAttention 2 với Transformer để giảm bộ nhớ GPU khi tải dữ liệu ở định dạng float16 hoặc bfloat16 . Với vLLM, FlashAttention 2 được tích hợp sẵn, và các tham số như limit_mm_per_prompt (phân bổ trước bộ nhớ GPU) và max_num_seqs cho tính song song được mô tả chi tiết ; ngoài ra, việc tăng tensor_parallel_size cho phép suy luận đa GPU.
Có một số mẹo hữu ích để tiết kiệm tài nguyên: nếu bạn không cần âm thanh, bạn có thể tắt Talker sau khi khởi tạo, tiết kiệm khoảng 10 GB VRAM. Và nếu bạn muốn xuất văn bản nhanh hơn, hãy sử dụng `return_audio=False` trong quá trình tạo. Yêu cầu bộ nhớ tối thiểu về mặt lý thuyết cho BF16 với FlashAttn2 cũng được cung cấp: ví dụ, Instruct 30B-A3B sử dụng khoảng 78,9 GB với 15 giây video và 144,8 GB với 120 giây; Thinking sử dụng khoảng 68,7 GB và 131,7 GB tương ứng.
Để thiết lập bản demo web cục bộ , họ khuyên bạn nên chuẩn bị môi trường vLLM (hoặc môi trường Transformers chậm hơn), đảm bảo bạn đã cài đặt ffmpeg và sử dụng các tập lệnh của họ. Họ cung cấp các ảnh Docker sẵn sàng cho GPU “qwenllm/qwen3-omni” với NVIDIA Container Toolkit , ánh xạ cổng (ví dụ: máy chủ 8901 → container 80) và tùy chọn phục vụ từ 0.0.0.0. Bạn có thể mở lại hoặc xóa container khi cần.
Bản demo, API và hệ sinh thái
Nếu bạn không muốn triển khai cục bộ, bạn có thể thử các bản demo trên Hugging Face Spaces và ModelScope Studio , với trải nghiệm dành cho Qwen3-Omni-Realtime, Instruct, Thinking và Captioner. Qwen Chat với tính năng phát trực tuyến thời gian thực cũng có sẵn: chỉ cần chọn tùy chọn cuộc gọi thoại/video trong giao diện.
Để tích hợp quy mô lớn với độ trễ thấp, phương pháp được khuyến nghị là sử dụng API của DashScope , cung cấp hiệu suất ổn định nhất. Hơn nữa, cộng đồng phối hợp thông qua các kênh như Discord và WeChat , và xuất bản các cẩm nang hướng dẫn với nhật ký thực thi thực tế cho phép người dùng tái tạo kết quả bằng cách thay đổi các lời nhắc hoặc mô hình.
Lộ trình và những cải tiến đang diễn ra
Nhóm đang nghiên cứu các tính năng bổ sung như nhận dạng giọng nói đa người nói , OCR áp dụng cho video, cải tiến học tập nghe nhìn chủ động và quy trình làm việc phong phú hơn cho tác nhân . Họ cũng cho biết hỗ trợ đầu ra âm thanh trong vLLM cho mô hình Instruct sẽ sớm được cung cấp, hoàn thiện chu trình triển khai thời gian thực từ hệ thống phụ trợ đó.
Câu hỏi thường gặp: Hỗ trợ thời gian chạy và lượng tử hóa
Một số người dùng đã nhận xét rằng họ không thể chạy Qwen3-Omni ngay cả với các công cụ thông thường và họ không thấy các lượng tử trong Hugging Face ; hơn nữa, định dạng 16-bit gốc có dung lượng khoảng 70 GB, một kích thước gây khó khăn cho các máy tính cấu hình khiêm tốn. Bản thân dự án đã làm rõ rằng Transformers đã được hợp nhất nhưng không có gói PyPI , gói này phải được cài đặt từ mã nguồn, và vLLM là tùy chọn được ưu tiên cho suy luận, mặc dù hỗ trợ âm thanh Instruct trong vLLM sẽ được phát hành trong tương lai gần.
Về vấn đề lượng tử hóa, hiện chưa có vị trí giữ chỗ nào được liệt kê trong HF cho Qwen3-Omni 30B-A3B, và cần nhớ rằng bản chất MoE và đa phương thức làm phức tạp khả năng tương thích ngay lập tức với các runtime như llama.cpp. Đối với những người cần kiểm tra ngay bây giờ, khuyến nghị chính thức là sử dụng Docker + Transformers/vLLM từ mã nguồn hoặc API , và theo dõi kho lưu trữ để biết các yêu cầu kéo hỗ trợ và các lượng tử hóa trong tương lai khi chúng có sẵn.
Thực hành đánh giá tốt và lời nhắc
Để tái tạo các số liệu, các hướng dẫn sau đây được nêu chi tiết: hầu hết các bài kiểm tra hiệu năng sử dụng giải mã tham lam trong Instruct mà không lấy mẫu, và đối với Thinking, các tham số trong generation_config.json phải được tuân thủ . Tốc độ khung hình video cũng được đặt thành fps=2 trong quá trình đánh giá, và có chỉ dẫn rằng lời nhắc của người dùng nên tuân theo dữ liệu đa phương thức trừ khi tập dữ liệu quy định khác.
Khi bài kiểm tra hiệu năng không bao gồm lời nhắc, có thể sử dụng các lời nhắc mặc định (nhận dạng giọng nói tiếng Trung/khác, S2TT, lời bài hát). Ngoài ra, không nên thiết lập lời nhắc hệ thống trong quá trình đánh giá để đảm bảo kết quả có thể so sánh được giữa các hệ thống và các lần chạy khác nhau.
Qwen3-Omni tự định vị mình là một nền tảng đa phương thức thực sự, với độ trễ thấp, hỗ trợ đa ngôn ngữ rộng rãi, khả năng xử lý âm thanh và video tiên tiến , cùng lộ trình triển khai rõ ràng bằng Transformers, vLLM và Docker. Đối với những ai đang tìm kiếm một mô hình duy nhất có thể xử lý văn bản và hình ảnh một cách liền mạch mà không làm giảm hiệu suất, đồng thời có khả năng nghe, nói và hiểu video , thì đây là một giải pháp khó có thể đánh bại hiện nay.
