- 具有文字、圖像、音訊和視訊以及即時串流媒體的原生全模式模型。
- 22/36 個音訊/視訊基準測試中的 SOTA 和多語言(119/19/10 種語言)。
- 具有 MoE、低延遲和系統提示控制的思想者–談話者架構。
- 建議使用 vLLM/Transformers、Docker 和官方實用程式進行部署。
Qwen3-Omni 的問世改變了人工智慧的格局:它是一款原生模型,能夠理解並響應文字、圖像、音頻和視頻,並能即時以書面和語音形式做出回應。我們說的不是多模態“補丁”,而是一種從根本上設計的架構,能夠以低延遲和精細的行為控制整合各種模態。
在幾乎所有人都在測試聊天機器人和助手的當下,Qwen3-Omni 橫空出世,雄心勃勃:它支持 119 種語言的文本交互,能夠識別 19 種語言的語音並進行 10 種語言的語音朗讀,理解長達 30 分鐘的音頻,並在數十項測試中取得了基準級的優異成績。此外,其「思考者-對話者」設計和混合專家方法旨在提昇在實際場景中的反應速度和推理品質。
Qwen3-Omni 是什麼?它提供什麼功能?
Qwen3-Omni 是一系列基礎的、全模態的、端到端的多語言模型,旨在處理文字、圖像、音訊和視頻,並輸出文字和自然語音。其關鍵不僅在於輸入和輸出的多樣性,還在於其流暢的對話處理能力和即時回應能力。
為了提升效能和效率,團隊引入了多項架構改進:早期「文字優先」預訓練結合混合多模態訓練,以及採用專家混合模型(MoE)設計,該設計在保持文字和圖像效能的同時,增強了音訊和視訊處理能力。憑藉這些改進,該模型在36項音訊/視訊基準測試中的22項中達到了SOTA(最先進水平),並在32項中達到了開源SOTA,其在自動語音識別(ASR)、音訊理解和語音對話方面的結果與Gemini 2.5 Pro相當。

關鍵能力和模式
Qwen3-Omni 已為實際音訊、視覺和視聽應用做好準備,並提供廣泛的多語言支援:119 種文字語言、19 種語音輸入語言和 10 種語音輸出語言。語音輸入語言包括英語、中文、韓語、日語、德語、俄語、義大利語、法語、西班牙語、葡萄牙語、馬來語、荷蘭語、印尼語、土耳其語、越南語、粵語、阿拉伯語和烏爾都語;輸出語言包括英語、中文、韓國語、德語、俄語、義大利語、西班牙語、葡萄牙語、日語和法語等。
這套官方食譜充分展現了其廣泛的應用範圍。在音訊領域,它展示了多語言和長音訊語音識別 (ASR)、語音轉文字和語音轉語音翻譯、音樂分析(風格、節奏、流派)、音效描述以及任何音訊的字幕生成。它還支援對包含語音、音樂和環境音的音軌進行混合分析。
在視覺方面,它提供複雜圖像的「硬」OCR、目標檢測與定位、圖像品質保證、圖像數學求解(這是思維模型的優勢所在)、視頻描述、第一人稱視角視頻導航以及場景過渡分析。在視聽場景中,它展示了基於時間對齊的音視頻品質保證、與音視頻輸入的引導式互動以及與助手行為的對話。
作為一款代理,它最突出的特點是能夠透過音訊進行呼叫,從而開啟語音工作流程並激活各種工具;此外,它還擁有一個強大的Omni-Captioner,可以產生非常詳細的字幕,這充分體現了基礎功能的通用性。
與教育部合作的思想者-談話者建築與設計
關鍵差異之一在於職責分離:思考者產生文字(包含明確的心智圖等多種變體),而說話者產生即時音訊。這種分離使得系統能夠在保持高水準文字理解和規劃能力的同時,實現自然流暢的語音對話。
MoE資料庫將工作負載分配給專家,並依靠AuT預訓練來建立強大的通用表示。此外,音訊通道中採用的多碼編碼將延遲降至最低,這對於通話或助理等每一百分之一秒都至關重要的應用場景來說尤其重要。
性能和基準:文字、視覺、音訊和視聽
Qwen3-Omni 在保持卓越的文字和影像表現的同時,與尺寸相近但專注於單一模式的 Qwen 型號相比毫不遜色;而在音訊和視聽效能方面,它在大多數測試中都遙遙領先。在 36 項音訊和視聽基準測試中,它在 32 項測試中達到了開源 SOTA 水平,在 22 項測試中達到了總 SOTA 水平,並在多個方面超越了Gemini 2.5 Pro 和 GPT-4o。
在文本方面取得了一些顯著的里程碑:在AIME25 測試中,Flash-Instruct 變體的得分約為 65,9 分;在ZebraLogic測試中,Instruct 模型達到了 90 分;在MultiPL-E測試中,其成績與 GPT-4o 相當。在 IFEval 和 WritingBench 等對齊任務中,Instruct 和 Thinking 模型均表現出高且穩定的得分。
在音訊方面,Qwen3-Omni 對中文和英文的自動語音辨識 (ASR) 效果都非常出色:在WenetSpeech和LibriSpeech 資料集中,它顯著降低了詞錯誤率,LibriSpeech clean/other 資料集的字詞錯誤率分別接近 1,22% 和 2,48%,而在資料集中率是極等字節。在 VoiceBench 測試中, AlpacaEval、CommonEval 和 WildVoice等指標均顯示 Qwen3-Omni 的表現與封閉參考系統不相上下,並且在MMAU v05.15.25 的音訊推理方面表現優異。
在視聽應用中,最常被引用的指標是WorldSense(約 54,1),超過了 Gemini-2.5-Flash。此外,在DailyOmni和VideoHolmes 等測試套件中, Thinking 版本也超越了以往的開源 SOTA 應用。在純視覺領域,它在MMMU、MathVista、MathVision和文件理解(AI2D、ChartQA)方面表現出色,在計數(CountBench)和視訊理解(Video-MME、MLVU)方面也取得了非常優異的成績。
零樣本語音產生也進行了測試:與 CosyVoice 和 Seed-TTS 等語音合成器家族相比,Qwen3-Omni在多種語言中展現出更佳的內容一致性和更高的說話人相似度。在多語言部分,「內容一致性」和「說話者相似度」表格顯示,Qwen3-Omni 30B-A3B 在中文和英文中極具競爭力,在德語、義大利語、葡萄牙語、西班牙語、日語、韓語、法語和俄語中也表現穩健。在跨語言 TTS方面,與 CosyVoice 2/3 相比,它在多個語言對(例如,zh→en、ja→en、ko→zh)中實現了更高的單字錯誤率/一致性。
可用的模型及其用途
Qwen3-Omni系列包含三個主要組件,分別針對特定用途而設計:指導(Instruct)、思考(Thinking)和字幕(Captioner)。它們都基於同一核心技術,但針對特定任務啟動或最佳化了不同的功能。
Qwen3-Omni-30B-A3B- Instruct包含 Thinker 和 Talker 兩個元件,支援音訊、視訊和文字輸入,並傳回文字和音訊結果。如果您需要完整的互動功能和即時語音回饋,它是您的理想之選,尤其推薦用於語音或視訊演示。
Qwen3-Omni-30B-A3B- Thinking專注於鍊式推理,支援音訊、視訊和文字輸出。它適用於深度分析、解決複雜問題、視覺化數學運算,或無需語音輸出但需要最佳結構化思維的工作流程。
Qwen3-Omni-30B-A3B- Captioner是高精度、低過度活動的音訊字幕技術的改良版。它是開源的,涵蓋廣泛且細節豐富,填補了開源生態系統中的歷史空白:為通用音訊提供可靠且豐富的字幕。
延遲、即時和行為控制
該系統針對即時互動進行了最佳化,音訊回應時間約為 211 毫秒,音訊和視訊回應時間約為 507 毫秒。除了串流媒體外,系統還注重自然流暢的對話和穩定的語音傳輸,這得益於清晰的「思考者」(文字)和「說話者」(語音)角色劃分。
為了進行微調,您可以使用系統提示自訂樣式。在視訊音訊用作參考的音訊視訊場景中,團隊建議使用一種系統提示,既能保持思考者的推理思路,又能提供更易讀、更口語化的文本,從而幫助說話者更流暢地表達。此外,建議在多輪對話中保持`use_audio_in_video`參數的一致性。
在評估中,有具體的指導原則:不要設定係統提示,遵循每個基準測試的 ChatML 格式,如果沒有提示,則預設使用以下選項:中文 ASR(「請將這段中文語音轉換為純文字。」)、ASR 其他語言(「將音訊轉錄為文字。」)、S2TT (「聆聽提供的 <source_lanage> 行符號…不轉錄
部署、要求和工具
為了獲得完整的本地體驗,團隊推薦使用Hugging Face Transformers並回顧軟體工程階段,但請注意:由於它採用 MoE 架構,因此在進行 HF 推理時運行速度可能會較慢;對於生產環境或低延遲應用,他們建議使用vLLM 或 DashScope API,甚至提供了一個包含兩者環境的 Docker 鏡像。 Transformers 程式碼已合併,但 PyPI 套件尚未發布,必須從原始碼安裝。
它們提供了處理音訊和圖像/視訊(base64、URL、交錯輸入)的實用工具,並建議在載入float16或bfloat16資料時,使用FlashAttention 2和 Transformers 來減少 GPU 記憶體佔用。 vLLM 內建了 FlashAttention 2,並詳細介紹了limit_mm_per_prompt(預先分配 GPU 記憶體)和max_num_seqs(用於平行處理)等參數;此外,增加tensor_parallel_size可以啟用多 GPU 推理。
以下是一些節省資源的實用技巧:如果您不需要音頻,可以在初始化後停用 Talker,這樣可以節省約 10 GB 的記憶體。如果您想要更快的文字輸出,可以在產生文字時使用`return_audio=False`。此外,我們還提供了配備 FlashAttn2 的 BF16 的最低理論內存需求:例如,Instruct 30B-A3B 在播放15 秒視頻時大約需要 78,9 GB 內存,播放 120 秒視頻時大約需要 144,8 GB 內存;Thinking 則分別大約需要 617 GB 和 GB 內存。
要建立本機Web 示範環境,他們建議您準備好 vLLM 環境(或速度較慢的 Transformers 環境),確保已安裝ffmpeg,並使用他們的腳本。他們提供支援 GPU 的 Docker 映像“qwenllm/qwen3-omni”,其中包含NVIDIA 容器工具包、連接埠對映(例如,主機 8901 → 容器 80)以及從 0.0.0.0 提供服務的選項。您可以根據需要重新進入或刪除容器。
演示、API 和生態系統
如果您不想在本地部署,可以嘗試Hugging Face Spaces 和 ModelScope Studio 上的演示,體驗 Qwen3-Omni-Realtime、Instruct、Thinking 和 Captioner 等功能。 Qwen Chat也支援即時串流播放:只需在介面中選擇語音/視訊通話選項即可。
為了實現可擴展且低延遲的集成,建議使用DashScope API,它能提供最可預測的效能。此外,社群透過Discord 和微信等管道進行協作,並發布包含真實執行日誌的 cookbook,使用者可以透過更改提示或模型來復現結果。
路線圖和持續改進
團隊正在開發更多功能,例如多說話人語音辨識、視訊OCR、改進主動式視聽學習以及更豐富的智慧體工作流程。他們還表示,vLLM中Instruct模型的音訊輸出支援即將推出,這將完成該後端的即時部署週期。
常見問題:運行時支援和量化
有些使用者反映,即使使用常用的編譯器也無法運行 Qwen3-Omni,並且在 Hugging Face 中看不到量化資料;此外,原生 16 位元格式的檔案大小約為 70 GB,對於配置一般的電腦來說是個問題。專案本身也明確指出,Transformers 已經合併,但尚未提供 PyPI 包,需要從原始碼安裝;vLLM 是推理的首選方案,不過 vLLM 對 Instruct 音訊的支援將在不久的將來發布。
關於量化,HF 中尚未列出 Qwen3-Omni 30B-A3B 的佔位符,值得注意的是,由於MoE 和多模態特性,與 llama.cpp 等運行時環境的直接相容性較為複雜。對於需要立即進行測試的用戶,官方建議使用Docker + Transformers/vLLM(透過原始碼或API 實現),並密切關注程式碼倉庫,以便及時獲取支援拉取請求和未來可用的量化方案。
良好的評估實踐和提示
為了重現這些數據,我們詳細列出了以下準則:大多數基準測試在 Instruct 模式下使用貪婪解碼而不進行取樣,而對於 Thinking 模式,必須遵循generation_config.json 檔案中的參數。此外,評估期間視訊幀率設定為fps=2 ,且除非資料集另有規定,否則使用者提示應遵循多模態資料。
當基準測試不包含提示音時,可以使用預設提示音(中文自動語音辨識/其他、S2TT、歌詞)。此外,評估期間不應設定係統提示音,以確保不同系統和運作結果具有可比性。
Qwen3-Omni 將自身定位為一個真正的全模態平台,它具有低延遲、廣泛的多語言支援、尖端的音訊和視訊功能,並可透過 Transformers、vLLM 和 Docker 實現清晰的部署路徑。對於那些尋求能夠無縫處理文字和圖像而不犧牲效能,並且還能聆聽、朗讀和理解影片的單一模型的用戶而言,Qwen3-Omni 是目前市場上難以匹敵的理想之選。
