Qwen3-Omni:关于全模式你需要知道的一切

最后更新: 九月24, 2025
  • 具有文本、图像、音频和视频以及实时流媒体的原生全模式模型。
  • 22/36 个音频/视频基准测试中的 SOTA 和多语言(119/19/10 种语言)。
  • 具有 MoE、低延迟和系统提示控制的思想者–谈话者架构。
  • 建议使用 vLLM/Transformers、Docker 和官方实用程序进行部署。

Qwen3-Omni 全模态模型

Qwen3-Omni 的问世改变了人工智能的格局:它是一款原生模型,能够理解并响应文本、图像、音频和视频,并能即时以书面和语音形式做出回应。我们说的不是多模态“补丁”,而是一种从根本上设计的架构,能够以低延迟和精细的行为控制整合各种模态。

在几乎所有人都在测试聊天机器人和助手的当下,Qwen3-Omni 横空出世,雄心勃勃:它支持 119 种语言的文本交互,能够识别 19 种语言的语音并进行 10 种语言的语音朗读,理解长达 30 分钟的音频,并在数十项测试中取得了基准级的优异成绩。此外,其“思考者-对话者”设计和混合专家方法旨在提升在实际场景中的响应速度和推理质量。

gpt-5-0
相关文章:
GPT-5:关于人工智能的下一次重大革命

Qwen3-Omni 是什么?它提供什么功能?

Qwen3-Omni 是一系列基础的、全模态的、端到端的多语言模型,旨在处理文本、图像、音频和视频,并输出文本和自然语音。其关键不仅在于输入和输出的多样性,还在于其流畅的对话处理能力和即时响应能力。

为了提升性能和效率,该团队引入了多项架构改进:早期“文本优先”预训练结合混合多模态训练,以及采用专家混合模型(MoE)设计,该设计在保持文本和图像性能的同时,增强了音频和视频处理能力。凭借这些改进,该模型在36项音频/视频基准测试中的22项中达到了SOTA(最先进水平),并在32项中达到了开源SOTA,其在自动语音识别(ASR)、音频理解和语音对话方面的结果与Gemini 2.5 Pro相当。

Qwen3-Omni 多模式交互

关键能力和模式

Qwen3-Omni 已为实际音频、视觉和视听应用做好准备,并提供广泛的多语言支持:119 种文本语言、19 种语音输入语言和 10 种语音输出语言。语音输入语言包括英语、中文、韩语、日语、德语、俄语、意大利语、法语、西班牙语、葡萄牙语、马来语、荷兰语、印尼语、土耳其语、越南语、粤语、阿拉伯语和乌尔都语;输出语言包括英语、中文、法语、德语、俄语、意大利语、西班牙语、葡萄牙语、日语和韩语等。

这套官方食谱充分展现了其广泛的应用范围。在音频领域,它展示了多语言和长音频语音识别 (ASR)、语音转文本和语音转语音翻译、音乐分析(风格、节奏、流派)、音效描述以及任何音频的字幕生成。它还支持对包含语音、音乐和环境音的音轨进行混合分析。

在视觉方面,它提供复杂图像的“硬”OCR、目标检测与定位、图像质量保证、图像数学求解(这是思维模型的优势所在)、视频描述、第一人称视角视频导航以及场景过渡分析。在视听场景中,它展示了基于时间对齐的音视频质量保证、与音视频输入的引导式交互以及与助手行为的对话。

作为一款代理,它最突出的特点是能够通过音频进行呼叫,从而开启语音工作流程并激活各种工具;此外,它还拥有一个功能强大的Omni-Captioner,可以生成非常详细的字幕,这充分体现了基础功能的通用性。

  React 是什么?领先 Web 开发库的完整解释

与教育部合作的思想者-谈话者建筑与设计

关键区别之一在于职责分离:思考者生成文本(包含明确的思维导图等多种变体),而说话者生成实时音频。这种分离使得系统能够在保持高水平文本理解和规划能力的同时,实现自然流畅的语音对话。

MoE数据库将工作负载分配给专家,并依靠AuT预训练来构建强大的通用表示。此外,音频通道中采用的多码编码将延迟降至最低,这对于通话或助手等每一百分之一秒都至关重要的应用场景来说尤为重要。

性能和基准:文本、视觉、音频和视听

Qwen3-Omni 在保持卓越的文本和图像性能的同时,与尺寸相近但专注于单一模式的 Qwen 型号相比毫不逊色;而在音频和视听性能方面,它在大多数测试中都遥遥领先。在 36 项音频和视听基准测试中,它在 32 项测试中达到了开源 SOTA 水平,在 22 项测试中达到了总 SOTA 水平,并在多个方面超越了Gemini 2.5 Pro 和 GPT-4o。

文本方面取得了一些显著的里程碑:在AIME25 测试中,Flash-Instruct 变体的得分约为 65,9 分;在ZebraLogic测试中,Instruct 模型达到了 90 分;在MultiPL-E测试中,其成绩与 GPT-4o 相当。在 IFEval 和 WritingBench 等对齐任务中,Instruct 和 Thinking 模型均表现出高且稳定的得分。

在音频方面,Qwen3-Omni 对中文和英文的自动语音识别 (ASR) 效果都非常出色:在WenetSpeech和LibriSpeech 数据集中,它显著降低了词错误率,LibriSpeech clean/other 数据集的词错误率分别接近 1,22% 和 2,48%,而在FLEURS (多语言)等数据集中,其词错误率更是极低。在 VoiceBench 测试中, AlpacaEval、CommonEval 和 WildVoice等指标均表明 Qwen3-Omni 的性能与封闭参考系统不相上下,并且在MMAU v05.15.25 的音频推理方面表现优异。

在视听应用中,最常被引用的指标是WorldSense(约 54,1),超过了 Gemini-2.5-Flash。此外,在DailyOmni和VideoHolmes 等测试套件中, Thinking 版本也超越了以往的开源 SOTA 应用。在纯视觉领域,它在MMMU、MathVista、MathVision和文档理解(AI2D、ChartQA)方面表现出色,在计数(CountBench)和视频理解(Video-MME、MLVU)方面也取得了非常优异的成绩。

零样本语音生成也进行了测试:与 CosyVoice 和 Seed-TTS 等语音合成器家族相比,Qwen3-Omni在多种语言中展现出更佳的内容一致性和更高的说话人相似度。在多语言部分,“内容一致性”和“说话人相似度”表格显示,Qwen3-Omni 30B-A3B 在中文和英文中极具竞争力,在德语、意大利语、葡萄牙语、西班牙语、日语、韩语、法语和俄语中也表现稳健。在跨语言 TTS方面,与 CosyVoice 2/3 相比,它在多个语言对(例如,zh→en、ja→en、ko→zh)中实现了更高的词错误率/一致性。

可用的模型及其用途

Qwen3-Omni系列包含三个主要组件,分别针对特定用途而设计:指导(Instruct)、思考(Thinking)和字幕(Captioner)。它们都基于同一核心技术,但针对特定任务激活或优化了不同的功能。

Qwen3-Omni-30B-A3B- Instruct包含 Thinker 和 Talker 两个组件,支持音频、视频和文本输入,并返回文本和音频结果。如果您需要完整的交互功能和实时语音反馈,它是您的理想之选,尤其推荐用于语音或视频演示。

Qwen3-Omni-30B-A3B- Thinking专注于链式推理,支持音频、视频和文本输出。它适用于深度分析、解决复杂问题、可视化数学运算,或无需语音输出但需要最佳结构化思维的工作流程。

  人工智能时代的法律和民事责任

Qwen3-Omni-30B-A3B- Captioner是高精度、低过度活动的音频字幕技术的改进版。它是开源的,涵盖范围广泛且细节丰富,填补了开源生态系统中的历史空白:为通用音频提供可靠且丰富的字幕。

延迟、实时和行为控制

该系统针对即时交互进行了优化,音频响应时间约为 211 毫秒,音视频响应时间约为 507 毫秒。除了流媒体传输外,系统还注重自然流畅的对话和稳定的语音传输,这得益于清晰的“思考者”(文本)和“说话者”(语音)角色划分。

为了进行微调,您可以使用系统提示自定义样式。在视频音频用作参考的音视频场景中,团队建议使用一种系统提示,既能保持思考者的推理思路,又能提供更易读、更口语化的文本,从而帮助说话者更流畅地表达。此外,建议在多轮对话中保持`use_audio_in_video`参数的一致性。

在评估中,有具体的指导原则:不要设置系统提示,遵循每个基准测试的 ChatML 格式,如果没有提示,则默认使用以下选项:中文 ASR(“请将这段中文语音转换为纯文本。”)、ASR 其他语言(“将音频转录为文本。”)、S2TT(“聆听提供的 <source_language> 语音…”)和歌词(“转录歌曲歌词”……不带标点符号,行之间用换行符分隔)。

部署、要求和工具

为了获得完整的本地体验,团队推荐使用Hugging Face Transformers并回顾软件工程阶段,但请注意:由于它采用 MoE 架构,因此在进行 HF 推理时运行速度可能会较慢;对于生产环境或低延迟应用,他们建议使用vLLM 或 DashScope API,甚至提供了一个包含两者环境的 Docker 镜像。Transformers 代码已合并,但 PyPI 包尚未发布,必须从源代码安装。

它们提供了处理音频和图像/视频(base64、URL、交错输入)的实用工具,并建议在加载float16或bfloat16数据时,使用FlashAttention 2和 Transformers 来减少 GPU 内存占用。vLLM 内置了 FlashAttention 2,并详细介绍了limit_mm_per_prompt(预先分配 GPU 内存)和max_num_seqs(用于并行处理)等参数;此外,增加tensor_parallel_size可以启用多 GPU 推理。

以下是一些节省资源的实用技巧:如果您不需要音频,可以在初始化后禁用 Talker,这样可以节省大约 10 GB 的显存。如果您想要更快的文本输出,可以在生成文本时使用`return_audio=False`。此外,我们还提供了配备 FlashAttn2 的 BF16 的最低理论内存需求:例如,Instruct 30B-A3B 在播放15 秒视频时大约需要 78,9 GB 内存,播放 120 秒视频时大约需要 144,8 GB 内存;Thinking 则分别大约需要 68,7 GB 和 131,7 GB 内存。

要搭建本地Web 演示环境,他们建议您准备好 vLLM 环境(或速度较慢的 Transformers 环境),确保已安装ffmpeg,并使用他们的脚本。他们提供支持 GPU 的 Docker 镜像“qwenllm/qwen3-omni”,其中包含NVIDIA 容器工具包、端口映射(例如,主机 8901 → 容器 80)以及从 0.0.0.0 提供服务的选项。您可以根据需要重新进入或删除容器。

演示、API 和生态系统

如果您不想在本地部署,可以尝试Hugging Face Spaces 和 ModelScope Studio 上的演示,体验 Qwen3-Omni-Realtime、Instruct、Thinking 和 Captioner 等功能。Qwen Chat也支持实时流媒体播放:只需在界面中选择语音/视频通话选项即可。

  谷歌量子回声算法的工作原理

为了实现可扩展且低延迟的集成,推荐使用DashScope API,它能提供最可预测的性能。此外,社区通过Discord 和微信等渠道进行协作,并发布包含真实执行日志的 cookbook,用户可以通过更改提示或模型来复现结果。

路线图和持续改进

团队正在开发更多功能,例如多说话人语音识别、视频OCR、改进主动式视听学习以及更丰富的智能体工作流程。他们还表示,vLLM中Instruct模型的音频输出支持即将推出,这将完成该后端的实时部署周期。

常见问题解答:运行时支持和量化

一些用户反映,即使使用常用的编译器也无法运行 Qwen3-Omni,并且在 Hugging Face 中看不到量化数据;此外,原生 16 位格式的文件大小约为 70 GB,对于配置一般的电脑来说是个问题。项目本身也明确指出,Transformers 已经合并,但尚未提供 PyPI 包,需要从源代码安装;vLLM 是推理的首选方案,不过 vLLM 对 Instruct 音频的支持将在不久的将来发布。

关于量化,HF 中尚未列出 Qwen3-Omni 30B-A3B 的占位符,值得注意的是,由于MoE 和多模态特性,与 llama.cpp 等运行时环境的直接兼容性较为复杂。对于需要立即进行测试的用户,官方建议使用Docker + Transformers/vLLM(通过源代码或API 实现),并密切关注代码仓库,以便及时获取支持拉取请求和未来可用的量化方案。

良好的评估实践和提示

为了复现这些数据,我们详细列出了以下准则:大多数基准测试在 Instruct 模式下使用贪婪解码而不进行采样,而对于 Thinking 模式,必须遵循generation_config.json 文件中的参数。此外,评估期间视频帧率设置为fps=2 ,并且除非数据集另有规定,否则用户提示应遵循多模态数据。

当基准测试不包含提示音时,可以使用默认提示音(中文自动语音识别/其他、S2TT、歌词)。此外,评估期间不应设置系统提示音,以确保不同系统和运行结果具有可比性。

Qwen3-Omni 将自身定位为一个真正的全模态平台,它具有低延迟、广泛的多语言支持、尖端的音频和视频功能,并可通过 Transformers、vLLM 和 Docker 实现清晰的部署路径。对于那些寻求能够无缝处理文本和图像而不牺牲性能,并且还能聆听、朗读和理解视频的单一模型的用户而言,Qwen3-Omni 是目前市场上难以匹敌的理想之选。