Qwen3-Omni: все, что вам нужно знать об омнимодальной модели

Последнее обновление: 24 сентября 2025
Автор: TecnoDigital
  • Собственная омнимодальная модель с текстом, изображениями, аудио и видео, а также потоковой передачей в реальном времени.
  • SOTA в 22/36 аудио/видео тестах и ​​многоязычность (119/19/10 языков).
  • Архитектура Thinker–Talker с MoE, низкой задержкой и управлением системными подсказками.
  • Рекомендуемое развертывание с использованием vLLM/Transformers, Docker и официальных утилит.

Омнимодальная модель Qwen3-Omni

Появление Qwen3-Omni изменило ландшафт искусственного интеллекта: единая нативная модель, способная понимать текст, изображения, аудио и видео и реагировать на них , предоставляя мгновенные ответы как в письменной, так и в устной форме. Речь идёт не о мультимодальных «патчах», а о принципиально новой архитектуре, предназначенной для интеграции различных модальностей с низкой задержкой и точным управлением поведением.

В эпоху, когда практически все тестируют чат-боты и голосовых помощников, Qwen3-Omni выходит на рынок с амбициозными целями: он поддерживает 119 языков в текстовом формате, распознает речь на 19 языках и говорит на 10 , понимает длинные аудиозаписи (до 30 минут) и может похвастаться высокими результатами в десятках тестов. Кроме того, его архитектура Thinker-Talker и подход Mixture of Experts направлены на обеспечение скорости ответа и качества рассуждений в реальных условиях.

gpt-5-0
Связанная статья:
GPT-5: все о следующей большой революции в области искусственного интеллекта

Что такое Qwen3-Omni и что он предлагает?

Qwen3-Omni — это семейство базовых, всенаправленных и сквозных многоязычных моделей, предназначенных для обработки текста, изображений, аудио и видео с выводом как в текстовом, так и в естественном речевом формате. Ключ к успеху заключается не только в разнообразии входных и выходных данных, но и в функциональности потоковой передачи с плавным переходом между диалогами и возможностью мгновенного ответа.

Команда внесла ряд архитектурных улучшений для повышения производительности и эффективности: раннее предварительное обучение с приоритетом текста в сочетании со смешанным мультимодальным обучением, а также дизайн с использованием смеси экспертов (MoE), который сохраняет свою производительность в текстовых и графических тестах, одновременно улучшая качество аудио и видео. Благодаря этим улучшениям модель достигает лучших результатов в 22 из 36 аудио/видео бенчмарков и лучших результатов среди моделей с открытым исходным кодом в 32 из 36, демонстрируя результаты, сопоставимые с Gemini 2.5 Pro в системах распознавания речи, понимании звука и разборе речи.

Мультимодальное взаимодействие Qwen3-Omni

Ключевые возможности и методы

Qwen3-Omni готов к работе в реальных условиях, в том числе в приложениях для обработки звука, изображения и аудиовизуальных материалов, и обладает обширной многоязычной поддержкой: 119 языков текста, 19 языков голосового ввода и 10 языков голосового вывода . Языки голосового ввода включают английский, китайский, корейский, японский, немецкий, русский, итальянский, французский, испанский, португальский, малайский, голландский, индонезийский, турецкий, вьетнамский, кантонский, арабский и урду; а языки вывода включают английский, китайский, французский, немецкий, русский, итальянский, испанский, португальский, японский и корейский, и другие.

Набор официальных руководств демонстрирует широкий спектр его применения. В области аудио он включает в себя многоязычное и длинноформатное распознавание речи (ASR) , преобразование речи в текст и речь в речь, анализ музыки (стиль, ритм, жанры), описание звуковых эффектов и создание субтитров к любым аудиофайлам . Он также поддерживает смешанный анализ треков, содержащих речь, музыку и окружающие звуки.

В области компьютерного зрения система предлагает «сложное» оптическое распознавание текста для сложных изображений, обнаружение и определение местоположения объектов , контроль качества изображений, решение математических задач с изображениями (где модель Thinking проявляет себя наилучшим образом), описание видео, навигацию по видео от первого лица и анализ переходов между сценами . В аудиовизуальных сценариях система демонстрирует контроль качества аудио- и видео с синхронизацией по времени, управляемое взаимодействие с аудиовизуальными входами и диалоги с поведением ассистента.

В качестве агента он выделяется своей способностью функционировать при вызове аудио , что открывает голосовые рабочие процессы, активирующие инструменты, а в производных задачах имеется универсальный субтитратор для создания субтитров с высокой детализацией, что демонстрирует универсальность базового инструмента.

  Практическое применение искусственного интеллекта в компаниях

Архитектура и дизайн Thinker-Talker с MoE

Одним из ключевых отличий является разделение обязанностей: « Мыслитель» генерирует текст (с вариантами, включающими явную цепочку рассуждений), а « Говорящий» создает аудио в реальном времени . Такое разделение позволяет вести естественный голосовой диалог, сохраняя при этом высокий уровень понимания текста и планирования.

База данных MoE распределяет рабочую нагрузку между экспертами и использует предварительное обучение AuT для создания мощных универсальных представлений. Кроме того, использование многокодового кодирования в аудиоканале сводит задержку к минимуму, что крайне важно для звонков или работы с голосовыми помощниками, где каждая сотая доля секунды на счету.

Производительность и контрольные показатели: текст, зрение, аудио и аудиовизуальные данные

Qwen3-Omni демонстрирует высочайшую производительность при работе с текстом и изображениями, не уступая аналогичным по размеру моделям Qwen, ориентированным на один режим работы, а в большинстве тестов он лидирует по производительности в области звука и видео . В серии из 36 аудио- и видеотестов он показывает лучшие результаты среди всех устройств с открытым исходным кодом в 32 тестах и ​​лучшие результаты в общей сложности в 22 тестах, превосходя Gemini 2.5 Pro и GPT-4o по нескольким показателям.

В текстовых тестах достигнуты значительные успехи: в AIME25 вариант Flash-Instruct набирает около 65,9 баллов; в ZebraLogic Instruct достигает 90 баллов, а в MultiPL-E демонстрирует результаты, сопоставимые с GPT-4o. В задачах выравнивания, таких как IFEval и WritingBench, модели Instruct и Thinking показывают высокие и стабильные результаты.

В аудиосистемах результаты распознавания речи для китайского и английского языков превосходны: в WenetSpeech и LibriSpeech значительно снижается частота ошибок распознавания слов, достигая показателей, близких к 1,22/2,48 в LibriSpeech clean/other, а в таких наборах данных, как FLEURS (многоязычный), показатели очень низкие. В VoiceBench такие метрики, как AlpacaEval, CommonEval и WildVoice, ставят Qwen3-Omni на один уровень с закрытыми эталонными системами, и он превосходит их по качеству обработки аудиоданных в MMAU v05.15.25.

В аудиовизуальных приложениях наиболее часто упоминаемым показателем является WorldSense (приблизительно 54,1 ), превосходящий Gemini-2.5-Flash. Кроме того, в таких пакетах, как DailyOmni и VideoHolmes, вариант Thinking демонстрирует улучшения по сравнению с предыдущими передовыми приложениями с открытым исходным кодом. В области компьютерного зрения он превосходит конкурентов в MMMU, MathVista, MathVision и понимании документов (AI2D, ChartQA), показывая очень хорошие результаты в подсчете (CountBench) и понимании видео (Video-MME, MLVU).

Также были измерены показатели генерации голоса без предварительного обучения: по сравнению с такими семействами, как CosyVoice и Seed-TTS, Qwen3-Omni демонстрирует лучшую согласованность контента на нескольких языках и высокое сходство говорящих . В многоязычном разделе таблицы «Согласованность контента» и «Сходство говорящих» показывают, что Qwen3-Omni 30B-A3B очень конкурентоспособен на китайском и английском языках и стабилен на немецком, итальянском, португальском, испанском, японском, корейском, французском и русском языках. В кроссъязыковом синтезе речи он достигает лучших показателей WER/согласованности для нескольких пар (например, zh→en, ja→en, ko→zh) по сравнению с CosyVoice 2/3.

Доступные модели и для чего каждая из них используется

Линейка Qwen3-Omni включает три основных устройства, каждое из которых предназначено для определенного применения: Instruct , Thinking и Captioner . Все они основаны на одном и том же ядре, но с различными функциями, активируемыми или тонко настроенными для решения конкретных задач.

Qwen3-Omni-30B-A3B- Instruct содержит модули Thinker и Talker, принимает аудио, видео и текст , а также возвращает текст и аудио. Это правильный выбор, если вам нужно полное взаимодействие и голосовые результаты в реальном времени, и рекомендуется для голосовых или видеодемонстраций.

Qwen3-Omni-30B-A3B- Thinking ориентирован на мыслителя, использующего цепную аргументацию , и поддерживает аудио, видео и текстовый вывод. Он полезен для углубленного анализа, решения сложных задач, визуальной математики или рабочих процессов, где не требуется голосовой вывод, но необходим максимально структурированный подход к мышлению.

  ChatGPT Go против Plus: различия, цены, ограничения и кому это подходит

Qwen3-Omni-30B-A3B- Captioner — это усовершенствованная версия высокоточной системы субтитров с низкой интенсивностью воспроизведения аудио . Это программное обеспечение с открытым исходным кодом, которое с высокой детализацией охватывает широкий спектр аудиоформатов и заполняет исторический пробел в экосистеме открытого исходного кода: надежные и содержательные субтитры для аудио общего назначения.

Задержка, реальное время и контроль поведения

Система оптимизирована для мгновенного взаимодействия, со временем отклика приблизительно 211 мс для аудио и 507 мс для аудио-видео . Помимо потоковой передачи, особое внимание уделяется естественной манере разговора и стабильной передаче голоса, чему способствуют четко определенные роли « Мыслителя» (текст) и «Говорящего» (голос).

Для более точной настройки вы можете изменить стиль с помощью системных подсказок . В сценариях AV, где видео и аудио используются в качестве эталона, команда предлагает системную подсказку, которая сохраняет ход рассуждений «мыслителя», предоставляя при этом более читабельный и разговорный текст, облегчающий «говорящему» беглую речь . Также рекомендуется сохранять параметр `use_audio_in_video` неизменным на протяжении всего многоходового разговора.

При оценке используются следующие рекомендации: не задавайте системный запрос , следуйте формату ChatML каждого бенчмарка и, если запрос отсутствует, используйте по умолчанию следующие варианты: китайское ASR («请将这段中文语音转换为纯文本。»), ASR на других языках («Преобразовать аудио в текст»), S2TT («Прослушать предоставленную речь на языке <исходный_язык>…») и текст песни (« Преобразовать текст песни»… без знаков препинания, строки разделены переносами).

Развертывание, требования и инструменты

Для полноценной локальной работы команда рекомендует использовать Hugging Face Transformers и ознакомиться с этапами разработки программного обеспечения , но имейте в виду: будучи архитектурой MoE, она может работать медленно при выводе HF; для производственных приложений или приложений с низкой задержкой они советуют использовать vLLM или API DashScope и даже предоставляют образ Docker, включающий среды для обоих. Код Transformers уже был объединен, но пакет PyPI еще не выпущен и должен быть установлен из исходного кода.

Они предоставляют утилиты для обработки аудио и изображений/видео (base64, URL-адреса, чередующиеся входные данные) и рекомендуют использовать FlashAttention 2 с Transformers для уменьшения объема памяти GPU при загрузке в формате float16 или bfloat16 . В vLLM FlashAttn2 включен, и подробно описаны такие параметры, как limit_mm_per_prompt (предварительное выделение памяти GPU) и max_num_seqs для параллелизма ; кроме того, увеличение tensor_parallel_size позволяет выполнять вывод на нескольких GPU.

Есть несколько полезных советов по экономии ресурсов: если вам не нужен звук, вы можете отключить Talker после инициализации, сэкономив примерно 10 ГБ видеопамяти. А если вам нужен более быстрый вывод текста, используйте `return_audio=False` во время генерации. Также указаны минимальные теоретические требования к памяти для BF16 с FlashAttn2: например, Instruct 30B-A3B использует примерно 78,9 ГБ при 15 секундах видео и 144,8 ГБ при 120 секундах; Thinking использует примерно 68,7 ГБ и 131,7 ГБ соответственно.

Для настройки локальной веб-демонстрации они рекомендуют подготовить среду vLLM (или более медленную среду Transformers), убедиться в наличии установленного ffmpeg и использовать их скрипты. Они предлагают готовые к работе с GPU образы Docker «qwenllm/qwen3-omni» с NVIDIA Container Toolkit , сопоставлением портов (например, хост 8901 → контейнер 80) и возможностью запуска из 0.0.0.0. При необходимости вы можете повторно войти в контейнер или удалить его.

Демонстрации, API и экосистема

Если вы не хотите развертывать систему локально, вы можете попробовать демоверсии на Hugging Face Spaces и ModelScope Studio , включающие возможности Qwen3-Omni-Realtime, Instruct, Thinking и Captioner. Также доступен Qwen Chat с потоковой передачей в реальном времени: просто выберите опцию голосового/видеозвонка в интерфейсе.

  Автономная работа в промышленности: от данных к интеллектуальному принятию решений.

Для масштабируемой интеграции с низкой задержкой рекомендуется использовать API DashScope , который обеспечивает наиболее предсказуемую производительность. Кроме того, сообщество координирует свои действия через такие каналы, как Discord и WeChat , и публикует руководства с реальными логами выполнения, которые позволяют пользователям воспроизводить результаты, изменяя подсказки или модели.

Дорожная карта и текущие улучшения

Команда работает над дополнительными функциями, такими как распознавание речи нескольких говорящих , применение оптического распознавания символов к видео, улучшения в проактивном аудиовизуальном обучении и более сложные рабочие процессы агентов . Они также сообщили, что поддержка вывода звука в vLLM для модели Instruct будет доступна в ближайшее время, что завершит цикл развертывания в реальном времени с этого бэкэнда.

FAQ: Поддержка времени выполнения и квантизация

Некоторые пользователи отметили, что не могут запустить Qwen3-Omni даже с обычными компонентами и что не видят квантов в Hugging Face ; кроме того, собственный 16-битный формат занимает около 70 ГБ, что проблематично для компьютеров со скромными характеристиками. Сам проект уточняет, что Transformers уже интегрирован, но без пакета PyPI , который необходимо установить из исходного кода, и что vLLM является предпочтительным вариантом для вывода, хотя поддержка Instruct audio в vLLM будет выпущена в ближайшем будущем.

Что касается квантизации, в HF пока нет плейсхолдеров для Qwen3-Omni 30B-A3B, и стоит помнить, что MoE и многомодальный характер затрудняют непосредственную совместимость с средами выполнения, такими как llama.cpp. Тем, кому необходимо протестировать сейчас, официальная рекомендация — использовать Docker + Transformers/vLLM из исходного кода или API , а также следить за репозиторием на предмет запросов на добавление поддержки и будущих изменений в квантизации, когда они появятся.

Хорошие практики оценки и подсказки

Для воспроизведения результатов необходимо соблюдать следующие правила: в большинстве бенчмарков в Instruct используется жадное декодирование без выборки, а для Thinking необходимо соблюдать параметры в generation_config.json . Частота кадров видео также установлена ​​на fps=2 во время оценки, и указано, что подсказка пользователю должна следовать за мультимодальными данными, если в наборе данных не указано иное.

Если в бенчмарке отсутствует подсказка, можно использовать подсказки по умолчанию (китайский ASR/другие, S2TT, текст песни). Кроме того, системную подсказку не следует устанавливать во время оценки, чтобы обеспечить сопоставимость результатов между системами и запусками.

Qwen3-Omni позиционирует себя как настоящая всесторонняя платформа с низкой задержкой, широкой многоязычной поддержкой, передовыми возможностями обработки аудио и видео , а также понятным путем развертывания с использованием Transformers, vLLM и Docker. Для тех, кто ищет единую модель, которая бесперебойно обрабатывает текст и изображения без ущерба для производительности, а также умеет слушать, говорить и понимать видео , это предложение сегодня трудно превзойти.