- Рідна омнімодальна модель з текстом, зображеннями, аудіо та відео, а також потоковою передачею в режимі реального часу.
- SOTA у 22/36 аудіо/відео бенчмарках та багатомовність (119/19/10 мов).
- Архітектура Thinker–Talker з MoE, низькою затримкою та системним керуванням за допомогою підказок.
- Рекомендоване розгортання за допомогою vLLM/Transformers, Docker та офіційних утиліт.
Поява Qwen3-Omni змінила ландшафт штучного інтелекту: єдина нативна модель, здатна розуміти та реагувати на текст, зображення, аудіо та відео , з миттєвими відповідями як у письмовій, так і в усній формі. Йдеться не про мультимодальні «латки», а про фундаментально розроблену архітектуру для інтеграції модальностей з низькою затримкою та точно налаштованим поведінковим контролем.
У той час, коли майже всі тестують чат-ботів та помічників, Qwen3-Omni має амбіції: він підтримує 119 мов для текстового обміну, розпізнає мовлення 19 мовами та розмову 10 мовами , розуміє довгі аудіозаписи (до 30 хвилин) та може похвалитися результатами бенчмарків у десятках тестів. Крім того, його дизайн «Мислитель-Оратор» та підхід «Суміш експертів» спрямовані на швидкість реагування та якість міркувань у реальних сценаріях.
Що таке Qwen3-Omni та що він пропонує?
Qwen3-Omni — це сімейство базових, омнімодальних та комплексних багатомовних моделей, призначених для обробки тексту, зображень, аудіо та відео з виводом як у текстовому форматі, так і у вигляді природного мовлення. Ключ полягає не лише в різноманітності вхідних та вихідних даних, але й у функціональності потокової передачі з плавним переходом до розмовної мови та можливістю негайної реакції.
Команда запровадила кілька архітектурних покращень для підвищення продуктивності та ефективності: раннє попереднє навчання «спочатку текст» у поєднанні зі змішаним мультимодальним навчанням, а також дизайн зі сумішшю експертів (MoE), який зберігає продуктивність для тексту та зображень, одночасно покращуючи аудіо та відео. Завдяки цим покращенням модель досягає SOTA у 22 з 36 аудіо/відео бенчмарків та SOTA з відкритим кодом у 32 з 36, з результатами, порівнянними з Gemini 2.5 Pro в ASR, розумінні аудіо та розмові.

Ключові можливості та методи
Qwen3-Omni готовий до реальних аудіо-, відео- та аудіовізуальних застосувань, завдяки широкій багатомовній підтримці: 119 мов тексту, 19 мов голосового введення та 10 мов голосового виведення . Мови голосового введення включають англійську, китайську, корейську, японську, німецьку, російську, італійську, французьку, іспанську, португальську, малайську, голландську, індонезійську, турецьку, в'єтнамську, кантонську, арабську та урду; а мови виведення включають англійську, китайську, французьку, німецьку, російську, італійську, іспанську, португальську, японську та корейську, серед інших.
Набір офіційних кулінарних книг ілюструє широту його використання. В аудіо демонструє багатомовне та довге аудіорозпізнавання мовлення (ASR) , переклад мовлення в текст та з мовлення в мовлення, аналіз музики (стиль, ритм, жанри), опис звукових ефектів та субтитри до будь-якого аудіо . Він також підтримує змішаний аналіз треків з мовленням, музикою та навколишніми звуками.
У сфері зору він пропонує «жорстке» оптичне розпізнавання символів (OCR) для складних зображень, виявлення та визначення об'єктів , оцінку якості зображень, розв'язання математичних задач на зображеннях (де сяє модель мислення), опис відео, навігацію від першої особи та аналіз переходів між сценами . В аудіовізуальних сценаріях він демонструє оцінку якості аудіо-відео з вирівнюванням часу, керованою взаємодією з аудіовізуальними входами та діалогами з поведінкою асистента.
Як агент, він вирізняється своєю здатністю функціонувати, викликаючи аудіо , що відкриває голосові робочі процеси, що активують інструменти, а в похідних завданнях є Omni-Captioner для субтитрів з великою деталізацією, що демонструє узагальнюваність базового.
Архітектура та дизайн «Мислитель-оратор» з Міністерством освіти
Однією з ключових відмінностей є розподіл обов'язків: Мислитель генерує текст (з варіаціями, що включають чітке ланцюжок думок), а Промовець створює аудіо в режимі реального часу . Таке роз'єднання дозволяє вести природну голосову розмову, водночас система підтримує високий рівень розуміння тексту та планування.
База даних MoE розподіляє робоче навантаження між експертами та спирається на попереднє навчання AuT для отримання потужних загальних представлень. Крім того, використання багатокодового кодування в аудіоканалі зводить затримку до мінімуму, що є критично важливим для дзвінків або асистентів, де важлива кожна сота секунди.
Продуктивність та орієнтири: текст, зображення, аудіо та аудіовізуальні засоби
Qwen3-Omni підтримує найсучаснішу продуктивність відтворення тексту та зображень без погіршення якості порівняно з моделями Qwen аналогічного розміру, що працюють в одному режимі, тоді як у сфері аудіо та аудіовізуальних даних він задає тон у більшості тестів . У наборі з 36 аудіо та аудіовізуальних бенчмарків він досягає показника SOTA з відкритим кодом у 32 балах та загального SOTA у 22 балах, перевершуючи Gemini 2.5 Pro та GPT-4o за кількома показниками.
Деякі помітні досягнення в тексті: в AIME25 варіант Flash-Instruct набирає близько 65,9 балів; в ZebraLogic Instruct досягає 90 балів, а в MultiPL-E він досягає конкурентних показників порівняно з GPT-4o. У завданнях вирівнювання, таких як IFEval та WritingBench, моделі Instruct та Thinking показують високі та стабільні бали.
В аудіо результати ASR для китайської та англійської мов чудові: у WenetSpeech та LibriSpeech значно знижується рівень помилок слів, з показниками, близькими до 1,22/2,48 у LibriSpeech clean/other, а в таких наборах, як FLEURS (багатомовний), він пропонує дуже низькі показники. У VoiceBench такі метрики, як AlpacaEval, CommonEval та WildVoice, ставлять Qwen3-Omni нарівні із закритими системами відліку, і він перевершує аудіо-логічні здібності в MMAU v05.15.25.
В аудіовізуальних програмах найчастіше цитується WorldSense (приблизно 54,1 ), що перевершує Gemini-2.5-Flash. Крім того, в таких пакетах, як DailyOmni та VideoHolmes, варіант Thinking досягає покращень порівняно з попередніми SOTA-програмами з відкритим кодом. У чистому зорі він перевершує MMMU, MathVista, MathVision та розуміння документів (AI2D, ChartQA), з дуже хорошими результатами в підрахунку (CountBench) та розумінні відео (Video-MME, MLVU).
Також було виміряно генерацію голосу з нульовим числом повторень: порівняно з такими сімействами, як CosyVoice та Seed-TTS, Qwen3-Omni демонструє кращу узгодженість контенту між кількома мовами та високий рівень подібності носіїв мови . У багатомовному розділі таблиці «Узгодженість контенту» та «Узгодженість носіїв мови» показують, що Qwen3-Omni 30B-A3B є дуже конкурентоспроможним у китайській та англійській мовах, а також стабільним у німецькій, італійській, португальській, іспанській, японській, корейській, французькій та російській мовах. У міжмовному TTS він досягає кращої WER/узгодженості для кількох пар (наприклад, zh→en, ja→en, ko→zh) порівняно з CosyVoice 2/3.
Доступні моделі та для чого використовується кожна з них
Лінійка Qwen3-Omni включає три основні компоненти, кожен з яких розроблений для певного використання: Instruct , Thinking та Captioner . Усі вони базуються на одному ядре, але з різними можливостями, активованими або налаштованими для конкретних завдань.
Qwen3-Omni-30B-A3B- Instruct містить Thinker та Talker, приймає аудіо, відео та текст , а також повертає текст та аудіо. Це правильний вибір, якщо вам потрібна повна взаємодія та результати розмови в режимі реального часу, і рекомендується для голосових або відеодемонстрацій.
Qwen3-Omni-30B-A3B- Thinking фокусується на Мислителі з ланцюговим мисленням , підтримуючи аудіо, відео та текст з текстовим виводом. Він корисний для поглибленого аналізу, вирішення складних проблем, візуальної математики або робочих процесів, де вам не потрібен голосовий вивід, але потрібне найкраще структуроване мислення.
Qwen3-Omni-30B-A3B- Captioner — це вдосконалена похідна від високоточних аудіосубтитрів з низькою гіперактивністю . Він має відкритий вихідний код, охоплює широкий спектр аудіо з великою деталізацією та заповнює історичну прогалину в екосистемі відкритого коду: надійні та багаті субтитри для аудіо загального призначення.
Затримка, реальний час та контроль поведінки
Система оптимізована для миттєвої взаємодії, з часом відгуку приблизно 211 мс для аудіо та 507 мс для аудіо-відео . Окрім потокової передачі, акцент робиться на природних розмовних поворотах та стабільній передачі голосу, чому сприяють чіткі ролі Мислителя (текст) та Оратора (голос).
Для точного налаштування ви можете налаштувати стиль за допомогою системних підказок . У сценаріях аудіовізуального програмування, де відеоаудіо використовується для довідки, команда пропонує системну підказку, яка підтримує міркування Мислителя, водночас надаючи більш читабельний та розмовний текст, що полегшує мовлення Промовця плавністю . Також рекомендується підтримувати параметр `use_audio_in_video` узгодженим протягом усієї багаточергової розмови.
Під час оцінювання існують певні рекомендації: не встановлюйте системне підказку , дотримуйтесь формату ChatML кожного бенчмарку та, якщо підказки немає, використовуйте наступне за замовчуванням: китайська ASR («请将这段中文语音转换为纯文本。»), ASR іншими мовами («Транскрибуйте аудіо в текст.»), S2TT («Прослухайте надану <мову_оригіналу> мовлення…») та текст пісні (« Транскрибуйте текст пісні»… без розділових знаків, рядки розділені розривами»).
Розгортання, вимоги та інструменти
Для повного локального досвіду команда рекомендує Hugging Face Transformers та огляд фаз розробки програмного забезпечення , але майте на увазі: оскільки це архітектура MoE, вона може працювати повільно з високочастотним виводом; для продакшну або низькозатримувальних програм вони радять використовувати vLLM або DashScope API , і навіть надають образ Docker, який включає середовища для обох. Код Transformers вже об'єднано, але пакет PyPI ще не випущено і його потрібно встановити з вихідного коду.
Вони надають утиліти для обробки аудіо та зображень/відео (base64, URL-адреси, чергування вхідних даних) і рекомендують FlashAttention 2 з Transformers для зменшення обсягу пам'яті графічного процесора під час завантаження у float16 або bfloat16 . У vLLM включено FlashAttn2, а також детально описано такі параметри, як limit_mm_per_prompt (попередньо розподіляє пам'ять графічного процесора) та max_num_seqs для паралелізму ; крім того, збільшення tensor_parallel_size дозволяє виводити дані з кількох графічних процесорів.
Є кілька корисних порад щодо економії ресурсів: якщо вам не потрібен звук, ви можете вимкнути Talker після ініціалізації, заощадивши приблизно 10 ГБ відеопам'яті. А якщо ви хочете швидше виведення тексту, використовуйте `return_audio=False` під час генерації. Також наведено мінімальні теоретичні вимоги до пам'яті для BF16 з FlashAttn2: наприклад, Instruct 30B-A3B використовує приблизно 78,9 ГБ з 15 секундами відео та 144,8 ГБ з 120 секундами; Thinking використовує приблизно 68,7 ГБ та 131,7 ГБ відповідно.
Щоб налаштувати локальну веб-демонстрацію , вони рекомендують підготувати середовище vLLM (або повільніше середовище Transformers), переконатися, що у вас встановлено ffmpeg , та використовувати їхні скрипти. Вони пропонують готові до роботи з GPU образи Docker «qwenllm/qwen3-omni» з набором інструментів NVIDIA Container Toolkit , зіставленням портів (наприклад, хост 8901 → контейнер 80) та можливістю обслуговування з 0.0.0.0. Ви можете повторно ввести або видалити контейнер за потреби.
Демо-версії, API та екосистема
Якщо ви не хочете розгортати локально, ви можете спробувати демонстрації на Hugging Face Spaces та ModelScope Studio з досвідом роботи з Qwen3-Omni-Realtime, Instruct, Thinking та Captioner. Також доступний Qwen Chat із потоковою передачею в реальному часі: просто виберіть опцію голосового/відеодзвінка в інтерфейсі.
Для масштабованої інтеграції з низькою затримкою рекомендованим підходом є DashScope API , який пропонує найбільш передбачувану продуктивність. Крім того, спільнота координує дії через такі канали, як Discord та WeChat , і публікує кулінарні книги з реальними журналами виконання, які дозволяють користувачам відтворювати результати, змінюючи підказки або моделі.
Дорожня карта та постійні вдосконалення
Команда працює над додатковими функціями, такими як розпізнавання мовлення кількох мовців , застосування оптичного розпізнавання символів (OCR) до відео, покращення проактивного аудіовізуального навчання та розширені робочі процеси агентів . Вони також зазначили, що підтримка аудіовиводу у vLLM для моделі Instruct буде доступна незабаром, завершивши цикл розгортання в режимі реального часу з цього сервера.
FAQ: Підтримка виконання та квантування
Деякі користувачі зазначили, що вони не можуть запустити Qwen3-Omni навіть зі звичними підозрюваними, і що вони не бачать квантів у Hugging Face ; крім того, рідний 16-бітний формат має розмір близько 70 ГБ, що є проблематичним для скромних комп'ютерів. У самому проєкті уточнюється, що Transformers вже об'єднано, але без пакета PyPI , який потрібно встановити з вихідного коду, і що vLLM є кращим варіантом для виводу, хоча підтримка аудіоінструкцій у vLLM буде випущена найближчим часом.
Щодо квантування, у HF поки що немає заповнювачів для Qwen3-Omni 30B-A3B, і варто пам'ятати, що MoE та мультимодальна природа ускладнюють безпосередню сумісність із середовищами виконання, такими як llama.cpp. Для тих, кому потрібно протестувати зараз, офіційно рекомендується використовувати Docker + Transformers/vLLM з вихідного коду або API , а також слідкувати за репозиторієм на наявність запитів на підтримку та майбутніх квантування , коли вони стануть доступними.
Належні практики та підказки для оцінювання
Для відтворення чисел детально описано такі рекомендації: більшість бенчмарків використовують жадібне декодування в Instruct без семплінгу, а для Thinking необхідно дотримуватися параметрів у generation_config.json . Частота кадрів відео також встановлюється на fps=2 під час оцінки, і вказується, що підказка користувача повинна слідувати за мультимодальними даними, якщо в наборі даних не зазначено інше.
Якщо бенчмарк не містить підказки, можна використовувати підказки за замовчуванням (китайська ASR/інше, S2TT, тексти пісень). Крім того, системну підказку не слід встановлювати під час оцінювання, щоб забезпечити порівнянність результатів між системами та запусками.
Qwen3-Omni позиціонує себе як справжня омнімодальна платформа з низькою затримкою, широкою багатомовною підтримкою, передовими аудіо- та відеоможливостями , а також чітким шляхом розгортання з використанням Transformers, vLLM та Docker. Для тих, хто шукає єдину модель, яка безперешкодно обробляє текст і зображення без шкоди для продуктивності, а також прослуховує, озвучує та розуміє відео , це пропозиція, яку сьогодні важко перевершити.
