- Native omnimodal na modelo na may text, larawan, audio at video, at real-time na streaming.
- SOTA sa 22/36 audio/video na mga benchmark at multilingual (119/19/10 na wika).
- Thinker–Talker architecture na may MoE, mababang latency, at system prompt control.
- Inirerekomenda ang pag-deploy sa vLLM/Transformers, Docker at mga opisyal na utility.
Binago ng pagdating ng Qwen3-Omni ang tanawin ng AI: isang nag-iisang katutubong modelo na may kakayahang umunawa at tumugon sa teksto, mga imahe, audio, at video , na may mga agarang tugon sa parehong nakasulat at pasalitang anyo. Hindi natin pinag-uusapan ang mga multimodal na "patches," kundi isang pangunahing dinisenyong arkitektura para sa pagsasama ng mga modalidad na may mababang latency at pinong-tuning na kontrol sa pag-uugali.
Sa panahong halos lahat ay sumusubok sa mga chatbot at assistant, ang Qwen3-Omni ay dumating nang may ambisyon: sinusuportahan nito ang 119 na wika sa pamamagitan ng text, kinikilala ang pagsasalita sa 19 at nagsasalita sa 10 , nakakaintindi ng mahabang audio (hanggang 30 minuto), at ipinagmamalaki ang mga benchmark score sa dose-dosenang mga pagsubok. Bukod pa rito, ang disenyo ng Thinker-Talker at ang Mixture of Experts approach nito ay naglalayong bilis ng tugon at kalidad ng pangangatwiran sa mga totoong sitwasyon sa mundo.
Ano ang Qwen3-Omni at ano ang inaalok nito?
Ang Qwen3-Omni ay isang pamilya ng mga pundasyonal, omnimodal, at end-to-end na multilingual na modelo na idinisenyo upang iproseso ang teksto, mga imahe, audio, at video, na may output sa parehong teksto at natural na pagsasalita. Ang susi ay hindi lamang nakasalalay sa iba't ibang input at output kundi pati na rin sa streaming functionality nito na may maayos na pag-uusap at ang kakayahang tumugon kaagad.
Nagpakilala ang pangkat ng ilang mga pagpapabuti sa arkitektura para sa pagganap at kahusayan: maagang "text-first" na pre-training na sinamahan ng mixed multimodal training, at isang disenyo na may Mixture of Experts (MoE) na nagpapanatili ng pagganap nito sa teksto at imahe habang pinapalakas ang audio at video. Gamit ang mga pagpapabuting ito, nakamit ng modelo ang SOTA sa 22 sa 36 na audio/video benchmark at open-source na SOTA sa 32 sa 36, na may mga resultang maihahambing sa Gemini 2.5 Pro sa ASR, audio comprehension, at speech conversation.

Mga pangunahing kakayahan at modalidad
Ang Qwen3-Omni ay handa na para sa mga totoong aplikasyon sa audio, vision, at audiovisual, na may malawak na suporta sa maraming wika: 119 na wika ng teksto, 19 na wika ng voice input, at 10 wika ng voice output . Kabilang sa mga wika ng voice input ang Ingles, Chinese, Korean, Japanese, German, Russian, Italian, French, Spanish, Portuguese, Malay, Dutch, Indonesian, Turkish, Vietnamese, Cantonese, Arabic, at Urdu; at kabilang sa mga output na wika ang Ingles, Chinese, French, German, Russian, Italian, Spanish, Portuguese, Japanese, at Korean, bukod sa iba pa.
Inilalarawan ng hanay ng mga opisyal na cookbook ang lawak ng gamit nito. Sa audio, ipinapakita nito ang multilingual at long-audio speech recognition (ASR) , pagsasalin mula sa speech-to-text hanggang speech, pagsusuri ng musika (estilo, ritmo, genre), paglalarawan ng sound effect, at captioning ng anumang audio . Sinusuportahan din nito ang magkahalong pagsusuri ng mga track na may speech, musika, at mga tunog sa paligid.
Sa paningin, nag-aalok ito ng "matigas" na OCR para sa mga kumplikadong imahe, pagtuklas at pag-ground ng bagay , image QA, paglutas ng image math (kung saan kumikinang ang Thinking model), paglalarawan ng video, first-person video-based navigation, at pagsusuri ng scene transition . Sa mga audiovisual na senaryo, ipinapakita nito ang audio-video QA na may time alignment, guided interaction sa mga AV input , at mga diyalogo na may assistant behavior.
Bilang isang ahente, namumukod-tangi ito sa kakayahang gumana sa pagtawag mula sa audio , na nagbubukas ng mga daloy ng trabaho gamit ang boses na nagpapagana ng mga tool, at sa mga hinangong gawain ay mayroong Omni-Captioner para sa pagbibigay ng subtitling nang may mahusay na detalye, na nagpapakita ng pagiging pangkalahatan ng pangunahing subtitling.
Thinker-Talker Architecture at Design kasama ang MoE
Isa sa mga pangunahing nagpapaiba ay ang paghihiwalay ng mga responsibilidad: ang Nag-iisip ang bumubuo ng teksto (na may mga baryasyon na kinabibilangan ng tahasang pangangatwiran na may kawing-kawing na pag-iisip), at ang Nagsasalita ang gumagawa ng real-time na audio . Ang paghihiwalay na ito ay nagbibigay-daan para sa natural na pag-uusap gamit ang boses habang pinapanatili ng sistema ang isang mataas na antas ng pag-unawa at pagpaplano ng teksto.
Ipinamamahagi ng database ng MoE ang workload sa mga eksperto at umaasa sa pre-training ng AuT para sa malalakas na pangkalahatang representasyon. Bukod pa rito, ang paggamit ng multi-code encoding sa audio channel ay nakakabawas ng latency sa pinakamababa, na mahalaga para sa mga tawag o assistant kung saan mahalaga ang bawat ika-isandaang bahagi ng isang segundo.
Pagganap at mga benchmark: text, vision, audio at audiovisual
Pinapanatili ng Qwen3-Omni ang makabagong pagganap ng teksto at imahe nang hindi bumababa kumpara sa mga modelo ng Qwen na may katulad na laki na nakatuon sa iisang mode, habang sa pagganap ng audio at audiovisual , ito ang nagtatakda ng bilis sa karamihan ng mga pagsubok . Sa baterya ng 36 na audio at audiovisual benchmark, nakakamit nito ang open-source SOTA na 32 at kabuuang SOTA na 22, na higitan ang Gemini 2.5 Pro at GPT-4o sa ilang puntos.
Ilang mahahalagang milestone sa teksto: sa AIME25, ang Flash-Instruct variant ay may iskor na humigit-kumulang 65,9; sa ZebraLogic, ang Instruct ay umabot sa 90, at sa MultiPL-E , nakakamit nito ang mga kompetitibong numero laban sa GPT-4o. Sa mga gawaing pang-alignment tulad ng IFEval at WritingBench, ang mga modelo ng Instruct at Thinking ay nagpapakita ng matataas at pare-parehong mga iskor.
Sa audio, mahusay ang mga resulta ng ASR para sa Chinese at English: sa WenetSpeech at LibriSpeech, malaki ang nababawasan nitong word error rate, na may mga bilang na malapit sa 1,22/2,48 sa LibriSpeech clean/other, at sa mga set tulad ng FLEURS (multilingual), nag-aalok ito ng napakababang rate. Sa VoiceBench, inilalagay ng mga metrics tulad ng AlpacaEval, CommonEval, at WildVoice ang Qwen3-Omni kapantay ng mga closed reference system, at mahusay ito sa audio reasoning sa MMAU v05.15.25.
Sa mga aplikasyong audiovisual, ang pinakamadalas na binabanggit na sukatan ay ang WorldSense (humigit-kumulang 54,1 ), na nalampasan ang Gemini-2.5-Flash. Bukod pa rito, sa mga suite tulad ng DailyOmni at VideoHolmes, ang variant na Thinking ay nakakamit ng mga pagpapabuti kumpara sa mga nakaraang open-source na aplikasyong SOTA. Sa purong paningin, ito ay mahusay sa MMMU, MathVista, MathVision , at pag-unawa sa dokumento (AI2D, ChartQA), na may napakagandang marka sa pagbibilang (CountBench) at pag-unawa sa video (Video-MME, MLVU).
Sinukat din ang pagbuo ng boses na zero-shot: kumpara sa mga pamilyang tulad ng CosyVoice at Seed-TTS, ang Qwen3-Omni ay nagpapakita ng mas mahusay na pagkakapare-pareho ng nilalaman sa maraming wika at mataas na pagkakatulad ng nagsasalita . Sa seksyong multilingual , ipinapakita ng mga talahanayan na "Content Consistency" at "Speaker Similarity" na ang Qwen3-Omni 30B-A3B ay lubos na mapagkumpitensya sa Chinese at English, at matatag sa German, Italian, Portuguese, Spanish, Japanese, Korean, French, at Russian. Sa cross-lingual TTS , nakakamit nito ang mas mahusay na WER/consistencies sa ilang pares (hal., zh→en, ja→en, ko→zh) kumpara sa CosyVoice 2/3.
Magagamit na mga modelo at kung para saan ginagamit ang bawat isa
Ang linya ng Qwen3-Omni ay may kasamang tatlong pangunahing piraso, bawat isa ay idinisenyo para sa isang partikular na gamit: Instruct , Thinking , at Captioner . Lahat sila ay nagmula sa iisang core ngunit may iba't ibang kakayahan na na-activate o pinahusay para sa mga partikular na gawain.
Ang Qwen3-Omni-30B-A3B- Instruct ay naglalaman ng Thinker at Talker, tumatanggap ng audio, video, at teksto , at nagbabalik ng teksto at audio. Ito ang tamang pagpipilian kung gusto mo ng ganap na interaksyon at mga resulta sa pagsasalita sa totoong oras, at inirerekomenda para sa mga demo sa boses o video .
Qwen3-Omni-30B-A3B- Ang Pag-iisip ay nakatuon sa Nag-iisip gamit ang chain reasoning , na sumusuporta sa audio, video, at teksto gamit ang textual output. Ito ay kapaki-pakinabang para sa malalimang pagsusuri, paglutas ng mga kumplikadong problema, visual mathematics, o mga workflow kung saan hindi mo kailangan ng voice output ngunit kailangan mo ng pinakamahusay na istrukturang pag-iisip.
Ang Qwen3-Omni-30B-A3B- Captioner ay isang pinong hinango ng high-precision, low-hyperactivity audio subtitling . Ito ay open source, sumasaklaw sa malawak na hanay ng audio nang detalyado, at pinupunan ang isang makasaysayang puwang sa open-source ecosystem: maaasahan at masaganang mga caption para sa pangkalahatang layunin ng audio.
Latency, real time at kontrol sa pag-uugali
Ang sistema ay na-optimize para sa agarang interaksyon, na may mga oras ng pagtugon na humigit-kumulang 211 ms para sa audio at 507 ms para sa audio-video . Bukod sa streaming, binibigyang-diin din ang natural na mga takbo ng pag-uusap at matatag na paghahatid ng boses, sa tulong ng malinaw na mga tungkulin ng Thinker (teksto) at Talker (boses).
Para sa pagpipino, maaari mong i-customize ang estilo gamit ang mga system prompt . Sa mga senaryo ng AV kung saan ginagamit ang video audio bilang sanggunian, nagmumungkahi ang team ng system prompt na nagpapanatili sa pangangatwiran ng Thinker habang nagbibigay ng mas madaling basahin at pang-usap na teksto, na ginagawang mas madali para sa Talker na magsalita nang matatas . Inirerekomenda rin na panatilihing pare-pareho ang parameter na `use_audio_in_video` sa buong pag-uusap na may maraming turno.
Sa pagsusuri, may mga partikular na alituntunin: huwag itakda ang system prompt , sundin ang format ng ChatML ng bawat benchmark at, kapag walang prompt, gamitin ang sumusunod bilang default: Chinese ASR (“请将这段中文语音转换为纯文本。”), ASR iba pang mga wika ("I-transcribe ang audio sa teksto."), S2TT (“Makinig sa ibinigay na talumpati <source_language> …”), at liriko ng kanta (“ I-transcribe ang liriko ng kanta” … nang walang bantas, ang mga linya ay pinaghihiwalay ng mga pahinga”).
Deployment, mga kinakailangan at tool
Para sa kumpletong lokal na karanasan, inirerekomenda ng pangkat ang Hugging Face Transformers at ang pagsusuri sa mga yugto ng software engineering , ngunit tandaan: dahil isa itong arkitektura ng MoE, maaari itong tumakbo nang mabagal na may HF inference; para sa mga aplikasyon ng produksyon o mababang latency , ipinapayo nila ang paggamit ng vLLM o ang DashScope API , at nagbibigay pa nga ng Docker image na may kasamang mga kapaligiran para sa pareho. Ang Transformers code ay na-merge na, ngunit ang PyPI package ay hindi pa nailalabas at dapat na i-install mula sa pinagmulan.
Nagbibigay sila ng mga utility para sa paghawak ng audio at imahe/video (base64, URL, interleaved inputs), at inirerekomenda ang FlashAttention 2 na may Transformers upang mabawasan ang memorya ng GPU tuwing naglo-load sa float16 o bfloat16 . Sa vLLM, kasama ang FlashAttn2, at ang mga parameter tulad ng limit_mm_per_prompt (paunang naglalaan ng memorya ng GPU) at max_num_seqs para sa parallelism ay detalyado ; bilang karagdagan, ang pagtaas ng tensor_parallel_size ay nagbibigay-daan sa multi-GPU inference.
May ilang kapaki-pakinabang na tip sa pagtitipid ng resources: kung hindi mo kailangan ng audio, maaari mong i-disable ang Talker pagkatapos ng initialization, na makakatipid ng humigit-kumulang 10 GB ng VRAM. At kung gusto mo ng mas mabilis na text output, gamitin ang `return_audio=False` habang nagbubuo. Nakasaad din ang minimum na theoretical memory requirements para sa BF16 na may FlashAttn2: halimbawa, ang Instruct 30B-A3B ay gumagamit ng humigit-kumulang 78,9 GB na may 15 segundo ng video at 144,8 GB na may 120 segundo; ang Thinking ay gumagamit ng humigit-kumulang 68,7 GB at 131,7 GB, ayon sa pagkakabanggit.
Para mag-set up ng lokal na web demo , inirerekomenda nila ang paghahanda ng iyong vLLM environment (o ang mas mabagal na Transformers environment), siguraduhing naka -install ang ffmpeg , at gamitin ang kanilang mga script. Nag-aalok sila ng mga GPU-ready na Docker image na "qwenllm/qwen3-omni" kasama ang NVIDIA Container Toolkit , port mapping (hal., host 8901 → container 80), at ang opsyong magsilbi mula sa 0.0.0.0. Maaari mong muling ilagay o tanggalin ang container kung kinakailangan.
Mga demo, API, at ecosystem
Kung ayaw mong mag-deploy nang lokal, maaari mong subukan ang mga demo sa Hugging Face Spaces at ModelScope Studio , na may mga karanasan para sa Qwen3-Omni-Realtime, Instruct, Thinking, at Captioner. Available din ang Qwen Chat na may real-time streaming: piliin lamang ang opsyong voice/video call sa interface.
Para sa scalable integration na may mababang latency, ang inirerekomendang diskarte ay ang DashScope API , na nag-aalok ng pinaka-nahuhulaang performance. Bukod pa rito, ang komunidad ay nakikipag-ugnayan sa pamamagitan ng mga channel tulad ng Discord at WeChat , at naglalathala ng mga cookbook na may mga totoong execution log na nagbibigay-daan sa mga user na kopyahin ang mga resulta sa pamamagitan ng pagbabago ng mga prompt o modelo.
Roadmap at patuloy na pagpapabuti
Ang pangkat ay nagtatrabaho sa mga karagdagang tampok tulad ng pagkilala sa pagsasalita ng multi-speaker , inilapat na OCR sa video, mga pagpapabuti sa proactive audiovisual learning, at mas mayamang mga daloy ng trabaho ng ahente . Ipinahiwatig din nila na ang suporta sa audio output sa vLLM para sa modelo ng Instruct ay malapit nang maging available, na kukumpleto sa real-time deployment cycle mula sa backend na iyon.
FAQ: Suporta sa runtime at quantization
Nagkomento ang ilang mga gumagamit na hindi nila maaaring patakbuhin ang Qwen3-Omni kahit na sa mga karaniwang pinaghihinalaan at hindi nila nakikita ang mga quant sa Hugging Face ; bukod pa rito, ang katutubong 16-bit na format ay nasa humigit-kumulang 70 GB, isang laki na problematiko para sa mga simpleng computer. Nilinaw mismo ng proyekto na ang Transformers ay pinagsama na ngunit wala ang PyPI package , na dapat i-install mula sa pinagmulan, at ang vLLM ang mas gustong opsyon para sa paghihinuha, bagama't ang suporta sa audio ng Instruct sa vLLM ay ilalabas sa malapit na hinaharap.
Tungkol sa quantization, wala pang nakalistang mga placeholder sa HF para sa Qwen3-Omni 30B-A3B, at mahalagang tandaan na ang MoE at multimodal na katangian ay nagpapakomplikado sa agarang compatibility sa mga runtime tulad ng llama.cpp. Para sa mga kailangang subukan ngayon, ang opisyal na rekomendasyon ay gamitin ang Docker + Transformers/vLLM mula sa source o sa API , at bantayan ang repository para sa mga support pull request at mga quantization sa hinaharap kapag available na ang mga ito.
Mahusay na mga kasanayan sa pagsusuri at mga senyas
Para makopya muli ang mga numero, ang mga sumusunod na alituntunin ay nakadetalye: karamihan sa mga benchmark ay gumagamit ng greedy decoding sa Instruct nang walang sampling, at para sa Thinking, dapat sundin ang mga parameter sa generation_config.json . Ang video frame rate ay nakatakda rin sa fps=2 habang sinusuri, at ipinapahiwatig na dapat sundin ng user prompt ang multimodal data maliban kung iba ang tinukoy ng dataset.
Kapag ang isang benchmark ay walang kasamang prompt, maaaring gamitin ang mga default na prompt (Chinese ASR/iba pa, S2TT, liriko ng kanta). Bukod pa rito, hindi dapat itakda ang prompt ng system habang sinusuri upang matiyak na ang mga resulta ay maihahambing sa iba't ibang sistema at pagpapatakbo.
Ipinoposisyon ng Qwen3-Omni ang sarili bilang isang tunay na omnimodal platform, na may mababang latency, malawak na suporta sa maraming wika, makabagong kakayahan sa audio at video , at isang malinaw na landas ng pag-deploy gamit ang Transformers, vLLM, at Docker. Para sa mga naghahanap ng iisang modelo na humahawak ng teksto at mga imahe nang walang putol nang hindi isinasakripisyo ang pagganap, at nakikinig, nagsasalita, at nakakaintindi rin ng video , ito ay isang proposisyon na mahirap talunin ngayon.
