- Dzimtais omnimodālais modelis ar tekstu, attēlu, audio un video, kā arī straumēšanu reāllaikā.
- SOTA 22/36 audio/video etalonos un daudzvalodu (119/19/10 valodās).
- Thinker-Talker arhitektūra ar MoE, zemu latentumu un sistēmas tūlītēju vadību.
- Ieteicamā izvietošana ar vLLM/Transformers, Docker un oficiālajām utilītprogrammām.
Qwen3-Omni ienākšana ir mainījusi mākslīgā intelekta ainavu: viens vietējais modelis, kas spēj saprast un reaģēt uz tekstu, attēliem, audio un video , sniedzot atbildes gan rakstiskā, gan mutiskā formā. Mēs nerunājam par multimodāliem "ielāpiem", bet gan par fundamentāli izstrādātu arhitektūru modalitāšu integrēšanai ar zemu latentumu un precīzi noregulētu uzvedības kontroli.
Laikā, kad gandrīz visi testē tērzēšanas robotus un asistentus, Qwen3-Omni ir ambiciozs: tas atbalsta 119 valodas teksta formātā, atpazīst runu 19 valodās un runā 10 valodās , saprot garus audio ierakstus (līdz 30 minūtēm) un lepojas ar salīdzinošiem rezultātiem desmitiem testu. Turklāt tā Thinker-Talker dizains un Mixture of Experts pieeja ir vērsta uz reakcijas ātrumu un spriešanas kvalitāti reālās dzīves situācijās.
Kas ir Qwen3-Omni un ko tas piedāvā?
Qwen3-Omni ir fundamentālu, omnimodālu un pilnīgu daudzvalodu modeļu saime, kas paredzēta teksta, attēlu, audio un video apstrādei, izvadot gan tekstu, gan dabisko runu. Galvenais kritērijs ir ne tikai ievades un izvades datu daudzveidība, bet arī straumēšanas funkcionalitāte ar plūstošām sarunu pavērsieniem un spēju nekavējoties reaģēt.
Komanda ir ieviesusi vairākus arhitektūras uzlabojumus veiktspējas un efektivitātes uzlabošanai: agrīnu “teksts vispirms” iepriekšēju apmācību apvienojumā ar jauktu multimodālu apmācību un dizainu ar ekspertu maisījumu (MoE), kas saglabā veiktspēju teksta un attēlu vidē, vienlaikus uzlabojot audio un video kvalitāti. Ar šiem uzlabojumiem modelis sasniedz SOTA līmeni 22 no 36 audio/video etalonuzdevumos un atvērtā koda SOTA līmeni 32 no 36, un rezultāti ir salīdzināmi ar Gemini 2.5 Pro ASR, audio izpratnes un runas sarunas ziņā.

Galvenās spējas un veidi
Qwen3-Omni ir gatavs reālās pasaules audio, vizuālās un audiovizuālās lietojumprogrammām, piedāvājot plašu daudzvalodu atbalstu: 119 teksta valodas, 19 balss ievades valodas un 10 balss izvades valodas . Balss ievades valodas ietver angļu, ķīniešu, korejiešu, japāņu, vācu, krievu, itāļu, franču, spāņu, portugāļu, malajiešu, holandiešu, indonēziešu, turku, vjetnamiešu, kantoniešu, arābu un urdu valodu; un izvades valodas ietver angļu, ķīniešu, franču, vācu, krievu, itāļu, spāņu, portugāļu, japāņu un korejiešu valodu, kā arī citas.
Oficiālo pavārgrāmatu komplekts ilustrē tā izmantošanas plašumu. Audio jomā tas demonstrē daudzvalodu un garu audio runas atpazīšanu (ASR) , runas pārveidošanu tekstā un runas tulkošanu runā, mūzikas analīzi (stils, ritms, žanri), skaņas efektu aprakstus un jebkura audio subtitru pievienošanu . Tas atbalsta arī jauktu ierakstu analīzi ar runu, mūziku un apkārtējām skaņām.
Redzes jomā tā piedāvā "stingru" OCR sarežģītiem attēliem, objektu noteikšanu un iezemēšanu , attēlu kvalitātes nodrošināšanu, attēlu matemātisko risināšanu (kur izceļas domāšanas modelis), video aprakstu, pirmās personas video navigāciju un ainu pārejas analīzi . Audiovizuālos scenārijos tā demonstrē audio-video kvalitātes nodrošināšanu ar laika saskaņošanu, vadītu mijiedarbību ar AV ievades elementiem un dialogus ar palīga darbību.
Kā aģents tas izceļas ar spēju veikt zvanus no audio , kas atver balss darbplūsmas, kuras aktivizē rīkus, un atvasinātajos uzdevumos ir pieejams Omni-Captioner subtitru izveidei ar lielu detalizācijas pakāpi, kas demonstrē pamata subtitra vispārināmību.
Domātāja un runātāja arhitektūras un dizaina jomā kopā ar Izglītības ministriju
Viena no galvenajām atšķirībām ir pienākumu sadalījums: Domātājs ģenerē tekstu (ar variācijām, kas ietver skaidru domu ķēdes spriešanu), bet Runātājs ģenerē reāllaika audio . Šī atdalīšana nodrošina dabisku balss sarunu, vienlaikus saglabājot augstu teksta izpratnes un plānošanas līmeni .
MoE datubāze sadala darba slodzi starp ekspertiem un paļaujas uz AuT iepriekšēju apmācību, lai nodrošinātu jaudīgas vispārīgas reprezentācijas. Turklāt vairāku kodu kodēšanas izmantošana audio kanālā samazina latentumu līdz minimumam, kas ir ļoti svarīgi zvaniem vai asistentiem, kur katra simtdaļa sekundes ir svarīga.
Veiktspēja un kritēriji: teksts, attēls, audio un audiovizuālie materiāli
Qwen3-Omni saglabā vismodernāko teksta un attēlu veiktspēju, nepazeminoties salīdzinājumā ar līdzīga izmēra Qwen modeļiem, kas koncentrējas uz vienu režīmu, savukārt audio un audiovizuālajā veiktspējā tas nosaka tempu lielākajā daļā testu . 36 audio un audiovizuālo etalonu kopumā tas sasniedz atvērtā koda SOTA 32 gadījumos un kopējo SOTA 22 gadījumos, vairākos punktos pārspējot Gemini 2.5 Pro un GPT-4o.
Daži ievērojami teksta sasniegumi: AIME25 testā Flash-Instruct variants iegūst aptuveni 65,9 punktus; ZebraLogic testā Instruct sasniedz 90 punktus, un MultiPL-E testā tas sasniedz konkurētspējīgus rezultātus ar GPT-4o. Izlīdzināšanas uzdevumos, piemēram, IFEval un WritingBench, Instruct un Thinking modeļi uzrāda augstus un konsekventus rezultātus.
Audio versijā ASR rezultāti ķīniešu un angļu valodā ir izcili: WenetSpeech un LibriSpeech versijās tas ievērojami samazina vārdu kļūdu līmeni, LibriSpeech tīrajā/citā valodā sasniedzot tuvu 1,22/2,48, un tādās kopās kā FLEURS (daudzvalodu) tas piedāvā ļoti zemus rādītājus. VoiceBench versijā tādi rādītāji kā AlpacaEval, CommonEval un WildVoice pielīdzina Qwen3-Omni slēgtajām atsauču sistēmām, un tas izceļas audio spriešanas ziņā MMAU v05.15.25 versijā.
Audiovizuālajās lietojumprogrammās visbiežāk minētais rādītājs ir WorldSense (aptuveni 54,1 ), kas pārspēj Gemini-2.5-Flash. Turklāt tādos komplektos kā DailyOmni un VideoHolmes Thinking variants sasniedz uzlabojumus salīdzinājumā ar iepriekšējām atvērtā pirmkoda SOTA lietojumprogrammām. Tīrā redzē tas izceļas MMMU, MathVista, MathVision un dokumentu izpratnē (AI2D, ChartQA), ar ļoti labiem rezultātiem skaitīšanā ( CountBench) un video izpratnē (Video-MME, MLVU).
Tika mērīta arī nulles kadra balss ģenerēšana: salīdzinot ar tādām saimēm kā CosyVoice un Seed-TTS, Qwen3-Omni uzrāda labāku satura konsekvenci vairākās valodās un augstu runātāju līdzību . Daudzvalodu sadaļā tabulas "Satura konsekvence" un "Runātāju līdzība" liecina, ka Qwen3-Omni 30B-A3B ir ļoti konkurētspējīgs ķīniešu un angļu valodā, kā arī stabils vācu, itāļu, portugāļu, spāņu, japāņu, korejiešu, franču un krievu valodā. Starpvalodu TTS tas sasniedz labāku WER/konsekvenci vairākos pāros (piemēram, zh→en, ja→en, ko→zh) salīdzinājumā ar CosyVoice 2/3.
Pieejamie modeļi un to pielietojums
Qwen3-Omni līnijā ietilpst trīs galvenās daļas, katra no tām paredzēta konkrētam lietojumam: Instruct , Thinking un Captioner . Tās visas ir balstītas uz vienu un to pašu pamatprincipu, taču tām ir dažādas iespējas, kas tiek aktivizētas vai pielāgotas konkrētiem uzdevumiem.
Qwen3-Omni-30B-A3B- Instruct ietver Thinker un Talker, pieņem audio, video un tekstu , kā arī atgriež tekstu un audio. Tā ir pareizā izvēle, ja vēlaties pilnīgu mijiedarbību un reāllaika runas rezultātus, un tā ir ieteicama balss vai video demonstrācijām .
Qwen3-Omni-30B-A3B- Thinkting (Tēvēšana) koncentrējas uz domātāju ar ķēdes spriešanu , atbalstot audio, video un tekstu ar teksta izvadi. Tas ir noderīgi padziļinātai analīzei, sarežģītu problēmu risināšanai, vizuālai matemātikai vai darbplūsmām, kurās nav nepieciešama balss izvade, bet ir nepieciešama vislabākā strukturētā domāšana.
Qwen3-Omni-30B-A3B- Captioner ir uzlabots augstas precizitātes, zemas hiperaktivitātes audio subtitru atvasinājums . Tas ir atvērtā pirmkoda produkts, detalizēti aptver plašu audio klāstu un aizpilda vēsturisku robu atvērtā pirmkoda ekosistēmā: uzticami un bagātīgi titri vispārējas nozīmes audio.
Latentums, reāllaika un uzvedības kontrole
Sistēma ir optimizēta tūlītējai mijiedarbībai, ar aptuveni 211 ms audio un 507 ms audio-video saziņai . Papildus straumēšanai uzsvars tiek likts uz dabiskām sarunu pavērsieniem un stabilu balss piegādi, ko veicina skaidras Domātāja (teksts) un Runātāja (balss) lomas.
Lai precizētu stilu, varat pielāgot sistēmas uzvednes . AV scenārijos, kuros video audio tiek izmantots kā atsauce, komanda iesaka sistēmas uzvedni, kas saglabā Domātāja spriešanas procesu, vienlaikus nodrošinot lasāmāku un sarunvalodai atbilstošāku tekstu, atvieglojot Runātājam tekošu runāšanu . Ieteicams arī saglabāt parametru `use_audio_in_video` konsekventu visā vairāku pavērsienu sarunā.
Novērtēšanā ir jāievēro īpašas vadlīnijas: neiestatiet sistēmas uzvedni , ievērojiet katra etalona ChatML formātu un, ja uzvednes nav, pēc noklusējuma izmantojiet sekojošo: ķīniešu ASR (“请将这段中文语音转换为纯文本。”), citu valodu ASR (“Transkribēt audio tekstā.”), S2TT (“Klausieties sniegto <avota_valoda> runu…”) un dziesmu vārdus (“ Transkribēt dziesmas vārdus” … bez pieturzīmēm, rindas atdalītas ar pārtraukumiem”).
Izvietošana, prasības un rīki
Lai iegūtu pilnvērtīgu lokālu pieredzi, komanda iesaka izmantot Hugging Face Transformers un pārskatīt programmatūras izstrādes fāzes , taču ņemiet vērā: tā kā tā ir MoE arhitektūra, tā var darboties lēni ar HF secinājumiem; ražošanas vai zema latentuma lietojumprogrammām viņi iesaka izmantot vLLM vai DashScope API un pat nodrošina Docker attēlu, kas ietver vides abiem. Transformers kods jau ir apvienots, bet PyPI pakotne vēl nav izlaista un tā ir jāinstalē no avota koda.
Tie nodrošina utilītas audio un attēlu/video apstrādei (base64, URL, savstarpēji savienotas ievades) un iesaka FlashAttention 2 ar Transformers, lai samazinātu GPU atmiņu, ielādējot to float16 vai bfloat16 . Izmantojot vLLM, ir iekļauts FlashAttn2, un ir detalizēti aprakstīti tādi parametri kā limit_mm_per_prompt (iepriekš piešķir GPU atmiņu) un max_num_seqs paralēlismam ; turklāt, palielinot tensor_parallel_size, tiek iespējota vairāku GPU secinājumu veikšana.
Ir daži noderīgi padomi resursu taupīšanai: ja audio nav nepieciešams, pēc inicializācijas varat atspējot Talker , ietaupot aptuveni 10 GB video atmiņas. Un, ja vēlaties ātrāku teksta izvadi, ģenerēšanas laikā izmantojiet `return_audio=False` . Ir norādītas arī minimālās teorētiskās atmiņas prasības BF16 ar FlashAttn2: piemēram, Instruct 30B-A3B izmanto aptuveni 78,9 GB ar 15 sekundēm video un 144,8 GB ar 120 sekundēm; Thinking izmanto attiecīgi aptuveni 68,7 GB un 131,7 GB.
Lai iestatītu lokālu tīmekļa demonstrāciju , viņi iesaka sagatavot vLLM vidi (vai lēnāko Transformers vidi), pārliecināties, ka ir instalēts ffmpeg , un izmantot viņu skriptus. Viņi piedāvā GPU gatavus Docker attēlus “qwenllm/qwen3-omni” ar NVIDIA Container Toolkit , portu kartēšanu (piemēram, resursdators 8901 → konteiners 80) un iespēju apkalpot no 0.0.0.0. Varat atkārtoti ievadīt vai dzēst konteineru pēc nepieciešamības.
Demonstrācijas, API un ekosistēma
Ja nevēlaties izvietot lokāli, varat izmēģināt demonstrācijas versijas Hugging Face Spaces un ModelScope Studio platformās , izmantojot Qwen3-Omni-Realtime, Instruct, Thinking un Captioner pieredzi. Ir pieejama arī Qwen Chat ar straumēšanu reāllaikā: vienkārši atlasiet balss/video zvana opciju saskarnē.
Lai nodrošinātu mērogojamu integrāciju ar zemu latentumu, ieteicamā pieeja ir DashScope API , kas piedāvā visparedzamāko veiktspēju. Turklāt kopiena koordinē darbību, izmantojot tādus kanālus kā Discord un WeChat , un publicē pavārgrāmatas ar reāliem izpildes žurnāliem, kas ļauj lietotājiem reproducēt rezultātus, mainot uzvednes vai modeļus.
Ceļvedis un pastāvīgie uzlabojumi
Komanda strādā pie papildu funkcijām, piemēram, vairāku runātāju runas atpazīšanas , OCR piemērošanas video, proaktīvās audiovizuālās mācīšanās uzlabojumiem un bagātīgākām aģentu darbplūsmām . Viņi arī norādīja, ka drīzumā būs pieejams audio izvades atbalsts vLLM Instruct modelim , pabeidzot reāllaika izvietošanas ciklu no šīs aizmugursistēmas.
BUJ: Izpildes laika atbalsts un kvantēšana
Daži lietotāji ir komentējuši, ka viņi nevar palaist Qwen3-Omni pat ar parastajiem aizdomās turamajiem un ka viņi neredz kvantus Hugging Face ; turklāt vietējais 16 bitu formāts ir aptuveni 70 GB liels, kas ir problemātisks izmērs pieticīgiem datoriem. Pašā projektā ir precizēts, ka Transformers jau ir apvienots, bet bez PyPI pakotnes , kas jāinstalē no avota, un ka vLLM ir vēlamā opcija secinājumiem, lai gan Instruct audio atbalsts vLLM tiks izlaists tuvākajā nākotnē.
Runājot par kvantēšanu, HF vēl nav norādīti vietturi Qwen3-Omni 30B-A3B, un ir vērts atcerēties, ka MoE un multimodālais raksturs sarežģī tūlītēju saderību ar izpildlaikiem, piemēram, llama.cpp. Tiem, kam testēšana ir nepieciešama tagad, oficiālais ieteikums ir izmantot Docker + Transformers/vLLM no avota vai API un sekot līdzi repozitorijam, lai saņemtu atbalstu no pull pieprasījumiem un turpmākajām kvantizācijām , kad tās būs pieejamas.
Labas izvērtēšanas prakses un ieteikumi
Lai reproducētu skaitļus, ir sniegtas šādas vadlīnijas: lielākā daļa etalonu izmanto alkatīgu dekodēšanu programmā Instruct bez izlases veidošanas, un attiecībā uz Thinking ir jāievēro generation_config.json parametri . Video kadru nomaiņas ātrums novērtēšanas laikā tiek iestatīts arī uz fps=2 , un ir norādīts, ka lietotāja uzvednei jāseko multimodālajiem datiem, ja vien datu kopā nav norādīts citādi.
Ja etalonā nav iekļauta uzvedne, var izmantot noklusējuma uzvednes (ķīniešu ASR/cits, S2TT, dziesmu vārdi). Turklāt sistēmas uzvedne nav jāiestata novērtēšanas laikā, lai nodrošinātu rezultātu salīdzināmību dažādās sistēmās un palaišanas reizēs.
Qwen3-Omni sevi pozicionē kā patiesi omnimodālu platformu ar zemu latentumu, plašu daudzvalodu atbalstu, modernām audio un video iespējām un skaidru ieviešanas ceļu, izmantojot Transformers, vLLM un Docker. Tiem, kas meklē vienu modeli, kas nemanāmi apstrādā tekstu un attēlus, neupurējot veiktspēju, un kas arī klausās, runā un saprot video , tas ir piedāvājums, ko mūsdienās ir grūti pārspēt.
