- Native omnimodaal model met tekst, afbeeldingen, audio, video en realtime streaming.
- SOTA in 22/36 audio/video benchmarks en meertalig (119/19/10 talen).
- Thinker-Talker-architectuur met MoE, lage latentie en systeempromptbesturing.
- Aanbevolen implementatie met vLLM/Transformers, Docker en officiële hulpprogramma's.
De komst van Qwen3-Omni heeft het AI-landschap veranderd: één enkel, native model dat tekst, afbeeldingen, audio en video kan begrijpen en erop kan reageren , met realtime reacties in zowel geschreven als gesproken vorm. We hebben het hier niet over multimodale "lapjes", maar over een fundamenteel ontworpen architectuur voor het integreren van modaliteiten met een lage latentie en nauwkeurige gedragscontrole.
In een tijd waarin bijna iedereen chatbots en assistenten test, komt Qwen3-Omni met ambitie: het ondersteunt 119 talen via tekst, herkent spraak in 19 talen en spreekt in 10 talen , begrijpt lange audiofragmenten (tot 30 minuten) en scoort hoog in tientallen tests. Bovendien zijn het Thinker-Talker-ontwerp en de Mixture of Experts-aanpak gericht op snelle reacties en kwalitatief hoogstaand redeneren in realistische scenario's.
Wat is Qwen3-Omni en wat biedt het?
Qwen3-Omni is een familie van fundamentele, omnimodale en end-to-end meertalige modellen die zijn ontworpen om tekst, afbeeldingen, audio en video te verwerken, met uitvoer in zowel tekst als natuurlijke spraak. De kracht zit hem niet alleen in de verscheidenheid aan in- en uitvoermogelijkheden, maar ook in de streamingfunctionaliteit met vloeiende gesprekswisselingen en de mogelijkheid om direct te reageren.
Het team heeft verschillende architectonische verbeteringen doorgevoerd voor betere prestaties en efficiëntie: vroege "tekst-eerst" pre-training gecombineerd met gemengde multimodale training, en een ontwerp met een Mixture of Experts (MoE) dat zijn prestaties in tekst en beeld behoudt, terwijl het audio en video verbetert. Dankzij deze verbeteringen behaalt het model state-of-the-art prestaties in 22 van de 36 audio/video-benchmarks en open-source state-of-the-art prestaties in 32 van de 36, met resultaten die vergelijkbaar zijn met Gemini 2.5 Pro op het gebied van ASR, audiobegrip en spraakconversatie.

Belangrijkste mogelijkheden en modaliteiten
Qwen3-Omni is klaar voor praktijkgerichte audio-, beeld- en audiovisuele toepassingen, met uitgebreide meertalige ondersteuning: 119 teksttalen, 19 talen voor spraakinvoer en 10 talen voor spraakuitvoer . De talen voor spraakinvoer omvatten Engels, Chinees, Koreaans, Japans, Duits, Russisch, Italiaans, Frans, Spaans, Portugees, Maleis, Nederlands, Indonesisch, Turks, Vietnamees, Kantonees, Arabisch en Urdu; en de talen voor spraakuitvoer omvatten onder andere Engels, Chinees, Frans, Duits, Russisch, Italiaans, Spaans, Portugees, Japans en Koreaans.
De reeks officiële kookboeken illustreert de veelzijdigheid van het programma. Op audiogebied biedt het meertalige en lange audiofragmenten spraakherkenning (ASR) , spraak-naar-tekst- en spraak-naar-spraakvertaling, muziekanalyse (stijl, ritme, genres), beschrijving van geluidseffecten en ondertiteling van alle soorten audio . Het ondersteunt ook gemengde analyses van tracks met spraak, muziek en omgevingsgeluiden.
Op het gebied van beeldverwerking biedt het "harde" OCR voor complexe afbeeldingen, objectdetectie en -positionering , beeldkwaliteitscontrole, wiskundige oplossingen voor afbeeldingen (waar het Thinking-model in uitblinkt), videobeschrijving, video-navigatie vanuit een eerstepersoonsperspectief en analyse van scèneovergangen . In audiovisuele scenario's demonstreert het audio-video-kwaliteitscontrole met tijdsynchronisatie, begeleide interactie met AV-ingangen en dialogen met assistentgedrag.
Als agent onderscheidt het zich door zijn vermogen om te functioneren via audio-oproepen , wat spraakworkflows mogelijk maakt die tools activeren. In afgeleide taken is er een Omni-Captioner voor zeer gedetailleerde ondertiteling, wat de generaliseerbaarheid van de basisfunctionaliteit aantoont.
Thinker-Palker Architectuur en Design met MoE
Een van de belangrijkste onderscheidende kenmerken is de scheiding van verantwoordelijkheden: de Denker genereert de tekst (met variaties die expliciete gedachtegangen omvatten), en de Spreker produceert realtime audio . Deze ontkoppeling maakt natuurlijke spraakconversaties mogelijk, terwijl het systeem een hoog niveau van tekstbegrip en planning behoudt.
De MoE-database verdeelt de werklast over experts en maakt gebruik van AuT-vooropleiding voor krachtige algemene representaties. Bovendien minimaliseert het gebruik van multi-code-codering in het audiokanaal de latentie, wat cruciaal is voor gesprekken of spraakassistenten waarbij elke honderdste van een seconde telt.
Prestaties en benchmarks: tekst, visie, audio en audiovisueel
De Qwen3-Omni behoudt toonaangevende prestaties op het gebied van tekst en beeld, zonder dat dit ten koste gaat van vergelijkbare Qwen-modellen die zich op één modus richten. Ook op het gebied van audio- en audiovisuele prestaties is hij toonaangevend in de meeste tests . In de reeks van 36 audio- en audiovisuele benchmarks behaalt hij in 32 gevallen de hoogste open-source state-of-the-art (SOTA) status en in 22 gevallen de hoogste totale SOTA-status, waarmee hij de Gemini 2.5 Pro en GPT-4o op verschillende punten overtreft.
Enkele opmerkelijke mijlpalen op het gebied van tekstverwerking: in AIME25 behaalt de Flash-Instruct-variant een score van ongeveer 65,9; in ZebraLogic bereikt de Instruct-variant 90, en in MultiPL-E behaalt deze concurrerende resultaten ten opzichte van GPT-4o. Bij alignment-taken zoals IFEval en WritingBench laten de Instruct- en Thinking-modellen hoge en consistente scores zien.
Wat audio betreft, zijn de ASR-resultaten voor Chinees en Engels uitstekend: in WenetSpeech en LibriSpeech wordt het woordfoutpercentage aanzienlijk verlaagd, met waarden rond de 1,22/2,48 in LibriSpeech clean/other, en in datasets zoals FLEURS (meertalig) biedt het zeer lage percentages. In VoiceBench plaatsen meetwaarden zoals AlpacaEval, CommonEval en WildVoice Qwen3-Omni op hetzelfde niveau als gesloten referentiesystemen, en het blinkt uit in audio-redenering in MMAU v05.15.25.
In audiovisuele toepassingen is WorldSense (ongeveer 54,1 ) de meest geciteerde score , waarmee het Gemini-2.5-Flash overtreft. Bovendien behaalt de Thinking-variant in suites zoals DailyOmni en VideoHolmes verbeteringen ten opzichte van eerdere open-source state-of-the-art-toepassingen. Op het gebied van beeldherkenning blinkt het uit in MMMU, MathVista, MathVision en documentbegrip (AI2D, ChartQA), met zeer goede scores in tellen (CountBench) en videobegrip (Video-MME, MLVU).
Ook de zero-shot spraakgeneratie werd gemeten: vergeleken met families zoals CosyVoice en Seed-TTS, laat Qwen3-Omni een betere inhoudelijke consistentie zien in meerdere talen en een hoge sprekersgelijkenis . In het meertalige gedeelte tonen de tabellen "Content Consistency" en "Speaker Similarity" aan dat Qwen3-Omni 30B-A3B zeer concurrerend is in Chinees en Engels, en solide in Duits, Italiaans, Portugees, Spaans, Japans, Koreaans, Frans en Russisch. Bij cross-linguale TTS behaalt het betere WER/consistenties voor verschillende paren (bijv. zh→en, ja→en, ko→zh) vergeleken met CosyVoice 2/3.
Beschikbare modellen en waarvoor elk model wordt gebruikt
De Qwen3-Omni-lijn bestaat uit drie hoofdonderdelen, elk ontworpen voor een specifiek gebruik: Instruct , Thinking en Captioner . Ze zijn allemaal gebaseerd op dezelfde kern, maar met verschillende mogelijkheden die geactiveerd of verfijnd zijn voor specifieke taken.
De Qwen3-Omni-30B-A3B- Instruct bevat een Thinker- en een Talker-module, accepteert audio, video en tekst en geeft zowel tekst als audio terug. Het is de juiste keuze als u volledige interactie en realtime gesproken resultaten wilt, en wordt aanbevolen voor spraak- of videodemonstraties.
Qwen3-Omni-30B-A3B- Thinking richt zich op de denker met ketenredenering en ondersteunt audio, video en tekst met tekstuele uitvoer. Het is nuttig voor diepgaande analyses, het oplossen van complexe problemen, visuele wiskunde of workflows waarbij spraakuitvoer niet nodig is, maar wel een goed gestructureerd denkproces.
Qwen3-Omni-30B-A3B- Captioner is een verfijnde variant van zeer nauwkeurige, rustige audio-ondertiteling . Het is open source, ondersteunt een breed scala aan audio met veel detail en vult een historisch gat in het open-source ecosysteem: betrouwbare en uitgebreide ondertiteling voor algemene audio.
Latentie, realtime en gedragscontrole
Het systeem is geoptimaliseerd voor directe interactie, met reactietijden van ongeveer 211 ms voor audio en 507 ms voor audio-video . Naast streaming ligt de nadruk op natuurlijke gespreksloop en stabiele spraakweergave, ondersteund door de duidelijke rollen van Denker (tekst) en Spreker (spraak).
Voor fijnafstelling kunt u de stijl aanpassen met systeemprompts . In AV-scenario's waarbij de audio van de video als referentie wordt gebruikt, stelt het team een systeemprompt voor die de redenering van de Denker behoudt, maar tegelijkertijd een beter leesbare en meer conversatiegerichte tekst biedt, waardoor het voor de Spreker gemakkelijker wordt om vloeiend te spreken . Het is ook aan te raden de parameter `use_audio_in_video` consistent te houden gedurende een gesprek dat uit meerdere beurten bestaat.
Bij de evaluatie gelden specifieke richtlijnen: stel geen systeemprompt in , volg het ChatML-formaat van elke benchmark en gebruik, indien er geen prompt is, standaard het volgende: Chinese ASR (“请将这段中文语音转换为纯文本。”), ASR andere talen (“Transcribeer de audio naar tekst.”), S2TT (“Luister naar de aangeleverde <source_language> spraak …”) en songteksten (“ Transcribeer de songteksten” … zonder leestekens, regels gescheiden door regeleinden).
Implementatie, vereisten en tools
Voor een complete lokale ervaring raadt het team Hugging Face Transformers aan en adviseert het de softwareontwikkelingsfasen te bekijken . Houd er echter rekening mee dat, aangezien het een MoE-architectuur is, het traag kan werken met HF-inferentie. Voor productie- of low-latency-toepassingen adviseren ze het gebruik van vLLM of de DashScope API . Ze bieden zelfs een Docker-image aan met omgevingen voor beide. De Transformers-code is al samengevoegd, maar het PyPI-pakket is nog niet uitgebracht en moet vanuit de broncode worden geïnstalleerd.
Ze bieden hulpprogramma's voor het verwerken van audio en beeld/video (base64, URL's, interleaved inputs) en bevelen FlashAttention 2 met Transformers aan om het GPU-geheugen te verminderen bij het laden van float16 of bfloat16 . Met vLLM is FlashAttn2 inbegrepen en worden parameters zoals limit_mm_per_prompt (vooraf toewijzen van GPU-geheugen) en max_num_seqs voor parallellisatie gedetailleerd beschreven ; bovendien maakt het verhogen van tensor_parallel_size inferentie met meerdere GPU's mogelijk.
Er zijn een paar handige tips om resources te besparen: als je geen audio nodig hebt, kun je de Talker na initialisatie uitschakelen, waardoor je ongeveer 10 GB VRAM bespaart. En als je snellere tekstuitvoer wilt, gebruik dan `return_audio=False` tijdens het genereren. De minimale theoretische geheugenvereisten voor BF16 met FlashAttn2 worden ook vermeld: de Instruct 30B-A3B gebruikt bijvoorbeeld ongeveer 78,9 GB met 15 seconden video en 144,8 GB met 120 seconden; de Thinking gebruikt respectievelijk ongeveer 68,7 GB en 131,7 GB.
Om een lokale webdemo op te zetten , raden ze aan om je vLLM-omgeving (of de tragere Transformers-omgeving) voor te bereiden, ervoor te zorgen dat ffmpeg is geïnstalleerd en hun scripts te gebruiken. Ze bieden GPU-compatibele Docker-images "qwenllm/qwen3-omni" met de NVIDIA Container Toolkit , poorttoewijzing (bijv. host 8901 → container 80) en de optie om te serveren vanaf 0.0.0.0. Je kunt de container opnieuw openen of verwijderen indien nodig.
Demo's, API's en ecosysteem
Als je de applicatie niet lokaal wilt implementeren, kun je demo's uitproberen op Hugging Face Spaces en ModelScope Studio , met ervaringen voor Qwen3-Omni-Realtime, Instruct, Thinking en de Captioner. Qwen Chat met realtime streaming is ook beschikbaar: selecteer eenvoudig de optie voor spraak-/videogesprekken in de interface.
Voor schaalbare integratie met lage latentie is de DashScope API de aanbevolen aanpak , die de meest voorspelbare prestaties biedt. Bovendien coördineert de community via kanalen zoals Discord en WeChat en publiceert handleidingen met echte uitvoeringslogboeken, waarmee gebruikers resultaten kunnen reproduceren door prompts of modellen aan te passen.
Routekaart en doorlopende verbeteringen
Het team werkt aan extra functies zoals spraakherkenning voor meerdere sprekers , OCR toegepast op video, verbeteringen aan proactief audiovisueel leren en rijkere agentworkflows . Ze gaven ook aan dat ondersteuning voor audio-uitvoer in vLLM voor het Instruct-model binnenkort beschikbaar zal zijn, waarmee de realtime implementatiecyclus vanuit die backend wordt voltooid.
FAQ: Runtime-ondersteuning en kwantificering
Sommige gebruikers hebben aangegeven dat ze Qwen3-Omni zelfs met de gebruikelijke programma's niet kunnen uitvoeren en dat ze geen quants zien in Hugging Face ; bovendien is het native 16-bits formaat ongeveer 70 GB groot, een omvang die problematisch is voor bescheiden computers. Het project zelf verduidelijkt dat Transformers al is samengevoegd, maar zonder het PyPI-pakket , dat vanuit de broncode moet worden geïnstalleerd, en dat vLLM de voorkeur heeft voor inferentie, hoewel ondersteuning voor Instruct-audio in vLLM binnenkort zal worden uitgebracht.
Wat betreft kwantisering zijn er nog geen placeholders in HF voor Qwen3-Omni 30B-A3B, en het is belangrijk om te onthouden dat het MoE- en multimodale karakter directe compatibiliteit met runtimes zoals llama.cpp bemoeilijkt. Voor degenen die nu willen testen, is de officiële aanbeveling om Docker + Transformers/vLLM vanuit de broncode of de API te gebruiken en de repository in de gaten te houden voor pull requests ter ondersteuning en toekomstige kwantiseringen zodra deze beschikbaar zijn.
Goede evaluatiepraktijken en -aanwijzingen
Om de resultaten te reproduceren, worden de volgende richtlijnen beschreven: de meeste benchmarks gebruiken gierige decodering in Instruct zonder sampling, en voor Thinking moeten de parameters in generation_config.json worden gerespecteerd . De framesnelheid van de video wordt tijdens de evaluatie ingesteld op fps=2 , en er wordt aangegeven dat de gebruikersprompt de multimodale data moet volgen , tenzij de dataset anders aangeeft.
Als een benchmark geen prompt bevat, kunnen de standaardprompts worden gebruikt (Chinese ASR/overige, S2TT, songteksten). Daarnaast mag de systeemprompt niet worden ingesteld tijdens de evaluatie om ervoor te zorgen dat de resultaten vergelijkbaar zijn tussen systemen en uitvoeringen.
Qwen3-Omni positioneert zich als een echt omnimodaal platform, met lage latentie, brede meertalige ondersteuning, geavanceerde audio- en videomogelijkheden en een duidelijke implementatieroute met behulp van Transformers, vLLM en Docker. Voor wie op zoek is naar één model dat tekst en afbeeldingen naadloos verwerkt zonder in te leveren op prestaties, en dat ook luistert, spreekt en video begrijpt , is dit een aanbod dat momenteel moeilijk te evenaren is.
