- Izvorni omnimodalni model s tekstom, slikom, zvukom i videom te strujanjem u stvarnom vremenu.
- SOTA u 22/36 audio/video testovima i višejezična (119/19/10 jezika).
- Arhitektura Thinker–Talker s MoE-om, niskom latencijom i kontrolom sistemskih promptova.
- Preporučeno je korištenje vLLM/Transformersa, Dockera i službenih uslužnih programa.
Dolazak Qwen3-Omnija promijenio je krajolik umjetne inteligencije: jedinstveni izvorni model sposoban razumjeti i reagirati na tekst, slike, zvuk i video , s odgovorima u hodu u pisanom i govornom obliku. Ne govorimo o multimodalnim "zakrpama", već o temeljno dizajniranoj arhitekturi za integraciju modaliteta s niskom latencijom i fino podešenom kontrolom ponašanja.
U vrijeme kada gotovo svi testiraju chatbotove i asistente, Qwen3-Omni stiže s ambicijom: podržava 119 jezika putem teksta, prepoznaje govor na 19 i 10 jezika , razumije duge audio zapise (do 30 minuta) i može se pohvaliti rezultatima u desecima testova. Nadalje, njegov dizajn Mislilac-Govorac i pristup Mješavina stručnjaka usmjereni su na brzinu odgovora i kvalitetu rasuđivanja u stvarnim scenarijima.
Što je Qwen3-Omni i što nudi?
Qwen3-Omni je obitelj temeljnih, omnimodalnih i end-to-end višejezičnih modela dizajniranih za obradu teksta, slika, zvuka i videa, s izlazom u tekstu i prirodnom govoru. Ključ leži ne samo u raznolikosti ulaza i izlaza, već i u funkcionalnosti strujanja s fluidnim konverzacijskim okretajima i mogućnošću trenutnog odgovora.
Tim je uveo nekoliko arhitektonskih poboljšanja za performanse i učinkovitost: rano prethodno treniranje „prvo tekst“ u kombinaciji s miješanim multimodalnim treniranjem i dizajn s mješavinom stručnjaka (MoE) koji održava svoje performanse u tekstu i slici, a istovremeno poboljšava zvuk i video. S ovim poboljšanjima, model postiže SOTA u 22 od 36 audio/video benchmarkova i SOTA otvorenog koda u 32 od 36, s rezultatima usporedivim s Gemini 2.5 Pro u ASR-u, razumijevanju zvuka i govornom razgovoru.

Ključne sposobnosti i modaliteti
Qwen3-Omni je spreman za stvarne audio, vizualne i audiovizualne primjene, s opsežnom višejezičnom podrškom: 119 tekstualnih jezika, 19 jezika za glasovni unos i 10 jezika za glasovni izlaz . Jezici za glasovni unos uključuju engleski, kineski, korejski, japanski, njemački, ruski, talijanski, francuski, španjolski, portugalski, malajski, nizozemski, indonezijski, turski, vijetnamski, kantonski, arapski i urdu; a izlazni jezici uključuju, između ostalih, engleski, kineski, francuski, njemački, ruski, talijanski, španjolski, portugalski, japanski i korejski.
Paket službenih kuharica ilustrira širinu njegove upotrebe. U audio formatu prikazuje višejezično i dugo audio prepoznavanje govora (ASR) , pretvaranje govora u tekst i govora u govor, analizu glazbe (stil, ritam, žanrovi), opis zvučnih efekata i titlove bilo kojeg audio zapisa . Također podržava mješovitu analizu zapisa s govorom, glazbom i ambijentalnim zvukovima.
U vizualnom području nudi "tvrdo" OCR za složene slike, detekciju i uzemljenje objekata , procjenu kvalitete slike, rješavanje matematičkih zadataka slike (gdje model razmišljanja blista), opis videa, navigaciju iz videa iz prvog lica i analizu prijelaza scene . U audiovizualnim scenarijima demonstrira procjenu kvalitete zvuka i videa s vremenskim usklađivanjem, vođenom interakcijom s AV ulazima i dijalogima s ponašanjem asistenta.
Kao agent, ističe se svojom sposobnošću funkcioniranja pozivanja iz zvuka , što otvara glasovne tijekove rada koji aktiviraju alate, a u izvedenim zadacima postoji Omni-Captioner za titlovanje s velikim detaljima, što pokazuje generaliziranost osnovnog.
Mislilac-govornik Arhitektura i dizajn s MoE
Jedna od ključnih razlika je podjela odgovornosti: Mislilac generira tekst (s varijacijama koje uključuju eksplicitno zaključivanje o lancu misli), a Govornik proizvodi zvuk u stvarnom vremenu . Ovo razdvajanje omogućuje prirodan glasovni razgovor dok sustav održava visoku razinu razumijevanja teksta i planiranja.
MoE baza podataka raspoređuje radno opterećenje među stručnjacima i oslanja se na predobuku AuT-a za snažne opće reprezentacije. Nadalje, korištenje višekodnog kodiranja u audio kanalu smanjuje latenciju na minimum, što je ključno za pozive ili asistente gdje je svaka stotinka sekunde važna.
Performanse i mjerila: tekst, slika, audio i audiovizualni sadržaj
Qwen3-Omni održava vrhunske performanse teksta i slike bez degradacije u usporedbi sa slično velikim Qwen modelima usmjerenim na jedan način rada, dok u audio i audiovizualnim performansama postavlja tempo u većini testova . U bateriji od 36 audio i audiovizualnih benchmarkova, postiže open-source SOTA u 32 i ukupni SOTA u 22, nadmašujući Gemini 2.5 Pro i GPT-4o u nekoliko točaka.
Neke značajne prekretnice u tekstu: u AIME25 varijanta Flash-Instruct postiže rezultat od oko 65,9; u ZebraLogic- u Instruct doseže 90, a u MultiPL-E postiže konkurentne brojke u odnosu na GPT-4o. U zadacima poravnanja kao što su IFEval i WritingBench, modeli Instruct i Thinking pokazuju visoke i konzistentne rezultate.
U audio sustavu, ASR rezultati za kineski i engleski jezik su izvrsni: u WenetSpeechu i LibriSpeechu značajno smanjuje stopu pogrešaka u riječi, s brojkama blizu 1,22/2,48 u LibriSpeechu čisto/ostalo, a u setovima poput FLEURS-a (višejezični) nudi vrlo niske stope. U VoiceBenchu, metrike poput AlpacaEval-a, CommonEval-a i WildVoice-a svrstavaju Qwen3-Omni u rang sa zatvorenim referentnim sustavima, a izvrstan je u audio zaključivanju u MMAU v05.15.25.
U audiovizualnim primjenama, najčešće citirana metrika je WorldSense (približno 54,1 ), nadmašujući Gemini-2.5-Flash. Nadalje, u paketima poput DailyOmni i VideoHolmes, varijanta Thinking postiže poboljšanja u odnosu na prethodne SOTA aplikacije otvorenog koda. U čistom vidu, izvrsno se ističe u MMMU, MathVista, MathVision i razumijevanju dokumenata (AI2D, ChartQA), s vrlo dobrim rezultatima u brojanju (CountBench) i razumijevanju videa (Video-MME, MLVU).
Također je izmjereno generiranje glasa s nultom brzinom: u usporedbi s obiteljima poput CosyVoice i Seed-TTS, Qwen3-Omni pokazuje bolju konzistentnost sadržaja na više jezika i visoku sličnost govornika . U višejezičnom odjeljku, tablice "Konzistentnost sadržaja" i "Sličnost govornika" pokazuju da je Qwen3-Omni 30B-A3B vrlo konkurentan na kineskom i engleskom jeziku, te solidan na njemačkom, talijanskom, portugalskom, španjolskom, japanskom, korejskom, francuskom i ruskom. U međujezičnom TTS -u postiže bolju WER/konzistentnost na nekoliko parova (npr. zh→en, ja→en, ko→zh) u usporedbi s CosyVoice 2/3.
Dostupni modeli i za što se svaki od njih koristi
Linija Qwen3-Omni uključuje tri glavna dijela, svaki dizajniran za specifičnu upotrebu: Instruct , Thinking i Captioner . Svi proizlaze iz iste jezgre, ali s različitim mogućnostima aktiviranim ili fino podešenim za specifične zadatke.
Qwen3-Omni-30B-A3B- Instruct sadrži Thinker i Talker, prihvaća audio, video i tekst te vraća tekst i audio. To je pravi izbor ako želite potpunu interakciju i govorne rezultate u stvarnom vremenu, a preporučuje se za glasovne ili video demonstracije .
Qwen3-Omni-30B-A3B- Razmišljanje se fokusira na Mislioca s lančanim zaključivanjem , podržavajući audio, video i tekst s tekstualnim izlazom. Koristan je za dubinsku analizu, rješavanje složenih problema, vizualnu matematiku ili tijekove rada gdje vam nije potreban glasovni izlaz , ali vam je potrebno najbolje strukturirano razmišljanje.
Qwen3-Omni-30B-A3B- Captioner je profinjena izvedenica visokopreciznog titlovanja zvuka s niskom hiperaktivnošću . Otvorenog je koda, pokriva širok raspon zvuka s velikim detaljima i popunjava povijesnu prazninu u ekosustavu otvorenog koda: pouzdani i bogati titlovi za zvuk opće namjene.
Latencija, kontrola u stvarnom vremenu i kontrola ponašanja
Sustav je optimiziran za trenutnu interakciju, s vremenom odziva od približno 211 ms za audio i 507 ms za audio-video . Uz streaming, naglasak je stavljen na prirodne konverzacijske promjene i stabilnu glasovnu isporuku, uz pomoć jasnih uloga Mislioca (tekst) i Govornika (glas).
Za fino podešavanje, stil možete prilagoditi pomoću sistemskih uputa . U AV scenarijima gdje se video zvuk koristi kao referenca, tim predlaže sistemsku uputu koja održava razmišljanje Mislioca, a istovremeno pruža čitljiviji i razgovorniji tekst, što Govorniku olakšava tečni govor . Također se preporučuje da parametar `use_audio_in_video` ostane dosljedan tijekom višestrukog razgovora.
U evaluaciji postoje specifične smjernice: nemojte postavljati sistemski upitnik , slijedite ChatML format svakog benchmarka i, kada nema upitnika, koristite sljedeće prema zadanim postavkama: kineski ASR („请将这段中文语音转换为纯文本。“), ASR za druge jezike („Transkripcija zvuka u tekst.“), S2TT („Poslušajte priloženi <izvorni_jezik> govor…“) i tekst pjesme („ Transkripcija teksta pjesme“… bez interpunkcijskih znakova, retci odvojeni prekidima“).
Implementacija, zahtjevi i alati
Za potpuno lokalno iskustvo, tim preporučuje Hugging Face Transformers i pregled faza softverskog inženjerstva , ali imajte na umu: budući da je MoE arhitektura, može se sporo izvoditi s HF inferencijom; za produkcijske ili aplikacije s niskom latencijom , savjetuju korištenje vLLM-a ili DashScope API-ja , pa čak i pružaju Docker sliku koja uključuje okruženja za oba. Transformers kod je već spojen, ali PyPI paket još nije objavljen i mora se instalirati iz izvornog koda.
Pružaju uslužne programe za rukovanje zvukom i slikama/videom (base64, URL-ovi, isprepleteni ulazi) i preporučuju FlashAttention 2 s Transformersima za smanjenje GPU memorije pri svakom učitavanju u float16 ili bfloat16 . S vLLM-om, FlashAttn2 je uključen, a parametri poput limit_mm_per_prompt (unaprijed dodjeljuje GPU memoriju) i max_num_seqs za paralelizam detaljno su opisani ; osim toga, povećanje tensor_parallel_size omogućuje zaključivanje o više GPU-ova.
Postoji nekoliko korisnih savjeta za uštedu resursa: ako vam ne treba zvuk, možete onemogućiti Talker nakon inicijalizacije, čime ćete uštedjeti otprilike 10 GB VRAM-a. A ako želite brži ispis teksta, upotrijebite `return_audio=False` tijekom generiranja. Također su navedeni minimalni teorijski memorijski zahtjevi za BF16 s FlashAttn2: na primjer, Instruct 30B-A3B koristi otprilike 78,9 GB s 15 sekundi videa i 144,8 GB sa 120 sekundi; Thinking koristi otprilike 68,7 GB odnosno 131,7 GB.
Za postavljanje lokalne web demo verzije , preporučuju pripremu vašeg vLLM okruženja (ili sporijeg Transformers okruženja), osiguranje da imate instaliran ffmpeg i korištenje njihovih skripti. Nude Docker slike "qwenllm/qwen3-omni" spremne za GPU s NVIDIA Container Toolkitom , mapiranjem portova (npr. host 8901 → container 80) i mogućnošću posluživanja od 0.0.0.0. Možete ponovno unijeti ili izbrisati kontejner po potrebi.
Demo verzije, API-ji i ekosustav
Ako ne želite implementirati lokalno, možete isprobati demo verzije na Hugging Face Spaces i ModelScope Studio , s iskustvima za Qwen3-Omni-Realtime, Instruct, Thinking i Captioner. Dostupan je i Qwen Chat sa streamingom u stvarnom vremenu: jednostavno odaberite opciju glasovnog/video poziva u sučelju.
Za skalabilnu integraciju s niskom latencijom, preporučeni pristup je DashScope API , koji nudi najpredvidljivije performanse. Nadalje, zajednica koordinira putem kanala poput Discorda i WeChata te objavljuje kuharice sa stvarnim zapisnicima izvršavanja koji korisnicima omogućuju reprodukciju rezultata promjenom upita ili modela.
Plan i kontinuirana poboljšanja
Tim radi na dodatnim značajkama kao što su prepoznavanje govora više govornika , OCR primijenjen na video, poboljšanja proaktivnog audiovizualnog učenja i bogatiji tijekovi rada agenata . Također su naznačili da će podrška za audio izlaz u vLLM-u za model Instruct uskoro biti dostupna, čime će se završiti ciklus implementacije u stvarnom vremenu iz tog backenda.
Često postavljana pitanja: Podrška za izvođenje i kvantizacija
Neki su korisnici komentirali da ne mogu pokrenuti Qwen3-Omni čak ni s uobičajenim osumnjičenicima te da ne vide kvantne vrijednosti u Hugging Faceu ; nadalje, izvorni 16-bitni format je oko 70 GB, veličina koja je problematična za skromnija računala. Sam projekt pojašnjava da je Transformers već spojen, ali bez PyPI paketa , koji se mora instalirati iz izvornog koda, te da je vLLM preferirana opcija za inferenciju, iako će podrška za Instruct audio u vLLM-u biti objavljena u bliskoj budućnosti.
Što se tiče kvantizacije, u HF-u još nema navedenih rezerviranih mjesta za Qwen3-Omni 30B-A3B, a vrijedi imati na umu da MoE i multimodalna priroda kompliciraju neposrednu kompatibilnost s okruženjima za izvođenje poput llama.cpp. Za one kojima je potrebno testiranje sada, službena preporuka je korištenje Dockera + Transformersa/vLLM-a iz izvornog koda ili API-ja te praćenje repozitorija za zahtjeve za podršku i buduće kvantizacije kada budu dostupne.
Dobre prakse i upute za evaluaciju
Za reprodukciju brojeva, detaljno su opisane sljedeće smjernice: većina mjerila koristi pohlepno dekodiranje u Instructu bez uzorkovanja, a za Thinking se moraju poštivati parametri u generation_config.json . Broj sličica u sekundi videozapisa također je postavljen na fps=2 tijekom evaluacije, a naznačeno je da korisnički upit treba slijediti multimodalne podatke osim ako skup podataka ne određuje drugačije.
Kada mjerilo ne uključuje upit, mogu se koristiti zadani upiti (kineski ASR/ostalo, S2TT, tekstovi pjesama). Osim toga, sistemski upit ne bi se trebao postavljati tijekom evaluacije kako bi se osigurala usporedivost rezultata među sustavima i prolazima.
Qwen3-Omni se pozicionira kao prava omnimodalna platforma, s niskom latencijom, širokom višejezičnom podrškom, vrhunskim audio i video mogućnostima te jasnim putem implementacije pomoću Transformersa, vLLM-a i Dockera. Za one koji traže jedinstveni model koji besprijekorno obrađuje tekst i slike bez žrtvovanja performansi, a koji također sluša, govori i razumije video , to je prijedlog koji je danas teško nadmašiti.
