- Natív omnimodális modell szöveggel, képpel, hanggal és videóval, valamint valós idejű streameléssel.
- SOTA 22/36 audio/video benchmarkban és többnyelvű (119/19/10 nyelven).
- Thinker–Talker architektúra MoE-vel, alacsony késleltetéssel és rendszergyors vezérléssel.
- Ajánlott telepítés vLLM/Transformers, Docker és hivatalos segédprogramok használatával.
A Qwen3-Omni érkezése megváltoztatta a mesterséges intelligencia képét: egyetlen natív modell jelenik meg, amely képes megérteni és reagálni a szövegre, képekre, hanganyagokra és videókra , menet közbeni válaszokkal mind írásban, mind szóban. Nem multimodális „javításokról” beszélünk, hanem egy alapvetően tervezett architektúráról, amely alacsony késleltetésű és finomhangolt viselkedésvezérlésű modalitásokat integrál.
Egy olyan időszakban, amikor szinte mindenki chatbotokat és asszisztenseket tesztel, a Qwen3-Omni ambiciózusan érkezik: 119 nyelvet támogat szöveges üzenetküldésen keresztül, 19 nyelven ismeri fel a beszédet és 10 nyelven beszél , megérti a hosszú hanganyagokat (akár 30 percig), és több tucat tesztben is kiemelkedő eredményeket ért el. Továbbá a Thinker-Talker kialakítása és a Mixture of Experts megközelítése a válaszadási sebességet és az érvelés minőségét célozza meg valós helyzetekben.
Mi az a Qwen3-Omni és mit kínál?
A Qwen3-Omni egy alapvető, omnimodális és teljes körű többnyelvű modellekből álló család, amelyet szöveg, képek, hanganyagok és videók feldolgozására terveztek, szöveges és természetes beszéd kimenettel. A kulcs nemcsak a bemenetek és kimenetek sokféleségében rejlik, hanem a folyamatos beszélgetési fordulatokat és az azonnali reagálási képességet kínáló streamelési funkciójában is.
A csapat számos architekturális fejlesztést vezetett be a teljesítmény és a hatékonyság növelése érdekében: korai „szöveg-először” előtanítás kombinálva vegyes multimodális betanítással, valamint egy olyan tervezést, amely a szakértők keverékét (MoE) alkalmazza, és megőrzi teljesítményét szöveg és kép esetén, miközben feljavítja a hang és a videó minőségét. Ezekkel a fejlesztésekkel a modell 36 audio/video benchmarkból 22-ben eléri a SOTA minősítést, 36-ból pedig a nyílt forráskódú SOTA minősítést, az eredmények pedig összehasonlíthatók a Gemini 2.5 Pro-val az ASR, a hangértés és a beszédbeszélgetés terén.

Kulcsfontosságú képességek és módozatok
A Qwen3-Omni készen áll a valós audio-, vizuális és audiovizuális alkalmazásokra, kiterjedt többnyelvű támogatással: 119 szövegnyelv, 19 hangbeviteli nyelv és 10 hangkimeneti nyelv . A hangbeviteli nyelvek közé tartozik az angol, kínai, koreai, japán, német, orosz, olasz, francia, spanyol, portugál, maláj, holland, indonéz, török, vietnami, kantoni, arab és urdu; a kimeneti nyelvek pedig többek között az angol, kínai, francia, német, orosz, olasz, spanyol, portugál, japán és koreai.
A hivatalos szakácskönyvek gyűjteménye jól mutatja a felhasználási lehetőségek széles skáláját. Hanganyagok terén bemutatja a többnyelvű és hosszú hanganyagok beszédfelismerését (ASR) , a beszéd szöveggé és beszéd beszéddé alakítását, a zeneelemzést (stílus, ritmus, műfajok), a hangeffektusok leírását és bármilyen hanganyag feliratozását . Támogatja a számok beszéddel, zenével és környezeti hangokkal történő vegyes elemzését is.
Látástechnikában „kemény” OCR-t kínál összetett képekhez, objektumészlelést és földelést , képminőség-ellenőrzést, képmatematikai megoldásokat (ahol a gondolkodási modell ragyog), videóleírást, első személyű videóalapú navigációt és jelenetátmenet-elemzést . Audiovizuális forgatókönyvekben időillesztéses audio-video minőségellenőrzést, AV-bemenetekkel való irányított interakciót és az asszisztens viselkedésével folytatott párbeszédeket mutat be.
Ügynökként kiemelkedik azzal, hogy képes hanghívásokat kezdeményezni , amelyek eszközöket aktiváló hangalapú munkafolyamatokat nyitnak meg, a származtatott feladatokban pedig egy Omni-Captioner található a részletes feliratozáshoz, ami az alapfelirat általánosíthatóságát demonstrálja.
Gondolkodó-beszélő Építészet és Design az Oktatási Minisztériummal
Az egyik legfontosabb megkülönböztető tényező a felelősségek szétválasztása: a Gondolkodó generálja a szöveget (olyan variációkkal, amelyek explicit gondolatlánc-következtetést is tartalmaznak), míg a Beszélő valós idejű hangot állít elő . Ez a szétválasztás természetes hangalapú beszélgetést tesz lehetővé, miközben a rendszer magas szintű szövegértést és tervezést tart fenn.
Az MoE adatbázis elosztja a munkaterhelést a szakértők között, és az AuT előtanítására támaszkodik a hatékony általános reprezentációk érdekében. Továbbá a többkódos kódolás használata az audiocsatornában minimálisra csökkenti a késleltetést, ami kulcsfontosságú a hívások vagy az asszisztensek esetében, ahol minden századmásodperc számít.
Teljesítmény és referenciaértékek: szöveg, kép, hang és audiovizuális
A Qwen3-Omni élvonalbeli szöveg- és képteljesítményt nyújt anélkül, hogy ez a hasonló méretű, egyetlen módra fókuszáló Qwen modellekhez képest romlana, míg audio- és audiovizuális teljesítmény terén a legtöbb tesztben diktálja az iramot . A 36 audio- és audiovizuális benchmarkból álló tesztsorozatban 32-ben elérte a nyílt forráskódú SOTA-t és 22-ben a teljes SOTA-t, számos ponton meghaladva a Gemini 2.5 Pro-t és a GPT-4o-t.
Néhány figyelemre méltó mérföldkő a szövegben: az AIME25 -ben a Flash-Instruct variáns körülbelül 65,9 pontot ér el; a ZebraLogicban az Instruct eléri a 90-es értéket, a MultiPL-E -ben pedig versenyképes eredményeket ér el a GPT-4o-val szemben. Az olyan igazítási feladatokban, mint az IFEval és a WritingBench, az Instruct és a Thinking modellek magas és konzisztens pontszámokat mutatnak.
Hanganyag tekintetében a kínai és angol nyelvű ASR-eredmények kiválóak: a WenetSpeech és a LibriSpeech nyelvekben jelentősen csökkenti a szóhibaarányt, közel 1,22/2,48-as értékekkel a LibriSpeech tiszta/egyéb nyelvekben, és olyan készletekben, mint a FLEURS (többnyelvű), nagyon alacsony arányokat kínál. A VoiceBenchben az olyan metrikák, mint az AlpacaEval, a CommonEval és a WildVoice, a Qwen3-Omni-t a zárt vonatkoztatási rendszerekkel egyenrangúnak tekintik, és az MMAU v05.15.25- ben a hangos érvelésben is kiemelkedően teljesít.
Az audiovizuális alkalmazásokban a leggyakrabban idézett mutató a WorldSense (körülbelül 54,1 ), meghaladva a Gemini-2.5-Flash-t. Továbbá olyan csomagokban, mint a DailyOmni és a VideoHolmes, a Thinking változat javulást ér el a korábbi nyílt forráskódú SOTA alkalmazásokhoz képest. A tiszta látás terén kiemelkedően teljesít MMMU, MathVista, MathVision és dokumentumértelmezés (AI2D, ChartQA) területeken, nagyon jó pontszámokkal a számolás (CountBench) és a videóértés (Video-MME, MLVU) terén.
A nullapontos hanggenerálást is mérték: a CosyVoice és a Seed-TTShez hasonló családokhoz képest a Qwen3-Omni jobb tartalomkonzisztenciát mutat több nyelven, és magas a beszélők hasonlósága . A többnyelvű részben a „Tartalomkonzisztencia” és a „Hangszórók hasonlósága” táblázatok azt mutatják, hogy a Qwen3-Omni 30B-A3B nagyon versenyképes kínai és angol nyelven, és szilárdan teljesít német, olasz, portugál, spanyol, japán, koreai, francia és orosz nyelven. A többnyelvű TTS- ben jobb WER/konzisztenciát ér el több nyelvpáron (pl. zh→en, ja→en, ko→zh) a CosyVoice 2/3-hoz képest.
Elérhető modellek és mire használják őket
A Qwen3-Omni termékcsalád három fő elemet tartalmaz, amelyek mindegyikét egy adott felhasználási célra tervezték: Instruct , Thinking és Captioner . Mindegyik ugyanarra az alapra épül, de különböző képességekkel rendelkeznek, amelyeket adott feladatokhoz aktiválnak vagy finomhangolnak.
A Qwen3-Omni-30B-A3B- Instruct tartalmazza a Thinker és a Talker modulokat, hangot, videót és szöveget fogad , valamint szöveget és hangot ad vissza. Ez a megfelelő választás, ha teljes interakciót és valós idejű szóbeli eredményeket szeretne, és hang- vagy videós demókhoz ajánlott.
A Qwen3-Omni-30B-A3B- Gondolkodás kurzus a láncgondolkodásra összpontosít , támogatva a hang-, videó- és szöveges kimenetet. Hasznos mélyreható elemzésekhez, összetett problémák megoldásához, vizuális matematikához vagy olyan munkafolyamatokhoz, ahol nincs szükség hangkimenetre, de a legjobb strukturált gondolkodásra van szükség.
A Qwen3-Omni-30B-A3B- Captioner a nagy pontosságú, alacsony hiperaktivitású hangfeliratozás finomított változata . Nyílt forráskódú, a hanganyagok széles skáláját fedi le részletesen, és egy történelmi hiányt pótol a nyílt forráskódú ökoszisztémában: megbízható és gazdag feliratozást kínál általános célú hanganyagokhoz.
Latencia, valós idejű és viselkedésbeli kontroll
A rendszer azonnali interakcióra van optimalizálva, körülbelül 211 ms válaszidővel hang esetén és 507 ms-os hang-videó válaszidővel . A streamelés mellett a hangsúly a természetes beszélgetési fordulatokon és a stabil hangátvitelen van, amit a Gondolkodó (szöveg) és a Beszélő (hang) egyértelmű szerepei is segítenek.
A finomhangoláshoz testreszabhatja a stílust rendszerpromptokkal . Azokban az audiovizuális forgatókönyvekben, ahol a videó hangját referenciaként használják, a csapat egy olyan rendszerpromptot javasol, amely megőrzi a Gondolkodó érvelését, miközben olvashatóbb és társalgásibb szöveget biztosít, megkönnyítve a Beszélő számára a folyékony beszédet . Azt is javasoljuk, hogy a `use_audio_in_video` paramétert konzisztensen tartsa a többfordulós beszélgetés során.
A kiértékelés során konkrét irányelvek vannak: ne állítson be rendszerkérést , kövesse az egyes benchmarkok ChatML formátumát, és ha nincs kérdőív, használja alapértelmezés szerint a következőket: kínai ASR („请将这段中文语音转换为纯文本。”), egyéb nyelvű ASR („Hang átírása szöveggé.”), S2TT („Hallgassa meg a megadott <forrásnyelv> beszédet…”), és dalszöveg („ Dalszöveg átírása ” … írásjelek nélkül, sortöréssel elválasztva”).
Telepítés, követelmények és eszközök
A teljes körű helyi élmény érdekében a csapat a Hugging Face Transformers használatát és a szoftverfejlesztési fázisok áttekintését ajánlja , de vegye figyelembe: mivel MoE architektúra, HF következtetéssel lassan futhat; éles vagy alacsony késleltetésű alkalmazásokhoz a vLLM vagy a DashScope API használatát javasolják , sőt, egy Docker képet is biztosítanak, amely mindkettőhöz tartalmaz környezetet. A Transformers kódot már egyesítették, de a PyPI csomagot még nem adták ki , és forrásból kell telepíteni.
Segédprogramokat biztosítanak a hang és kép/videó (base64, URL-ek, összefonódó bemenetek) kezelésére, és a FlashAttention 2 Transformers használatát ajánlják a GPU-memória csökkentéséhez float16 vagy bfloat16 esetén . A vLLM esetében a FlashAttn2 benne van, és a párhuzamossághoz szükséges paraméterek, mint például a limit_mm_per_prompt (a GPU-memória előzetes lefoglalása) és a max_num_seqs részletesen szerepelnek ; továbbá a tensor_parallel_size növelése lehetővé teszi a több GPU-s következtetést.
Van néhány hasznos tipp az erőforrás-megtakarításhoz: ha nincs szüksége hangra, az inicializálás után letilthatja a Talkert , ami körülbelül 10 GB VRAM-ot takarít meg. Ha pedig gyorsabb szövegkimenetet szeretne, a generálás során használja a `return_audio=False` beállítást . A BF16 és a FlashAttn2 minimális elméleti memóriakövetelményeit is megadjuk: például az Instruct 30B-A3B körülbelül 78,9 GB-ot használ 15 másodperc videóval és 144,8 GB-ot 120 másodperccel; a Thinking körülbelül 68,7 GB-ot, illetve 131,7 GB-ot.
Egy helyi webes demó beállításához azt javasolják, hogy készítsd elő a vLLM környezetedet (vagy a lassabb Transformers környezetet), győződj meg róla, hogy telepítve van az ffmpeg , és használd a szkriptjeiket. GPU-kész Docker képeket kínálnak: „qwenllm/qwen3-omni” az NVIDIA Container Toolkittel , portleképezést (pl. host 8901 → container 80), és a 0.0.0.0-ról történő kiszolgálás lehetőségét. Szükség szerint újra megadhatod vagy törölheted a konténert.
Demók, API-k és ökoszisztéma
Ha nem szeretnél helyben telepíteni, kipróbálhatod a Hugging Face Spaces és a ModelScope Studio demóit , amelyekben tapasztalatokat találsz a Qwen3-Omni-Realtime, az Instruct, a Thinking és a Captioner platformokon. A Qwen Chat valós idejű streameléssel is elérhető: egyszerűen válaszd ki a hang-/videohívás lehetőséget a felületen.
A skálázható, alacsony késleltetésű integrációhoz az ajánlott megközelítés a DashScope API , amely a leginkább kiszámítható teljesítményt kínálja. Továbbá a közösség olyan csatornákon keresztül koordinál, mint a Discord és a WeChat , és valós végrehajtási naplókkal ellátott szakácskönyveket tesz közzé, amelyek lehetővé teszik a felhasználók számára az eredmények reprodukálását a promptok vagy modellek módosításával.
Ütemterv és folyamatos fejlesztések
A csapat további funkciókon dolgozik, mint például a többbeszélős beszédfelismerés , a videókhoz alkalmazott OCR, a proaktív audiovizuális tanulás fejlesztései és a gazdagabb ügynöki munkafolyamatok . Azt is jelezték, hogy hamarosan elérhető lesz a vLLM hangkimeneti támogatása az Instruct modellhez , ezzel lezárva a valós idejű telepítési ciklust erről a háttérrendszerről.
GYIK: Futásidejű támogatás és kvantálás
Néhány felhasználó megjegyezte, hogy még a szokásos gyanúsítottakkal sem tudják futtatni a Qwen3-Omni-t, és hogy nem látnak kvantumokat a Hugging Face-ben ; továbbá a natív 16 bites formátum körülbelül 70 GB, ami problémás a szerényebb számítógépek számára. Maga a projekt tisztázza, hogy a Transformers már össze van vonva, de a PyPI csomag nélkül , amelyet a forrásból kell telepíteni, és hogy a vLLM az előnyben részesített opció a következtetéshez, bár az Instruct audio támogatása a vLLM-ben a közeljövőben megjelenik.
A kvantálást illetően a HF-ben még nincsenek helyőrzők felsorolva a Qwen3-Omni 30B-A3B-hez, és érdemes megjegyezni, hogy az MoE és a multimodális jelleg bonyolítja az azonnali kompatibilitást olyan futtatókörnyezetekkel, mint a llama.cpp. Azok számára, akiknek most kell tesztelniük, a hivatalos ajánlás a Docker + Transformers/vLLM forráskódú vagy API-s verziójának használata , és a repository figyelése a támogatott pull requestek és a jövőbeli kvantálások miatt , amikor azok elérhetővé válnak.
Jó értékelési gyakorlatok és kérdések
A számok reprodukálásához a következő részletes irányelveket ismertetjük: a legtöbb benchmark mohó dekódolást használ Instruct nyelven mintavételezés nélkül, Thinking esetén pedig a generation_config.json fájlban található paramétereket kell figyelembe venni . A videó képkockasebessége a kiértékelés során szintén fps=2 -re van állítva, és jelezve van, hogy a felhasználói promptnak a multimodális adatokat kell követnie, kivéve, ha az adathalmaz másképp rendelkezik.
Ha egy benchmark nem tartalmaz promptot, akkor az alapértelmezett promptok használhatók (kínai ASR/egyéb, S2TT, dalszövegek). Ezenkívül a rendszerpromptot nem szabad beállítani a kiértékelés során, hogy az eredmények összehasonlíthatók legyenek a rendszerek és futtatások között.
A Qwen3-Omni egy valódi omnimodális platformként pozicionálja magát, alacsony késleltetéssel, széleskörű többnyelvű támogatással, élvonalbeli audio- és videoképességekkel , valamint a Transformers, vLLM és Docker használatával egyértelmű telepítési útvonallal. Azok számára, akik egyetlen modellt keresnek, amely zökkenőmentesen kezeli a szöveget és a képeket a teljesítmény feláldozása nélkül, és amely a videókat is figyeli, beszél és megérti , ez egy olyan ajánlat, amelyet ma már nehéz felülmúlni.
