Qwen3-Omni: Vše, co potřebujete vědět o omnimodálním modelu

Poslední aktualizace: 24 září 2025
  • Nativní omnimodální model s textem, obrázky, zvukem a videem a streamováním v reálném čase.
  • SOTA v 22/36 audio/video benchmarkech a vícejazyčná (119/19/10 jazyků).
  • Architektura Thinker–Talker s MoE, nízkou latencí a systémovým řízením pomocí prompts.
  • Doporučené nasazení s vLLM/Transformers, Dockerem a oficiálními utilitami.

Omnimodální model Qwen3-Omni

Příchod Qwen3-Omni změnil pohled na umělou inteligenci: jeden nativní model schopný rozumět textu, obrázkům, zvuku a videu a reagovat na ně , s okamžitými odpověďmi v písemné i mluvené podobě. Nemluvíme o multimodálních „záplatách“, ale spíše o zásadně navržené architektuře pro integraci modalit s nízkou latencí a jemně vyladěnou kontrolou chování.

V době, kdy téměř každý testuje chatboty a asistenty, přichází Qwen3-Omni s ambicemi: podporuje 119 jazyků prostřednictvím textu, rozpoznává řeč v 19 jazycích a mluvení v 10 jazycích , rozumí dlouhému zvuku (až 30 minut) a pyšní se benchmarkovým skóre v desítkách testů. Jeho design Thinker-Talker a přístup Mixture of Experts navíc cílí na rychlost odezvy a kvalitu uvažování v reálných scénářích.

gpt-5-0
Související článek:
GPT-5: Vše o další velké revoluci v umělé inteligenci

Co je Qwen3-Omni a co nabízí?

Qwen3-Omni je rodina základních, omnimodálních a komplexních vícejazyčných modelů určených pro zpracování textu, obrázků, zvuku a videa s výstupem v textové i přirozené řeči. Klíčem je nejen rozmanitost vstupů a výstupů, ale také streamovací funkce s plynulými konverzačními obraty a schopností okamžitě reagovat.

Tým zavedl několik architektonických vylepšení pro zvýšení výkonu a efektivity: včasné předtrénování „text-first“ v kombinaci se smíšeným multimodálním tréninkem a návrh se směsí expertů (MoE), který si zachovává výkon v textu a obrazu a zároveň vylepšuje zvuk a video. Díky těmto vylepšením model dosahuje SOTA ve 22 z 36 audio/video benchmarků a SOTA s otevřeným zdrojovým kódem ve 32 z 36, s výsledky srovnatelnými s Gemini 2.5 Pro v ASR, porozumění zvuku a řečové konverzaci.

Multimodální interakce Qwen3-Omni

Klíčové schopnosti a modality

Qwen3-Omni je připraven pro reálné audio, video a audiovizuální aplikace s rozsáhlou vícejazyčnou podporou: 119 textových jazyků, 19 jazyků hlasového vstupu a 10 jazyků hlasového výstupu . Mezi jazyky hlasového vstupu patří angličtina, čínština, korejština, japonština, němčina, ruština, italština, francouzština, španělština, portugalština, malajština, holandština, indonéština, turečtina, vietnamština, kantonština, arabština a urdština; a mezi výstupní jazyky patří mimo jiné angličtina, čínština, francouzština, němčina, ruština, italština, španělština, portugalština, japonština a korejština.

Sada oficiálních kuchařek ilustruje šíři jeho využití. V oblasti audia nabízí vícejazyčné a dlouhé rozpoznávání řeči (ASR) , převod řeči na text a z řeči na řeč, analýzu hudby (styl, rytmus, žánry), popis zvukových efektů a titulkování jakéhokoli zvuku . Podporuje také smíšenou analýzu stop s řečí, hudbou a okolními zvuky.

V oblasti vidění nabízí „hard“ OCR pro komplexní obrazy, detekci a uzemnění objektů , kontrolu kvality obrazu, řešení matematických úloh v obrazech (kde vyniká model myšlení), popis videa, navigaci z pohledu první osoby a analýzu přechodů mezi scénami . V audiovizuálních scénářích demonstruje kontrolu kvality zvuku a videa s časovým zarovnáním, řízenou interakcí s AV vstupy a dialogy s chováním asistenta.

Jako agent vyniká svou schopností volat ze zvuku , což otevírá hlasové pracovní postupy aktivující nástroje, a v odvozených úlohách je k dispozici Omni-Captioner pro titulkování s velkým detailem, což demonstruje zobecnitelnost základního nástroje.

  Co je React? Kompletní vysvětlení přední knihovny pro vývoj webových stránek

Architektura a design myslitele a řečníka s MoE

Jedním z klíčových rozlišovacích znaků je oddělení odpovědností: Myslitel generuje text (s variacemi, které zahrnují explicitní myšlenkový řetězec) a Mluvící produkuje zvuk v reálném čase . Toto oddělení umožňuje přirozenou hlasovou konverzaci, zatímco systém si udržuje vysokou úroveň porozumění textu a plánování.

Databáze MoE rozděluje pracovní zátěž mezi experty a pro efektivní obecné reprezentace se spoléhá na předběžné trénování AuT. Použití vícekódového kódování v audio kanálu navíc minimalizuje latenci, což je klíčové pro hovory nebo asistenty, kde se počítá každá setina sekundy.

Výkon a benchmarky: text, obraz, zvuk a audiovizuální technika

Qwen3-Omni si udržuje špičkový textový a obrazový výkon bez zhoršení ve srovnání s podobně velkými modely Qwen zaměřenými na jeden režim, zatímco v oblasti zvukového a audiovizuálního výkonu udává tempo ve většině testů . V sadě 36 zvukových a audiovizuálních benchmarků dosahuje open-source SOTA ve 32 bodech a celkové SOTA ve 22 bodech, čímž v několika bodech překonává Gemini 2.5 Pro a GPT-4o.

Některé významné milníky v textu: v AIME25 dosahuje varianta Flash-Instruct skóre kolem 65,9; v ZebraLogic dosahuje Instruct 90 a v MultiPL-E dosahuje konkurenceschopných hodnot s GPT-4o. V úlohách zarovnání, jako jsou IFEval a WritingBench, vykazují modely Instruct a Thinking vysoké a konzistentní skóre.

V oblasti audia jsou výsledky ASR pro čínštinu a angličtinu vynikající: ve WenetSpeech a LibriSpeech výrazně snižuje míru chybovosti slov, s hodnotami blízkými 1,22/2,48 v LibriSpeech clean/other, a v sadách jako FLEURS (vícejazyčné) nabízí velmi nízké míry. Ve VoiceBench metriky jako AlpacaEval, CommonEval a WildVoice řadí Qwen3-Omni na roveň uzavřeným referenčním systémům a v MMAU v05.15.25 vyniká v oblasti audio uvažování.

V audiovizuálních aplikacích je nejčastěji uváděnou metrikou WorldSense (přibližně 54,1 ), která překonává Gemini-2.5-Flash. Navíc v sadách jako DailyOmni a VideoHolmes dosahuje varianta Thinking zlepšení oproti předchozím open-source SOTA aplikacím. V oblasti čistého vidění vyniká v MMMU, MathVista, MathVision a porozumění dokumentům (AI2D, ChartQA), s velmi dobrými skóre v počítání (CountBench) a porozumění videu (Video-MME, MLVU).

Byla také měřena generace hlasu s nulovým počtem hlasových signálů: ve srovnání s rodinami jako CosyVoice a Seed-TTS vykazuje Qwen3-Omni lepší konzistenci obsahu napříč více jazyky a vysokou podobnost mluvčích . V vícejazyčné sekci tabulky „Konzistence obsahu“ a „Podobnost mluvčích“ ukazují, že Qwen3-Omni 30B-A3B je velmi konkurenceschopný v čínštině a angličtině a solidní v němčině, italštině, portugalštině, španělštině, japonštině, korejštině, francouzštině a ruštině. V mezijazyčném TTS dosahuje lepších WER/konzistencí napříč několika páry (např. zh→en, ja→en, ko→zh) ve srovnání s CosyVoice 2/3.

Dostupné modely a k čemu se každý z nich používá

Řada Qwen3-Omni zahrnuje tři hlavní části, z nichž každá je navržena pro specifické použití: Instruct , Thinking a Captioner . Všechny vycházejí ze stejného jádra, ale s různými funkcemi aktivovanými nebo vyladěnými pro specifické úkoly.

Qwen3-Omni-30B-A3B- Instruct obsahuje Thinker a Talker, přijímá audio, video a text a vrací text i audio. Je to správná volba, pokud chcete plnou interakci a mluvené výsledky v reálném čase, a doporučuje se pro hlasové nebo video demonstrace .

Qwen3-Omni-30B-A3B- Thinking se zaměřuje na myslitele s řetězovým uvažováním a podporuje zvuk, video a text s textovým výstupem. Je užitečný pro hloubkovou analýzu, řešení složitých problémů, vizuální matematiku nebo pracovní postupy, kde nepotřebujete hlasový výstup, ale potřebujete co nejlépe strukturované myšlení.

  Právní a občanskoprávní odpovědnost ve věku umělé inteligence

Qwen3-Omni-30B-A3B- Captioner je vylepšená odvozenina vysoce přesných titulků pro audio s nízkou hyperaktivitou . Je open source, pokrývá širokou škálu zvuku s velkým detailem a vyplňuje historickou mezeru v ekosystému open source: spolehlivé a bohaté titulky pro univerzální zvuk.

Latence, reálný čas a kontrola chování

Systém je optimalizován pro okamžitou interakci s dobou odezvy přibližně 211 ms pro zvuk a 507 ms pro audio-video . Kromě streamování je kladen důraz na přirozené konverzační obraty a stabilní hlasový projev, čemuž napomáhají jasné role Myslitele (text) a Mluvčího (hlas).

Pro jemné doladění si můžete styl přizpůsobit pomocí systémových pokynů . V autonomních video scénářích, kde se video a zvuk používá jako reference, tým navrhuje systémový pokyn, který zachovává uvažování Myslitele a zároveň poskytuje čitelnější a konverzační text, což Mluvčímu usnadňuje plynulý projev . Doporučuje se také zachovat parametr `use_audio_in_video` konzistentní v průběhu vícenásobné konverzace.

Při hodnocení existují specifická pravidla: nenastavujte systémový prompt , dodržujte formát ChatML každého benchmarku a pokud žádný prompt není k dispozici, použijte ve výchozím nastavení následující: čínský ASR („请将这段中文语音转换为纯文本。“), ASR ostatní jazyky („Přepis zvuku do textu.“), S2TT („Poslechněte si poskytnutou řeč <zdrojový_jazyk>…“) a text písně („ Přepis textu písně“ … bez interpunkce, řádky oddělené zalomením“).

Nasazení, požadavky a nástroje

Pro kompletní lokální zážitek tým doporučuje Hugging Face Transformers a zopakování fází softwarového inženýrství , ale mějte na paměti: jelikož se jedná o architekturu MoE, může běžet pomalu s HF inferencí; pro produkční aplikace nebo aplikace s nízkou latencí doporučují použít vLLM nebo DashScope API a dokonce poskytují obraz Dockeru, který obsahuje prostředí pro obě. Kód Transformers již byl sloučen, ale balíček PyPI ještě nebyl vydán a je nutné jej nainstalovat ze zdrojového kódu.

Poskytují nástroje pro práci se zvukem a obrázky/videem (base64, URL, prokládané vstupy) a doporučují FlashAttention 2 s Transformers pro snížení paměti GPU při načítání ve float16 nebo bfloat16 . U vLLM je zahrnut FlashAttn2 a jsou podrobně popsány parametry jako limit_mm_per_prompt (předalokuje paměť GPU) a max_num_seqs pro paralelismus ; navíc zvýšení tensor_parallel_size umožňuje inferenci pro více GPU.

Existuje několik užitečných tipů pro úsporu zdrojů: pokud nepotřebujete zvuk, můžete po inicializaci vypnout Talker , čímž ušetříte přibližně 10 GB VRAM. A pokud chcete rychlejší textový výstup, použijte během generování parametr `return_audio=False` . Jsou také uvedeny minimální teoretické požadavky na paměť pro BF16 s FlashAttn2: například Instruct 30B-A3B používá přibližně 78,9 GB s 15 sekundami videa a 144,8 GB se 120 sekundami; Thinking používá přibližně 68,7 GB a 131,7 GB.

Pro nastavení lokální webové demoverze doporučují připravit prostředí vLLM (nebo pomalejší prostředí Transformers), ujistit se, že máte nainstalovaný ffmpeg , a použít jejich skripty. Nabízejí obrazy Dockeru „qwenllm/qwen3-omni“ připravené pro GPU s NVIDIA Container Toolkit , mapováním portů (např. hostitel 8901 → kontejner 80) a možností obsluhovat od 0.0.0.0. Kontejner můžete v případě potřeby znovu zadat nebo smazat.

Dema, API a ekosystém

Pokud nechcete implementovat lokální prostředí, můžete si vyzkoušet dema na Hugging Face Spaces a ModelScope Studio s funkcemi pro Qwen3-Omni-Realtime, Instruct, Thinking a Captioner. K dispozici je také Qwen Chat se streamováním v reálném čase: jednoduše v rozhraní vyberte možnost hlasového/videohovoru .

  Jak funguje algoritmus Quantum Echoes od Googlu

Pro škálovatelnou integraci s nízkou latencí se doporučuje rozhraní DashScope API , které nabízí nejpředvídatelnější výkon. Komunita dále koordinuje činnost prostřednictvím kanálů, jako jsou Discord a WeChat , a publikuje kuchařky se skutečnými protokoly provádění, které uživatelům umožňují reprodukovat výsledky změnou výzev nebo modelů.

Plán a průběžná vylepšení

Tým pracuje na dalších funkcích, jako je rozpoznávání řeči více mluvčích , OCR aplikované na video, vylepšení proaktivního audiovizuálního učení a bohatší pracovní postupy agentů . Také uvedli, že podpora zvukového výstupu ve vLLM pro model Instruct bude brzy k dispozici, čímž se dokončí cyklus nasazení v reálném čase z tohoto backendu.

Často kladené otázky: Podpora a kvantizace za běhu

Někteří uživatelé poznamenali, že nemohou spustit Qwen3-Omni ani s obvyklými podezřelými a že v Hugging Face nevidí kvantové funkce ; navíc nativní 16bitový formát má velikost okolo 70 GB, což je velikost, která je problematická pro skromnější počítače. Samotný projekt objasňuje, že Transformers je již začleněn, ale bez balíčku PyPI , který je nutné nainstalovat ze zdrojového kódu, a že vLLM je preferovanou volbou pro inferenci, ačkoli podpora zvuku Instruct ve vLLM bude vydána v blízké budoucnosti.

Pokud jde o kvantizaci, v HF zatím nejsou uvedeny žádné zástupné symboly pro Qwen3-Omni 30B-A3B a je třeba si uvědomit, že povaha MoE a multimodální verze komplikuje okamžitou kompatibilitu s běhovými prostředími, jako je llama.cpp. Pro ty, kteří potřebují testovat nyní, je oficiálním doporučením používat Docker + Transformers/vLLM ze zdrojového kódu nebo API a sledovat repozitář, zda neobsahuje žádosti o podporu a budoucí kvantizace , až budou k dispozici.

Dobré postupy a podněty pro hodnocení

Pro reprodukci čísel jsou podrobně popsány následující pokyny: většina benchmarků používá v Instructu hladové dekódování bez vzorkování a pro Thinking je nutné respektovat parametry v generation_config.json . Snímková frekvence videa je během vyhodnocování také nastavena na fps=2 a je uvedeno, že uživatelská výzva by měla následovat po multimodálních datech, pokud datová sada neurčuje jinak.

Pokud benchmark neobsahuje výzvu, lze použít výchozí výzvy (čínský ASR/jiné, S2TT, texty písní). Systémová výzva by se navíc neměla nastavovat během vyhodnocování, aby se zajistila srovnatelnost výsledků napříč systémy a běhy.

Qwen3-Omni se prezentuje jako skutečně omnimodální platforma s nízkou latencí, širokou vícejazyčnou podporou, špičkovými audio a video funkcemi a jasnou cestou nasazení pomocí Transformers, vLLM a Dockeru. Pro ty, kteří hledají jeden model, který bezproblémově zpracovává text a obrázky bez kompromisů ve výkonu a zároveň poslouchá, mluví a rozumí videu , je to dnes těžko překonatelná nabídka.