Qwen3-Omni: Viskas, ką reikia žinoti apie omnimodalinį modelį

Paskutiniai pakeitimai: rugsėjo 24 d. 2025 m.
  • Gimtoji omnimodalinė sistema su tekstu, vaizdais, garsu ir vaizdo įrašais bei transliacija realiuoju laiku.
  • SOTA 22/36 garso/vaizdo testuose ir daugiakalbėje kalboje (119/19/10 kalbų).
  • „Thinker-Talker“ architektūra su MoE, mažu delsos laiku ir sistemos greitu valdymu.
  • Rekomenduojamas diegimas naudojant vLLM/Transformers, Docker ir oficialias programas.

Qwen3-Omni omnimodalinis modelis

„Qwen3-Omni“ atsiradimas pakeitė dirbtinio intelekto kraštovaizdį: atsirado vienas vietinis modelis, galintis suprasti ir reaguoti į tekstą, vaizdus, ​​garso ir vaizdo įrašus , teikiantis momentinius atsakymus tiek rašytine, tiek žodine forma. Kalbame ne apie multimodalinius „pataisus“, o apie iš esmės sukurtą architektūrą, skirtą integruoti modalumus su mažu delsos laiku ir tiksliai suderinta elgesio kontrole.

Tuo metu, kai beveik visi testuoja pokalbių robotus ir asistentus, „Qwen3-Omni“ pasirodo su ambicijomis: palaiko 119 kalbų teksto perdavimu, atpažįsta kalbą 19 kalbų ir kalba 10 kalbų , supranta ilgus garso įrašus (iki 30 minučių) ir gali pasigirti lyginamaisiais balais dešimtyse testų. Be to, jo „Thinker-Talker“ dizainas ir „Mixture of Experts“ metodas siekia greito reagavimo ir kokybiško samprotavimo realiose situacijose.

gpt-5-0
Susijęs straipsnis:
GPT-5: Viskas apie kitą didelę dirbtinio intelekto revoliuciją

Kas yra „Qwen3-Omni“ ir ką jis siūlo?

„Qwen3-Omni“ – tai pagrindinių, omnimodalinių ir visapusiškų daugiakalbių modelių šeima, skirta tekstui, vaizdams, garsui ir vaizdo įrašams apdoroti, o išvestis pateikiama tiek tekstu, tiek natūralia kalba. Svarbiausia ne tik įvesties ir išvesties įvairovė, bet ir srautinio perdavimo funkcija su sklandžiais pokalbių posūkiais ir galimybe nedelsiant reaguoti.

Komanda įdiegė keletą architektūrinių patobulinimų, skirtų našumui ir efektyvumui didinti: ankstyvą „pirmiausia tekstu“ parengiamąjį mokymą kartu su mišriu multimodaliniu mokymu ir dizainą su ekspertų mišiniu (MoE), kuris išlaiko našumą teksto ir vaizdo apdorojime, tuo pačiu pagerindamas garsą ir vaizdą. Dėl šių patobulinimų modelis pasiekia SOTA 22 iš 36 garso / vaizdo lyginamųjų testų ir atvirojo kodo SOTA 32 iš 36, o rezultatai, palyginti su „Gemini 2.5 Pro“, ASR, garso supratimo ir kalbos pokalbių rezultatais.

Qwen3-Omni multimodalinė sąveika

Pagrindinės galimybės ir būdai

„Qwen3-Omni“ yra paruoštas realaus pasaulio garso, vaizdo ir audiovizualinėms programoms, turėdamas platų daugiakalbių kalbų palaikymą: 119 teksto kalbų, 19 balso įvesties kalbų ir 10 balso išvesties kalbų . Balso įvesties kalbos: anglų, kinų, korėjiečių, japonų, vokiečių, rusų, italų, prancūzų, ispanų, portugalų, malajų, olandų, indoneziečių, turkų, vietnamiečių, kantoniečių, arabų ir urdu; o išvesties kalbos: anglų, kinų, prancūzų, vokiečių, rusų, italų, ispanų, portugalų, japonų, korėjiečių ir kt.

Oficialių kulinarijos knygų rinkinys iliustruoja platų jo panaudojimo spektrą. Garso srityje jis demonstruoja daugiakalbį ir ilgo garso kalbos atpažinimą (ASR) , kalbos pavertimą tekstu ir kalbos vertimą į kalbą, muzikos analizę (stilius, ritmas, žanrai), garso efektų aprašymą ir bet kokio garso subtitrų sudarymą . Jis taip pat palaiko mišrią takelių su kalba, muzika ir aplinkos garsais analizę.

Regėjimo srityje ji siūlo „griežtąjį“ OCR sudėtingiems vaizdams, objektų aptikimą ir įžeminimą , vaizdų kokybės užtikrinimą, matematinį vaizdų sprendimą (kur praverčia mąstymo modelis), vaizdo aprašymą, pirmojo asmens vaizdo įrašais pagrįstą navigaciją ir scenų perėjimo analizę . Audiovizualiniuose scenarijuose ji demonstruoja garso ir vaizdo kokybės užtikrinimą su laiko derinimu, valdomą sąveiką su AV įvestimis ir dialogus su asistento elgesiu.

Kaip agentas, jis išsiskiria savo gebėjimu skambinti iš garso , kuris atidaro balso darbo eigas, aktyvuojančias įrankius, o išvestinėse užduotyse yra „ Omni-Captioner“, skirtas detaliems subtitrams, o tai rodo pagrindinio subtitro apibendrinamumą.

  Kometa: „Perplexity“ navigatorius, keičiantis dirbtinio intelekto navigaciją

„Thinker-Talker“ architektūros ir dizaino studija su Švietimo ministerija

Vienas iš pagrindinių skirtumų yra atsakomybių atskyrimas: „Mąstytojas “ generuoja tekstą (su variantais, kurie apima aiškią minčių grandinės samprotavimo sistemą), o „ Kalbėtojas“ kuria garsą realiuoju laiku . Šis atskyrimas leidžia vesti natūralų balso pokalbį, o sistema išlaiko aukštą teksto supratimo ir planavimo lygį.

„MoE“ duomenų bazė paskirsto darbo krūvį tarp ekspertų ir remiasi „AuT“ išankstiniu mokymu, kad būtų galima pateikti veiksmingus bendruosius vaizdus. Be to, kelių kodų kodavimo naudojimas garso kanale sumažina delsą iki minimumo, o tai labai svarbu skambučiams ar asistentams, kur svarbi kiekviena šimtoji sekundės dalis.

Veikimas ir lyginamieji rodikliai: tekstas, vaizdas, garsas ir audiovizualiniai duomenys

„Qwen3-Omni“ išlaiko pažangiausias teksto ir vaizdo atkūrimo galimybes, nepablogėdamas, palyginti su panašaus dydžio „Qwen“ modeliais, skirtais vienam režimui, o garso ir audiovizualinių savybių srityje jis pirmauja daugumoje testų . Iš 36 garso ir audiovizualinių etalonų jis pasiekia atvirojo kodo SOTA per 32 bandymus ir bendrą SOTA per 22 bandymus, keliais punktais pranokdamas „ Gemini 2.5 Pro“ ir „GPT-4o “.

Keletas svarbių teksto etapų: AIME25 teste „Flash-Instruct“ variantas surinko apie 65,9 balo; „ZebraLogic“ teste „Instruct“ pasiekė 90 balų, o „MultiPL-E“ teste pasiekė konkurencingus rezultatus, palyginti su GPT-4o. Lygiavimo užduotyse, tokiose kaip IFEval ir WritingBench, „Instruct“ ir „Thinking“ modeliai parodė aukštus ir nuoseklius balus.

Garso srityje ASR rezultatai kinų ir anglų kalbomis yra puikūs: „WenetSpeech“ ir „LibriSpeech“ kalbose žodžių klaidų lygis gerokai sumažėja – „LibriSpeech“ kalbose „clean/other“ kalbose jis siekia beveik 1,22/2,48, o tokiuose rinkiniuose kaip FLEURS (daugiakalbis) – labai mažas. „VoiceBench“ programoje tokie rodikliai kaip „AlpacaEval“, „CommonEval“ ir „WildVoice“ prilygsta uždaroms atskaitos sistemoms, o garso samprotavimo srityje jis puikiai veikia MMAU v05.15.25 versijoje.

Audiovizualinėse programose dažniausiai minimas rodiklis yra „WorldSense“ (apytiksliai 54,1 ), lenkiantis „Gemini-2.5-Flash“. Be to, tokiuose paketuose kaip „DailyOmni“ ir „VideoHolmes“ „Thinking“ variantas pasiekia patobulinimų, palyginti su ankstesnėmis atvirojo kodo SOTA programomis. Grynosios regos srityje jis puikiai veikia MMMU, „MathVista“, „MathVision“ ir dokumentų supratimo (AI2D, ChartQA) srityse, o skaičiavimo (CountBench) ir vaizdo įrašų supratimo (Video-MME, MLVU) balai yra labai geri .

Taip pat buvo išmatuotas balso generavimas be atskirų kalbų: palyginti su tokiomis šeimomis kaip „CosyVoice“ ir „Seed-TTS“, „Qwen3-Omni“ pasižymi geresniu turinio nuoseklumu keliomis kalbomis ir dideliu kalbėtojų panašumu . Daugiakalbių kalbų skyriuje lentelėse „Turinio nuoseklumas“ ir „Kalbančiųjų panašumas“ matyti, kad „Qwen3-Omni 30B-A3B“ yra labai konkurencingas kinų ir anglų kalbomis ir solidus vokiečių, italų, portugalų, ispanų, japonų, korėjiečių, prancūzų ir rusų kalbomis. Įvairiakalbiame TTS , palyginti su „CosyVoice 2/3“, jis pasiekia geresnį WER/nuoseklumą keliose kalbų porose (pvz., zh→en, ja→en, ko→zh).

Galimi modeliai ir kam kiekvienas iš jų naudojamas

„Qwen3-Omni“ liniją sudaro trys pagrindiniai elementai, kurių kiekvienas skirtas konkrečiam naudojimui: „Instruct“ , „Thinking“ ir „Captioner“ . Visi jie kilę iš to paties pagrindo, tačiau turi skirtingas galimybes, aktyvuojamas arba tikslinamas konkrečioms užduotims.

„Qwen3-Omni-30B-A3B- Instruct“ apima „Thinker“ ir „Talker“, priima garsą, vaizdą ir tekstą bei grąžina tekstą ir garsą. Tai tinkamas pasirinkimas, jei norite visapusiškos sąveikos ir realiuoju laiku gaunamų balsinių rezultatų, ir rekomenduojamas balso ar vaizdo demonstracijoms .

„Qwen3-Omni-30B-A3B- Thinking“ orientuotas į mąstytoją, naudojantį grandininį samprotavimą , palaikant garso, vaizdo ir teksto išvestį. Jis naudingas atliekant išsamią analizę, sprendžiant sudėtingas problemas, atliekant vizualinę matematiką arba atliekant darbo eigą, kai nereikia balso išvesties , bet reikia geriausiai struktūrizuoto mąstymo.

  Kaip naudotis dirbtiniu intelektu neregistruojantis: išsamus vadovas

„Qwen3-Omni-30B-A3B- Captioner“ yra patobulintas didelio tikslumo, mažo hiperaktyvumo garso subtitrų darinys . Tai atvirojo kodo programa, apimanti platų garso diapazoną ir labai išsamiai ją naudojanti, užpildanti istorinę spragą atvirojo kodo ekosistemoje: patikimi ir sodrūs subtitrai bendrosios paskirties garsui.

Latencija, realusis laikas ir elgesio kontrolė

Sistema optimizuota momentinei sąveikai, jos atsako laikas yra maždaug 211 ms garsui ir 507 ms garso ir vaizdo ryšiui . Be transliacijos, dėmesys skiriamas natūraliems pokalbių posūkiams ir stabiliam balso perteikimui, o aiškūs mąstytojo (tekstas) ir kalbėtojo (balsas) vaidmenys padeda.

Norėdami tiksliai derinti stilių, galite tinkinti jį naudodami sistemos raginimus . AV scenarijuose, kai vaizdo įrašas naudojamas kaip nuoroda, komanda siūlo sistemos raginimą, kuris išlaikytų Mąstytojo samprotavimus, kartu pateikdamas aiškesnį ir pokalbio formatu pagrįstą tekstą, kad Kalbėtojui būtų lengviau kalbėti sklandžiai . Taip pat rekomenduojama parametrą „use_audio_in_video“ išlaikyti nuoseklų viso kelių pokalbių metu.

Vertinant taikomos konkrečios gairės: nenustatykite sistemos raginimo , laikykitės kiekvieno etalono „ChatML“ formato ir, kai raginimo nėra, pagal numatytuosius nustatymus naudokite šiuos formatus: kinų ASR („请将这段中文语音转换为纯文本。“), kitų kalbų ASR („Transkribuoti garsą į tekstą.“), S2TT („Klausykitės pateiktos <šaltinio_kalba> kalbos...“) ir dainų žodžių („ Transkribuoti dainos žodžius“... be skyrybos ženklų, eilutės atskirtos skirtukais).

Diegimas, reikalavimai ir įrankiai

Norint visapusiškos vietinės patirties, komanda rekomenduoja naudoti „Hugging Face Transformers“ ir peržiūrėti programinės įrangos kūrimo etapus , tačiau atminkite: kadangi tai yra MoE architektūra, ji gali veikti lėtai su HF išvada; gamybinėms arba mažo delsos laiko programoms jie pataria naudoti vLLM arba „DashScope API“ ir netgi pateikia „Docker“ atvaizdą, kuriame yra abiejų aplinkų. „Transformers“ kodas jau sujungtas, tačiau „PyPI“ paketas dar neišleistas ir turi būti įdiegtas iš šaltinio kodo.

Jie teikia garso ir vaizdų / vaizdo įrašų tvarkymo priemones („base64“, URL, įterptosios įvesties sistemos) ir rekomenduoja „FlashAttention 2“ su „Transformers“, kad sumažintų GPU atminties kiekį, kai kraunama naudojant „float16“ arba „bfloat16“ . Naudojant vLLM, įtraukiamas „FlashAttn2“, o tokie parametrai kaip „limit_mm_per_prompt“ (iš anksto paskirsto GPU atmintį) ir „max_num_seqs“ lygiagretumui yra išsamiai aprašyti ; be to, padidinus „tensor_parallel_size“ , įgalinama kelių GPU išvada.

Yra keletas naudingų patarimų, kaip taupyti išteklius: jei garso nereikia, po inicijavimo galite išjungti „Talker“ , taip sutaupydami maždaug 10 GB vaizdo atminties. O jei norite greitesnės teksto išvesties, generavimo metu naudokite `return_audio=False` . Taip pat pateikiami minimalūs teoriniai BF16 su „FlashAttn2“ atminties reikalavimai: pavyzdžiui, „Instruct 30B-A3B“ naudoja maždaug 78,9 GB su 15 sekundžių vaizdo įrašu ir 144,8 GB su 120 sekundžių; „Thinking“ naudoja atitinkamai maždaug 68,7 GB ir 131,7 GB.

Norėdami sukurti vietinę žiniatinklio demonstraciją , jie rekomenduoja paruošti vLLM aplinką (arba lėtesnę „Transformers“ aplinką), užtikrinti, kad būtų įdiegtas „ffmpeg“ , ir naudoti jų scenarijus. Jie siūlo GPU paruoštus „Docker“ atvaizdus „qwenllm/qwen3-omni“ su „NVIDIA Container Toolkit“ , prievadų susiejimą (pvz., pagrindinis kompiuteris 8901 → konteineris 80) ir galimybę aptarnauti iš 0.0.0.0. Prireikus galite iš naujo įvesti arba ištrinti konteinerį.

Demonstracijos, API ir ekosistema

Jei nenorite diegti vietoje, galite išbandyti demonstracines versijas „Hugging Face Spaces“ ir „ModelScope Studio“ platformose , kuriose yra patirties su „Qwen3-Omni-Realtime“, „Instruct“, „Thinking“ ir „Captioner“. Taip pat galima naudotis „Qwen Chat“ funkcija su tiesioginiu transliavimu: tiesiog sąsajoje pasirinkite balso / vaizdo skambučio parinktį.

  Meistriškas dirbtinis intelektas: didelis Europos šuolis į priekį pažangių samprotavimo modelių srityje

Norint užtikrinti keičiamo mastelio integraciją su mažu delsos laiku, rekomenduojama naudoti „ DashScope“ API , kuri siūlo labiausiai nuspėjamą našumą. Be to, bendruomenė koordinuoja veiksmus per tokius kanalus kaip „Discord“ ir „WeChat“ ir skelbia receptų knygas su realiais vykdymo žurnalais, kurie leidžia vartotojams atkurti rezultatus keičiant raginimus ar modelius.

Veiksmų planas ir nuolatiniai patobulinimai

Komanda dirba su papildomomis funkcijomis, tokiomis kaip kelių kalbėtojų kalbos atpažinimas , OCR taikymas vaizdo įrašams, proaktyvaus audiovizualinio mokymosi patobulinimai ir platesnės agentų darbo eigos . Jie taip pat nurodė, kad netrukus bus galima naudotis garso išvesties palaikymu vLLM „Instruct“ modelyje , užbaigiant realaus laiko diegimo ciklą iš tos vidinės sistemos.

DUK: Palaikymas vykdymo metu ir kvantavimas

Kai kurie vartotojai komentavo, kad jie negali paleisti „Qwen3-Omni“ net su įprastais įtariamaisiais ir kad nemato kvantinių elementų „Hugging Face“ ; be to, originalus 16 bitų formatas yra apie 70 GB, o tai kelia problemų kukliems kompiuteriams. Pats projektas paaiškina, kad „Transformers“ jau yra sujungtas, bet be „PyPI“ paketo , kurį reikia įdiegti iš šaltinio kodo, ir kad vLLM yra pageidaujamas išvadų darymo variantas, nors „Instruct“ garso palaikymas vLLM bus išleistas artimiausiu metu.

Kalbant apie kvantizavimą, HF dar nėra įrašytų vietos žymeklių, skirtų „Qwen3-Omni 30B-A3B“, ir verta prisiminti, kad MoE ir multimodalinis pobūdis apsunkina tiesioginį suderinamumą su vykdymo aplinkomis, tokiomis kaip llama.cpp. Tiems, kuriems reikia išbandyti dabar, oficiali rekomendacija yra naudoti „Docker + Transformers/vLLM“ iš šaltinio arba API ir stebėti saugyklą, ar nėra palaikymo užklausų ir būsimų kvantizavimų, kai jie bus prieinami.

Gera vertinimo praktika ir raginimai

Norint atkurti skaičius, pateikiamos šios išsamios gairės: dauguma lyginamųjų testų „Instruct“ kalboje naudoja godų dekodavimą be atrankos, o „Thinking“ kalboje reikia atsižvelgti į generation_config.json parametrus . Vaizdo įrašo kadrų dažnis vertinimo metu taip pat nustatomas kaip fps=2 , ir nurodoma, kad vartotojo raginimas turėtų sekti multimodalinius duomenis, nebent duomenų rinkinyje nurodyta kitaip.

Kai lyginamajame teste nėra raginimo, galima naudoti numatytuosius raginimus (kinų ASR / kita, S2TT, dainų žodžiai). Be to, sistemos raginimas neturėtų būti nustatytas vertinimo metu, siekiant užtikrinti, kad rezultatai būtų palyginami skirtingose ​​sistemose ir paleidimo metu.

„Qwen3-Omni“ save pozicionuoja kaip tikrą visapusę platformą, pasižyminčią mažu delsos laiku, plačiu daugiakalbystės palaikymu, pažangiausiomis garso ir vaizdo galimybėmis bei aiškiu diegimo keliu naudojant „Transformers“, „vLLM“ ir „Docker“. Tiems, kurie ieško vieno modelio, kuris sklandžiai apdoroja tekstą ir vaizdus neprarandant našumo, taip pat klausosi, kalba ir supranta vaizdo įrašus , tai šiandien sunkiai įveikiamas pasiūlymas.