- Model omnimodal nativ cu text, imagine, audio și video și streaming în timp real.
- SOTA în teste audio/video 22/36 și multilingv (119/19/10 limbi).
- Arhitectură Thinker-Talker cu MoE, latență redusă și control al prompturilor de sistem.
- Implementare recomandată cu vLLM/Transformers, Docker și utilitarele oficiale.
Apariția Qwen3-Omni a schimbat peisajul inteligenței artificiale: un model nativ unic, capabil să înțeleagă și să răspundă la text, imagini, audio și video , cu răspunsuri rapide, atât în formă scrisă, cât și vorbită. Nu vorbim despre „patch-uri” multimodale, ci mai degrabă despre o arhitectură fundamental concepută pentru integrarea modalităților cu latență redusă și control comportamental fin reglat.
Într-o perioadă în care aproape toată lumea testează chatbot-uri și asistenți, Qwen3-Omni sosește cu ambiție: acceptă 119 limbi prin text, recunoaște vorbirea în 19 limbi și vorbește în 10 , înțelege sunete lungi (până la 30 de minute) și se mândrește cu scoruri de referință în zeci de teste. În plus, designul său Thinker-Talker și abordarea Mixture of Experts vizează viteza de răspuns și calitatea raționamentului în scenarii din lumea reală.
Ce este Qwen3-Omni și ce oferă?
Qwen3-Omni este o familie de modele fundamentale, omnimodale și multilingve end-to-end, concepute pentru a procesa text, imagini, audio și video, cu ieșiri atât în text, cât și în vorbire naturală. Cheia constă nu doar în varietatea de intrări și ieșiri, ci și în funcționalitatea de streaming cu ture conversaționale fluide și capacitatea de a răspunde imediat.
Echipa a introdus mai multe îmbunătățiri arhitecturale pentru performanță și eficiență: pre-antrenament „text-first” timpuriu, combinat cu antrenament multimodal mixt și un design cu un Amestec de Experți (MoE) care își menține performanța în text și imagine, amplificând în același timp sunetul și video. Cu aceste îmbunătățiri, modelul obține SOTA în 22 din 36 de teste de performanță audio/video și SOTA open-source în 32 din 36, cu rezultate comparabile cu Gemini 2.5 Pro în ASR, înțelegere audio și conversație vocală.

Capacități și modalități cheie
Qwen3-Omni este pregătit pentru aplicații audio, vizuale și audiovizuale din lumea reală, cu suport multilingv extins: 119 limbi de text, 19 limbi de introducere vocală și 10 limbi de ieșire vocală . Limbile de introducere vocală includ engleză, chineză, coreeană, japoneză, germană, rusă, italiană, franceză, spaniolă, portugheză, malaeză, olandeză, indoneziană, turcă, vietnameză, cantoneză, arabă și urdu; iar limbile de ieșire includ engleză, chineză, franceză, germană, rusă, italiană, spaniolă, portugheză, japoneză și coreeană, printre altele.
Suita de cărți de bucate oficiale ilustrează amploarea utilizărilor sale. În domeniul audio, prezintă recunoașterea vorbirii (ASR) multilingvă și audio de lungă durată , traducerea vorbirii în text și vorbire în vorbire, analiza muzicală (stil, ritm, genuri), descrierea efectelor sonore și subtitrarea oricărui fișier audio . De asemenea, acceptă analiza mixtă a pieselor cu vorbire, muzică și sunete ambientale.
În domeniul vizual, oferă OCR „hard” pentru imagini complexe, detectarea și fundamentarea obiectelor , asigurarea calității imaginilor, rezolvarea matematică a imaginilor (unde modelul Thinking excelează), descrierea video, navigarea video la persoana întâi și analiza tranzițiilor scenelor . În scenariile audiovizuale, demonstrează asigurarea calității audio-video cu aliniere temporală, interacțiune ghidată cu intrările AV și dialoguri cu comportamentul asistentului.
Ca agent, se remarcă prin capacitatea sa de a funcționa prin apelare din format audio , ceea ce deschide fluxuri de lucru vocale ce activează instrumente, iar în sarcinile derivate există un Omni-Captioner pentru subtitrare cu detalii deosebite, ceea ce demonstrează generalizabilitatea celui fundamental.
Arhitectură și design Thinker-Talker cu MoE
Unul dintre factorii cheie de diferențiere este separarea responsabilităților: Gânditorul generează textul (cu variații care includ raționament explicit în lanț de gânduri), iar Vorbitorul produce sunet în timp real . Această decuplare permite o conversație vocală naturală, în timp ce sistemul menține un nivel ridicat de înțelegere și planificare a textului.
Baza de date MoE distribuie volumul de muncă între experți și se bazează pe antrenamentul prealabil AuT pentru reprezentări generale puternice. În plus, utilizarea codificării multi-cod în canalul audio reduce latența la minimum, ceea ce este crucial pentru apeluri sau asistenți unde fiecare sutime de secundă contează.
Performanță și repere: text, imagine, audio și audiovizual
Qwen3-Omni menține performanțe de ultimă generație pentru text și imagini, fără a se degrada, în comparație cu modelele Qwen de dimensiuni similare, axate pe un singur mod, în timp ce în ceea ce privește performanța audio și audiovizuală, acesta stabilește ritmul în majoritatea testelor . În bateria de 36 de teste audio și audiovizuale, atinge SOTA open-source în 32 și SOTA total în 22, depășind Gemini 2.5 Pro și GPT-4o în mai multe puncte.
Câteva etape notabile în text: în AIME25 varianta Flash-Instruct obține un scor de aproximativ 65,9; în ZebraLogic, Instruct ajunge la 90, iar în MultiPL-E obține cifre competitive față de GPT-4o. În sarcini de aliniere precum IFEval și WritingBench, modelele Instruct și Thinking prezintă scoruri mari și consistente.
În domeniul audio, rezultatele ASR pentru chineză și engleză sunt excelente: în WenetSpeech și LibriSpeech, reduce semnificativ rata de eroare a cuvintelor, cu cifre apropiate de 1,22/2,48 în LibriSpeech clean/other, iar în seturi precum FLEURS (multilingv), oferă rate foarte scăzute. În VoiceBench, metrici precum AlpacaEval, CommonEval și WildVoice plasează Qwen3-Omni la egalitate cu sistemele de referință închise și excelează în raționamentul audio în MMAU v05.15.25.
În aplicațiile audiovizuale, cea mai frecvent citată metrică este WorldSense (aproximativ 54,1 ), depășind Gemini-2.5-Flash. Mai mult, în suite precum DailyOmni și VideoHolmes, varianta Thinking realizează îmbunătățiri față de aplicațiile SOTA open-source anterioare. În viziunea pură, excelează în MMMU, MathVista, MathVision și înțelegerea documentelor (AI2D, ChartQA), cu scoruri foarte bune la numărare (CountBench) și înțelegerea videoclipurilor (Video-MME, MLVU).
Generarea vocii de tip zero-shot a fost, de asemenea, măsurată: comparativ cu familii precum CosyVoice și Seed-TTS, Qwen3-Omni prezintă o consistență mai bună a conținutului în mai multe limbi și o similaritate ridicată a vorbitorilor . În secțiunea multilingvă, tabelele „Consistența conținutului” și „Similitudinea vorbitorilor” arată că Qwen3-Omni 30B-A3B este foarte competitiv în chineză și engleză și solid în germană, italiană, portugheză, spaniolă, japoneză, coreeană, franceză și rusă. În TTS interlingvistic , obține un WER/consistență mai bună în mai multe perechi (de exemplu, zh→en, ja→en, ko→zh) comparativ cu CosyVoice 2/3.
Modele disponibile și la ce se folosește fiecare
Linia Qwen3-Omni include trei componente principale, fiecare concepută pentru o utilizare specifică: Instruct , Thinking și Captioner . Toate provin din același nucleu, dar cu capabilități diferite activate sau ajustate fin pentru sarcini specifice.
Qwen3-Omni-30B-A3B- Instruct conține Thinker și Talker, acceptă fișiere audio, video și text și returnează text și audio. Este alegerea potrivită dacă doriți interacțiune completă și rezultate vorbite în timp real și este recomandată pentru demonstrații vocale sau video .
Qwen3-Omni-30B-A3B - Thinking se concentrează pe Gânditor cu raționament în lanț , suportând audio, video și text cu ieșire textuală. Este util pentru analize aprofundate, rezolvarea problemelor complexe, matematică vizuală sau fluxuri de lucru în care nu aveți nevoie de ieșire vocală, dar aveți nevoie de cea mai bună gândire structurată.
Qwen3-Omni-30B-A3B- Captioner este un derivat rafinat al subtitrării audio de înaltă precizie și cu hiperactivitate redusă . Este open source, acoperă o gamă largă de sunete în detaliu și umple un gol istoric în ecosistemul open source: subtitrări fiabile și bogate în conținut audio pentru uz general.
Latență, control în timp real și control comportamental
Sistemul este optimizat pentru interacțiune instantanee, cu timpi de răspuns de aproximativ 211 ms pentru audio și 507 ms pentru audio-video . Pe lângă streaming, accentul se pune pe turele naturale ale conversațiilor și pe redarea stabilă a vocii, ajutate de rolurile clare ale Gânditorului (text) și Vorbitorului (voce).
Pentru reglaje fine, puteți personaliza stilul cu ajutorul solicitărilor de sistem . În scenariile AV în care sunetul video este utilizat ca referință, echipa sugerează o solicitare de sistem care menține raționamentul Gânditorului, oferind în același timp un text mai lizibil și mai conversațional, facilitând vorbirea fluentă a Vorbitorului . De asemenea, se recomandă menținerea consecvenței parametrului `use_audio_in_video` pe parcursul unei conversații cu mai multe ture.
În evaluare, există îndrumări specifice: nu setați promptul de sistem , urmați formatul ChatML al fiecărui criteriu de referință și, atunci când nu există niciun prompt, utilizați următoarele în mod implicit: ASR chinezesc („请将这段中文语音转换为纯文本。”), ASR în alte limbi („Transcrieți sunetul în text.”), S2TT („Ascultați vorbirea <limba_sursă> furnizată...”) și versurile melodiilor („ Transcrieți versurile melodiei” ... fără punctuație, rânduri separate prin pauze”).
Implementare, cerințe și instrumente
Pentru o experiență locală completă, echipa recomandă Hugging Face Transformers și revizuirea fazelor de inginerie software , dar fiți atenți: fiind o arhitectură MoE, poate rula lent cu inferență HF; pentru aplicații de producție sau cu latență redusă , recomandă utilizarea vLLM sau a API-ului DashScope și chiar oferă o imagine Docker care include medii pentru ambele. Codul Transformers a fost deja îmbinat, dar pachetul PyPI nu a fost încă lansat și trebuie instalat de la sursă.
Aceștia oferă utilitare pentru gestionarea audio și a imaginilor/video (base64, URL-uri, intrări intercalate) și recomandă FlashAttention 2 cu Transformers pentru a reduce memoria GPU de fiecare dată când se încarcă în float16 sau bfloat16 . Cu vLLM, FlashAttn2 este inclus, iar parametrii precum limit_mm_per_prompt (pre-alocă memoria GPU) și max_num_seqs pentru paralelism sunt detaliați ; în plus, creșterea tensor_parallel_size permite inferența multi-GPU.
Există câteva sfaturi utile pentru economisirea resurselor: dacă nu aveți nevoie de sunet, puteți dezactiva Talker-ul după inițializare, economisind aproximativ 10 GB de VRAM. Și dacă doriți o ieșire text mai rapidă, utilizați `return_audio=False` în timpul generării. Sunt furnizate și cerințe minime teoretice de memorie pentru BF16 cu FlashAttn2: de exemplu, Instruct 30B-A3B utilizează aproximativ 78,9 GB cu 15 secunde de video și 144,8 GB cu 120 de secunde; Thinking utilizează aproximativ 68,7 GB și, respectiv, 131,7 GB.
Pentru a configura o demonstrație web locală , recomandă pregătirea mediului vLLM (sau a mediului Transformers, care este mai lent), asigurarea că aveți instalat ffmpeg și utilizarea scripturilor lor. Aceștia oferă imagini Docker „qwenllm/qwen3-omni” compatibile cu GPU cu NVIDIA Container Toolkit , maparea porturilor (de exemplu, gazda 8901 → containerul 80) și opțiunea de a servi de la 0.0.0.0. Puteți reintroduce sau șterge containerul după cum este necesar.
Demonstrații, API-uri și ecosistem
Dacă nu doriți să implementați local, puteți încerca demonstrații pe Hugging Face Spaces și ModelScope Studio , cu experiențe pentru Qwen3-Omni-Realtime, Instruct, Thinking și Captioner. Este disponibil și Qwen Chat cu streaming în timp real: pur și simplu selectați opțiunea de apel vocal/video din interfață.
Pentru o integrare scalabilă cu latență redusă, abordarea recomandată este API-ul DashScope , care oferă cea mai previzibilă performanță. În plus, comunitatea se coordonează prin canale precum Discord și WeChat și publică cărți de bucate cu jurnale de execuție reale care permit utilizatorilor să reproducă rezultatele prin schimbarea prompturilor sau modelelor.
Foaie de parcurs și îmbunătățiri continue
Echipa lucrează la funcții suplimentare, cum ar fi recunoașterea vorbirii cu mai mulți vorbitori , OCR aplicat videoclipurilor, îmbunătățiri ale învățării audiovizuale proactive și fluxuri de lucru mai bogate pentru agenți . De asemenea, au indicat că suportul pentru ieșirea audio în vLLM pentru modelul Instruct va fi disponibil în curând, completând ciclul de implementare în timp real din backend-ul respectiv.
Întrebări frecvente: Suport pentru runtime și cuantizare
Unii utilizatori au comentat că nu pot rula Qwen3-Omni nici măcar cu suspecții obișnuiți și că nu văd cuante în Hugging Face ; în plus, formatul nativ pe 16 biți este de aproximativ 70 GB, o dimensiune problematică pentru computerele modeste. Proiectul în sine clarifică faptul că Transformers este deja îmbinat, dar fără pachetul PyPI , care trebuie instalat din sursă, și că vLLM este opțiunea preferată pentru inferență, deși suportul audio Instruct în vLLM va fi lansat în viitorul apropiat.
În ceea ce privește cuantizarea, nu există încă provizorii listați în HF pentru Qwen3-Omni 30B-A3B și merită să ne amintim că natura MoE și multimodală complică compatibilitatea imediată cu runtime-uri precum llama.cpp. Pentru cei care trebuie să testeze acum, recomandarea oficială este să utilizeze Docker + Transformers/vLLM din sursă sau din API și să urmărească depozitul pentru solicitări de asistență și cuantizări viitoare atunci când acestea sunt disponibile.
Bune practici și sugestii de evaluare
Pentru a reproduce numerele, sunt detaliate următoarele instrucțiuni: majoritatea testelor de performanță utilizează decodare greedy în Instruct fără eșantionare, iar pentru Thinking, trebuie respectați parametrii din generation_config.json . Rata de cadre video este, de asemenea, setată la fps=2 în timpul evaluării și este indicat ca promptul utilizatorului să urmeze datele multimodale, cu excepția cazului în care setul de date specifică altfel.
Când un test de performanță nu include o solicitare, se pot utiliza solicitările implicite (ASR/altele în chineză, S2TT, versuri de cântece). În plus, solicitarea de sistem nu ar trebui setată în timpul evaluării pentru a se asigura că rezultatele sunt comparabile între sisteme și rulări.
Qwen3-Omni se poziționează ca o adevărată platformă omnimodală, cu latență redusă, suport multilingv extins, capabilități audio și video de ultimă generație și o cale de implementare clară folosind Transformers, vLLM și Docker. Pentru cei care caută un model unic care să gestioneze textul și imaginile fără probleme, fără a sacrifica performanța și care să asculte, să vorbească și să înțeleagă conținutul video , este o propunere greu de întrecut astăzi.
