- Model omnimodal nativ me tekst, imazh, audio dhe video, dhe transmetim në kohë reale.
- SOTA në 22/36 standarde audio/video dhe shumëgjuhëshe (119/19/10 gjuhë).
- Arkitekturë Mendues-Folës me MoE, latencë të ulët dhe kontroll të menjëhershëm të sistemit.
- Vendosje e rekomanduar me vLLM/Transformers, Docker dhe programe zyrtare ndihmëse.
Ardhja e Qwen3-Omni ka ndryshuar peizazhin e IA-së: një model i vetëm vendas i aftë të kuptojë dhe t'i përgjigjet tekstit, imazheve, audios dhe videos , me përgjigje të menjëhershme si në formë të shkruar ashtu edhe në të folur. Nuk po flasim për "arnime" multimodale, por përkundrazi për një arkitekturë të projektuar në thelb për integrimin e modaliteteve me latencë të ulët dhe kontroll të imët të sjelljes.
Në një kohë kur pothuajse të gjithë po testojnë chatbot-e dhe asistentë, Qwen3-Omni vjen me ambicie: mbështet 119 gjuhë nëpërmjet tekstit, njeh të folurit në 19 gjuhë dhe flet në 10 gjuhë , kupton audio të gjatë (deri në 30 minuta) dhe krenohet me rezultate krahasuese në dhjetëra teste. Për më tepër, dizajni i tij Thinker-Talker dhe qasja e Përzierjes së Ekspertëve synojnë shpejtësinë e përgjigjes dhe cilësinë e arsyetimit në skenarë të botës reale.
Çfarë është Qwen3-Omni dhe çfarë ofron?
Qwen3-Omni është një familje modelesh themelore, omnimodale dhe shumëgjuhëshe nga fillimi në fund, të dizajnuara për të përpunuar tekst, imazhe, audio dhe video, me dalje si në tekst ashtu edhe në të folur natyrale. Çelësi nuk qëndron vetëm në shumëllojshmërinë e të dhënave hyrëse dhe dalëse, por edhe në funksionalitetin e transmetimit me rrjedha të rrjedhshme bisedore dhe aftësinë për t'u përgjigjur menjëherë.
Ekipi ka prezantuar disa përmirësime arkitekturore për performancën dhe efikasitetin: trajnim paraprak të hershëm "teksti i pari" i kombinuar me trajnim multimodal të përzier, dhe një dizajn me një Përzierje Ekspertësh (MoE) që ruan performancën e tij në tekst dhe imazh duke përmirësuar audion dhe videon. Me këto përmirësime, modeli arrin SOTA në 22 nga 36 teste audio/video dhe SOTA me burim të hapur në 32 nga 36, me rezultate të krahasueshme me Gemini 2.5 Pro në ASR, kuptimin e audios dhe bisedën me zë.

Aftësitë dhe modalitetet kryesore
Qwen3-Omni është gati për aplikacione audio, vizuale dhe audiovizuale të botës reale, me mbështetje të gjerë shumëgjuhëshe: 119 gjuhë teksti, 19 gjuhë hyrjeje zanore dhe 10 gjuhë daljeje zanore . Gjuhët e hyrjes zanore përfshijnë anglisht, kinezisht, koreanisht, japonisht, gjermanisht, rusisht, italisht, frëngjisht, spanjisht, portugalisht, malajisht, holandisht, indonezisht, turqisht, vietnamisht, kantonezisht, arabisht dhe urduisht; dhe gjuhët e daljes përfshijnë anglisht, kinezisht, frëngjisht, gjermanisht, rusisht, italisht, spanjisht, portugalisht, japonisht dhe koreanisht, ndër të tjera.
Seti i librave zyrtarë të gatimit ilustron gamën e gjerë të përdorimeve të tij. Në audio, ai shfaq njohjen e të folurit shumëgjuhëshe dhe me audio të gjatë (ASR) , përkthimin nga të folurit në tekst dhe nga të folurit në të folur, analizën e muzikës (stili, ritmi, zhanret), përshkrimin e efekteve zanore dhe mbishkrimin e çdo audioje . Ai gjithashtu mbështet analizën e përzier të këngëve me të folur, muzikë dhe tinguj ambienti.
Në vizion, ofron OCR "të fortë" për imazhe komplekse, zbulimin dhe tokëzimin e objekteve , kontrollin e cilësisë së imazheve, zgjidhjen matematikore të imazheve (ku shkëlqen modeli i të menduarit), përshkrimin e videos, navigimin e bazuar në video në vetën e parë dhe analizën e tranzicionit të skenës . Në skenarët audiovizualë, ai demonstron kontrollin e cilësisë audio-video me shtrirjen kohore, ndërveprimin e udhëhequr me hyrjet AV dhe dialogët me sjelljen e asistentit.
Si agjent, ai dallohet për aftësinë e tij për të funksionuar duke thirrur nga audio , gjë që hap rrjedha pune zanore që aktivizojnë mjete, dhe në detyrat e derivuara ekziston një Omni-Citrator për titra me detaje të shkëlqyera, gjë që demonstron përgjithësueshmërinë e atij themelor.
Arkitekturë dhe Dizajn Mendues-Folës me Ministrinë e Arsimit
Një nga dalluesit kryesorë është ndarja e përgjegjësive: Mendimtari gjeneron tekstin (me variacione që përfshijnë arsyetim të qartë të zinxhirit të mendimit) dhe Folësi prodhon audio në kohë reale . Ky shkëputje lejon bisedë natyrale me zë, ndërsa sistemi ruan një nivel të lartë të të kuptuarit dhe planifikimit të tekstit.
Baza e të dhënave e Ministrisë së Arsimit shpërndan ngarkesën e punës midis ekspertëve dhe mbështetet në trajnimin paraprak të AuT për përfaqësime të përgjithshme të fuqishme. Për më tepër, përdorimi i kodimit me shumë kode në kanalin audio e zvogëlon vonesën në minimum, gjë që është thelbësore për thirrjet ose asistentët ku çdo e qindta e sekondës ka rëndësi.
Performanca dhe standardet: tekst, vizion, audio dhe audiovizual
Qwen3-Omni ruan performancën më të përparuar të tekstit dhe imazhit pa degraduar krahasuar me modelet Qwen me madhësi të ngjashme të përqendruara në një modalitet të vetëm, ndërsa në performancën audio dhe audiovizuale ai përcakton ritmin në shumicën e testeve . Në serinë e 36 testeve të performancës audio dhe audiovizuale, ai arrin SOTA me burim të hapur në 32 dhe SOTA totale në 22, duke tejkaluar Gemini 2.5 Pro dhe GPT-4o në disa pika.
Disa arritje të rëndësishme në tekst: në AIME25 varianti Flash-Instruct shënon rreth 65,9 pikë; në ZebraLogic Instruct arrin 90 pikë, dhe në MultiPL-E arrin shifra konkurruese kundrejt GPT-4. Në detyrat e radhitjes si IFEval dhe WritingBench, modelet Instruct dhe Thinking tregojnë rezultate të larta dhe të qëndrueshme.
Në audio, rezultatet ASR për kinezishten dhe anglishten janë të shkëlqyera: në WenetSpeech dhe LibriSpeech, ul ndjeshëm shkallën e gabimeve të fjalëve, me shifra afër 1,22/2,48 në LibriSpeech clean/other, dhe në grupe si FLEURS (shumëgjuhëshe), ofron shkallë shumë të ulëta. Në VoiceBench, metrika të tilla si AlpacaEval, CommonEval dhe WildVoice e vendosin Qwen3-Omni në të njëjtin nivel me sistemet e referencës së mbyllur, dhe shkëlqen në arsyetimin audio në MMAU v05.15.25.
Në aplikacionet audiovizuale, metrika e cituar më shpesh është WorldSense (afërsisht 54,1 ), duke tejkaluar Gemini-2.5-Flash. Për më tepër, në suita si DailyOmni dhe VideoHolmes, varianti Thinking arrin përmirësime krahasuar me aplikacionet e mëparshme SOTA me burim të hapur. Në vizionin e pastër, ai shkëlqen në MMMU, MathVista, MathVision dhe në të kuptuarit e dokumenteve (AI2D, ChartQA), me rezultate shumë të mira në numërim (CountBench) dhe të kuptuarit e videove (Video-MME, MLVU).
U mat edhe gjenerimi i zërit me zero-shot: krahasuar me familje si CosyVoice dhe Seed-TTS, Qwen3-Omni tregon qëndrueshmëri më të mirë të përmbajtjes në shumë gjuhë dhe ngjashmëri të lartë me folësit . Në seksionin shumëgjuhësh, tabelat "Konsistenca e Përmbajtjes" dhe "Ngjashmëria e Folësve" tregojnë se Qwen3-Omni 30B-A3B është shumë konkurrues në kinezisht dhe anglisht, dhe i fortë në gjermanisht, italisht, portugalisht, spanjisht, japonisht, koreanisht, frëngjisht dhe rusisht. Në TTS ndërgjuhësore , ai arrin WER/qëndrueshmëri më të mirë në disa çifte (p.sh., zh→en, ja→en, ko→zh) krahasuar me CosyVoice 2/3.
Modelet e disponueshme dhe për çfarë përdoret secila prej tyre
Linja Qwen3-Omni përfshin tre pjesë kryesore, secila e projektuar për një përdorim specifik: Instruct , Thinking dhe Captioner . Të gjitha burojnë nga e njëjta bërthamë, por me aftësi të ndryshme të aktivizuara ose të përshtatura për detyra specifike.
Qwen3-Omni-30B-A3B- Instruct përmban Mendues dhe Folës, pranon audio, video dhe tekst , dhe kthen tekst dhe audio. Është zgjedhja e duhur nëse dëshironi ndërveprim të plotë dhe rezultate të folura në kohë reale, dhe rekomandohet për demo me zë ose video .
Qwen3-Omni-30B-A3B- Të menduarit përqendrohet te Mendimtari me arsyetim zinxhir , duke mbështetur audion, videon dhe tekstin me rezultate tekstuale. Është i dobishëm për analiza të thella, zgjidhjen e problemeve komplekse, matematikën vizuale ose rrjedhat e punës ku nuk keni nevojë për rezultate zanore, por keni nevojë për të menduarit më të mirë të strukturuar.
Qwen3-Omni-30B-A3B- Titra është një derivat i rafinuar i titrimit audio me precizion të lartë dhe hiperaktivitet të ulët . Është me burim të hapur, mbulon një gamë të gjerë audiosh me detaje të shkëlqyera dhe mbush një boshllëk historik në ekosistemin me burim të hapur: titra të besueshme dhe të pasura për audio me qëllim të përgjithshëm.
Latencia, koha reale dhe kontrolli i sjelljes
Sistemi është i optimizuar për ndërveprim të menjëhershëm, me kohë reagimi prej afërsisht 211 ms për audio dhe 507 ms për audio-video . Përveç transmetimit, theksi vihet në rrjedhat natyrale të bisedës dhe transmetimin e qëndrueshëm të zërit, të ndihmuar nga rolet e qarta të Mendimtarit (tekstit) dhe Folësit (zërit).
Për rregullim të imët, mund ta personalizoni stilin me udhëzime të sistemit . Në skenarët AV ku audioja video përdoret për referencë, ekipi sugjeron një kërkesë sistemi që ruan arsyetimin e Mendimtarit, ndërkohë që ofron tekst më të lexueshëm dhe bisedor, duke e bërë më të lehtë për Folësin të flasë rrjedhshëm . Gjithashtu rekomandohet që parametri `use_audio_in_video` të mbahet konsistent gjatë gjithë një bisede me shumë kthesa.
Gjatë vlerësimit, ka udhëzime specifike: mos caktoni njoftim të sistemit , ndiqni formatin ChatML të secilit standard dhe, kur nuk ka njoftim, përdorni si parazgjedhje formatin e mëposhtëm: ASR kineze (“请将这段中文语音转换为纯文本。”), ASR në gjuhë të tjera (“Transkribo audion në tekst.”), S2TT (“Dëgjo fjalimin e dhënë në <gjuhën_e_burimit> …”) dhe tekstet e këngëve (“ Transkribo tekstin e këngës” … pa shenja pikësimi, rreshtat e ndarë me ndërprerje”).
Vendosja, kërkesat dhe mjetet
Për një përvojë të plotë lokale, ekipi rekomandon Hugging Face Transformers dhe shqyrtimin e fazave të inxhinierisë së softuerit , por kini kujdes: duke qenë një arkitekturë MoE, mund të funksionojë ngadalë me inferencë HF; për aplikacione prodhimi ose me vonesë të ulët , ata këshillojnë përdorimin e vLLM ose DashScope API , dhe madje ofrojnë një imazh Docker që përfshin mjedise për të dyja. Kodi i Transformers është bashkuar tashmë, por paketa PyPI nuk është publikuar ende dhe duhet të instalohet nga burimi.
Ato ofrojnë shërbime për trajtimin e audios dhe imazhit/videos (base64, URL, hyrje të ndërthurura) dhe rekomandojnë FlashAttention 2 me Transformers për të zvogëluar memorien e GPU-së sa herë që ngarkohet në float16 ose bfloat16 . Me vLLM, përfshihet FlashAttn2, dhe parametra të tillë si limit_mm_per_prompt (cakton paraprakisht memorien e GPU-së) dhe max_num_seqs për paralelizëm janë të detajuar ; përveç kësaj, rritja e tensor_parallel_size mundëson inferencën me shumë GPU.
Ka disa këshilla të dobishme për kursimin e burimeve: nëse nuk keni nevojë për audio, mund ta çaktivizoni Folësin pas inicializimit, duke kursyer afërsisht 10 GB VRAM. Dhe nëse dëshironi dalje më të shpejtë të tekstit, përdorni `return_audio=False` gjatë gjenerimit. Kërkesat minimale teorike të memories për BF16 me FlashAttn2 janë gjithashtu të dhëna: për shembull, Instruct 30B-A3B përdor afërsisht 78,9 GB me 15 sekonda video dhe 144,8 GB me 120 sekonda; Thinking përdor afërsisht 68,7 GB dhe 131,7 GB, përkatësisht.
Për të konfiguruar një demo lokale në internet , ata rekomandojnë përgatitjen e mjedisit tuaj vLLM (ose mjedisit më të ngadaltë Transformers), duke u siguruar që keni instaluar ffmpeg dhe duke përdorur skriptet e tyre. Ata ofrojnë imazhe Docker të gatshme për GPU "qwenllm/qwen3-omni" me NVIDIA Container Toolkit , hartëzimin e portave (p.sh., hosti 8901 → kontejneri 80) dhe opsionin për të shërbyer nga 0.0.0.0. Mund ta rifutni ose fshini kontejnerin sipas nevojës.
Demo, API dhe ekosistemi
Nëse nuk doni ta vendosni në nivel lokal, mund të provoni demo në Hugging Face Spaces dhe ModelScope Studio , me përvoja për Qwen3-Omni-Realtime, Instruct, Thinking dhe Captioner. Qwen Chat me transmetim në kohë reale është gjithashtu i disponueshëm: thjesht zgjidhni opsionin e thirrjes zanore/video në ndërfaqe.
Për integrim të shkallëzueshëm me vonesë të ulët, qasja e rekomanduar është DashScope API , i cili ofron performancën më të parashikueshme. Për më tepër, komuniteti koordinohet përmes kanaleve si Discord dhe WeChat , dhe publikon libra gatimi me regjistra ekzekutimi realë që u lejojnë përdoruesve të riprodhojnë rezultatet duke ndryshuar kërkesat ose modelet.
Plani i veprimit dhe përmirësimet e vazhdueshme
Ekipi po punon në veçori shtesë, të tilla si njohja e të folurit nga shumë folës , OCR-ja e aplikuar në video, përmirësime në të mësuarit proaktiv audiovizual dhe rrjedha pune më të pasura të agjentëve . Ata gjithashtu treguan se mbështetja e daljes audio në vLLM për modelin Instruct do të jetë e disponueshme së shpejti, duke përfunduar ciklin e vendosjes në kohë reale nga ai backend.
Pyetje të shpeshta: Mbështetje në kohën e ekzekutimit dhe kuantizim
Disa përdorues kanë komentuar se nuk mund ta ekzekutojnë Qwen3-Omni as me versionet e zakonshme dhe se nuk shohin kuantë në Hugging Face ; për më tepër, formati nativ 16-bit është rreth 70 GB, një madhësi problematike për kompjuterët modestë. Vetë projekti sqaron se Transformers është tashmë i bashkuar, por pa paketën PyPI , e cila duhet të instalohet nga burimi, dhe se vLLM është opsioni i preferuar për nxjerrjen e përfundimeve, megjithëse mbështetja audio e Instruct në vLLM do të publikohet në të ardhmen e afërt.
Lidhur me kuantizimin, ende nuk ka asnjë vendmbajtës të listuar në HF për Qwen3-Omni 30B-A3B, dhe ia vlen të kujtojmë se natyra MoE dhe multimodale e ndërlikojnë përputhshmërinë e menjëhershme me kohëzgjatjet si llama.cpp. Për ata që duhet të testojnë tani, rekomandimi zyrtar është të përdorin Docker + Transformers/vLLM nga burimi ose API , dhe të mbajnë një sy në depo për kërkesa mbështetjeje dhe kuantizime të ardhshme kur ato të jenë të disponueshme.
Praktikat dhe sugjerimet e mira të vlerësimit
Për të riprodhuar numrat, udhëzimet e mëposhtme janë detajuar: shumica e testeve të referencës përdorin dekodimin lakmitar në Instruct pa mostrim, dhe për Thinking, parametrat në generation_config.json duhet të respektohen . Shpejtësia e kuadrove të videos është vendosur gjithashtu në fps=2 gjatë vlerësimit, dhe tregohet se kërkesa e përdoruesit duhet të ndjekë të dhënat multimodale, përveç nëse të dhënat specifikojnë ndryshe.
Kur një pikë referimi nuk përfshin një kërkesë, mund të përdoren kërkesat e parazgjedhura (ASR kineze/të tjera, S2TT, tekste këngësh). Përveç kësaj, kërkesa e sistemit nuk duhet të caktohet gjatë vlerësimit për të siguruar që rezultatet të jenë të krahasueshme në të gjitha sistemet dhe ekzekutimet.
Qwen3-Omni pozicionohet si një platformë e vërtetë omnimodale, me vonesë të ulët, mbështetje të gjerë shumëgjuhëshe, aftësi audio dhe video të përparuara dhe një rrugë të qartë zbatimi duke përdorur Transformers, vLLM dhe Docker. Për ata që kërkojnë një model të vetëm që trajton tekstin dhe imazhet pa probleme pa sakrifikuar performancën, dhe që gjithashtu dëgjon, flet dhe kupton videon , është një propozim që është i vështirë për t'u mposhtur sot.
