Qwen3-Omni: Alt du behøver at vide om den omnimodale model

Sidste ændring: 24 September 2025
Forfatter: TecnoDigital
  • Native omnimodal model med tekst, billede, lyd og video samt streaming i realtid.
  • SOTA i 22/36 audio/video benchmarks og flersproget (119/19/10 sprog).
  • Thinker-Talker-arkitektur med MoE, lav latenstid og systempromptkontrol.
  • Anbefalet implementering med vLLM/Transformers, Docker og officielle værktøjer.

Qwen3-Omni omnimodal model

Ankomsten af ​​Qwen3-Omni har ændret landskabet for AI: en enkelt native model, der er i stand til at forstå og reagere på tekst, billeder, lyd og video , med on-the-fly-responser i både skriftlig og mundtlig form. Vi taler ikke om multimodale "patches", men snarere en fundamentalt designet arkitektur til integration af modaliteter med lav latenstid og finjusteret adfærdskontrol.

I en tid hvor næsten alle tester chatbots og assistenter, ankommer Qwen3-Omni med ambitioner: den understøtter 119 sprog via tekst, genkender tale på 19 sprog og taler på 10 sprog , forstår lang lyd (op til 30 minutter) og kan prale af benchmark-scorer i snesevis af tests. Derudover sigter dens Thinker-Talker-design og Mixture of Experts-tilgang mod hurtig respons og kvalitet i ræsonnement i virkelige scenarier.

gpt-5-0
Relateret artikel:
GPT-5: Alt om den næste store revolution inden for kunstig intelligens

Hvad er Qwen3-Omni, og hvad tilbyder det?

Qwen3-Omni er en familie af grundlæggende, omnimodale og end-to-end flersprogede modeller designet til at behandle tekst, billeder, lyd og video, med output i både tekst og naturlig tale. Nøglen ligger ikke kun i variationen af ​​input og output, men også i dens streamingfunktionalitet med flydende samtaleforløb og evnen til at reagere øjeblikkeligt.

Teamet har introduceret adskillige arkitektoniske forbedringer for ydeevne og effektivitet: tidlig "tekst-først" præ-træning kombineret med blandet multimodal træning og et design med en blanding af eksperter (MoE), der opretholder sin ydeevne i tekst og billede, samtidig med at lyd og video forbedres. Med disse forbedringer opnår modellen SOTA i 22 ud af 36 lyd/video-benchmarks og open source SOTA i 32 ud af 36, med resultater sammenlignelige med Gemini 2.5 Pro i ASR, lydforståelse og talesamtale.

Qwen3-Omni multimodal interaktion

Nøglekompetencer og -modaliteter

Qwen3-Omni er klar til virkelige lyd-, billed- og audiovisuelle applikationer med omfattende flersproget understøttelse: 119 tekstsprog, 19 stemmeinputsprog og 10 stemmeoutputsprog . Stemmeinputsprog omfatter engelsk, kinesisk, koreansk, japansk, tysk, russisk, italiensk, fransk, spansk, portugisisk, malaysisk, hollandsk, indonesisk, tyrkisk, vietnamesisk, kantonesisk, arabisk og urdu; og outputsprog omfatter blandt andet engelsk, kinesisk, fransk, tysk, russisk, italiensk, spansk, portugisisk, japansk og koreansk.

De officielle kogebøger illustrerer bredden af ​​dens anvendelsesmuligheder. Inden for lyd præsenterer den flersproget og lang lyd talegenkendelse (ASR) , tale-til-tekst og tale-til-tale oversættelse, musikanalyse (stil, rytme, genrer), beskrivelse af lydeffekter og undertekster til enhver lyd . Den understøtter også blandet analyse af spor med tale, musik og omgivende lyde.

I visuelle scenarier tilbyder den "hård" OCR til komplekse billeder, objektdetektion og -jording , billedkvalitetskontrol, billedmatematikløsning (hvor Thinking - modellen skinner), videobeskrivelse, førstepersons videobaseret navigation og sceneovergangsanalyse . I audiovisuelle scenarier demonstrerer den lyd-video kvalitetskontrol med tidsjustering, guidet interaktion med AV-input og dialoger med assistentadfærd.

Som agent skiller den sig ud ved sin evne til at fungere via opkald fra lyd , hvilket åbner stemmearbejdsgange, der aktiverer værktøjer, og i afledte opgaver er der en Omni-Captioner til undertekster med stor detaljerigdom, hvilket demonstrerer generaliserbarheden af ​​den grundlæggende.

  Hardwarekrav for at bruge Ollama uden forstyrrelser

Tænker-snakker Arkitektur og Design med MoE

En af de vigtigste differentiatorer er ansvarsfordelingen: Tænkeren genererer teksten (med variationer, der inkluderer eksplicit tankekæderæsonnement), og Taleren producerer lyd i realtid . Denne afkobling muliggør naturlig stemmesamtale, mens systemet opretholder et højt niveau af tekstforståelse og planlægning.

MoE-databasen fordeler arbejdsbyrden blandt eksperter og er afhængig af AuT-forudtræning for at opnå effektive generelle repræsentationer. Desuden reducerer brugen af ​​multikodekodning i lydkanalen latenstiden til et minimum, hvilket er afgørende for opkald eller assistenter, hvor hvert hundrededel af et sekund tæller.

Ydeevne og benchmarks: tekst, billede, lyd og audiovisuelt

Qwen3-Omni opretholder banebrydende tekst- og billedydelse uden at blive forringet sammenlignet med Qwen-modeller i samme størrelse, der fokuserer på en enkelt tilstand, mens den inden for lyd- og audiovisuel ydeevne sætter tempoet i de fleste tests . I en række af 36 lyd- og audiovisuelle benchmarks opnår den open source SOTA i 32 og samlet SOTA i 22 og overgår dermed Gemini 2.5 Pro og GPT-4o på flere punkter.

Nogle bemærkelsesværdige milepæle inden for tekst: I AIME25 scorer Flash-Instruct-varianten omkring 65,9; i ZebraLogic når Instruct 90, og i MultiPL-E opnår den konkurrencedygtige tal mod GPT-4o. I justeringsopgaver som IFEval og WritingBench viser Instruct- og Thinking-modellerne høje og konsistente scorer.

Inden for lyd er ASR-resultaterne for kinesisk og engelsk fremragende: i WenetSpeech og LibriSpeech reducerer det ordfejlraten betydeligt, med tal tæt på 1,22/2,48 i LibriSpeech clean/other, og i sæt som FLEURS (flersproget) tilbyder det meget lave rater. I VoiceBench placerer målinger som AlpacaEval, CommonEval og WildVoice Qwen3-Omni på niveau med lukkede referencesystemer, og det udmærker sig i lydræsonnement i MMAU v05.15.25.

Inden for audiovisuelle applikationer er den hyppigst citerede metrik WorldSense (cirka 54,1 ), hvilket overgår Gemini-2.5-Flash. Desuden opnår Thinking-varianten i suiter som DailyOmni og VideoHolmes forbedringer i forhold til tidligere open source SOTA-applikationer. Inden for ren vision udmærker den sig i MMMU, MathVista, MathVision og dokumentforståelse (AI2D, ChartQA) med meget gode scorer i optælling (CountBench) og videoforståelse (Video-MME, MLVU).

Zero-shot stemmegenerering blev også målt: sammenlignet med familier som CosyVoice og Seed-TTS viser Qwen3-Omni bedre indholdskonsistens på tværs af flere sprog og høj højttalerlighed . I den flersprogede sektion viser tabellerne "Indholdskonsistens" og "Talerlighed", at Qwen3-Omni 30B-A3B er meget konkurrencedygtig på kinesisk og engelsk og solid på tysk, italiensk, portugisisk, spansk, japansk, koreansk, fransk og russisk. I tværsproget TTS opnår den bedre WER/konsistens på tværs af flere par (f.eks. zh→en, ja→en, ko→zh) sammenlignet med CosyVoice 2/3.

Tilgængelige modeller og hvad hver enkelt bruges til

Qwen3-Omni-serien indeholder tre hoveddele, der hver især er designet til et specifikt formål: Instruct , Thinking og Captioner . De stammer alle fra den samme kerne, men med forskellige funktioner aktiveret eller finjusteret til specifikke opgaver.

Qwen3-Omni-30B-A3B- Instruct indeholder Thinker og Talker, accepterer lyd, video og tekst , og returnerer tekst og lyd. Det er det rigtige valg, hvis du ønsker fuld interaktion og talte resultater i realtid, og anbefales til stemme- eller videodemonstrationer.

Qwen3-Omni-30B-A3B - Thinking fokuserer på tænkeren med kædereaktion , understøtter lyd, video og tekst med tekstoutput. Det er nyttigt til dybdegående analyse, løsning af komplekse problemer, visuel matematik eller arbejdsgange, hvor du ikke har brug for stemmeoutput , men har brug for den bedst strukturerede tænkning.

  Komplet guide til at forbedre din hjemmesides placering

Qwen3-Omni-30B-A3B- Captioner er en raffineret variant af højpræcisions -lydtekstning med lav hyperaktivitet . Den er open source, dækker en bred vifte af lyd i detaljer og udfylder et historisk hul i open source-økosystemet: pålidelige og omfattende tekstninger til generel lyd.

Latens, realtids- og adfærdskontrol

Systemet er optimeret til øjeblikkelig interaktion med svartider på cirka 211 ms for lyd og 507 ms for lyd-video . Ud over streaming lægges der vægt på naturlige samtaleforløb og stabil stemmegengivelse, hjulpet af de klare roller som tænker (tekst) og taler (stemme).

For finjustering kan du tilpasse stilen med systemprompter . I AV-scenarier, hvor video- og lydoptagelser bruges som reference, foreslår teamet en systemprompt, der fastholder tænkerens ræsonnement, samtidig med at den giver mere læsbar og samtalepræget tekst, hvilket gør det lettere for taleren at tale flydende . Det anbefales også at holde parameteren `use_audio_in_video` konsistent gennem en samtale med flere vendinger.

I evalueringen er der specifikke retningslinjer: Undlad at indstille systemprompten , følg ChatML-formatet for hver benchmark, og når der ikke er nogen prompt, skal du bruge følgende som standard: kinesisk ASR (“请将这段中文语音转换为纯文本。”), ASR på andre sprog (“Transkriber lyden til tekst.”), S2TT (“Lyt til den angivne <source_language>-tale…”) og sangtekster (“ Transkriber sangteksterne” … uden tegnsætning, linjer adskilt af pauser”).

Implementering, krav og værktøjer

For en komplet lokal oplevelse anbefaler teamet at bruge Hugging Face Transformers og gennemgå softwareudviklingsfaserne , men vær opmærksom på: da det er en MoE-arkitektur, kan den køre langsomt med HF-inferens. Til produktions- eller lav-latency-applikationer anbefaler de at bruge vLLM eller DashScope API'en , og de leverer endda et Docker-billede, der inkluderer miljøer til begge. Transformers-koden er allerede blevet flettet sammen, men PyPI-pakken er endnu ikke udgivet og skal installeres fra kildekoden.

De leverer værktøjer til håndtering af lyd og billede/video (base64, URL'er, interleaved input) og anbefaler FlashAttention 2 med Transformers for at reducere GPU-hukommelse, når der indlæses i float16 eller bfloat16 . Med vLLM er FlashAttn2 inkluderet, og parametre som limit_mm_per_prompt (forudallokerer GPU-hukommelse) og max_num_seqs for parallelisme er detaljeret ; derudover muliggør forøgelse af tensor_parallel_size multi-GPU-inferens.

Der er nogle nyttige tips til ressourcebesparelse: Hvis du ikke har brug for lyd, kan du deaktivere Talker efter initialisering, hvilket sparer cirka 10 GB VRAM. Og hvis du ønsker hurtigere tekstoutput, skal du bruge `return_audio=False` under generering. Minimum teoretiske hukommelseskrav for BF16 med FlashAttn2 er også angivet: for eksempel bruger Instruct 30B-A3B cirka 78,9 GB med 15 sekunders video og 144,8 GB med 120 sekunder; Thinking bruger henholdsvis cirka 68,7 GB og 131,7 GB.

For at opsætte en lokal webdemo anbefaler de at forberede dit vLLM-miljø (eller det langsommere Transformers-miljø), sikre at du har ffmpeg installeret og bruge deres scripts. De tilbyder GPU-klare Docker-billeder "qwenllm/qwen3-omni" med NVIDIA Container Toolkit , portmapping (f.eks. vært 8901 → container 80) og muligheden for at servere fra 0.0.0.0. Du kan genindtaste eller slette containeren efter behov.

Demoer, API'er og økosystem

Hvis du ikke ønsker at implementere lokalt, kan du prøve demoer af Hugging Face Spaces og ModelScope Studio med oplevelser for Qwen3-Omni-Realtime, Instruct, Thinking og Captioner. Qwen Chat med streaming i realtid er også tilgængelig: vælg blot indstillingen for tale-/videoopkald i brugerfladen.

  Hvad laver en softwareudviklingschef?

For skalerbar integration med lav latenstid anbefales DashScope API'en , som tilbyder den mest forudsigelige ydeevne. Derudover koordinerer fællesskabet via kanaler som Discord og WeChat og udgiver kogebøger med reelle udførelseslogfiler, der giver brugerne mulighed for at reproducere resultater ved at ændre prompts eller modeller.

Køreplan og løbende forbedringer

Teamet arbejder på yderligere funktioner såsom talegenkendelse fra flere højttalere , OCR anvendt på video, forbedringer af proaktiv audiovisuel læring og mere omfattende agent-arbejdsgange . De angav også, at understøttelse af lydoutput i vLLM til Instruct-modellen snart vil være tilgængelig, hvilket fuldfører realtidsimplementeringscyklussen fra den backend.

Ofte stillede spørgsmål: Runtime-support og kvantisering

Nogle brugere har kommenteret, at de ikke kan køre Qwen3-Omni selv med de sædvanlige mistænkte, og at de ikke ser kvanter i Hugging Face ; desuden er det native 16-bit format omkring 70 GB, en størrelse der er problematisk for beskedne computere. Selve projektet præciserer, at Transformers allerede er fusioneret, men uden PyPI-pakken , som skal installeres fra kildekoden, og at vLLM er den foretrukne mulighed for inferens, selvom Instruct-lydunderstøttelse i vLLM vil blive udgivet i den nærmeste fremtid.

Med hensyn til kvantisering er der endnu ingen pladsholdere angivet i HF for Qwen3-Omni 30B-A3B, og det er værd at huske, at MoE- og multimodaliteten komplicerer øjeblikkelig kompatibilitet med runtime-programmer som llama.cpp. For dem, der har brug for at teste nu, er den officielle anbefaling at bruge Docker + Transformers/vLLM fra kildekoden eller API'en , og holde øje med repository'et for support pull requests og fremtidige kvantiseringer, når de er tilgængelige.

Gode ​​evalueringspraksisser og opfordringer

For at reproducere tallene er følgende retningslinjer detaljeret: de fleste benchmarks bruger grådig afkodning i Instruct uden sampling, og for Thinking skal parametrene i generation_config.json respekteres . Videoens billedhastighed er også indstillet til fps=2 under evalueringen, og det er angivet, at brugerprompten skal følge de multimodale data, medmindre datasættet angiver andet.

Når et benchmark ikke indeholder en prompt, kan standardprompterne bruges (kinesisk ASR/andet, S2TT, sangtekster). Derudover bør systemprompten ikke indstilles under evalueringen for at sikre, at resultaterne er sammenlignelige på tværs af systemer og kørsler.

Qwen3-Omni positionerer sig som en ægte omnimodal platform med lav latenstid, bred flersproget understøttelse, banebrydende lyd- og videofunktioner og en klar implementeringssti ved hjælp af Transformers, vLLM og Docker. For dem, der søger en enkelt model, der håndterer tekst og billeder problemfrit uden at ofre ydeevne, og som også lytter, taler og forstår video , er det et tilbud, der er svært at slå i dag.