Qwen3-Omni: Tutto quello che devi sapere sul modello omnimodale

Ultimo aggiornamento: 24 settembre 2025
  • Modello omnimodale nativo con testo, immagini, audio e video e streaming in tempo reale.
  • SOTA in 22/36 benchmark audio/video e multilingue (119/19/10 lingue).
  • Architettura Thinker–Talker con MoE, bassa latenza e controllo dei prompt di sistema.
  • Distribuzione consigliata con vLLM/Transformers, Docker e utility ufficiali.

Modello omnimodale Qwen3-Omni

L'arrivo di Qwen3-Omni ha cambiato il panorama dell'IA: un singolo modello nativo in grado di comprendere e rispondere a testo, immagini, audio e video , con risposte immediate sia in forma scritta che orale. Non stiamo parlando di "patch" multimodali, bensì di un'architettura progettata specificamente per integrare diverse modalità con bassa latenza e un controllo comportamentale preciso.

In un momento in cui quasi tutti stanno testando chatbot e assistenti virtuali, Qwen3-Omni si presenta con ambizione: supporta 119 lingue tramite testo, riconosce il parlato in 19 e parla in 10 , comprende audio di lunga durata (fino a 30 minuti) e vanta punteggi di riferimento in decine di test. Inoltre, il suo design Thinker-Talker e l'approccio Mixture of Experts mirano alla velocità di risposta e alla qualità del ragionamento in scenari reali.

gpt-5-0
Articolo correlato:
GPT-5: Tutto sulla prossima grande rivoluzione dell'intelligenza artificiale

Che cos'è Qwen3-Omni e cosa offre?

Qwen3-Omni è una famiglia di modelli multilingue fondamentali, omnimodali e end-to-end, progettati per elaborare testo, immagini, audio e video, con output sia in formato testuale che vocale. La chiave del suo successo risiede non solo nella varietà di input e output, ma anche nella funzionalità di streaming, che consente di gestire fluidamente i turni di conversazione e di rispondere immediatamente.

Il team ha introdotto diversi miglioramenti architetturali per ottimizzare prestazioni ed efficienza: un pre-addestramento iniziale "text-first" combinato con un addestramento multimodale misto e un design con una Mixture of Experts (MoE) che mantiene le sue prestazioni in ambito testuale e visivo, potenziando al contempo le prestazioni audio e video. Grazie a questi miglioramenti, il modello raggiunge lo stato dell'arte (SOTA) in 22 su 36 benchmark audio/video e lo stato dell'arte open-source in 32 su 36, con risultati paragonabili a quelli di Gemini 2.5 Pro in ASR, comprensione audio e conversazione vocale.

Interazione multimodale Qwen3-Omni

Capacità e modalità chiave

Qwen3-Omni è pronto per applicazioni audio, video e audiovisive reali, con un ampio supporto multilingue: 119 lingue di testo, 19 lingue di input vocale e 10 lingue di output vocale . Le lingue di input vocale includono inglese, cinese, coreano, giapponese, tedesco, russo, italiano, francese, spagnolo, portoghese, malese, olandese, indonesiano, turco, vietnamita, cantonese, arabo e urdu; e le lingue di output includono inglese, cinese, francese, tedesco, russo, italiano, spagnolo, portoghese, giapponese e coreano, tra le altre.

La serie di manuali ufficiali illustra la vastità delle sue applicazioni. In ambito audio, offre funzionalità di riconoscimento vocale multilingue e per file audio di lunga durata (ASR) , traduzione da parlato a testo e da parlato a parlato, analisi musicale (stile, ritmo, generi), descrizione degli effetti sonori e sottotitolazione di qualsiasi file audio . Supporta inoltre l'analisi mista di tracce audio contenenti parlato, musica e suoni ambientali.

In ambito visivo, offre OCR "hard" per immagini complesse, rilevamento e individuazione di oggetti , controllo qualità delle immagini, risoluzione di problemi matematici sulle immagini (dove il modello Thinking eccelle), descrizione video, navigazione video in prima persona e analisi delle transizioni di scena . In scenari audiovisivi, dimostra il controllo qualità audio-video con allineamento temporale, interazione guidata con input AV e dialoghi con il comportamento dell'assistente.

Come agente, si distingue per la sua capacità di funzionare con chiamate audio , che aprono flussi di lavoro vocali che attivano strumenti, e nelle attività derivate è presente un Omni-Captioner per la sottotitolazione con grande dettaglio, che dimostra la generalizzabilità di quello fondamentale.

  Comet: il navigatore di Perplexity rivoluziona la navigazione AI

Architettura e design Thinker-Talker con MoE

Uno degli elementi distintivi principali è la separazione delle responsabilità: il Pensatore genera il testo (con varianti che includono un ragionamento esplicito basato sulla catena di pensiero), mentre il Parlante produce l'audio in tempo reale . Questo disaccoppiamento consente una conversazione vocale naturale, mentre il sistema mantiene un elevato livello di comprensione del testo e di pianificazione.

Il database del Ministero dell'Istruzione distribuisce il carico di lavoro tra esperti e si basa sul pre-addestramento di AuT per ottenere rappresentazioni generali efficaci. Inoltre, l'utilizzo della codifica multi-codice nel canale audio riduce al minimo la latenza, aspetto cruciale per le chiamate o gli assistenti virtuali, dove ogni centesimo di secondo conta.

Prestazioni e benchmark: testo, visione, audio e audiovisivo

Il Qwen3-Omni mantiene prestazioni di testo e immagini all'avanguardia senza alcun degrado rispetto ai modelli Qwen di dimensioni simili focalizzati su una singola modalità, mentre nelle prestazioni audio e audiovisive detta il ritmo nella maggior parte dei test . Nella batteria di 36 benchmark audio e audiovisivi, raggiunge lo stato dell'arte open-source in 32 e lo stato dell'arte totale in 22, superando Gemini 2.5 Pro e GPT-4o in diversi punti.

Alcuni traguardi significativi nel campo del testo: in AIME25 la variante Flash-Instruct ottiene un punteggio di circa 65,9; in ZebraLogic Instruct raggiunge 90 e in MultiPL-E ottiene risultati competitivi rispetto a GPT-4o. Nei test di allineamento come IFEval e WritingBench, i modelli Instruct e Thinking mostrano punteggi elevati e costanti.

In ambito audio, i risultati ASR per il cinese e l'inglese sono eccellenti: in WenetSpeech e LibriSpeech, riduce significativamente il tasso di errore di parola, con valori vicini a 1,22/2,48 in LibriSpeech clean/other, e in set come FLEURS (multilingue), offre tassi molto bassi. In VoiceBench, metriche come AlpacaEval, CommonEval e WildVoice pongono Qwen3-Omni alla pari con i sistemi di riferimento chiusi, ed eccelle nel ragionamento audio in MMAU v05.15.25.

Nelle applicazioni audiovisive, la metrica più citata è WorldSense (circa 54,1 ), che supera Gemini-2.5-Flash. Inoltre, in suite come DailyOmni e VideoHolmes, la variante Thinking raggiunge miglioramenti rispetto alle precedenti applicazioni open-source all'avanguardia. Nell'ambito della visione artificiale, eccelle in MMMU, MathVista, MathVision e nella comprensione di documenti (AI2D, ChartQA), con ottimi punteggi nel conteggio (CountBench) e nella comprensione video (Video-MME, MLVU).

È stata misurata anche la generazione vocale zero-shot: rispetto a famiglie come CosyVoice e Seed-TTS, Qwen3-Omni mostra una migliore coerenza dei contenuti in più lingue e un'elevata similarità tra parlanti . Nella sezione multilingue, le tabelle "Coerenza dei contenuti" e "Similitudine tra parlanti" mostrano che Qwen3-Omni 30B-A3B è molto competitivo in cinese e inglese, e solido in tedesco, italiano, portoghese, spagnolo, giapponese, coreano, francese e russo. Nella sintesi vocale multilingue , raggiunge migliori valori di WER/coerenza in diverse coppie (ad esempio, zh→en, ja→en, ko→zh) rispetto a CosyVoice 2/3.

Modelli disponibili e a cosa serve ciascuno

La linea Qwen3-Omni comprende tre componenti principali, ciascuno progettato per un utilizzo specifico: Instruct , Thinking e Captioner . Tutti derivano dallo stesso nucleo centrale, ma con funzionalità diverse attivate o ottimizzate per compiti specifici.

Qwen3-Omni-30B-A3B- Instruct include Thinker e Talker, accetta audio, video e testo e restituisce testo e audio. È la scelta ideale se si desidera un'interazione completa e risultati vocali in tempo reale, ed è consigliato per dimostrazioni vocali o video .

Qwen3-Omni-30B-A3B- Thinking si concentra sul pensiero con ragionamento a catena , supportando audio, video e testo con output testuale. È utile per analisi approfondite, risoluzione di problemi complessi, matematica visiva o flussi di lavoro in cui non è necessario l'output vocale ma è fondamentale un pensiero strutturato al meglio.

  Come utilizzare l'intelligenza artificiale senza registrarsi: una guida completa

Qwen3-Omni-30B-A3B- Captioner è una versione perfezionata dei sottotitoli audio ad alta precisione e bassa iperattività . È open source, copre un'ampia gamma di formati audio con grande dettaglio e colma una lacuna storica nell'ecosistema open source: sottotitoli affidabili e completi per audio di uso generale.

Latenza, tempo reale e controllo comportamentale

Il sistema è ottimizzato per l'interazione istantanea, con tempi di risposta di circa 211 ms per l'audio e 507 ms per l'audio-video . Oltre allo streaming, l'accento è posto sulla naturalezza dei turni di conversazione e sulla stabilità della voce, grazie alla chiara definizione dei ruoli di Pensatore (testo) e Parlante (voce).

Per una messa a punto precisa, è possibile personalizzare lo stile con i prompt di sistema . Negli scenari AV in cui l'audio del video viene utilizzato come riferimento, il team suggerisce un prompt di sistema che mantenga il ragionamento del Pensatore fornendo al contempo un testo più leggibile e colloquiale, facilitando così la fluidità di parola del Parlante . Si consiglia inoltre di mantenere costante il parametro `use_audio_in_video` durante una conversazione a più turni.

Nella fase di valutazione, sono previste linee guida specifiche: non impostare il prompt di sistema , seguire il formato ChatML di ciascun benchmark e, in assenza di prompt, utilizzare di default le seguenti opzioni: ASR cinese (“请将这段中文语音转换为纯文本。”), ASR altre lingue ​​ (“Trascrivi l'audio in testo.”), S2TT (“Ascolta il parlato fornito in <lingua_sorgente> …”) e testi delle canzoni (“ Trascrivi i testi delle canzoni” … senza punteggiatura, righe separate da interruzioni”).

Distribuzione, requisiti e strumenti

Per un'esperienza locale completa, il team consiglia Hugging Face Transformers e di esaminare le fasi di ingegneria del software , ma attenzione: essendo un'architettura MoE, può risultare lenta con l'inferenza HF; per applicazioni di produzione o a bassa latenza , consigliano di utilizzare vLLM o l'API DashScope , e forniscono anche un'immagine Docker che include ambienti per entrambi. Il codice di Transformers è già stato integrato, ma il pacchetto PyPI non è ancora stato rilasciato e deve essere installato dai sorgenti.

Forniscono utilità per la gestione di audio e immagini/video (base64, URL, input interlacciati) e raccomandano FlashAttention 2 con Transformers per ridurre la memoria GPU durante il caricamento in float16 o bfloat16 . Con vLLM, FlashAttn2 è incluso e vengono descritti in dettaglio parametri come limit_mm_per_prompt (prealloca la memoria GPU) e max_num_seqs per il parallelismo ; inoltre, l'aumento di tensor_parallel_size abilita l'inferenza multi-GPU.

Sono disponibili alcuni utili suggerimenti per risparmiare risorse: se non è necessario l'audio, è possibile disabilitare Talker dopo l'inizializzazione, risparmiando circa 10 GB di VRAM. Inoltre, per una generazione del testo più rapida, utilizzare `return_audio=False` durante la generazione. Sono forniti anche i requisiti minimi teorici di memoria per BF16 con FlashAttn2: ad esempio, Instruct 30B-A3B utilizza circa 78,9 GB con 15 secondi di video e 144,8 GB con 120 secondi; Thinking utilizza rispettivamente circa 68,7 GB e 131,7 GB.

Per configurare una demo web locale , consigliano di preparare l'ambiente vLLM (o l'ambiente Transformers, più lento), di assicurarsi di avere ffmpeg installato e di utilizzare i loro script. Offrono immagini Docker ottimizzate per GPU, "qwenllm/qwen3-omni", con NVIDIA Container Toolkit , mappatura delle porte (ad esempio, host 8901 → container 80) e l'opzione di servire da 0.0.0.0. È possibile accedere nuovamente al container o eliminarlo a seconda delle necessità.

Demo, API ed ecosistema

Se non desideri effettuare l'installazione in locale, puoi provare le demo su Hugging Face Spaces e ModelScope Studio , con esperienze per Qwen3-Omni-Realtime, Instruct, Thinking e Captioner. È disponibile anche Qwen Chat con streaming in tempo reale: basta selezionare l' opzione di chiamata vocale/video nell'interfaccia.

  Intelligenza artificiale magistrale: il grande passo avanti dell'Europa nei modelli di ragionamento avanzato

Per un'integrazione scalabile a bassa latenza, l'approccio consigliato è l' API DashScope , che offre le prestazioni più prevedibili. Inoltre, la community si coordina attraverso canali come Discord e WeChat e pubblica guide con log di esecuzione reali che consentono agli utenti di riprodurre i risultati modificando i prompt o i modelli.

Roadmap e miglioramenti in corso

Il team sta lavorando su funzionalità aggiuntive come il riconoscimento vocale multi-speaker , l'OCR applicato ai video, miglioramenti all'apprendimento audiovisivo proattivo e flussi di lavoro degli agenti più ricchi. Hanno anche indicato che il supporto per l'output audio in vLLM per il modello Instruct sarà presto disponibile, completando il ciclo di implementazione in tempo reale da quel backend.

FAQ: Supporto runtime e quantizzazione

Alcuni utenti hanno segnalato di non riuscire a eseguire Qwen3-Omni nemmeno con i soliti programmi e di non visualizzare i dati quantitativi in ​​Hugging Face ; inoltre, il formato nativo a 16 bit occupa circa 70 GB, una dimensione problematica per computer di fascia bassa. Il progetto stesso chiarisce che Transformers è già stato integrato, ma senza il pacchetto PyPI , che deve essere installato dai sorgenti, e che vLLM è l'opzione preferita per l'inferenza, sebbene il supporto audio di Instruct in vLLM sarà rilasciato a breve.

Per quanto riguarda la quantizzazione, non sono ancora presenti placeholder elencati in HF per Qwen3-Omni 30B-A3B, ed è importante ricordare che la natura multimodale e del modello di espressione (MoE) complica la compatibilità immediata con runtime come llama.cpp. Per chi ha bisogno di effettuare dei test ora, la raccomandazione ufficiale è di utilizzare Docker + Transformers/vLLM dal codice sorgente o tramite API , e di tenere d'occhio il repository per eventuali pull request di supporto e future quantizzazioni non appena saranno disponibili.

Buone pratiche di valutazione e suggerimenti

Per riprodurre i numeri, vengono fornite le seguenti linee guida dettagliate: la maggior parte dei benchmark utilizza la decodifica greedy in Instruct senza campionamento e, per Thinking, è necessario rispettare i parametri in generation_config.json . Anche la frequenza dei fotogrammi video è impostata su fps=2 durante la valutazione ed è indicato che il prompt dell'utente deve seguire i dati multimodali a meno che il dataset non specifichi diversamente.

Quando un benchmark non include un prompt, è possibile utilizzare i prompt predefiniti (ASR cinese/altro, S2TT, testo della canzone). Inoltre, il prompt di sistema non deve essere impostato durante la valutazione per garantire che i risultati siano comparabili tra sistemi ed esecuzioni.

Qwen3-Omni si propone come una vera piattaforma omnimodale, con bassa latenza, ampio supporto multilingue, funzionalità audio e video all'avanguardia e un percorso di implementazione chiaro tramite Transformers, vLLM e Docker. Per chi cerca un unico modello in grado di gestire testo e immagini in modo impeccabile senza sacrificare le prestazioni, e che sia anche in grado di ascoltare, parlare e comprendere i video , si tratta di una proposta difficile da battere oggi sul mercato.