- Modèle omnimodal natif avec texte, image, audio et vidéo, et streaming en temps réel.
- SOTA en 22/36 benchmarks audio/vidéo et multilingue (119/19/10 langues).
- Architecture Thinker–Talker avec MoE, faible latence et contrôle des invites système.
- Déploiement recommandé avec vLLM/Transformers, Docker et les utilitaires officiels.
L'arrivée de Qwen3-Omni a bouleversé le paysage de l'IA : un modèle natif unique capable de comprendre et de répondre au texte, aux images, à l'audio et à la vidéo , avec des réponses instantanées à l'écrit comme à l'oral. Il ne s'agit pas de simples « patchs » multimodaux, mais d'une architecture fondamentalement conçue pour intégrer les modalités avec une faible latence et un contrôle comportemental précis.
Alors que presque tout le monde teste des chatbots et des assistants, Qwen3-Omni arrive avec de grandes ambitions : il prend en charge 119 langues par écrit, reconnaît la parole dans 19 langues et parle dans 10 autres , comprend les enregistrements audio longs (jusqu’à 30 minutes) et affiche des scores de référence dans des dizaines de tests. De plus, sa conception « Thinker-Talkker » et son approche « Mixture of Experts » visent à garantir la rapidité de réponse et la qualité du raisonnement dans des situations réelles.
Qu'est-ce que Qwen3-Omni et que propose-t-il ?
Qwen3-Omni est une famille de modèles multilingues fondamentaux, omnimodaux et de bout en bout, conçus pour traiter le texte, les images, l'audio et la vidéo, avec une sortie textuelle et vocale. Sa force réside non seulement dans la variété des entrées et des sorties, mais aussi dans sa fonctionnalité de flux continu permettant des échanges fluides et une réponse instantanée.
L'équipe a apporté plusieurs améliorations architecturales pour optimiser les performances et l'efficacité : un pré-entraînement initial axé sur le texte, combiné à un entraînement multimodal mixte, et une conception basée sur un modèle d'experts (MoE) qui préserve les performances pour le texte et l'image tout en améliorant celles pour l'audio et la vidéo. Grâce à ces améliorations, le modèle atteint l'état de l'art dans 22 des 36 benchmarks audio/vidéo et l'état de l'art open source dans 32 des 36 benchmarks, avec des résultats comparables à ceux de Gemini 2.5 Pro en reconnaissance automatique de la parole (ASR), en compréhension audio et en conversation vocale.

Capacités et modalités clés
Qwen3-Omni est prêt pour les applications audio, vidéo et audiovisuelles concrètes, avec une prise en charge multilingue étendue : 119 langues de texte, 19 langues de saisie vocale et 10 langues de sortie vocale . Les langues de saisie vocale incluent l’anglais, le chinois, le coréen, le japonais, l’allemand, le russe, l’italien, le français, l’espagnol, le portugais, le malais, le néerlandais, l’indonésien, le turc, le vietnamien, le cantonais, l’arabe et l’ourdou ; et les langues de sortie incluent, entre autres, l’anglais, le chinois, le français, l’allemand, le russe, l’italien, l’espagnol, le portugais, le japonais et le coréen.
La suite de manuels officiels illustre l'étendue de ses applications. En audio, elle présente la reconnaissance vocale multilingue et longue (ASR) , la transcription vocale et la transcription vocale, l'analyse musicale (style, rythme, genres), la description des effets sonores et le sous-titrage de tout type d'audio . Elle prend également en charge l'analyse mixte de pistes contenant de la parole, de la musique et des sons ambiants.
En matière de vision, il propose une reconnaissance optique de caractères (OCR) « dure » pour les images complexes, la détection et l'ancrage d'objets , le contrôle qualité d'images, la résolution de problèmes mathématiques sur les images (où le modèle Thinking excelle), la description vidéo, la navigation vidéo à la première personne et l'analyse des transitions de scènes . Dans les scénarios audiovisuels, il offre un contrôle qualité audio-vidéo avec alignement temporel, une interaction guidée avec les entrées AV et des dialogues avec un comportement d'assistant.
En tant qu'agent, il se distingue par sa capacité à fonctionner en appel audio , ce qui ouvre des flux de travail vocaux qui activent des outils, et dans les tâches dérivées, il existe un Omni-Captioner pour le sous-titrage avec un grand niveau de détail, ce qui démontre la généralisabilité de l'agent de base.
Architecture et conception Thinker-Talker avec MoE
L'un des principaux facteurs de différenciation réside dans la séparation des responsabilités : le Penseur génère le texte (avec des variantes incluant un raisonnement explicite), tandis que le Locuteur produit l'audio en temps réel . Ce découplage permet une conversation vocale naturelle tout en maintenant un haut niveau de compréhension et de planification du texte.
La base de données du ministère de l'Éducation répartit la charge de travail entre les experts et s'appuie sur un pré-entraînement des systèmes testés pour obtenir des représentations générales performantes. De plus, l'utilisation d' un encodage multicode dans le canal audio réduit la latence au minimum, ce qui est crucial pour les appels ou les assistants vocaux où chaque centième de seconde compte.
Performances et repères : texte, vision, audio et audiovisuel
Le Qwen3-Omni offre des performances de pointe en matière de texte et d'image, sans dégradation par rapport aux modèles Qwen de taille similaire dédiés à un seul mode. En audio et audiovisuel, il domine la plupart des tests . Sur une batterie de 36 benchmarks audio et audiovisuels, il atteint le niveau de performance optimal (SOTA) open-source dans 32 tests et le SOTA total dans 22, surpassant ainsi le Gemini 2.5 Pro et le GPT-4o sur plusieurs points.
Quelques résultats notables en traitement de texte : sur AIME25, la variante Flash-Instruct obtient un score d’environ 65,9 ; sur ZebraLogic, Instruct atteint 90, et sur MultiPL-E, elle affiche des performances compétitives face à GPT-4o. Dans les tâches d’alignement telles que IFEval et WritingBench, les modèles Instruct et Thinking présentent des scores élevés et constants.
En audio, les résultats de la reconnaissance automatique de la parole (ASR) pour le chinois et l'anglais sont excellents : sur WenetSpeech et LibriSpeech, le taux d'erreur sur les mots est considérablement réduit, avec des valeurs proches de 1,22/2,48 sur LibriSpeech (texte clair/texte altéré), et sur des ensembles de données comme FLEURS (multilingue), les taux sont très bas. Sur VoiceBench, des métriques telles qu'AlpacaEval, CommonEval et WildVoice placent Qwen3-Omni au même niveau que les systèmes de référence propriétaires, et il excelle en raisonnement audio sur MMAU v05.15.25.
Dans les applications audiovisuelles, la métrique la plus fréquemment citée est WorldSense (environ 54,1 ), surpassant Gemini-2.5-Flash. De plus, dans des suites logicielles comme DailyOmni et VideoHolmes, la variante Thinking surpasse les applications open source de pointe précédentes. En vision pure, elle excelle dans MMMU, MathVista, MathVision et la compréhension de documents (AI2D, ChartQA), avec de très bons résultats en comptage (CountBench) et en compréhension vidéo (Video-MME, MLVU).
La génération vocale sans exemple a également été mesurée : comparée à des familles de systèmes comme CosyVoice et Seed-TTS, Qwen3-Omni présente une meilleure cohérence de contenu entre les langues et une forte similarité entre les locuteurs . Dans la section multilingue, les tableaux « Cohérence de contenu » et « Similarité entre les locuteurs » montrent que Qwen3-Omni 30B-A3B est très performant en chinois et en anglais, et solide en allemand, italien, portugais, espagnol, japonais, coréen, français et russe. En synthèse vocale interlingue , il atteint de meilleurs taux d’erreur de mots (WER) et une meilleure cohérence pour plusieurs paires de langues (par exemple, zh→en, ja→en, ko→zh) comparé à CosyVoice 2/3.
Modèles disponibles et à quoi sert chacun d'eux
La gamme Qwen3-Omni comprend trois modules principaux, chacun conçu pour un usage spécifique : Instruct , Thinking et Captioner . Ils reposent tous sur le même noyau, mais leurs fonctionnalités activées ou optimisées diffèrent selon les tâches.
Qwen3-Omni-30B-A3B- Instruct intègre Thinker et Talker, accepte l'audio, la vidéo et le texte , et restitue le texte et l'audio. C'est le choix idéal pour une interaction complète et des résultats vocaux en temps réel, et il est recommandé pour les démonstrations vocales ou vidéo .
Qwen3-Omni-30B-A3B- Thinking se concentre sur la pensée analytique et le raisonnement en chaîne , prenant en charge l'audio, la vidéo et le texte avec une sortie textuelle. Il est utile pour l'analyse approfondie, la résolution de problèmes complexes, les mathématiques visuelles ou les flux de travail où la synthèse vocale n'est pas nécessaire, mais où une pensée structurée optimale est essentielle.
Qwen3-Omni-30B-A3B- Captioner est une version améliorée du sous-titrage audio haute précision à faible hyperactivité . Ce logiciel libre couvre un large éventail de contenus audio avec un niveau de détail élevé et comble une lacune historique de l'écosystème open source : des sous-titres fiables et complets pour les fichiers audio à usage général.
Latence, temps réel et contrôle comportemental
Le système est optimisé pour une interaction instantanée, avec des temps de réponse d' environ 211 ms pour l'audio et de 507 ms pour l'audio-vidéo . Outre la diffusion en continu, l'accent est mis sur des échanges conversationnels naturels et une restitution vocale stable, grâce à la distinction claire entre le Rédacteur (texte) et l'Orateur (voix).
Pour un réglage plus précis, vous pouvez personnaliser le style à l'aide des invites système . Dans les scénarios audiovisuels où l'audio de la vidéo sert de référence, l'équipe suggère une invite système qui préserve le raisonnement du Penseur tout en fournissant un texte plus lisible et naturel, facilitant ainsi la prise de parole du Parleur . Il est également recommandé de conserver le même paramètre `use_audio_in_video` tout au long d'une conversation à plusieurs tours de parole.
Lors de l'évaluation, des directives spécifiques doivent être respectées : ne pas définir d'invite système , suivre le format ChatML de chaque test de performance et, en l'absence d'invite, utiliser par défaut les éléments suivants : reconnaissance vocale chinoise (« 请将这段中文语音转换为纯文本。 »), reconnaissance vocale d'autres langues (« Transcribe the audio into text. »), S2TT (« Listen to the provided <source_language> speech … ») et paroles de chansons (« Transcribe the song lyrics » … sans ponctuation, lignes séparées par des sauts de ligne).
Déploiement, exigences et outils
Pour une expérience locale complète, l'équipe recommande Hugging Face Transformers et l'étude des phases d'ingénierie logicielle . Attention : son architecture MoE peut entraîner des ralentissements lors de l'inférence HF. Pour les applications de production ou à faible latence , l'utilisation de vLLM ou de l'API DashScope est conseillée , et une image Docker incluant les environnements pour les deux est même fournie. Le code de Transformers a déjà été intégré, mais le package PyPI n'est pas encore disponible et doit être installé à partir des sources.
Ils fournissent des utilitaires pour la gestion de l'audio et de l'image/vidéo (base64, URL, entrées entrelacées) et recommandent FlashAttention 2 avec Transformers afin de réduire la mémoire GPU lors du chargement en float16 ou bfloat16 . Avec vLLM, FlashAttn2 est inclus et des paramètres tels que limit_mm_per_prompt (pré-allocation de mémoire GPU) et max_num_seqs pour le parallélisme sont détaillés ; de plus, l'augmentation de tensor_parallel_size permet l'inférence multi-GPU.
Voici quelques astuces pour économiser des ressources : si vous n’avez pas besoin de l’audio, vous pouvez désactiver le Talker après l’initialisation, ce qui vous permettra d’économiser environ 10 Go de VRAM. Pour une sortie texte plus rapide, utilisez `return_audio=False` lors de la génération. Les exigences minimales théoriques en mémoire pour BF16 avec FlashAttn2 sont également fournies : par exemple, l’Instruct 30B-A3B utilise environ 78,9 Go avec 15 secondes de vidéo et 144,8 Go avec 120 secondes ; le Thinking utilise respectivement environ 68,7 Go et 131,7 Go.
Pour configurer une démo web locale , il est recommandé de préparer votre environnement vLLM (ou l'environnement Transformers, plus lent), de vérifier que ffmpeg est installé et d'utiliser leurs scripts. Ils proposent des images Docker compatibles GPU « qwenllm/qwen3-omni » avec le kit de développement NVIDIA pour conteneurs , le mappage des ports (par exemple, hôte 8901 → conteneur 80) et la possibilité de servir depuis 0.0.0.0. Vous pouvez accéder au conteneur ou le supprimer selon vos besoins.
Démos, API et écosystème
Si vous ne souhaitez pas déployer localement, vous pouvez tester des démos sur Hugging Face Spaces et ModelScope Studio , avec des exemples d'utilisation de Qwen3-Omni-Realtime, Instruct, Thinking et Captioner. Qwen Chat avec diffusion en temps réel est également disponible : il suffit de sélectionner l' option d'appel audio/vidéo dans l'interface.
Pour une intégration évolutive à faible latence, l' API DashScope est recommandée car elle offre les performances les plus prévisibles. De plus, la communauté se coordonne via des plateformes comme Discord et WeChat et publie des guides pratiques contenant des journaux d'exécution réels, permettant ainsi aux utilisateurs de reproduire les résultats en modifiant les invites ou les modèles.
Feuille de route et améliorations en cours
L'équipe travaille sur des fonctionnalités supplémentaires telles que la reconnaissance vocale multilocuteur , la reconnaissance optique de caractères (OCR) appliquée à la vidéo, l'amélioration de l'apprentissage audiovisuel proactif et des flux de travail d'agents plus riches. Elle a également indiqué que la prise en charge de la sortie audio dans vLLM pour le modèle Instruct sera bientôt disponible, ce qui complétera le cycle de déploiement en temps réel depuis ce backend.
FAQ : Prise en charge de l'exécution et quantification
Certains utilisateurs ont signalé l'impossibilité d'exécuter Qwen3-Omni, même avec les logiciels habituels, et l'absence de données quantiques dans Hugging Face . De plus, le format natif 16 bits pèse environ 70 Go, une taille problématique pour les ordinateurs aux performances modestes. Le projet précise que Transformers est déjà intégré, mais sans le paquet PyPI , qui doit être installé à partir des sources. Il indique également que vLLM est l'option privilégiée pour l'inférence, bien que la prise en charge d'Instruct Audio dans vLLM soit prévue prochainement.
Concernant la quantification, aucune valeur de substitution n'est encore répertoriée dans HF pour Qwen3-Omni 30B-A3B. Il est important de noter que la nature multimodale et le caractère MoE de ce système complexifient la compatibilité immédiate avec des environnements d'exécution comme llama.cpp. Pour ceux qui doivent effectuer des tests dès maintenant, la recommandation officielle est d'utiliser Docker + Transformers/vLLM à partir du code source ou de l' API , et de suivre les mises à jour du dépôt pour les demandes d'intégration et les futures quantifications dès leur disponibilité.
Bonnes pratiques et suggestions d'évaluation
Pour reproduire les résultats, veuillez suivre les instructions suivantes : la plupart des benchmarks utilisent un décodage glouton dans Instruct sans échantillonnage, et pour Thinking, les paramètres du fichier generation_config.json doivent être respectés . La fréquence d'images vidéo est également fixée à fps=2 lors de l'évaluation, et il est indiqué que l'invite utilisateur doit suivre les données multimodales , sauf indication contraire dans le jeu de données.
Lorsqu'un test de performance ne comporte pas d'invite de commande, les invites par défaut peuvent être utilisées (reconnaissance vocale chinoise/autres, S2TT, paroles de chansons). De plus, il est déconseillé d'afficher l'invite système pendant l'évaluation afin de garantir la comparabilité des résultats entre les systèmes et les exécutions.
Qwen3-Omni se positionne comme une véritable plateforme omnimodale, offrant une faible latence, une prise en charge multilingue étendue, des fonctionnalités audio et vidéo de pointe et un déploiement simplifié grâce aux Transformers, vLLM et Docker. Pour ceux qui recherchent un modèle unique capable de gérer le texte et les images de manière fluide sans compromettre les performances, et qui prend également en charge la vidéo (écoute, parole et compréhension) , c'est une solution difficile à égaler aujourd'hui.
