Qwen3-Omni: Tudo o que você precisa saber sobre o modelo omnimodal

Última atualização: 24 setembro 2025
  • Modelo omnimodal nativo com texto, imagem, áudio e vídeo, e streaming em tempo real.
  • SOTA em 22/36 benchmarks de áudio/vídeo e multilíngue (119/19/10 idiomas).
  • Arquitetura Thinker–Talker com MoE, baixa latência e controle de prompt do sistema.
  • Implantação recomendada com vLLM/Transformers, Docker e utilitários oficiais.

Modelo omnimodal Qwen3-Omni

A chegada do Qwen3-Omni mudou o panorama da IA: um único modelo nativo capaz de compreender e responder a textos, imagens, áudio e vídeo , com respostas instantâneas tanto na forma escrita quanto falada. Não estamos falando de "patches" multimodais, mas sim de uma arquitetura fundamentalmente projetada para integrar modalidades com baixa latência e controle comportamental preciso.

Numa altura em que quase toda a gente está a testar chatbots e assistentes, o Qwen3-Omni chega com ambição: suporta 119 línguas por texto, reconhece a fala em 19 e fala em 10 , compreende áudios longos (até 30 minutos) e apresenta excelentes resultados em dezenas de testes. Além disso, o seu design Thinker-Talker e a abordagem Mixture of Experts visam a rapidez de resposta e a qualidade do raciocínio em cenários do mundo real.

gpt-5-0
Artigo relacionado:
GPT-5: Tudo sobre a próxima grande revolução em Inteligência Artificial

O que é Qwen3-Omni e o que ele oferece?

Qwen3-Omni é uma família de modelos multilíngues fundamentais, omnimodais e de ponta a ponta, projetada para processar texto, imagens, áudio e vídeo, com saída em texto e fala natural. A chave reside não apenas na variedade de entradas e saídas, mas também em sua funcionalidade de streaming com turnos de conversação fluidos e a capacidade de resposta imediata.

A equipe introduziu diversas melhorias arquitetônicas para desempenho e eficiência: pré-treinamento inicial "primeiro texto" combinado com treinamento multimodal misto e um design com uma Mistura de Especialistas (MoE) que mantém seu desempenho em texto e imagem, ao mesmo tempo que aprimora áudio e vídeo. Com essas melhorias, o modelo alcança o estado da arte em 22 de 36 benchmarks de áudio/vídeo e o estado da arte de código aberto em 32 de 36, com resultados comparáveis ​​ao Gemini 2.5 Pro em reconhecimento automático de fala (ASR), compreensão de áudio e conversação.

Interação multimodal Qwen3-Omni

Principais capacidades e modalidades

O Qwen3-Omni está pronto para aplicações de áudio, vídeo e audiovisual do mundo real, com amplo suporte multilíngue: 119 idiomas de texto, 19 idiomas de entrada de voz e 10 idiomas de saída de voz . Os idiomas de entrada de voz incluem inglês, chinês, coreano, japonês, alemão, russo, italiano, francês, espanhol, português, malaio, holandês, indonésio, turco, vietnamita, cantonês, árabe e urdu; e os idiomas de saída incluem inglês, chinês, francês, alemão, russo, italiano, espanhol, português, japonês e coreano, entre outros.

O conjunto de manuais oficiais ilustra a amplitude de suas aplicações. Em áudio, ele demonstra reconhecimento de fala multilíngue e de áudio longo (ASR) , tradução de fala para texto e de fala para fala, análise musical (estilo, ritmo, gêneros), descrição de efeitos sonoros e legendagem de qualquer áudio . Também oferece suporte à análise mista de faixas com fala, música e sons ambientes.

Na área de visão computacional, oferece OCR "difícil" para imagens complexas, detecção e localização de objetos , controle de qualidade de imagens, resolução de cálculos matemáticos com imagens (onde o modelo de Pensamento se destaca), descrição de vídeo, navegação em primeira pessoa baseada em vídeo e análise de transição de cenas . Em cenários audiovisuais, demonstra controle de qualidade de áudio e vídeo com alinhamento temporal, interação guiada com entradas AV e diálogos com assistentes virtuais.

Como agente, destaca-se pela capacidade de funcionar com chamadas de áudio , o que possibilita fluxos de trabalho de voz que ativam ferramentas, e em tarefas derivadas há um Omni-Captioner para legendagem com grande detalhe, o que demonstra a generalização da funcionalidade fundamental.

  Guia completo para configurar o AdGuard Home com o Docker

Arquitetura e Design Pensador-Falante com MoE

Um dos principais diferenciais é a separação de responsabilidades: o Pensador gera o texto (com variações que incluem raciocínio explícito em cadeia), e o Falante produz o áudio em tempo real . Essa separação permite uma conversa por voz natural, enquanto o sistema mantém um alto nível de compreensão e planejamento do texto.

O banco de dados MoE distribui a carga de trabalho entre especialistas e utiliza o pré-treinamento de AuT para obter representações gerais robustas. Além disso, o uso de codificação multi-código no canal de áudio reduz a latência ao mínimo, o que é crucial para chamadas ou assistentes virtuais, onde cada centésimo de segundo conta.

Desempenho e benchmarks: texto, visão, áudio e audiovisual

O Qwen3-Omni mantém desempenho de ponta em texto e imagem sem degradação em comparação com modelos Qwen de tamanho similar focados em um único modo, enquanto em desempenho de áudio e audiovisual, ele dita o ritmo na maioria dos testes . Na bateria de 36 benchmarks de áudio e audiovisual, ele alcança o estado da arte de código aberto em 32 e o estado da arte total em 22, superando o Gemini 2.5 Pro e o GPT-4o em vários pontos.

Algumas conquistas notáveis ​​em testes de texto: no AIME25, a variante Flash-Instruct alcança uma pontuação em torno de 65,9; no ZebraLogic, o Instruct chega a 90, e no MultiPL-E, obtém resultados competitivos em relação ao GPT-4o. Em tarefas de alinhamento como IFEval e WritingBench, os modelos Instruct e Thinking apresentam pontuações altas e consistentes.

Em áudio, os resultados de reconhecimento automático de fala (ASR) para chinês e inglês são excelentes: no WenetSpeech e no LibriSpeech, reduz significativamente a taxa de erros de palavras, com valores próximos a 1,22/2,48 no LibriSpeech clean/other, e em conjuntos como o FLEURS (multilíngue), oferece taxas muito baixas. No VoiceBench, métricas como AlpacaEval, CommonEval e WildVoice colocam o Qwen3-Omni em pé de igualdade com sistemas de referência fechados, e se destaca no raciocínio de áudio no MMAU v05.15.25.

Em aplicações audiovisuais, a métrica mais citada é o WorldSense (aproximadamente 54,1 ), superando o Gemini-2.5-Flash. Além disso, em suítes como DailyOmni e VideoHolmes, a variante Thinking alcança melhorias em relação às aplicações de código aberto de última geração anteriores. Em visão computacional pura, destaca-se em MMMU, MathVista, MathVision e compreensão de documentos (AI2D, ChartQA), com pontuações muito boas em contagem (CountBench) e compreensão de vídeo (Video-MME, MLVU).

A geração de voz sem exemplos (zero-shot) também foi medida: em comparação com famílias como CosyVoice e Seed-TTS, o Qwen3-Omni demonstra melhor consistência de conteúdo em vários idiomas e alta similaridade entre falantes . Na seção multilíngue, as tabelas "Consistência de Conteúdo" e "Similaridade entre Falantes" mostram que o Qwen3-Omni 30B-A3B é muito competitivo em chinês e inglês, e sólido em alemão, italiano, português, espanhol, japonês, coreano, francês e russo. Em síntese de voz multilíngue (TTS) , ele alcança melhores taxas de erro de palavras (WER) e consistências em vários pares (por exemplo, chinês→inglês, japonês→inglês, coreano→chinês) em comparação com o CosyVoice 2/3.

Modelos disponíveis e para que serve cada um

A linha Qwen3-Omni inclui três peças principais, cada uma projetada para um uso específico: Instruir , Pensar e Legendar . Todas elas derivam do mesmo núcleo, mas com diferentes capacidades ativadas ou ajustadas para tarefas específicas.

O Qwen3-Omni-30B-A3B- Instruct contém os processadores Thinker e Talker, aceita áudio, vídeo e texto , e retorna texto e áudio. É a escolha certa se você deseja interação completa e resultados falados em tempo real, sendo recomendado para demonstrações de voz ou vídeo .

Qwen3-Omni-30B-A3B- O recurso Thinking concentra-se no Pensador com raciocínio em cadeia , oferecendo suporte a áudio, vídeo e texto com saída textual. É útil para análises aprofundadas, resolução de problemas complexos, matemática visual ou fluxos de trabalho onde não é necessária saída de voz, mas sim o melhor raciocínio estruturado.

  Principais tendências em engenharia de blockchain e Web3

O Qwen3-Omni-30B-A3B- Captioner é uma versão refinada de um sistema de legendagem de áudio de alta precisão e baixa hiperatividade . É de código aberto, abrange uma ampla gama de áudios com grande detalhe e preenche uma lacuna histórica no ecossistema de código aberto: legendas confiáveis ​​e ricas para áudio de uso geral.

Latência, tempo real e controle comportamental

O sistema é otimizado para interação instantânea, com tempos de resposta de aproximadamente 211 ms para áudio e 507 ms para áudio e vídeo . Além do streaming, a ênfase é colocada em turnos de conversa naturais e uma voz estável, auxiliada pelos papéis claros de Pensador (texto) e Falante (voz).

Para ajustes finos, você pode personalizar o estilo com avisos do sistema . Em cenários de áudio e vídeo onde o áudio do vídeo é usado como referência, a equipe sugere um aviso do sistema que mantenha o raciocínio do Pensador, ao mesmo tempo que fornece um texto mais legível e conversacional, facilitando a fluência do Falante . Também é recomendável manter o parâmetro `use_audio_in_video` consistente ao longo de uma conversa com várias interações.

Na avaliação, existem diretrizes específicas: não defina prompts do sistema , siga o formato ChatML de cada benchmark e, quando não houver prompt, use o seguinte por padrão: ASR chinês (“请将这段中文语音转换为纯文本。”), ASR outros idiomas (“Transcreva o áudio em texto.”), S2TT (“Ouça a fala fornecida em <idioma_de_origem>…”) e letras de músicas (“ Transcreva a letra da música…” … sem pontuação, linhas separadas por quebras”).

Implantação, requisitos e ferramentas

Para uma experiência local completa, a equipe recomenda o Hugging Face Transformers e a revisão das fases de engenharia de software , mas esteja ciente: por ser uma arquitetura MoE, pode apresentar lentidão com inferência HF; para aplicações de produção ou de baixa latência , eles aconselham o uso do vLLM ou da API DashScope , e até mesmo fornecem uma imagem Docker que inclui ambientes para ambos. O código do Transformers já foi integrado, mas o pacote PyPI ainda não foi lançado e precisa ser instalado a partir do código-fonte.

Eles fornecem utilitários para lidar com áudio e imagem/vídeo (base64, URLs, entradas intercaladas) e recomendam o FlashAttention 2 com Transformers para reduzir o consumo de memória da GPU ao carregar dados em float16 ou bfloat16 . Com o vLLM, o FlashAttn2 está incluído e parâmetros como limit_mm_per_prompt (que pré-aloca memória da GPU) e max_num_seqs para paralelismo são detalhados ; além disso, aumentar o tensor_parallel_size permite inferência em múltiplas GPUs.

Existem algumas dicas úteis para economizar recursos: se você não precisa de áudio, pode desativar o Talker após a inicialização, economizando aproximadamente 10 GB de VRAM. E se você quiser uma saída de texto mais rápida, use `return_audio=False` durante a geração. Os requisitos mínimos teóricos de memória para BF16 com FlashAttn2 também são fornecidos: por exemplo, o Instruct 30B-A3B usa aproximadamente 78,9 GB com 15 segundos de vídeo e 144,8 GB com 120 segundos; o Thinking usa aproximadamente 68,7 GB e 131,7 GB, respectivamente.

Para configurar uma demonstração web local , eles recomendam preparar seu ambiente vLLM (ou o ambiente Transformers, mais lento), garantir que o ffmpeg esteja instalado e usar os scripts fornecidos. Eles oferecem imagens Docker prontas para GPU, "qwenllm/qwen3-omni", com o NVIDIA Container Toolkit , mapeamento de portas (por exemplo, host 8901 → container 80) e a opção de servir a partir de 0.0.0.0. Você pode entrar novamente no container ou excluí-lo conforme necessário.

Demos, APIs e ecossistema

Se você não quiser implantar localmente, pode experimentar as demonstrações no Hugging Face Spaces e no ModelScope Studio , com experiências para Qwen3-Omni-Realtime, Instruct, Thinking e Captioner. O Qwen Chat com streaming em tempo real também está disponível: basta selecionar a opção de chamada de voz/vídeo na interface.

  Como criar aplicativos e flashcards com Inteligência Artificial

Para integração escalável com baixa latência, a abordagem recomendada é a API DashScope , que oferece o desempenho mais previsível. Além disso, a comunidade se coordena por meio de canais como Discord e WeChat e publica guias práticos com registros de execução reais que permitem aos usuários reproduzir os resultados alterando prompts ou modelos.

Roteiro e melhorias contínuas

A equipe está trabalhando em recursos adicionais, como reconhecimento de fala com múltiplos falantes , OCR aplicado a vídeos, melhorias no aprendizado audiovisual proativo e fluxos de trabalho de agentes mais robustos. Eles também indicaram que o suporte à saída de áudio no vLLM para o modelo Instruct estará disponível em breve, completando o ciclo de implantação em tempo real a partir desse backend.

FAQ: Suporte de tempo de execução e quantização

Alguns usuários comentaram que não conseguem executar o Qwen3-Omni mesmo com as bibliotecas usuais e que não visualizam os quantizadores no Hugging Face ; além disso, o formato nativo de 16 bits tem cerca de 70 GB, um tamanho problemático para computadores modestos. O próprio projeto esclarece que o Transformers já foi integrado, mas sem o pacote PyPI , que precisa ser instalado a partir do código-fonte, e que o vLLM é a opção preferencial para inferência, embora o suporte a áudio do Instruct no vLLM esteja previsto para breve.

Em relação à quantização, ainda não há espaços reservados listados no HF para Qwen3-Omni 30B-A3B, e vale lembrar que a natureza multimodal e de MoE complica a compatibilidade imediata com runtimes como o llama.cpp. Para quem precisa testar agora, a recomendação oficial é usar Docker + Transformers/vLLM a partir do código-fonte ou da API , e ficar de olho no repositório para pull requests de suporte e futuras quantizações quando estiverem disponíveis.

Boas práticas e instruções de avaliação

Para reproduzir os resultados, as seguintes diretrizes são detalhadas: a maioria dos benchmarks usa decodificação gulosa no Instruct sem amostragem e, para o Thinking, os parâmetros em generation_config.json devem ser respeitados . A taxa de quadros do vídeo também é definida como fps=2 durante a avaliação, e é indicado que o prompt do usuário deve seguir os dados multimodais, a menos que o conjunto de dados especifique o contrário.

Quando um teste de desempenho não inclui um prompt, os prompts padrão podem ser usados ​​(ASR chinês/outros, S2TT, letras de músicas). Além disso, o prompt do sistema não deve ser configurado durante a avaliação para garantir que os resultados sejam comparáveis ​​entre sistemas e execuções.

A Qwen3-Omni se posiciona como uma verdadeira plataforma omnimodal, com baixa latência, amplo suporte multilíngue, recursos de áudio e vídeo de ponta e um caminho de implantação claro usando Transformers, vLLM e Docker. Para quem busca um modelo único que lide com texto e imagens perfeitamente, sem sacrificar o desempenho, e que também ouça, fale e entenda vídeo , é uma proposta difícil de superar atualmente.