Qwen3-Omni: Omnimodal model hakkında bilmeniz gereken her şey

Son Güncelleme: 24 Eylül 2025
  • Metin, resim, ses ve video içeren, gerçek zamanlı yayın yapan yerel çok modlu model.
  • SOTA 22/36 ses/görüntü kıyaslamasında ve çok dilli (119/19/10 dil).
  • MoE, düşük gecikme ve sistem istemi kontrolüne sahip Düşünen-Konuşan mimarisi.
  • vLLM/Transformers, Docker ve resmi yardımcı programlarla birlikte kullanılması önerilir.

Qwen3-Omni omnimodal modeli

Qwen3-Omni'nin gelişi yapay zekânın çehresini değiştirdi: metin, görüntü, ses ve videoyu anlayabilen ve bunlara anında yazılı ve sözlü yanıt verebilen tek bir yerel model . Çok modlu "yama"lardan değil, düşük gecikme süresi ve ince ayarlı davranışsal kontrol ile modülleri entegre etmek için temel olarak tasarlanmış bir mimariden bahsediyoruz.

Neredeyse herkesin chatbot ve asistanları test ettiği bir dönemde, Qwen3-Omni iddialı bir şekilde ortaya çıkıyor: 119 dili metin yoluyla destekliyor, 19 dilde konuşmayı tanıyor ve 10 dilde konuşabiliyor , uzun ses kayıtlarını (30 dakikaya kadar) anlayabiliyor ve düzinelerce testte yüksek puanlar elde ediyor. Dahası, Düşünür-Konuşur tasarımı ve Uzman Karışımı yaklaşımı, gerçek dünya senaryolarında hızlı yanıt ve kaliteli akıl yürütmeyi hedefliyor.

gpt-5-0
İlgili makale:
GPT-5: Yapay Zeka'daki bir sonraki büyük devrim hakkında her şey

Qwen3-Omni nedir ve neler sunar?

Qwen3-Omni , metin, görüntü, ses ve video işlemek ve hem metin hem de doğal konuşma çıktısı üretmek üzere tasarlanmış, temel, çok modlu ve uçtan uca çok dilli modeller ailesidir . Önemli olan sadece girdi ve çıktı çeşitliliği değil, aynı zamanda akıcı konuşma geçişleri ve anında yanıt verme yeteneğiyle akış işlevselliğidir.

Ekip, performans ve verimlilik için çeşitli mimari iyileştirmeler getirdi: erken "metin odaklı" ön eğitim, karma çok modlu eğitimle birleştirildi ve metin ve görüntü performansını korurken ses ve video performansını artıran Uzmanlar Karışımı (MoE) tasarımı kullanıldı. Bu iyileştirmelerle model, 36 ses/video kıyaslama testinin 22'sinde en iyi performansı (SOTA) ve 36 testin 32'sinde açık kaynaklı en iyi performansı (SOTA) elde etti; sonuçlar ise otomatik konuşma tanıma (ASR), ses anlama ve konuşma diyalogu alanlarında Gemini 2.5 Pro ile karşılaştırılabilir düzeydeydi.

Qwen3-Çoklu çok modlu etkileşim

Temel yetenekler ve yöntemler

Qwen3-Omni, kapsamlı çok dilli desteğiyle gerçek dünya ses, görüntü ve görsel-işitsel uygulamaları için hazırdır: 119 metin dili, 19 ses giriş dili ve 10 ses çıkış dili . Ses giriş dilleri arasında İngilizce, Çince, Korece, Japonca, Almanca, Rusça, İtalyanca, Fransızca, İspanyolca, Portekizce, Malayca, Felemenkçe, Endonezce, Türkçe, Vietnamca, Kantonca, Arapça ve Urduca; çıkış dilleri arasında ise İngilizce, Çince, Fransızca, Almanca, Rusça, İtalyanca, İspanyolca, Portekizce, Japonca ve Korece gibi diller bulunmaktadır.

Resmi kılavuzlar serisi, kullanım alanlarının genişliğini göstermektedir. Ses alanında, çok dilli ve uzun sesli konuşma tanıma (ASR) , konuşmadan metne ve konuşmadan konuşmaya çeviri, müzik analizi (stil, ritim, türler), ses efekti açıklaması ve herhangi bir sesin altyazılandırılması gibi özellikler sergiler . Ayrıca konuşma, müzik ve ortam sesleri içeren parçaların karma analizini de destekler.

Görsel alanda, karmaşık görüntüler için "sert" OCR, nesne algılama ve temellendirme , görüntü kalite kontrolü, görüntü matematiksel çözümü (Düşünme modelinin öne çıktığı yer), video açıklaması, birinci şahıs video tabanlı navigasyon ve sahne geçiş analizi sunar . Görsel-işitsel senaryolarda ise zaman hizalamalı ses-video kalite kontrolü, AV girişleriyle yönlendirilmiş etkileşim ve asistan davranışıyla diyaloglar sergiler.

Bir aracı olarak, sesli arama yapabilme özelliğiyle öne çıkıyor ; bu özellik, araçları etkinleştiren sesli iş akışlarını açıyor ve türetilmiş görevlerde , temel olanın genelleştirilebilirliğini gösteren, son derece ayrıntılı altyazı sağlayan bir Omni-Captioner bulunuyor .

  Comet: Perplexity'nin Navigatörü Yapay Zeka Navigasyonunda Devrim Yaratıyor

MoE ile Düşünen-Konuşan Mimarlık ve Tasarım

En önemli farklılıklardan biri sorumlulukların ayrılmasıdır: Düşünür metni oluşturur (açıkça düşünce zinciri mantığını içeren varyasyonlarla) ve Konuşmacı gerçek zamanlı ses üretir . Bu ayrıştırma, sistem yüksek düzeyde metin anlama ve planlama yeteneğini korurken doğal sesli konuşmaya olanak tanır.

MoE veritabanı, iş yükünü uzmanlar arasında dağıtır ve güçlü genel temsiller için AuT ön eğitimine dayanır. Ayrıca, ses kanalında çoklu kod kodlamanın kullanılması, gecikmeyi minimuma indirir; bu da her saniyenin yüzde birinin önemli olduğu aramalar veya asistanlar için çok önemlidir.

Performans ve kıyaslamalar: metin, görüntü, ses ve görsel-işitsel

Qwen3-Omni, tek bir moda odaklanan benzer boyutlu Qwen modellerine kıyasla performans düşüşü yaşamadan en üst düzey metin ve görüntü performansını korurken, ses ve görsel-işitsel performansta çoğu testte öncü konumda yer alıyor . 36 ses ve görsel-işitsel kıyaslama testinden 32'sinde açık kaynaklı en iyi performansı, 22'sinde ise toplam en iyi performansı elde ederek Gemini 2.5 Pro ve GPT-4o'yu birçok noktada geride bırakıyor.

Metin alanında dikkat çekici bazı kilometre taşları şunlardır: AIME25'te Flash-Instruct varyantı yaklaşık 65,9 puan alırken; ZebraLogic'te Instruct 90 puana ulaşıyor ve MultiPL-E'de GPT-4o'ya karşı rekabetçi rakamlar elde ediyor. IFEval ve WritingBench gibi hizalama görevlerinde ise Instruct ve Thinking modelleri yüksek ve tutarlı puanlar gösteriyor.

Sesli tanıma alanında, Çince ve İngilizce için otomatik konuşma tanıma (ASR) sonuçları mükemmeldir: WenetSpeech ve LibriSpeech'te kelime hata oranını önemli ölçüde azaltır; LibriSpeech'te temiz/diğer testlerde 1,22/2,48'e yakın rakamlar elde edilir ve FLEURS (çok dilli) gibi testlerde çok düşük oranlar sunar. VoiceBench'te, AlpacaEval, CommonEval ve WildVoice gibi ölçütler Qwen3-Omni'yi kapalı referans sistemleriyle aynı seviyeye getirir ve MMAU v05.15.25'te sesli akıl yürütmede üstün performans gösterir.

Görsel-işitsel uygulamalarda en sık belirtilen ölçüt WorldSense'tir (yaklaşık 54,1 ), bu da Gemini-2.5-Flash'ı geride bırakmaktadır. Ayrıca, DailyOmni ve VideoHolmes gibi paketlerde , Thinking varyantı önceki açık kaynaklı en iyi uygulamalara göre iyileştirmeler sağlamaktadır. Saf görüntü işleme alanında ise MMMU, MathVista, MathVision ve belge anlama (AI2D, ChartQA) alanlarında üstün performans gösterirken, sayma (CountBench) ve video anlama (Video-MME, MLVU) alanlarında da çok iyi puanlar elde etmektedir.

Sıfır atışlı ses üretimi de ölçüldü: CosyVoice ve Seed-TTS gibi ailelerle karşılaştırıldığında, Qwen3-Omni birden fazla dilde daha iyi içerik tutarlılığı ve yüksek konuşmacı benzerliği gösteriyor. Çok dilli bölümde, "İçerik Tutarlılığı" ve "Konuşmacı Benzerliği" tabloları, Qwen3-Omni 30B-A3B'nin Çince ve İngilizce'de oldukça rekabetçi, Almanca, İtalyanca, Portekizce, İspanyolca, Japonca, Korece, Fransızca ve Rusça'da ise sağlam olduğunu gösteriyor. Diller arası metinden sese dönüştürmede , CosyVoice 2/3'e kıyasla çeşitli çiftlerde (örneğin, zh→en, ja→en, ko→zh) daha iyi WER/tutarlılık elde ediyor.

Mevcut modeller ve her birinin kullanım amacı

Qwen3-Omni serisi, her biri belirli bir kullanım amacına yönelik tasarlanmış üç ana parçadan oluşmaktadır: Öğretici , Düşünme ve Altyazı Oluşturucu . Hepsi aynı temelden türemiştir ancak belirli görevler için farklı yetenekler etkinleştirilmiş veya ince ayarlanmıştır.

Qwen3-Omni-30B-A3B- Instruct , Thinker ve Talker bileşenlerini içerir, ses, video ve metin kabul eder ve metin ile ses döndürür. Tam etkileşim ve gerçek zamanlı konuşma sonuçları istiyorsanız doğru seçimdir ve ses veya video demoları için önerilir.

Qwen3-Omni-30B-A3B- Thinking, zincirleme akıl yürütme ile Düşünür'e odaklanır ve metinsel çıktı ile ses, video ve metni destekler. Derinlemesine analiz, karmaşık problemlerin çözümü, görsel matematik veya ses çıktısına ihtiyaç duymadığınız ancak en iyi yapılandırılmış düşünmeye ihtiyaç duyduğunuz iş akışları için kullanışlıdır .

  Kayıt Olmadan Yapay Zekayı Nasıl Kullanabilirsiniz: Kapsamlı Bir Kılavuz

Qwen3-Omni-30B-A3B- Captioner , yüksek hassasiyetli, düşük hiperaktiviteli ses altyazılama teknolojisinin geliştirilmiş bir türevidir . Açık kaynaklıdır, çok çeşitli sesleri büyük bir ayrıntıyla kapsar ve açık kaynak ekosisteminde tarihsel bir boşluğu doldurur: genel amaçlı sesler için güvenilir ve zengin altyazılar .

Gecikme, gerçek zamanlı ve davranışsal kontrol

Sistem, anlık etkileşim için optimize edilmiştir; ses için yaklaşık 211 ms, ses-video için ise 507 ms'lik yanıt süreleri sunar. Akışa ek olarak, Düşünür (metin) ve Konuşan (ses) rollerinin net bir şekilde belirlenmesiyle desteklenen doğal konuşma sırası ve istikrarlı ses iletimine önem verilmektedir.

İnce ayar için, sistem uyarılarıyla stili özelleştirebilirsiniz . Video sesinin referans olarak kullanıldığı AV senaryolarında, ekip, Düşünürün mantığını korurken daha okunaklı ve konuşma diline uygun metin sağlayan ve Konuşanın akıcı bir şekilde konuşmasını kolaylaştıran bir sistem uyarısı önermektedir. Ayrıca , çok turlu bir konuşma boyunca `use_audio_in_video` parametresinin tutarlı tutulması önerilir .

Değerlendirmede belirli yönergeler vardır: sistem istemi ayarlamayın , her kıyaslama için ChatML formatını izleyin ve istem olmadığında varsayılan olarak şunları kullanın: Çince ASR (“请将这段中文语音转换为纯文本。”), diğer dillerde ASR (“Sesi metne dönüştür.”), S2TT (“Sağlanan <kaynak_dil> konuşmasını dinleyin…”) ve şarkı sözleri (“ Şarkı sözlerini noktalama işaretleri olmadan, satırlar satır sonuyla ayrılmış şekilde metne dönüştürün ”).

Dağıtım, gereksinimler ve araçlar

Tam bir yerel deneyim için ekip, Hugging Face Transformers'ı ve yazılım mühendisliği aşamalarını incelemeyi öneriyor , ancak şunu unutmayın: MoE mimarisi olduğundan, HF çıkarımıyla yavaş çalışabilir; üretim veya düşük gecikmeli uygulamalar için vLLM veya DashScope API'sini kullanmayı öneriyorlar ve hatta her ikisi için de ortamlar içeren bir Docker imajı sağlıyorlar. Transformers kodu zaten birleştirildi, ancak PyPI paketi henüz yayınlanmadı ve kaynak koddan yüklenmesi gerekiyor.

Ses ve görüntü/video (base64, URL'ler, aralıklı girişler) işleme için yardımcı programlar sağlarlar ve float16 veya bfloat16 yüklenirken GPU belleğini azaltmak için Transformers ile FlashAttention 2'yi önerirler. vLLM ile FlashAttn2 dahildir ve limit_mm_per_prompt (GPU belleğini önceden ayırır) ve paralellik için max_num_seqs gibi parametreler ayrıntılı olarak açıklanmıştır ; ayrıca, tensor_parallel_size'ı artırmak çoklu GPU çıkarımını etkinleştirir.

Bazı faydalı kaynak tasarrufu ipuçları şunlardır: Sese ihtiyacınız yoksa, başlatmadan sonra Talker'ı devre dışı bırakarak yaklaşık 10 GB VRAM tasarrufu sağlayabilirsiniz. Daha hızlı metin çıktısı istiyorsanız, oluşturma sırasında `return_audio=False` kullanın . FlashAttn2 ile BF16 için minimum teorik bellek gereksinimleri de verilmiştir: Örneğin, Instruct 30B-A3B, 15 saniyelik video ile yaklaşık 78,9 GB ve 120 saniyelik video ile 144,8 GB kullanır; Thinking ise sırasıyla yaklaşık 68,7 GB ve 131,7 GB kullanır.

Yerel bir web demosu kurmak için , vLLM ortamınızı (veya daha yavaş olan Transformers ortamını) hazırlamanızı, ffmpeg'in kurulu olduğundan emin olmanızı ve kendi komut dosyalarını kullanmanızı öneriyorlar. NVIDIA Container Toolkit , port eşleme (örneğin, ana bilgisayar 8901 → konteyner 80) ve 0.0.0.0 adresinden sunma seçeneği ile GPU'ya hazır Docker imajları "qwenllm/qwen3-omni" sunuyorlar. İhtiyaç duydukça konteyneri yeniden ekleyebilir veya silebilirsiniz.

Demolar, API'ler ve ekosistem

Yerel olarak dağıtım yapmak istemiyorsanız, Qwen3-Omni-Realtime, Instruct, Thinking ve Captioner uygulamalarının demolarını Hugging Face Spaces ve ModelScope Studio'da deneyebilirsiniz. Gerçek zamanlı yayın özelliğine sahip Qwen Chat de mevcuttur: arayüzde sesli/görüntülü arama seçeneğini seçmeniz yeterlidir.

  Usta Yapay Zeka: Avrupa'nın gelişmiş akıl yürütme modellerinde büyük sıçraması

Düşük gecikme süresiyle ölçeklenebilir entegrasyon için önerilen yaklaşım, en öngörülebilir performansı sunan DashScope API'sidir . Ayrıca, topluluk Discord ve WeChat gibi kanallar aracılığıyla koordinasyon sağlar ve kullanıcıların komutları veya modelleri değiştirerek sonuçları yeniden üretmelerine olanak tanıyan gerçek yürütme günlükleri içeren kılavuzlar yayınlar.

Yol haritası ve devam eden iyileştirmeler

Ekip, çoklu konuşmacılı konuşma tanıma , videoya uygulanan OCR, proaktif görsel-işitsel öğrenmeye yönelik iyileştirmeler ve daha zengin ajan iş akışları gibi ek özellikler üzerinde çalışıyor. Ayrıca, Instruct modeli için vLLM'de ses çıkışı desteğinin yakında kullanıma sunulacağını ve bu arka uçtan gerçek zamanlı dağıtım döngüsünün tamamlanacağını belirttiler.

SSS: Çalışma zamanı desteği ve niceleme

Bazı kullanıcılar, Qwen3-Omni'yi bilinen yöntemlerle bile çalıştıramadıklarını ve Hugging Face'te nicel verileri göremediklerini belirtmişlerdir ; ayrıca, yerel 16 bit format yaklaşık 70 GB boyutundadır ki bu da mütevazı bilgisayarlar için sorun teşkil etmektedir. Projenin kendisi, Transformers'ın zaten birleştirildiğini ancak PyPI paketinin olmadığını , bunun kaynak koddan yüklenmesi gerektiğini ve çıkarım için tercih edilen seçeneğin vLLM olduğunu, ancak vLLM'de Instruct ses desteğinin yakın gelecekte yayınlanacağını açıklamaktadır.

Nicelleştirme konusunda, HF'de Qwen3-Omni 30B-A3B için henüz yer tutucular listelenmemiştir ve MoE ve çok modlu yapının llama.cpp gibi çalışma ortamlarıyla anlık uyumluluğu zorlaştırdığını hatırlamakta fayda var. Şimdi test etmesi gerekenler için resmi öneri, kaynak koddan veya API'den Docker + Transformers/vLLM kullanmak ve destek çekme istekleri ve gelecekteki nicelleştirmeler için depoyu takip etmektir.

İyi değerlendirme uygulamaları ve uyarıları

Sayıları yeniden üretmek için aşağıdaki yönergeler ayrıntılı olarak açıklanmıştır: çoğu kıyaslama, örnekleme yapılmadan Instruct'ta açgözlü kod çözme kullanır ve Thinking için generation_config.json dosyasındaki parametrelere uyulmalıdır . Değerlendirme sırasında video kare hızı da fps=2 olarak ayarlanır ve veri kümesi aksini belirtmediği sürece çok modlu verilerin ardından kullanıcı isteminin gösterilmesi gerektiği belirtilir.

Bir kıyaslama testi bir komut istemi içermediğinde, varsayılan komut istemleri kullanılabilir (Çince ASR/diğer, S2TT, şarkı sözleri). Ayrıca, sonuçların sistemler ve çalıştırmalar arasında karşılaştırılabilir olmasını sağlamak için değerlendirme sırasında sistem komut istemi ayarlanmamalıdır.

Qwen3-Omni, düşük gecikme süresi, geniş çok dilli destek, son teknoloji ses ve video yetenekleri ve Transformers, vLLM ve Docker kullanarak net bir dağıtım yolu ile gerçek bir çok modlu platform olarak konumlanıyor. Performanstan ödün vermeden metin ve görüntüleri sorunsuz bir şekilde işleyen ve aynı zamanda dinleyen, konuşan ve videoyu anlayan tek bir model arayanlar için , günümüzde rakipsiz bir teklif sunuyor.