Qwen3-Omni: Semua yang anda perlu tahu tentang model omnimodal

Kemaskini terakhir: 24 September 2025
Pengarang TecnoDigital
  • Model omnimodal asli dengan teks, imej, audio dan video serta penstriman masa nyata.
  • SOTA dalam penanda aras audio/video 22/36 dan berbilang bahasa (119/19/10 bahasa).
  • Seni bina Thinker-Talker dengan MoE, kependaman rendah dan kawalan segera sistem.
  • Pengerahan yang disyorkan dengan vLLM/Transformers, Docker dan utiliti rasmi.

Model omnimodal Qwen3-Omni

Ketibaan Qwen3-Omni telah mengubah landskap AI: satu model asli tunggal yang mampu memahami dan bertindak balas terhadap teks, imej, audio dan video , dengan respons serta-merta dalam bentuk bertulis dan lisan. Kita bukan bercakap tentang "tampalan" multimodal, tetapi sebaliknya seni bina yang direka bentuk secara asas untuk mengintegrasikan modaliti dengan latensi rendah dan kawalan tingkah laku yang ditala dengan baik.

Pada masa hampir semua orang menguji chatbot dan pembantu, Qwen3-Omni hadir dengan cita-cita: ia menyokong 119 bahasa melalui teks, mengecam pertuturan dalam 19 dan bertutur dalam 10 bahasa , memahami audio panjang (sehingga 30 minit), dan mempunyai skor penanda aras dalam berpuluh-puluh ujian. Tambahan pula, reka bentuk Thinker-Talker dan pendekatan Mixture of Experts bertujuan untuk kelajuan tindak balas dan kualiti penaakulan dalam senario dunia sebenar.

gpt-5-0
Artikel berkaitan:
GPT-5: Semua tentang revolusi besar seterusnya dalam Kepintaran Buatan

Apakah Qwen3-Omni dan apakah yang ditawarkannya?

Qwen3-Omni ialah keluarga model berbilang bahasa asas, omnimodal dan hujung ke hujung yang direka untuk memproses teks, imej, audio dan video, dengan output dalam teks dan pertuturan semula jadi. Kuncinya bukan sahaja terletak pada kepelbagaian input dan output tetapi juga pada fungsi penstrimannya dengan pusingan perbualan yang lancar dan keupayaan untuk bertindak balas dengan segera.

Pasukan ini telah memperkenalkan beberapa penambahbaikan seni bina untuk prestasi dan kecekapan: pra-latihan awal "teks dahulu" yang digabungkan dengan latihan multimodal campuran, dan reka bentuk dengan Campuran Pakar (MoE) yang mengekalkan prestasinya dalam teks dan imej sambil meningkatkan audio dan video. Dengan penambahbaikan ini, model ini mencapai SOTA dalam 22 daripada 36 penanda aras audio/video dan SOTA sumber terbuka dalam 32 daripada 36, ​​dengan hasil yang setanding dengan Gemini 2.5 Pro dalam ASR, pemahaman audio dan perbualan pertuturan.

Interaksi multimodal Qwen3-Omni

Keupayaan dan modaliti utama

Qwen3-Omni sedia untuk aplikasi audio, visi dan audiovisual dunia sebenar, dengan sokongan berbilang bahasa yang meluas: 119 bahasa teks, 19 bahasa input suara dan 10 bahasa output suara . Bahasa input suara termasuk Bahasa Inggeris, Cina, Korea, Jepun, Jerman, Rusia, Itali, Perancis, Sepanyol, Portugis, Melayu, Belanda, Indonesia, Turki, Vietnam, Kantonis, Arab dan Urdu; dan bahasa output termasuk Bahasa Inggeris, Cina, Perancis, Jerman, Rusia, Itali, Sepanyol, Portugis, Jepun dan Korea, antara lain.

Set buku masakan rasmi menggambarkan keluasan kegunaannya. Dalam audio, ia mempamerkan pengecaman pertuturan berbilang bahasa dan audio panjang (ASR) , terjemahan pertuturan-ke-teks dan pertuturan-ke-pertuturan, analisis muzik (gaya, irama, genre), penerangan kesan bunyi dan kapsyen sebarang audio . Ia juga menyokong analisis campuran trek dengan pertuturan, muzik dan bunyi ambien.

Dalam visi, ia menawarkan OCR "keras" untuk imej kompleks, pengesanan dan pembumian objek , QA imej, penyelesaian matematik imej (yang mana model Pemikiran menonjol), penerangan video, navigasi berasaskan video orang pertama dan analisis peralihan pemandangan . Dalam senario audiovisual, ia menunjukkan QA audio-video dengan penjajaran masa, interaksi berpandu dengan input AV dan dialog dengan tingkah laku pembantu.

Sebagai ejen, ia menonjol kerana keupayaannya untuk berfungsi memanggil daripada audio , yang membuka aliran kerja suara yang mengaktifkan alatan, dan dalam tugasan terbitan terdapat Omni-Captioner untuk sari kata dengan terperinci, yang menunjukkan kebolehgeneralisasian tugasan asas.

  Komet: Navigator Perplexity Merevolusikan Navigasi AI

Seni Bina dan Reka Bentuk Thinker-Talker dengan MoE

Salah satu pembeza utama ialah pemisahan tanggungjawab: Pemikir menjana teks (dengan variasi yang merangkumi penaakulan rantaian pemikiran yang eksplisit), dan Penutur menghasilkan audio masa nyata . Penyahgandingan ini membolehkan perbualan suara semula jadi sementara sistem mengekalkan tahap pemahaman dan perancangan teks yang tinggi.

Pangkalan data KPM mengagihkan beban kerja antara pakar dan bergantung pada latihan awal AuT untuk perwakilan umum yang berkuasa. Tambahan pula, penggunaan pengekodan berbilang kod dalam saluran audio mengurangkan kependaman kepada minimum, yang penting untuk panggilan atau pembantu di mana setiap perseratus saat penting.

Prestasi dan penanda aras: teks, penglihatan, audio dan audiovisual

Qwen3-Omni mengekalkan prestasi teks dan imej yang canggih tanpa menjejaskan prestasi berbanding model Qwen bersaiz serupa yang tertumpu pada mod tunggal, manakala dalam prestasi audio dan audiovisual, ia menetapkan rentak dalam kebanyakan ujian . Dengan bateri 36 penanda aras audio dan audiovisual, ia mencapai SOTA sumber terbuka dalam 32 dan jumlah SOTA dalam 22, mengatasi Gemini 2.5 Pro dan GPT-4o dalam beberapa mata.

Beberapa peristiwa penting dalam teks: dalam AIME25, varian Flash-Instruct mendapat skor sekitar 65,9; dalam ZebraLogic, Instruct mencapai 90, dan dalam MultiPL-E ia mencapai angka kompetitif berbanding GPT-4o. Dalam tugasan penjajaran seperti IFEval dan WritingBench, model Instruct dan Thinking menunjukkan skor yang tinggi dan konsisten.

Dalam audio, keputusan ASR untuk bahasa Cina dan Inggeris adalah sangat baik: dalam WenetSpeech dan LibriSpeech, ia mengurangkan kadar ralat perkataan dengan ketara, dengan angka hampir 1,22/2,48 dalam LibriSpeech bersih/lain-lain, dan dalam set seperti FLEURS (berbilang bahasa), ia menawarkan kadar yang sangat rendah. Dalam VoiceBench, metrik seperti AlpacaEval, CommonEval dan WildVoice meletakkan Qwen3-Omni setanding dengan sistem rujukan tertutup, dan ia cemerlang dalam penaakulan audio dalam MMAU v05.15.25.

Dalam aplikasi audiovisual, metrik yang paling kerap disebut ialah WorldSense (kira-kira 54,1 ), mengatasi Gemini-2.5-Flash. Tambahan pula, dalam suit seperti DailyOmni dan VideoHolmes, varian Thinking mencapai penambahbaikan berbanding aplikasi SOTA sumber terbuka sebelumnya. Dalam visi tulen, ia cemerlang dalam MMMU, MathVista, MathVision dan pemahaman dokumen (AI2D, ChartQA), dengan skor yang sangat baik dalam pengiraan (CountBench) dan pemahaman video (Video-MME, MLVU).

Penjanaan suara zero-shot juga diukur: berbanding dengan keluarga seperti CosyVoice dan Seed-TTS, Qwen3-Omni menunjukkan konsistensi kandungan yang lebih baik merentasi pelbagai bahasa dan persamaan penutur yang tinggi . Dalam bahagian berbilang bahasa, jadual "Konsistensi Kandungan" dan "Persamaan Penutur" menunjukkan Qwen3-Omni 30B-A3B sangat kompetitif dalam bahasa Cina dan Inggeris, dan kukuh dalam bahasa Jerman, Itali, Portugis, Sepanyol, Jepun, Korea, Perancis dan Rusia. Dalam TTS silang bahasa , ia mencapai konsistensi/WER yang lebih baik merentasi beberapa pasangan (cth., zh→en, ja→en, ko→zh) berbanding CosyVoice 2/3.

Model yang tersedia dan kegunaan setiap satu

Barisan Qwen3-Omni merangkumi tiga bahagian utama, setiap satunya direka untuk kegunaan tertentu: Instruct , Thinking dan Captioner . Kesemuanya berasal dari teras yang sama tetapi dengan keupayaan berbeza yang diaktifkan atau ditala halus untuk tugas tertentu.

Qwen3-Omni-30B-A3B- Instruct mengandungi Pemikir dan Penutur, menerima audio, video dan teks , serta mengembalikan teks dan audio. Ia adalah pilihan yang tepat jika anda mahukan interaksi penuh dan hasil pertuturan masa nyata, dan disyorkan untuk demo suara atau video .

Qwen3-Omni-30B-A3B- Pemikiran memberi tumpuan kepada Pemikir dengan penaakulan berantai , menyokong audio, video dan teks dengan output tekstual. Ia berguna untuk analisis mendalam, menyelesaikan masalah kompleks, matematik visual atau aliran kerja di mana anda tidak memerlukan output suara tetapi memerlukan pemikiran berstruktur yang terbaik.

  Cara Menggunakan Kecerdasan Buatan Tanpa Mendaftar: Panduan Lengkap

Qwen3-Omni-30B-A3B- Captioner ialah terbitan halus bagi sari kata audio berketepatan tinggi dan hiperaktif rendah . Ia merupakan sumber terbuka, merangkumi pelbagai jenis audio dengan terperinci dan mengisi jurang sejarah dalam ekosistem sumber terbuka: sari kata yang andal dan kaya untuk audio tujuan umum.

Latensi, masa nyata dan kawalan tingkah laku

Sistem ini dioptimumkan untuk interaksi segera, dengan masa tindak balas kira-kira 211 ms untuk audio dan 507 ms untuk audio-video . Selain penstriman, penekanan diberikan pada giliran perbualan semula jadi dan penyampaian suara yang stabil, dibantu oleh peranan Pemikir (teks) dan Penutur (suara) yang jelas.

Untuk penalaan halus, anda boleh menyesuaikan gaya dengan gesaan sistem . Dalam senario AV di mana audio video digunakan untuk rujukan, pasukan mencadangkan gesaan sistem yang mengekalkan penaakulan Pemikir sambil menyediakan teks yang lebih mudah dibaca dan seperti perbualan, menjadikannya lebih mudah untuk Penutur bercakap dengan lancar . Anda juga disyorkan untuk memastikan parameter `use_audio_in_video` konsisten sepanjang perbualan berbilang pusingan.

Dalam penilaian, terdapat garis panduan khusus: jangan tetapkan gesaan sistem , ikut format ChatML bagi setiap penanda aras dan, apabila tiada gesaan, gunakan yang berikut secara lalai: ASR Cina (“请将这段中文语音转换为纯文本。”), ASR bahasa lain ("Transkripsi audio ke dalam teks."), S2TT (“Dengar ucapan <sumber_bahasa> yang disediakan…”), dan lirik lagu (“ Transkripsi lirik lagu” … tanpa tanda baca, baris dipisahkan oleh jeda”).

Penggunaan, keperluan dan alat

Untuk pengalaman tempatan yang lengkap, pasukan mengesyorkan Hugging Face Transformers dan menyemak fasa kejuruteraan perisian , tetapi perlu diingat: sebagai seni bina MoE, ia boleh berjalan perlahan dengan inferens HF; untuk aplikasi pengeluaran atau latensi rendah , mereka menasihatkan penggunaan vLLM atau DashScope API , dan juga menyediakan imej Docker yang merangkumi persekitaran untuk kedua-duanya. Kod Transformers telah digabungkan, tetapi pakej PyPI belum dikeluarkan dan mesti dipasang dari sumber.

Mereka menyediakan utiliti untuk mengendalikan audio dan imej/video (base64, URL, input interleaved), dan mengesyorkan FlashAttention 2 dengan Transformers untuk mengurangkan memori GPU setiap kali memuatkan dalam float16 atau bfloat16 . Dengan vLLM, FlashAttn2 disertakan, dan parameter seperti limit_mm_per_prompt (pra-memperuntukkan memori GPU) dan max_num_seqs untuk paralelisme diperincikan ; di samping itu, peningkatan tensor_parallel_size membolehkan inferens berbilang GPU.

Terdapat beberapa petua penjimatan sumber yang berguna: jika anda tidak memerlukan audio, anda boleh melumpuhkan Talker selepas permulaan, menjimatkan kira-kira 10 GB VRAM. Dan jika anda mahukan output teks yang lebih pantas, gunakan `return_audio=False` semasa penjanaan. Keperluan memori teori minimum untuk BF16 dengan FlashAttn2 juga disediakan: contohnya, Instruct 30B-A3B menggunakan kira-kira 78,9 GB dengan 15 saat video dan 144,8 GB dengan 120 saat; Thinking masing-masing menggunakan kira-kira 68,7 GB dan 131,7 GB.

Untuk menyediakan demo web setempat , mereka mengesyorkan menyediakan persekitaran vLLM anda (atau persekitaran Transformers yang lebih perlahan), memastikan anda telah memasang ffmpeg dan menggunakan skrip mereka. Mereka menawarkan imej Docker sedia GPU “qwenllm/qwen3-omni” dengan NVIDIA Container Toolkit , pemetaan port (cth., hos 8901 → kontena 80) dan pilihan untuk berkhidmat dari 0.0.0.0. Anda boleh memasukkan semula atau memadam kontena mengikut keperluan.

Demo, API dan ekosistem

Jika anda tidak mahu menggunakan aplikasi secara tempatan, anda boleh mencuba demo pada Hugging Face Spaces dan ModelScope Studio , dengan pengalaman untuk Qwen3-Omni-Realtime, Instruct, Thinking dan Captioner. Qwen Chat dengan penstriman masa nyata juga tersedia: cuma pilih pilihan panggilan suara/video dalam antara muka.

  AI yang mahir: Lonjakan hebat Eropah dalam model penaakulan lanjutan

Untuk penyepaduan berskala dengan kependaman rendah, pendekatan yang disyorkan ialah DashScope API , yang menawarkan prestasi yang paling boleh diramal. Tambahan pula, komuniti ini menyelaras melalui saluran seperti Discord dan WeChat , dan menerbitkan buku masakan dengan log pelaksanaan sebenar yang membolehkan pengguna menghasilkan semula hasil dengan menukar gesaan atau model.

Pelan hala tuju dan penambahbaikan berterusan

Pasukan ini sedang mengusahakan ciri-ciri tambahan seperti pengecaman pertuturan berbilang pembesar suara , OCR yang digunakan pada video, penambahbaikan pada pembelajaran audiovisual proaktif dan aliran kerja ejen yang lebih kaya. Mereka juga menunjukkan bahawa sokongan output audio dalam vLLM untuk model Instruct akan tersedia tidak lama lagi, melengkapkan kitaran penggunaan masa nyata daripada bahagian belakang tersebut.

Soalan Lazim: Sokongan masa jalan dan pengkuantitian

Sesetengah pengguna telah mengulas bahawa mereka tidak boleh menjalankan Qwen3-Omni walaupun dengan suspek biasa dan mereka tidak melihat quant dalam Hugging Face ; tambahan pula, format 16-bit natif adalah sekitar 70 GB, saiz yang bermasalah untuk komputer sederhana. Projek itu sendiri menjelaskan bahawa Transformers telah digabungkan tetapi tanpa pakej PyPI , yang mesti dipasang dari sumber, dan vLLM adalah pilihan pilihan untuk inferens, walaupun sokongan audio Instruct dalam vLLM akan dikeluarkan dalam masa terdekat.

Berkenaan kuantisasi, tiada ruang letak yang disenaraikan dalam HF untuk Qwen3-Omni 30B-A3B, dan perlu diingat bahawa sifat MoE dan multimodal merumitkan keserasian segera dengan masa jalan seperti llama.cpp. Bagi mereka yang perlu menguji sekarang, cadangan rasmi adalah menggunakan Docker + Transformers/vLLM daripada sumber atau API , dan perhatikan repositori untuk permintaan tarik sokongan dan kuantisasi masa hadapan apabila ia tersedia.

Amalan dan arahan penilaian yang baik

Untuk menghasilkan semula nombor, garis panduan berikut diperincikan: kebanyakan penanda aras menggunakan penyahkodan tamak dalam Instruct tanpa persampelan, dan untuk Thinking, parameter dalam generation_config.json mesti dipatuhi . Kadar bingkai video juga ditetapkan kepada fps=2 semasa penilaian, dan ditunjukkan bahawa gesaan pengguna harus mengikuti data multimodal melainkan set data menyatakan sebaliknya.

Apabila penanda aras tidak menyertakan gesaan, gesaan lalai boleh digunakan (ASR/lain-lain Bahasa Cina, S2TT, lirik lagu). Selain itu, gesaan sistem tidak boleh ditetapkan semasa penilaian bagi memastikan keputusan setanding merentasi sistem dan jalanan.

Qwen3-Omni meletakkan dirinya sebagai platform omnimodal sebenar, dengan kependaman rendah, sokongan berbilang bahasa yang luas, keupayaan audio dan video canggih , dan laluan penggunaan yang jelas menggunakan Transformers, vLLM dan Docker. Bagi mereka yang mencari model tunggal yang mengendalikan teks dan imej dengan lancar tanpa mengorbankan prestasi, dan juga mendengar, bercakap dan memahami video , ia merupakan cadangan yang sukar ditandingi hari ini.