- Εγγενές πολυτροπικό μοντέλο με κείμενο, εικόνα, ήχο και βίντεο, και ροή σε πραγματικό χρόνο.
- SOTA σε 22/36 σημεία αναφοράς ήχου/βίντεο και πολύγλωσσο (119/19/10 γλώσσες).
- Αρχιτεκτονική Thinker-Talker με MoE, χαμηλή καθυστέρηση και έλεγχο εντολών συστήματος.
- Συνιστώμενη ανάπτυξη με vLLM/Transformers, Docker και επίσημα βοηθητικά προγράμματα.
Η άφιξη του Qwen3-Omni έχει αλλάξει το τοπίο της Τεχνητής Νοημοσύνης: ένα ενιαίο εγγενές μοντέλο ικανό να κατανοεί και να ανταποκρίνεται σε κείμενο, εικόνες, ήχο και βίντεο , με άμεσες απαντήσεις τόσο σε γραπτή όσο και σε προφορική μορφή. Δεν μιλάμε για πολυτροπικά "patches", αλλά μάλλον για μια θεμελιωδώς σχεδιασμένη αρχιτεκτονική για την ενσωμάτωση μεθόδων με χαμηλή καθυστέρηση και λεπτορυθμισμένο έλεγχο συμπεριφοράς.
Σε μια εποχή που σχεδόν όλοι δοκιμάζουν chatbots και βοηθούς, το Qwen3-Omni έρχεται με φιλόδοξες ιδέες: υποστηρίζει 119 γλώσσες μέσω κειμένου, αναγνωρίζει την ομιλία σε 19 και μιλάει σε 10 , κατανοεί μεγάλο ήχο (έως 30 λεπτά) και διαθέτει συγκριτικές βαθμολογίες σε δεκάδες δοκιμές. Επιπλέον, ο σχεδιασμός Thinker-Talker και η προσέγγιση Mixture of Experts στοχεύουν στην ταχύτητα απόκρισης και την ποιότητα της συλλογιστικής σε σενάρια πραγματικού κόσμου.
Τι είναι το Qwen3-Omni και τι προσφέρει;
Το Qwen3-Omni είναι μια οικογένεια βασικών, πανομοιότυπων και ολοκληρωμένων πολυγλωσσικών μοντέλων, σχεδιασμένων για την επεξεργασία κειμένου, εικόνων, ήχου και βίντεο, με έξοδο τόσο σε κείμενο όσο και σε φυσική ομιλία. Το κλειδί δεν έγκειται μόνο στην ποικιλία των εισόδων και εξόδων, αλλά και στη λειτουργικότητα ροής με ομαλή ροή συνομιλίας και την ικανότητα άμεσης απόκρισης.
Η ομάδα έχει εισαγάγει αρκετές αρχιτεκτονικές βελτιώσεις για την απόδοση και την αποτελεσματικότητα: έγκαιρη προεκπαίδευση «με προτεραιότητα το κείμενο» σε συνδυασμό με μικτή πολυτροπική εκπαίδευση και σχεδιασμό με Μείγμα Εμπειρογνωμόνων (MoE) που διατηρεί την απόδοσή του σε κείμενο και εικόνα, ενώ παράλληλα ενισχύει τον ήχο και το βίντεο. Με αυτές τις βελτιώσεις, το μοντέλο επιτυγχάνει SOTA σε 22 από τα 36 benchmarks ήχου/βίντεο και SOTA ανοιχτού κώδικα σε 32 από τα 36, με αποτελέσματα συγκρίσιμα με το Gemini 2.5 Pro σε ASR, κατανόηση ήχου και συνομιλία ομιλίας.

Βασικές δυνατότητες και τρόποι
Το Qwen3-Omni είναι έτοιμο για εφαρμογές ήχου, εικόνας και οπτικοακουστικών μέσων σε πραγματικό κόσμο, με εκτεταμένη πολυγλωσσική υποστήριξη: 119 γλώσσες κειμένου, 19 γλώσσες φωνητικής εισαγωγής και 10 γλώσσες φωνητικής εξόδου . Οι γλώσσες φωνητικής εισαγωγής περιλαμβάνουν Αγγλικά, Κινέζικα, Κορεατικά, Ιαπωνικά, Γερμανικά, Ρωσικά, Ιταλικά, Γαλλικά, Ισπανικά, Πορτογαλικά, Μαλαισιανά, Ολλανδικά, Ινδονησιακά, Τουρκικά, Βιετναμέζικα, Καντονέζικα, Αραβικά και Ουρντού. Οι γλώσσες εξόδου περιλαμβάνουν Αγγλικά, Κινέζικα, Γαλλικά, Γερμανικά, Ρωσικά, Ιταλικά, Ισπανικά, Πορτογαλικά, Ιαπωνικά και Κορεατικά, μεταξύ άλλων.
Η σουίτα επίσημων βιβλίων μαγειρικής καταδεικνύει το εύρος των χρήσεών του. Στον ήχο, παρουσιάζει πολυγλωσσική και μακράς διάρκειας αναγνώριση ομιλίας (ASR) , μετάφραση ομιλίας σε κείμενο και ομιλίας σε ομιλία, ανάλυση μουσικής (στυλ, ρυθμός, είδη), περιγραφή ηχητικών εφέ και υπότιτλους οποιουδήποτε ήχου . Υποστηρίζει επίσης μικτή ανάλυση κομματιών με ομιλία, μουσική και ήχους περιβάλλοντος.
Στην όραση, προσφέρει «σκληρό» OCR για σύνθετες εικόνες, ανίχνευση και γείωση αντικειμένων , διασφάλιση ποιότητας εικόνας, επίλυση μαθηματικών εικόνων (όπου το μοντέλο σκέψης λάμπει), περιγραφή βίντεο, πλοήγηση με βάση βίντεο σε πρώτο πρόσωπο και ανάλυση μετάβασης σκηνών . Σε οπτικοακουστικά σενάρια, επιδεικνύει διασφάλιση ποιότητας ήχου-βίντεο με χρονική ευθυγράμμιση, καθοδηγούμενη αλληλεπίδραση με εισόδους AV και διαλόγους με τη συμπεριφορά του βοηθού.
Ως πράκτορας, ξεχωρίζει για την ικανότητά του να λειτουργεί ως agent μέσω ήχου , κάτι που ανοίγει φωνητικές ροές εργασίας που ενεργοποιούν εργαλεία, ενώ στις παράγωγες εργασίες υπάρχει ένα Omni-Captioner για υποτιτλισμό με μεγάλη λεπτομέρεια, το οποίο καταδεικνύει τη γενικευσιμότητα του βασικού.
Αρχιτεκτονική και Σχεδιασμός στοχαστών-ομιλητών με το Υπουργείο Παιδείας
Ένα από τα βασικά διαφοροποιητικά στοιχεία είναι ο διαχωρισμός των ευθυνών: ο Στοχαστής δημιουργεί το κείμενο (με παραλλαγές που περιλαμβάνουν σαφή συλλογιστική αλυσίδας σκέψης) και ο Ομιλητής παράγει ήχο σε πραγματικό χρόνο . Αυτή η αποσύνδεση επιτρέπει τη φυσική φωνητική συνομιλία, ενώ το σύστημα διατηρεί υψηλό επίπεδο κατανόησης και σχεδιασμού κειμένου.
Η βάση δεδομένων του MoE κατανέμει το φόρτο εργασίας μεταξύ των ειδικών και βασίζεται στην προ-εκπαίδευση AuT για ισχυρές γενικές αναπαραστάσεις. Επιπλέον, η χρήση κωδικοποίησης πολλαπλών κωδικών στο κανάλι ήχου μειώνει την καθυστέρηση στο ελάχιστο, κάτι που είναι κρίσιμο για κλήσεις ή βοηθούς όπου κάθε εκατοστό του δευτερολέπτου μετράει.
Απόδοση και σημεία αναφοράς: κείμενο, εικόνα, ήχος και οπτικοακουστικά μέσα
Το Qwen3-Omni διατηρεί κορυφαία απόδοση κειμένου και εικόνας χωρίς υποβάθμιση σε σύγκριση με παρόμοιας μεγέθους μοντέλα Qwen που επικεντρώνονται σε μία μόνο λειτουργία, ενώ στην απόδοση ήχου και οπτικοακουστικού υλικού δίνει τον ρυθμό στις περισσότερες δοκιμές . Στη σειρά 36 δοκιμών αναφοράς ήχου και οπτικοακουστικού υλικού, επιτυγχάνει SOTA ανοιχτού κώδικα σε 32 και συνολική SOTA σε 22, ξεπερνώντας τα Gemini 2.5 Pro και GPT-4o σε πολλά σημεία.
Μερικά αξιοσημείωτα ορόσημα στο κείμενο: στο AIME25 η παραλλαγή Flash-Instruct βαθμολογείται περίπου στο 65,9. στο ZebraLogic το Instruct φτάνει το 90 και στο MultiPL-E επιτυγχάνει ανταγωνιστικά αποτελέσματα έναντι του GPT-4. Σε εργασίες ευθυγράμμισης όπως το IFEval και το WritingBench, τα μοντέλα Instruct και Thinking παρουσιάζουν υψηλές και σταθερές βαθμολογίες.
Στον ήχο, τα αποτελέσματα ASR για τα Κινεζικά και τα Αγγλικά είναι εξαιρετικά: στα WenetSpeech και LibriSpeech, μειώνει σημαντικά το ποσοστό σφάλματος λέξεων, με τιμές κοντά στο 1,22/2,48 στο LibriSpeech clean/other, και σε σύνολα όπως το FLEURS (multilingual), προσφέρει πολύ χαμηλά ποσοστά. Στο VoiceBench, μετρήσεις όπως τα AlpacaEval, CommonEval και WildVoice τοποθετούν το Qwen3-Omni στο ίδιο επίπεδο με τα κλειστά συστήματα αναφοράς, και υπερέχει στον ηχητικό συλλογισμό στο MMAU v05.15.25.
Στις οπτικοακουστικές εφαρμογές, η πιο συχνά αναφερόμενη μέτρηση είναι το WorldSense (περίπου 54,1 ), ξεπερνώντας το Gemini-2.5-Flash. Επιπλέον, σε σουίτες όπως το DailyOmni και το VideoHolmes, η παραλλαγή Thinking επιτυγχάνει βελτιώσεις σε σχέση με προηγούμενες εφαρμογές SOTA ανοιχτού κώδικα. Στην καθαρή όραση, υπερέχει σε MMMU, MathVista, MathVision και κατανόηση εγγράφων (AI2D, ChartQA), με πολύ καλές βαθμολογίες στην καταμέτρηση (CountBench) και στην κατανόηση βίντεο (Video-MME, MLVU).
Μετρήθηκε επίσης η παραγωγή φωνής μηδενικού επιπέδου: σε σύγκριση με οικογένειες όπως το CosyVoice και το Seed-TTS, το Qwen3-Omni παρουσιάζει καλύτερη συνέπεια περιεχομένου σε πολλές γλώσσες και υψηλή ομοιότητα ομιλητών . Στην ενότητα πολυγλωσσίας, οι πίνακες "Συνέπεια Περιεχομένου" και "Ομοιότητα Ομιλητή" δείχνουν ότι το Qwen3-Omni 30B-A3B είναι πολύ ανταγωνιστικό στα Κινέζικα και τα Αγγλικά, και σταθερό στα Γερμανικά, Ιταλικά, Πορτογαλικά, Ισπανικά, Ιαπωνικά, Κορεατικά, Γαλλικά και Ρωσικά. Σε διαγλωσσικό TTS , επιτυγχάνει καλύτερη WER/συνέπειες σε πολλά ζεύγη (π.χ., zh→en, ja→en, ko→zh) σε σύγκριση με το CosyVoice 2/3.
Διαθέσιμα μοντέλα και η χρήση του καθενός
Η σειρά Qwen3-Omni περιλαμβάνει τρία κύρια κομμάτια, καθένα από τα οποία έχει σχεδιαστεί για μια συγκεκριμένη χρήση: Instruct , Thinking και Captioner . Όλα προέρχονται από τον ίδιο πυρήνα αλλά με διαφορετικές δυνατότητες που ενεργοποιούνται ή βελτιώνονται για συγκεκριμένες εργασίες.
Το Qwen3-Omni-30B-A3B- Instruct περιέχει Στοχαστή και Ομιλητή, δέχεται ήχο, βίντεο και κείμενο και επιστρέφει κείμενο και ήχο. Είναι η σωστή επιλογή αν θέλετε πλήρη αλληλεπίδραση και προφορικά αποτελέσματα σε πραγματικό χρόνο και συνιστάται για φωνητικές ή βιντεοεπιδείξεις.
Το Qwen3-Omni-30B-A3B- Thinking εστιάζει στον Στοχαστή με αλυσιδωτή συλλογιστική , υποστηρίζοντας ήχο, βίντεο και κείμενο με έξοδο κειμένου. Είναι χρήσιμο για εις βάθος ανάλυση, επίλυση σύνθετων προβλημάτων, οπτικά μαθηματικά ή ροές εργασίας όπου δεν χρειάζεστε φωνητική έξοδο αλλά χρειάζεστε την καλύτερα δομημένη σκέψη.
Το Qwen3-Omni-30B-A3B- Captioner είναι ένα εκλεπτυσμένο παράγωγο του υψηλής ακρίβειας και χαμηλής υπερκινητικότητας υποτιτλισμού ήχου . Είναι ανοιχτού κώδικα, καλύπτει ένα ευρύ φάσμα ήχου με μεγάλη λεπτομέρεια και καλύπτει ένα ιστορικό κενό στο οικοσύστημα ανοιχτού κώδικα: αξιόπιστους και πλούσιους υπότιτλους για ήχο γενικής χρήσης.
Λανθάνουσα κατάσταση, έλεγχος σε πραγματικό χρόνο και συμπεριφοράς
Το σύστημα είναι βελτιστοποιημένο για άμεση αλληλεπίδραση, με χρόνους απόκρισης περίπου 211 ms για ήχο και 507 ms για ήχο-βίντεο . Εκτός από τη ροή, δίνεται έμφαση στις φυσικές στροφές της συνομιλίας και στη σταθερή απόδοση φωνής, με τη βοήθεια των σαφών ρόλων του Στοχαστή (κείμενο) και του Ομιλητή (φωνή).
Για βελτιστοποίηση, μπορείτε να προσαρμόσετε το στυλ με προτροπές συστήματος . Σε σενάρια AV όπου ο ήχος βίντεο χρησιμοποιείται για αναφορά, η ομάδα προτείνει μια προτροπή συστήματος που διατηρεί τη συλλογιστική του Στοχαστή, παρέχοντας παράλληλα πιο ευανάγνωστο και συνομιλιακό κείμενο, διευκολύνοντας τον Ομιλητή να μιλάει άπταιστα . Συνιστάται επίσης να διατηρείτε την παράμετρο `use_audio_in_video` συνεπή σε όλη τη διάρκεια μιας συνομιλίας πολλαπλών στροφών.
Κατά την αξιολόγηση, υπάρχουν συγκεκριμένες οδηγίες: μην ορίσετε προτροπή συστήματος , ακολουθήστε τη μορφή ChatML κάθε σημείου αναφοράς και, όταν δεν υπάρχει προτροπή, χρησιμοποιήστε τα ακόλουθα από προεπιλογή: Κινεζικό ASR (“请将这段中文语音转换为纯文本。”), ASR σε άλλες γλώσσες (“Μεταγραφή του ήχου σε κείμενο.”), S2TT (“Ακούστε την παρεχόμενη ομιλία <source_language> …”) και στίχους τραγουδιών (“ Μεταγραφή των στίχων του τραγουδιού” … χωρίς σημεία στίξης, γραμμές διαχωρισμένες με διακοπές”).
Ανάπτυξη, απαιτήσεις και εργαλεία
Για μια ολοκληρωμένη τοπική εμπειρία, η ομάδα συνιστά το Hugging Face Transformers και την αναθεώρηση των φάσεων μηχανικής λογισμικού , αλλά να έχετε υπόψη σας: όντας μια αρχιτεκτονική MoE, μπορεί να εκτελείται αργά με συμπερασματολογία HF. Για εφαρμογές παραγωγής ή χαμηλής καθυστέρησης , συμβουλεύουν τη χρήση vLLM ή του DashScope API , και παρέχουν ακόμη και μια εικόνα Docker που περιλαμβάνει περιβάλλοντα και για τα δύο. Ο κώδικας του Transformers έχει ήδη συγχωνευθεί, αλλά το πακέτο PyPI δεν έχει κυκλοφορήσει ακόμη και πρέπει να εγκατασταθεί από τον πηγαίο κώδικα.
Παρέχουν βοηθητικά προγράμματα για τον χειρισμό ήχου και εικόνας/βίντεο (base64, URL, διεπαφή εισόδων) και συνιστούν το FlashAttention 2 με Transformers για τη μείωση της μνήμης της GPU κάθε φορά που φορτώνεται στο float16 ή στο bfloat16 . Με το vLLM, περιλαμβάνεται το FlashAttn2 και παραμέτρους όπως το limit_mm_per_prompt (προκαταλαμβάνει μνήμη GPU) και το max_num_seqs για παραλληλισμό περιγράφονται λεπτομερώς . Επιπλέον, η αύξηση του tensor_parallel_size επιτρέπει την εξαγωγή συμπερασμάτων από πολλαπλές GPU.
Υπάρχουν μερικές χρήσιμες συμβουλές για εξοικονόμηση πόρων: αν δεν χρειάζεστε ήχο, μπορείτε να απενεργοποιήσετε τον Ομιλητή μετά την αρχικοποίηση, εξοικονομώντας περίπου 10 GB VRAM. Και αν θέλετε ταχύτερη έξοδο κειμένου, χρησιμοποιήστε την εντολή `return_audio=False` κατά τη δημιουργία. Παρέχονται επίσης οι ελάχιστες θεωρητικές απαιτήσεις μνήμης για το BF16 με FlashAttn2: για παράδειγμα, το Instruct 30B-A3B χρησιμοποιεί περίπου 78,9 GB με 15 δευτερόλεπτα βίντεο και 144,8 GB με 120 δευτερόλεπτα. Το Thinking χρησιμοποιεί περίπου 68,7 GB και 131,7 GB, αντίστοιχα.
Για να ρυθμίσετε μια τοπική διαδικτυακή επίδειξη , συνιστούν την προετοιμασία του περιβάλλοντος vLLM (ή του πιο αργού περιβάλλοντος Transformers), διασφαλίζοντας ότι έχετε εγκαταστήσει το ffmpeg και χρησιμοποιώντας τα σενάρια τους. Προσφέρουν εικόνες Docker έτοιμες για GPU "qwenllm/qwen3-omni" με το NVIDIA Container Toolkit , αντιστοίχιση θυρών (π.χ., host 8901 → container 80) και την επιλογή εξυπηρέτησης από 0.0.0.0. Μπορείτε να εισαγάγετε ξανά ή να διαγράψετε το container ανάλογα με τις ανάγκες.
Demos, API και οικοσύστημα
Αν δεν θέλετε να το αναπτύξετε τοπικά, μπορείτε να δοκιμάσετε demos στα Hugging Face Spaces και ModelScope Studio , με εμπειρίες για Qwen3-Omni-Realtime, Instruct, Thinking και Captioner. Διατίθεται επίσης Qwen Chat με ροή σε πραγματικό χρόνο: απλώς επιλέξτε την επιλογή φωνητικής/βιντεοκλήσης στη διεπαφή.
Για επεκτάσιμη ενσωμάτωση με χαμηλή καθυστέρηση, η συνιστώμενη προσέγγιση είναι το DashScope API , το οποίο προσφέρει την πιο προβλέψιμη απόδοση. Επιπλέον, η κοινότητα συντονίζεται μέσω καναλιών όπως το Discord και το WeChat και δημοσιεύει βιβλία μαγειρικής με πραγματικά αρχεία καταγραφής εκτέλεσης που επιτρέπουν στους χρήστες να αναπαράγουν αποτελέσματα αλλάζοντας προτροπές ή μοντέλα.
Χάρτης πορείας και συνεχείς βελτιώσεις
Η ομάδα εργάζεται πάνω σε πρόσθετες λειτουργίες όπως η αναγνώριση ομιλίας από πολλαπλούς ομιλητές , η εφαρμογή OCR σε βίντεο, οι βελτιώσεις στην προληπτική οπτικοακουστική μάθηση και οι πλουσιότερες ροές εργασίας των πρακτόρων . Επίσης, ανέφεραν ότι η υποστήριξη εξόδου ήχου σε vLLM για το μοντέλο Instruct θα είναι σύντομα διαθέσιμη, ολοκληρώνοντας τον κύκλο ανάπτυξης σε πραγματικό χρόνο από αυτό το backend.
Συχνές ερωτήσεις: Υποστήριξη χρόνου εκτέλεσης και κβαντοποίηση
Μερικοί χρήστες έχουν σχολιάσει ότι δεν μπορούν να εκτελέσουν το Qwen3-Omni ακόμη και με τους συνήθεις υπόπτους και ότι δεν βλέπουν quants στο Hugging Face . Επιπλέον, η εγγενής μορφή 16-bit είναι περίπου 70 GB, ένα μέγεθος που είναι προβληματικό για μέτριους υπολογιστές. Το ίδιο το έργο διευκρινίζει ότι το Transformers έχει ήδη συγχωνευτεί αλλά χωρίς το πακέτο PyPI , το οποίο πρέπει να εγκατασταθεί από τον πηγαίο κώδικα, και ότι το vLLM είναι η προτιμώμενη επιλογή για συμπερασματολογία, αν και η υποστήριξη ήχου Instruct σε vLLM θα κυκλοφορήσει στο εγγύς μέλλον.
Όσον αφορά την κβαντοποίηση, δεν υπάρχουν ακόμη καταχωρημένα placeholders στο HF για το Qwen3-Omni 30B-A3B και αξίζει να θυμόμαστε ότι η MoE και η πολυτροπική φύση περιπλέκουν την άμεση συμβατότητα με χρόνους εκτέλεσης όπως το llama.cpp. Για όσους χρειάζεται να το δοκιμάσουν τώρα, η επίσημη σύσταση είναι να χρησιμοποιήσουν το Docker + Transformers/vLLM από την πηγή ή το API και να παρακολουθούν το αποθετήριο για αιτήματα υποστήριξης pull και μελλοντικές κβαντοποιήσεις όταν είναι διαθέσιμες.
Καλές πρακτικές και υποδείξεις αξιολόγησης
Για την αναπαραγωγή των αριθμών, παρουσιάζονται λεπτομερώς οι ακόλουθες οδηγίες: τα περισσότερα benchmarks χρησιμοποιούν άπληστη αποκωδικοποίηση στο Instruct χωρίς δειγματοληψία, και για το Thinking, πρέπει να τηρούνται οι παράμετροι στο generation_config.json . Ο ρυθμός καρέ βίντεο ορίζεται επίσης σε fps=2 κατά την αξιολόγηση και υποδεικνύεται ότι η προτροπή χρήστη θα πρέπει να ακολουθεί τα πολυτροπικά δεδομένα, εκτός εάν το σύνολο δεδομένων ορίζει διαφορετικά.
Όταν ένα benchmark δεν περιλαμβάνει κάποιο μήνυμα, μπορούν να χρησιμοποιηθούν τα προεπιλεγμένα μηνύματα (κινεζικά ASR/άλλα, S2TT, στίχοι τραγουδιών). Επιπλέον, το μήνυμα συστήματος δεν θα πρέπει να ορίζεται κατά την αξιολόγηση, για να διασφαλιστεί ότι τα αποτελέσματα είναι συγκρίσιμα μεταξύ συστημάτων και εκτελέσεων.
Το Qwen3-Omni αυτοπροσδιορίζεται ως μια πραγματικά παντοτροπική πλατφόρμα, με χαμηλή καθυστέρηση, ευρεία πολυγλωσσική υποστήριξη, δυνατότητες ήχου και βίντεο αιχμής και μια σαφή διαδρομή ανάπτυξης χρησιμοποιώντας Transformers, vLLM και Docker. Για όσους αναζητούν ένα ενιαίο μοντέλο που χειρίζεται κείμενο και εικόνες απρόσκοπτα χωρίς να θυσιάζει την απόδοση, και που επίσης ακούει, μιλάει και κατανοεί βίντεο , είναι μια πρόταση που δύσκολα μπορεί να ξεπεραστεί σήμερα.
