Qwen3-Omni: 옴니모달 모델에 대해 알아야 할 모든 것

마지막 업데이트 : 24 9월 2025
  • 텍스트, 이미지, 오디오 및 비디오, 실시간 스트리밍을 갖춘 기본 옴니모달 모델입니다.
  • 22/36 오디오/비디오 벤치마크 및 다국어(119/19/10 언어)의 SOTA.
  • MoE, 낮은 지연 시간 및 시스템 프롬프트 제어 기능을 갖춘 Thinker-Talker 아키텍처입니다.
  • vLLM/Transformers, Docker 및 공식 유틸리티를 사용한 배포가 권장됩니다.

Qwen3-Omni 옴니모달 모델

Qwen3-Omni의 등장으로 AI의 지형이 바뀌었습니다. 이 단일 네이티브 모델은 텍스트, 이미지, 오디오, 비디오를 이해하고 응답할 수 있으며 , 실시간으로 텍스트와 음성 형태로 모두 응답할 수 있습니다. 이는 단순히 멀티모달 기능을 "패치"하는 것이 아니라, 낮은 지연 시간과 정교한 동작 제어를 통해 다양한 모달리티를 통합하도록 근본적으로 설계된 아키텍처입니다.

거의 모든 기업이 챗봇과 어시스턴트를 테스트하는 이 시점에, Qwen3-Omni는 야심찬 행보를 보였습니다. 텍스트 입력을 통해 119개 언어를 지원하고, 19개 언어를 음성 인식하며 , 10개 언어로 말할 수 있습니다. 또한 최대 30분 길이의 오디오를 이해하고, 수십 가지 테스트에서 벤치마크 점수를 획득했습니다. 뿐만 아니라, 사고-말하기(Thinker-Talker) 설계와 전문가 혼합(Mixture of Experts) 접근 방식을 통해 실제 시나리오에서 빠른 응답 속도와 정확한 추론 능력을 목표로 합니다.

gpt-5-0
관련 기사 :
GPT-5: 인공지능의 차세대 혁명에 대한 모든 것

Qwen3-Omni란 무엇이고, 어떤 기능을 제공하나요?

Qwen3-Omni는 텍스트, 이미지, 오디오 및 비디오를 처리하고 텍스트와 자연어 음성으로 출력하도록 설계된 기본적이고, 옴니모달하며, 엔드투엔드 다국어 모델 제품군입니다 . 핵심은 다양한 입력 및 출력 형식뿐만 아니라, 자연스러운 대화 흐름을 지원하는 스트리밍 기능 과 즉각적인 응답 능력에 있습니다.

이 팀은 성능과 효율성을 향상시키기 위해 여러 가지 아키텍처 개선 사항을 도입했습니다. 초기 "텍스트 우선" 사전 학습 과 혼합 멀티모달 학습을 결합하고, 텍스트와 이미지 성능을 유지하면서 오디오 및 비디오 성능을 향상시키는 전문가 혼합 모델(MoE)을 설계했습니다. 이러한 개선을 통해 모델은 36개의 오디오/비디오 벤치마크 중 22개에서 최고 성능(SOTA)을 달성했으며 , 36개 중 32개에서 오픈 소스 최고 성능(SOTA)을 달성했습니다. 또한 음성 인식(ASR), 오디오 이해 및 음성 대화에서 Gemini 2.5 Pro와 유사한 결과를 보여줍니다.

Qwen3-Omni 다중 모드 상호 작용

주요 역량 및 모달리티

Qwen3-Omni는 119개 언어의 텍스트 입력, 19개 언어의 음성 입력, 10개 언어의 음성 출력 등 광범위한 다국어 지원을 통해 실제 오디오, 비전 및 시청각 애플리케이션에 최적화되어 있습니다 . 음성 입력 언어는 영어, 중국어, 한국어, 일본어, 독일어, 러시아어, 이탈리아어, 프랑스어, 스페인어, 포르투갈어, 말레이어, 네덜란드어, 인도네시아어, 터키어, 베트남어, 광둥어, 아랍어, 우르두어를 포함하며, 출력 언어는 영어, 중국어, 프랑스어, 독일어, 러시아어, 이탈리아어, 스페인어, 포르투갈어, 일본어, 한국어 등을 포함합니다.

공식 요리책 시리즈는 이 기술의 폭넓은 활용성을 보여줍니다. 오디오 분야에서는 다국어 및 장문 음성 인식(ASR) , 음성-텍스트 변환 및 음성-음성 변환, 음악 분석(스타일, 리듬, 장르), 음향 효과 설명, 모든 오디오에 대한 자막 생성 기능을 제공합니다. 또한 음성, 음악, 주변 소리가 혼합된 트랙에 대한 분석도 지원합니다.

이미지 처리 분야에서는 복잡한 이미지를 위한 "하드" OCR, 객체 감지 및 접지 , 이미지 품질 보증, 이미지 수학적 문제 해결 (Thinking 모델의 강점), 비디오 설명, 1인칭 비디오 기반 내비게이션, 장면 전환 분석 등을 제공합니다. 시청각 시나리오에서는 시간 정렬을 통한 오디오-비디오 품질 보증, 시청각 입력과의 안내형 상호 작용 , 어시스턴트 동작을 포함한 대화 기능을 시연합니다 .

에이전트로서 음성 통화 기능 을 통해 음성 워크플로우를 활성화하고 다양한 도구를 사용할 수 있다는 점이 돋보입니다. 또한, 파생 작업에서는 매우 상세한 자막을 생성하는 Omni-Captioner 기능을 제공 하여 기본 기능의 범용성을 입증합니다.

  AI 쇼핑 도우미 비교: ChatGPT 대 Perplexity

MoE와 함께하는 Thinker-Talker 건축 및 디자인

핵심적인 차별점 중 하나는 책임 분리입니다. 사고자는 텍스트를 생성하고 (명시적인 사고 과정 추론을 포함한 다양한 변형 포함), 대화자는 실시간 오디오를 출력합니다 . 이러한 분리를 통해 시스템은 높은 수준의 텍스트 이해 및 계획 기능을 유지하면서 자연스러운 음성 대화가 가능합니다.

MoE 데이터베이스는 전문가들 사이에 작업량을 분산시키고, 강력한 일반 표현을 위해 AuT 사전 학습을 활용합니다. 또한, 오디오 채널에 멀티코드 인코딩을 적용하여 지연 시간을 최소화했는데, 이는 100분의 1초도 중요한 통화나 음성 비서 서비스에 매우 중요합니다.

성능 및 벤치마크: 텍스트, 비전, 오디오 및 시청각

Qwen3-Omni는 단일 모드에 특화된 유사 크기의 Qwen 모델과 비교했을 때 성능 저하 없이 최첨단 텍스트 및 이미지 성능을 유지하는 동시에 오디오 및 시청각 성능에서도 대부분의 테스트에서 선두를 달립니다 . 36개의 오디오 및 시청각 벤치마크 테스트에서 오픈 소스 SOTA(최첨단) 성능을 32개, 전체 SOTA 성능을 22개 달성하여 Gemini 2.5 Pro 및 GPT-4o를 여러 항목에서 능가합니다.

텍스트 처리 분야에서 주목할 만한 성과로는 AIME25 에서 Flash-Instruct 변형 모델이 약 65,9점을 기록했고, ZebraLogic 에서는 Instruct 모델이 90점에 도달했으며, MultiPL-E 에서는 GPT-4o와 경쟁력 있는 수치를 달성했다는 점입니다. IFEval 및 WritingBench와 같은 정렬 작업에서도 Instruct 및 Thinking 모델은 일관적으로 높은 점수를 보여줍니다.

오디오 분야에서 중국어와 영어 ASR 결과는 탁월합니다. WenetSpeech 와 LibriSpeech 데이터 셋에서 단어 오류율을 크게 줄여주며, LibriSpeech의 깨끗한 음성/기타 음성 데이터셋에서는 1,22/2,48에 가까운 수치를 기록하고, FLEURS (다국어)와 같은 데이터셋에서도 매우 낮은 오류율을 보여줍니다. VoiceBench의 AlpacaEval, CommonEval, WildVoice 등 의 지표에서 Qwen3-Omni는 폐쇄형 레퍼런스 시스템과 동등한 수준의 성능을 보이며, MMAU v05.15.25 의 오디오 추론에서도 뛰어난 성능을 발휘합니다.

시청각 애플리케이션에서 가장 자주 언급되는 지표는 WorldSense(약 54,1 )로, Gemini-2.5-Flash를 능가합니다. 또한 DailyOmni 및 VideoHolmes 와 같은 제품군에서 Thinking 변형은 기존의 오픈 소스 최첨단 애플리케이션보다 향상된 성능을 보여줍니다. 순수 컴퓨터 비전 분야에서는 MMMU, MathVista, MathVision 및 문서 이해(AI2D, ChartQA)에서 뛰어난 성능을 보이며, 계수 (CountBench) 및 비디오 이해(Video-MME, MLVU) 에서도 매우 우수한 점수를 기록했습니다 .

제로샷 음성 생성 성능도 측정했습니다. CosyVoice 및 Seed-TTS와 같은 제품군과 비교했을 때, Qwen3-Omni는 여러 언어에서 더 나은 콘텐츠 일관성 과 높은 화자 유사성을 보여줍니다 . 다국어 섹션에서 "콘텐츠 일관성" 및 "화자 유사성" 표를 보면 Qwen3-Omni 30B-A3B는 중국어와 영어에서 매우 경쟁력 있는 성능을 보이며, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어에서도 안정적인 성능을 나타냅니다. 교차 언어 TTS 테스트 에서는 CosyVoice 2/3에 비해 여러 쌍(예: zh→en, ja→en, ko→zh)에서 더 나은 WER/일관성을 달성했습니다.

사용 가능한 모델과 각 모델의 용도

Qwen3-Omni 제품군은 Instruct , Thinking , Captioner의 세 가지 주요 모델로 구성되어 있으며, 각 모델은 특정 용도에 맞게 설계되었습니다 . 이 모델들은 모두 동일한 핵심 기능을 기반으로 하지만, 특정 작업에 맞춰 활성화되거나 세부적으로 조정된 다양한 기능을 제공합니다.

Qwen3-Omni-30B-A3B- Instruct는 Thinker와 Talker 기능을 모두 포함하고 있으며, 오디오, 비디오 및 텍스트를 입력받아 텍스트와 오디오를 출력합니다. 완전한 상호 작용과 실시간 음성 결과를 원하는 경우에 적합하며, 음성 또는 비디오 데모 에 권장됩니다.

Qwen3-Omni-30B-A3B- Thinking은 연쇄 추론을 통한 사고력 향상에 초점을 맞추고 , 오디오, 비디오 및 텍스트 출력을 지원합니다. 심층 분석, 복잡한 문제 해결, 시각적 수학, 또는 음성 출력은 필요하지 않지만 최상의 구조적 사고가 필요한 워크플로에 유용합니다 .

  내 PC를 진정한 AI 연구실로 바꾸는 방법

Qwen3-Omni-30B-A3B- Captioner는 높은 정밀도와 낮은 과잉반응성을 자랑하는 오디오 자막 생성 기술 의 개선된 버전입니다 . 오픈 소스 소프트웨어로, 다양한 오디오 장르를 매우 상세하게 지원하며, 오픈 소스 생태계에서 오랫동안 부족했던 부분, 즉 일반적인 오디오 콘텐츠에 안정적이고 풍부한 자막을 제공하는 기능을 제공합니다.

지연 시간, 실시간 및 행동 제어

이 시스템은 즉각적인 상호 작용에 최적화되어 있으며, 오디오 응답 시간은 약 211ms, 오디오-비디오 응답 시간은 약 507ms입니다 . 스트리밍 기능 외에도, 사고자(텍스트)와 발화자(음성) 의 역할이 명확하게 구분되어 자연스러운 대화 흐름과 안정적인 음성 전달을 지원합니다.

세부 조정을 위해 시스템 프롬프트를 사용하여 스타일을 사용자 지정할 수 있습니다 . 비디오 오디오가 참조용으로 사용되는 AV 시나리오에서는 생각하는 사람의 추론을 유지하면서 말하는 사람이 더 읽기 쉽고 대화체에 가까운 텍스트를 제공하는 시스템 프롬프트를 사용하는 것이 좋습니다. 이렇게 하면 말하는 사람이 더 유창하게 말할 수 있습니다. 또한 여러 차례에 걸친 대화에서는 `use_audio_in_video` 매개변수를 일관되게 유지하는 것이 좋습니다 .

평가 시에는 다음과 같은 구체적인 지침을 준수해야 합니다. 시스템 프롬프트를 설정하지 말고 , 각 벤치마크의 ChatML 형식을 따르며, 프롬프트가 없는 경우 기본적으로 다음을 사용합니다. 중국어 ASR(“请将这段中文语音转换为纯文本。”), 기타 언어 ASR(“Transcribe the audio into text.”), S2TT (“Listen to the provided <source_language> speech …”), 그리고 노래 가사(“ Transcribe the song lyrics” … without punctuation, lines separated by breaks”).

배포, 요구 사항 및 도구

완벽한 로컬 환경을 위해서는 Hugging Face Transformers를 사용 하고 소프트웨어 엔지니어링 단계를 검토하는 것이 좋습니다 . 하지만 MoE 아키텍처 특성상 HF 추론 시 속도가 느릴 수 있다는 점에 유의해야 합니다. 프로덕션 환경이나 저지연 애플리케이션 의 경우 vLLM 또는 DashScope API 사용을 권장하며 , 두 가지 환경을 모두 포함하는 Docker 이미지도 제공합니다. Transformers 코드는 이미 병합되었지만 PyPI 패키지는 아직 출시되지 않았 으므로 소스 코드에서 직접 설치해야 합니다.

이들은 오디오 및 이미지/비디오(base64, URL, 인터리브 입력) 처리를 위한 유틸리티를 제공하며, float16 또는 bfloat16 값을 로드할 때 GPU 메모리 사용량을 줄이기 위해 FlashAttention 2 와 Transformers 사용을 권장합니다. vLLM에는 FlashAttention 2가 포함되어 있으며, limit_mm_per_prompt (GPU 메모리 사전 할당) 및 max_num_seqs (병렬 처리)와 같은 매개변수가 자세히 설명되어 있습니다 . 또한 tensor_parallel_size 값을 늘리면 멀티 GPU 추론이 가능해집니다.

몇 가지 유용한 리소스 절약 팁이 있습니다. 오디오가 필요하지 않은 경우 초기화 후 Talker를 비활성화 하여 약 10GB의 VRAM을 절약할 수 있습니다. 또한 텍스트 출력을 빠르게 하려면 생성 시 `return_audio=False`를 사용하십시오. FlashAttn2를 사용하는 BF16의 최소 이론적 메모리 요구 사항도 제공됩니다. 예를 들어, Instruct 30B-A3B는 15초 분량의 비디오 재생 시 약 78,9GB , 120초 분량의 비디오 재생 시 약 144,8GB를 사용합니다. Thinking은 각각 약 68,7GB와 131,7GB를 사용합니다.

로컬 웹 데모를 설정하려면 vLLM 환경(또는 속도가 느린 Transformers 환경)을 준비하고, ffmpeg이 설치되어 있는지 확인한 후 제공된 스크립트를 사용하는 것이 좋습니다. NVIDIA Container Toolkit , 포트 매핑(예: 호스트 8901 → 컨테이너 80), 그리고 0.0.0.0에서 서비스를 제공하는 옵션이 포함된 GPU 지원 Docker 이미지 "qwenllm/qwen3-omni"를 제공 합니다. 필요에 따라 컨테이너에 다시 접속하거나 삭제할 수 있습니다.

데모, API 및 생태계

로컬 환경에 배포하지 않으려면 Hugging Face Spaces와 ModelScope Studio에서 Qwen3-Omni-Realtime, Instruct, Thinking, Captioner를 체험해 볼 수 있는 데모를 사용해 보세요. 실시간 스트리밍 기능을 갖춘 Qwen Chat 도 이용 가능합니다. 인터페이스에서 음성/영상 통화 옵션을 선택하기만 하면 됩니다.

  ZeroSearch: AI를 효율적이고 자율적으로 훈련하기 위한 Alibaba의 혁신

확장 가능하고 지연 시간이 짧은 통합을 위해서는 가장 예측 가능한 성능을 제공하는 DashScope API를 사용하는 것이 좋습니다 . 또한, 커뮤니티는 Discord 및 WeChat과 같은 채널을 통해 소통하며 , 실제 실행 로그가 포함된 쿡북을 게시하여 사용자가 프롬프트나 모델을 변경하여 결과를 재현할 수 있도록 지원합니다.

로드맵 및 지속적인 개선

해당 팀은 다중 화자 음성 인식 , 비디오에 적용된 OCR, 능동형 시청각 학습 개선, 더욱 풍부한 에이전트 워크플로우 와 같은 추가 기능을 개발 중입니다 . 또한 Instruct 모델의 vLLM에서 오디오 출력 지원이 곧 제공될 예정이며, 이를 통해 해당 백엔드에서 실시간 배포 주기가 완료될 것이라고 밝혔습니다.

FAQ: 런타임 지원 및 양자화

일부 사용자는 일반적인 설정으로도 Qwen3-Omni를 실행할 수 없으며 Hugging Face에서 양자화된 데이터가 표시되지 않는다고 지적했습니다 . 또한, 네이티브 16비트 형식의 파일 크기가 약 70GB에 달해 사양이 낮은 컴퓨터에서는 실행하기 어렵습니다. 프로젝트 측에서는 Transformers가 이미 병합되었지만 PyPI 패키지는 제공되지 않아 소스 코드에서 직접 설치해야 하며, 추론에는 vLLM이 권장되지만 향후 vLLM에서 Instruct 오디오 지원 기능이 추가 될 예정이라고 밝혔습니다.

양자화와 관련하여, HF에는 아직 Qwen3-Omni 30B-A3B에 대한 자리 표시자가 없으며, MoE 및 멀티모달 특성 으로 인해 llama.cpp와 같은 런타임과의 즉각적인 호환성이 어렵다는 점을 유념해야 합니다. 지금 테스트가 필요한 경우, 공식 권장 사항은 Docker + Transformers/vLLM을 소스 코드 또는 API 에서 사용하는 것이며, 지원 풀 요청 및 향후 양자화 기능 이 제공될 때까지 저장소를 주시하는 것입니다 .

좋은 평가 관행 및 프롬프트

결과를 재현하기 위한 자세한 지침은 다음과 같습니다. 대부분의 벤치마크는 샘플링 없이 Instruct에서 탐욕적 디코딩을 사용하며, Thinking의 경우 generation_config.json 의 매개변수를 준수해야 합니다 . 또한 평가 중 비디오 프레임 속도는 fps=2 로 설정되며 , 데이터셋에서 달리 지정하지 않는 한 사용자 프롬프트는 멀티모달 데이터 다음에 표시되어야 합니다.

벤치마크에 프롬프트가 포함되어 있지 않은 경우 기본 프롬프트(중국어 음성 인식/기타, S2TT, 노래 가사)를 사용할 수 있습니다. 또한 시스템 및 실행 간 결과의 비교 가능성을 확보하기 위해 평가 중에는 시스템 프롬프트를 설정하지 않아야 합니다.

Qwen3-Omni는 낮은 지연 시간, 폭넓은 다국어 지원, 최첨단 오디오 및 비디오 기능 , 그리고 Transformers, vLLM, Docker를 활용한 명확한 배포 경로를 제공하는 진정한 옴니모달 플랫폼입니다. 성능 저하 없이 텍스트와 이미지를 매끄럽게 처리하고, 음성 및 비디오까지 인식하는 단일 모델을 찾는 사용자에게 Qwen3-Omni는 현재로서는 최고의 선택 중 하나입니다.