ZeroSearch: AI를 효율적이고 자율적으로 훈련하기 위한 Alibaba의 혁신

마지막 업데이트 : 월 12 2025
  • ZeroSearch는 시뮬레이션 검색을 통해 AI 모델 학습 비용을 획기적으로 절감하고 외부 검색 엔진에 대한 의존도를 제거합니다.
  • LLM의 회수 및 추론 능력을 향상시키는 지도 강화 학습 시스템을 사용합니다.
  • 이를 통해 기업과 개발자는 저렴한 비용으로 고급 모델을 훈련시켜 프로세스에 대한 자율성과 제어력을 확보할 수 있습니다.

제로서치란 무엇인가, 인공지능

최근 인공지능 분야, 특히 대규모 언어 모델(LLM) 분야에서 혁신이 폭발적으로 증가했습니다. 2025년 가장 주목할 만한 발전 중 하나는 알리바바가 개발한 제로서치(ZeroSearch) 기술입니다. 이 기술은 대규모 언어 모델 학습 방식을 혁신적으로 변화시키고 있습니다. 제로서치는 정확히 무엇이며, 왜 업계에서 이토록 큰 관심을 불러일으키고 있을까요? 이 글에서는 제로서치의 작동 방식, 기존 방식 대비 장점, 그리고 인공지능 개발 전반에 미칠 수 있는 잠재력에 대해 자세히 살펴보겠습니다.

IT 업계에서 화제의 중심에 선 것은 바로 제로서치(ZeroSearch)입니다. 제로서치는 AI 학습 비용을 무려 88%나 절감할 수 있다고 약속합니다 . 이러한 효율성 향상은 단순한 마케팅 전략이 아니라, 크고 작은 기업, 개발자, 그리고 일반 인공지능의 발전에 있어 매우 중요한 의미를 지닙니다.

ZeroSearch란 무엇이고, 어디에서 왔나요?

제로서치(ZeroSearch)는 학습 과정에서 외부 검색 엔진에 의존하지 않고 언어 모델을 학습하도록 설계된 새로운 강화 학습 기법입니다. 알리바바의 통이 연구소(Tongyi Lab)에서 개발한 이 혁신적인 기술은 웹 검색을 사용하는 AI 모델 학습에서 흔히 발생하는 두 가지 문제, 즉 API 사용 비용이 높고 검색 결과 문서 품질의 예측 불가능성을 해결하는 것을 목표로 합니다.

지금까지 고급 비서, 챗봇, 추천 엔진을 개발하려면 유료 서비스를 통해 Google과 같은 검색 엔진에 수만 개의 쿼리를 보내야 했기 때문에 비용이 증가하고 확장성이 제한되었는데, 특히 예산이 부족한 회사의 경우 더욱 그렇습니다.

ZeroSearch는 LLM( 로컬 라이프사이클 모델) 자체가 검색 엔진의 작동 방식을 모방하여 관련성 있는 문서 또는 관련성이 없는 문서를 쿼리에 대한 응답으로 생성함으로써 외부 상호 작용 없이 학습할 수 있도록 하는 시스템에 기반하여 판도를 바꿉니다.

AI에서 ZeroSearch가 작동하는 방식

ZeroSearch는 어떻게 작동하나요? 자세한 기술 설명

제로서치의 핵심은 학습 과정에서 실제 인터넷 검색이 필요 없도록 하는 강화 학습(RL) 프레임워크입니다. 알리바바의 접근 방식과 해당 기술에 대해 발표된 종합적인 분석 자료를 바탕으로 이 과정이 어떻게 구성되는지 단계별로 살펴보겠습니다.

  ChatGPT에서 환각 현상을 최소화하는 방법

1. 검색을 시뮬레이션하기 위한 가벼운 감독 튜닝

모든 것은 지도 미세 조정(SFT)에서 시작됩니다. 이 단계에서 LLM은 정보 검색 모듈처럼 작동하도록 훈련됩니다. 이 조정을 통해 LLM은 실제 검색 엔진이 제공하는 텍스트 스타일과 콘텐츠 유형을 모방하여 질의에 대한 응답 문서를 생성하는 방법을 학습합니다. 이 초기 단계에서는 모델과 검색 엔진 간의 상호 작용 경로가 기록되어 질의 및 검색된 문서 로그가 생성됩니다.

성공적인 경로, 즉 정답으로 이어지는 경로는 긍정적(유용한 문서)으로 표시되고, 오류나 잘못된 답변으로 이어지는 경로는 부정적(노이즈가 있는 문서)으로 표시됩니다. 이러한 차별화는 나중에 모델이 현실적인 검색의 역학을 이해하고 재현하는 데 도움이 되며, 관련성 있는 결과와 유용성이 낮은 결과를 구분하는 데 도움이 됩니다.

2. 커리큘럼 시뮬레이션을 통한 강화 학습의 역할

지도 학습을 통한 튜닝 후, 모델은 강화 학습 단계로 넘어가는데, 이 단계에서는 좋은 관행이 강화되고 실패는 불이익을 받게 됩니다. 이 단계에서 시뮬레이션된 LLM 자체는 검색 엔진 역할을 하여 정책 모델이 생성한 질의에 응답하고 유용하거나 문제가 될 수 있는 문서를 반환합니다.

모델의 난이도는 생성되는 문서의 품질을 서서히 저하시키는 교육 과정 전략에 따라 점진적으로 증가합니다. 이를 통해 시스템은 먼저 통제된 환경에서 학습하고, 점차 잡음이 많거나 복잡한 예제를 접하게 됩니다 . 이러한 접근 방식은 모델이 현실적인 조건에서 견고한 검색 및 추론 능력을 개발하는 데 도움이 됩니다.

3. 보상 및 평가 지표 설계

학습을 유도하기 위해 ZeroSearch는 F1 점수 기반의 보상 함수를 사용합니다 . 이 함수는 예측과 정답 간의 단어 일치도를 고려하여 정확도와 재현율의 균형을 맞춥니다. 목표는 모델이 생성할 수 있는 최종 답변의 정확도를 극대화하는 것이며, LLM(언어 학습 모델)은 일반적으로 자연스럽게 잘 정리된 텍스트를 생성하기 때문에 형식에 대해서는 크게 신경 쓰지 않습니다.

4. 멀티턴 상호작용 및 추론 템플릿

훈련 중에는 상호작용 템플릿을 사용하여 프로세스를 세 단계로 나눕니다. 내적 추론 (태그 사이에 구분됨) <think>...</think>), 협의 진행 (<search>...</search>) 그리고 응답 생성 (<answer>...</answer>). 이를 통해 모델은 관련 질의를 공식화하고 근거 있는 답변을 제공하는 능력을 향상시킬 수 있습니다.

5. 호환성 및 확장성

ZeroSearch는 Qwen-2.5 계열, Qwen-2.5 , LLaMA-3.2 및 명령어 튜닝 또는 기본 변형 과 같은 주요 언어 모델과 호환됩니다 . 또한 다양한 강화 학습 알고리즘(PPO, GRPO 등)을 사용하여 구현할 수 있어 다양한 개발 환경에서 활용이 용이합니다.

  텍스트를 비디오로 변환하여 매력적인 스토리를 전달하는 방법

ZeroSearch 애플리케이션 및 결과

실제 데이터: ZeroSearch는 얼마나 많은 비용을 절감하고, 어떤 성능을 보일까요?

알리바바가 실시하고 전문 간행물 및 저장소에 기록된 실험에 따르면, ZeroSearch는 기존 상용 검색 엔진과 비교했을 때 동등하거나 더 우수한 성능을 달성합니다 . 특히 비용 절감 효과가 매우 큽니다.

  • Google 검색 API를 사용하여 64.000개의 쿼리를 수행하면 약 달러 586,70 (약 €540).
  • ZeroSearch를 사용하여 14.000억 개의 매개변수 LLM으로 생성 및 관리되는 동일한 쿼리 볼륨은 비용을 다음과 같이 줄입니다. 달러 70,80 (약 € 65).
  • 이 차이는 다음을 의미합니다. 교육 비용 88% 절감외부 API에 대한 종속성을 제거하고 더 큰 확장성을 제공합니다.

반면, 품질 결과는 인상적입니다. 실험 결과, 7B 매개변수 검색 모듈의 성능이 Google 검색 기반 시스템과 맞먹는 반면, 14B 매개변수를 사용하면 단일 홉 및 복잡한 추론 데이터 세트를 사용하는 질의응답 작업에서는 이 모델이 Google 검색을 능가하는 것으로 나타났습니다.

인공지능 산업에 미치는 주요 이점 및 영향

제로서치의 등장은 기업과 개발자들이 고급 모델을 학습시키는 방식에 있어 근본적인 변화를 의미합니다.

  • 경제적 장벽의 급격한 감소: 상업용 API 비용으로 인해 제약을 받았던 중소기업, 스타트업, 개인 개발자들이 고급 AI 기술에 쉽게 접근할 수 있도록 지원합니다.
  • 훈련에 대한 더 큰 통제력시뮬레이션 문서를 생성함으로써 팀은 모델이 수신하는 정보를 정확히 정의하고, 요구 사항에 맞게 난이도와 품질을 조정할 수 있습니다.
  • 기술적 자율성 강화: 대형 외국 기술 플랫폼에 대한 의존도를 최소화하고, 맞춤형 AI 솔루션의 국내 개발을 촉진합니다.
  • 적응성 및 모듈성ZeroSearch는 다양한 모델에 배포될 수 있으며, 다양한 워크플로와 비즈니스 요구 사항에 맞게 조정할 수 있습니다.

이전 전략과의 차이점: RAG, 실제 검색 및 시뮬레이션

ZeroSearch가 출시되기 전에는 LLM에게 최신의 정확한 정보를 제공하는 가장 일반적인 솔루션은 RAG(Retrieval-Augmented Generation)를 사용하는 것이었습니다. 이는 모델이 실제 검색을 사용하여 외부 소스를 쿼리하는 방식입니다. 하지만 여기에는 몇 가지 명백한 문제가 있습니다.

  • 고비용: API를 지속적으로 사용하면 예산이 엄청나게 늘어날 수 있습니다.
  • 다양한 품질: 검색 결과의 문서는 검색 내용과 API 자체에 따라 매우 일관성이 없을 수 있습니다.
  • 법적 및 개인 정보 보호 제한: 타사 서비스에 의존하면 법적, 정치적 위험이 따르며, 특히 민감한 정보를 사용하여 교육을 실시하는 경우 더욱 그렇습니다.

ZeroSearch는 외부 소스를 지속적으로 참조할 필요성을 없애고, 검색 엔진과 상호 작용하는 경험을 시뮬레이션하면서 모델이 "자체 내부에서" 검색하는 방법을 학습할 수 있도록 합니다.

  응답을 개선하기 위해 ChatGPT를 사용자 정의하세요: 스타일, 역할, 글꼴 및 고급 기능

영향과 실제 적용: Quark에서 AI의 민주화까지

알리바바는 이미 ZeroSearch를 자사 상용 제품에 통합했습니다. Qwen 모델을 기반으로 하는 알리바바의 Quark 애플리케이션은 이 기술 덕분에 추론 능력과 복잡한 쿼리에 대한 정확한 응답에서 놀라운 개선을 보였습니다. 하지만 무엇보다 중요한 것은 ZeroSearch가 소규모 기업들이 값비싼 외부 인프라 없이도 자체적인 고급 모델을 설계할 수 있는 길을 열어준다는 점입니다.

마누스 ia-0
관련 기사 :
당신의 일을 대신 해줄 AI 에이전트, 마누스에 대해 알아야 할 모든 것

연구 커뮤니티는 GitHub과 Hugging Face에서 코드 저장소, 데이터 세트 및 사전 학습된 모델에 액세스할 수 있으며, 이를 통해 전 세계적인 도입과 실험이 촉진되고 있습니다.

ZeroSearch 덕분에 AI 훈련의 미래는 어떻게 될까요?

이러한 기술이 발전함에 따라 구글, 빙 또는 유사한 서비스에 의존하지 않는 고급 검색 기능을 갖춘 지능형 비서가 급증할 것입니다. 이는 교육, 비즈니스 및 연구 분야에서 새로운 기회를 창출하는 동시에 인공지능 분야에서 주요 검색 엔진의 지배력을 약화시킬 가능성이 있습니다.

스페인과 유럽의 경우, 이는 자율적 성장, 기술 의존도와 비용 감소, 중요 정보 시스템에 대한 전략적 통제 강화의 가능성을 의미합니다.

제로서치의 등장은 인공지능 모델 학습이 소수에게만 허용되던 사치가 아닌, 누구나 접근 가능하고 확장 가능하며 점점 더 정교해지는 도구로 거듭나는 새로운 시대의 시작을 알립니다. 알리바바는 인공지능이 자체 환경을 벗어나지 않고 검색할 수 있도록 학습시킴으로써, 어떤 요구에도 적응할 수 있는 자립적이고 효율적인 시스템 개발에 한 걸음 더 나아갔습니다 . 이는 단순히 비용 절감을 넘어, 인공지능 산업 전체의 판도를 바꾸는 중요한 발걸음입니다.

전자 상거래 란?
관련 기사 :
전자상거래란 무엇인가: 전자상거래를 이해하기 위한 10가지 핵심