MAI-Voice-1 和 MAI-1-preview:这是微软 AI 的首个 AI 模型。

最后更新: 九月2, 2025
  • MAI-Voice-1 使用单个 GPU 生成具有超低延迟的高保真富有表现力的语音。
  • MAI-1-preview 是一个使用约 15.000 个 H100 进行训练的 MoE 模型,专注于遵循指令。
  • 两者都正在逐步集成到 Copilot 中,并可以在 Labs 和 LMArena 中进行测试。
  • 策略:协调专门的模型,同时与 OpenAI 共存。

微软AI语音模型
意象

微软正式推出其首批自主研发的人工智能模型:MAI-Voice-1 和 MAI-1-preview ,这两款模型均隶属于微软人工智能 (Microsoft AI) 旗下。此举旨在推动微软的产品战略,使其助手和服务能够受益于专为语音和文本处理而设计的专用模型。

这家科技公司的目标是让人工智能成为“通往知识宇宙的门户”,构建一套能够理解每位用户的可靠系统。这体现在两项关键创新中:一是速度极快、表现力丰富的语音模型;二是融合多位专家意见的文本模型,专注于理解指令并为日常使用提供实用答案。

什么是 MAI?为什么是现在?

MAI是Microsoft AI的缩写,微软总部位于雷德蒙德,旗下拥有众多基础模型。需要注意的是,微软与OpenAI的合作关系仍在继续,但竞争日益激烈,以至于微软已将OpenAI列入竞争对手名单。即便如此,微软仍坚持表示,在合适的情况下,将继续使用来自合作伙伴和开源社区的“最佳模型”。

这些项目的幕后推手是微软人工智能首席执行官兼DeepMind联合创始人穆斯塔法·苏莱曼,他明确表示,其目标在于打造“应用于产品的AI平台”。换句话说,就是开发能够集成到Copilot和其他体验中的专用模型,高效满足特定的语音和文本需求。

MAI-Voice-1:优先考虑速度和表现力的语音模型

首先亮相的是MAI-Voice-1,这是一款语音合成系统,能够以极低的延迟生成富有表现力的高保真音频。其主要卖点在于,它能在不到一秒的时间内生成一分钟的音频,同时保持声音的自然度和语调变化。

除了速度之外,它的优势之一在于表现力:该模型支持不同的配音风格、语调和细微差别,专为旁白或语音提示而设计。无论是在单人配音还是多人配音场景中,最终效果都如微软所描述的那样,呈现出“极富表现力且自然”的声音。

效率也是一项关键特性:MAI-Voice-1 使用单个 GPU进行推理,使其成为目前最高效的语音系统之一。在计算成本高昂的生态系统中,这种优化对于将功能扩展到消费产品至关重要。

在可用性方面,MAI-Voice-1 已集成到Copilot Daily 和 Podcasts中,并且也作为一项全新体验在Copilot Labs中提供。在 Copilot Labs 中,用户可以尝试不同的旁白和表现性语音,调整风格并在实验室的限定范围内探索不同的声音。

它听起来像什么以及你今天可以用它做什么

试用过的人都说,音频听起来非常自然,语调和节奏控制得很好。不过需要注意的是,目前这项功能仅支持英语。微软提供了一些典型示例:你可以让它播放“一个关于恐龙的故事”,然后很快就能收到一个时长一分钟、语调和语气都恰到好处的故事。

在 Copilot Labs 中,“音频表达”功能允许您根据脚本生成音频并修改旁白风格。它包含多种模式,例如情感模式(用于调整语调和节奏,或分配不同的声音)和面向表现力丰富的旁白的叙事模式。其理念是方便用户进行测试和原型设计,无需搭建复杂的环境即可探索各种可能性。

  管理技术驱动型团队:领导者完整指南

微软列举的应用场景涵盖了从故事讲述和旁白到引导冥想等方方面面,以及具备实时对话功能的虚拟助手等。更低的延迟,加上更丰富的表现力,为语音界面带来更流畅的体验,而自然流畅的体验对语音交互至关重要

  • 动态叙述 用于故事、播客或教育。
  • 引导冥想 以及具有色调变化的健康内容。
  • 对话助手 几乎实时、上下文敏感。
  • 快速成型 在 Copilot Labs 中进行风格和声音调整。

计算效率:一分钟音频处理时间不到一秒

生成高保真、富有表现力的音频需要强大的技术实力,但 MAI-Voice-1 号称仅用单个 GPU即可实现这一目标,并且延迟极低。其数据令人印象深刻:不到一秒即可处理一分钟的音频。对于消费级产品而言,低延迟和低成本的组合对于提供流畅且可扩展的用户体验至关重要。

在当今语音系统竞相追求质量和速度的环境下,微软将 MAI-Voice-1 定位为目前最高效的系统之一。这种高效性不仅转化为成本节约,还使得以往因成本或延迟而无法实现的应用场景成为可能。

在哪里可以尝试 MAI-Voice-1

目前,用户正在通过Copilot Daily(新闻摘要)、Copilot Podcasts以及Copilot Labs对 MAI-Voice-1 进行测试。在 Copilot Labs 中,富有表现力的语音和旁白演示展示了对风格、节奏和语调的控制能力,并承诺提供高保真输出。

如果您有兴趣尝试,最直接的方法是打开 Copilot Labs 并访问语音部分,体验不同的旁白模式。虽然大家期望很高,但值得注意的是,这只是第一批功能;微软将根据社区反馈不断迭代,调整参数并逐步扩展功能。

MAI-1-预览:大规模训练文本模型

与语音模型一同推出的还有MAI-1-preview,这是微软人工智能的首个专有语言模型,旨在高效地遵循指令并回答日常查询。该模型采用混合专家架构(MoE),这是一种多位专家各有所长的策略,并根据任务选择性地激活这些专家,从而提高效率和性能

在训练方面,微软解释说,MAI-1-preview 使用了大约15.000 个 Nvidia H100 GPU进行预训练和后训练。这种规模为指令对齐以及在常见的聊天和办公场景中提供实用响应奠定了坚实的基础。

MoE 方法与近期高级模型的发展趋势不谋而合:将系统划分为多个专用组件,并根据查询需要仅激活相应的组件。这种方案已应用于DeepSeek和 Qwen等项目中,在这些项目中,推理效率成为其区别于传统密集架构的关键因素。

可用性、公开评估和逐步部署

MAI-1-preview 现已在LMArena社区评估平台上线,供用户测试。只需登录,选择“直接聊天”模式,然后选择“mai-1-preview”即可进行测试。任何人都可以体验其在真实对话中的表现,并将其与其他模型进行比较。

微软也已开始在 Copilot 中部署 MAI-1 预览版,用于某些文本使用场景。此举有两个目的:一是收集用户反馈,二是进一步完善真实环境中的模型,使其能够与目前支撑微软助手关键功能的其他系统协同工作。

  人工智能深度推理:完整指南

与此同时,该公司已向受信任的测试人员和开发人员开放了早期访问的 API 权限。在这个受控阶段,他们将收集有关 API 的稳健性和性能的反馈,然后再向更广泛的用户群体开放,尤其关注响应质量和对指令的遵循情况。

它会取代 OpenAI 的模型吗?共存与自身的野心

微软已明确表示,目前将继续把自身的模型与合作伙伴的模型以及社区创新相结合。实际上,这意味着 MAI-1 预览版并非旨在取代目前驱动 Copilot 的系统。事实上,微软计划将其用于特定任务,衡量结果并根据反馈调整部署。

一些报道指出,它不会取代Copilot中更高级的GPT系列模型;无论如何,重要的是微软正在朝着更大的技术独立性迈进。与OpenAI的合作仍在继续,但更加微妙,双方现在都视彼此为人工智能市场的竞争对手。

本章以微软与OpenAI之间错综复杂的关系为背景展开。微软曾投入巨资,双方的联盟一度是其战略的核心,但去年微软将OpenAI与亚马逊、苹果、谷歌和Meta并列为竞争对手。与此同时,OpenAI对分享未来的前沿技术(例如设想中的通用人工智能)表示保留意见,这凸显了微软拥有自身能力的重要性。

设计理念:实用的人工智能,而非“数字角色”

除了指标和基准之外,微软人工智能还对对话式人工智能应提供的体验提出了自己的观点。苏莱曼警告说,构建看似拥有自身情感或目标的系统存在风险,这可能会引发不必要的期望或造成困惑。

该路线图旨在消除使系统拟人化的功能,从而强化人工智能作为实用且负责任的工具的特性,避免产生伪装意识的副作用。以 MAI-Voice-1 为例,这意味着优先考虑语音的表现力和自然度,同时避免越界,以欺骗的方式模拟人类情感。

策略:以产品为中心,精心设计专业模型

微软坚称其目标是构建一个由针对特定意图和场景设计的模型组成的生态系统。实际上,MAI-Voice-1 能够快速、高质量地处理语音交互,而 MAI-1-preview 则专注于文本任务,在这些任务中,指令跟踪和即时用户体验尤为突出。

这种模块化设计使 Copilot 和其他服务能够根据具体情况结合每种模型的优点,无论是用引人入胜的声音播报新闻摘要、准确回答日常查询,还是调整播客或冥想指南的语音输出风格。

用户和开发人员的用例和机会

对于最终用户而言,这意味着他们在使用的产品中能够获得更有用的回复和更佳的语音体验。对于内容创作或播客团队而言,拥有高保真、低延迟的语音引擎意味着能够以更少的技术阻力制作出更多更优质的内容。

对于开发者而言,通过MAI-1 预览版 API 的早期访问,可以进行原型设计和受控测试,从而评估该模型相较于其他模型的优势所在。LMArena 阶段还支持进行情境比较,并收集关于响应质量和指令执行能力等方面的真实世界指标。

  • 用户:改进了 Copilot Daily 和 Podcasts 的语音;互动更加自然。
  • 创作者:具有风格和节奏控制的旁白和脚本。
  • 公司业务:具有极低延迟和高表现力的语音助手。
  • 开发者:LMArena 测试和早期 API 访问,以实现快速迭代。
  硬技术与……软技术:哪一个将主导就业市场?

短期内会发生什么

短期内,MAI-1预览版将与其他模型在Copilot中并行运行,用于特定的文本应用场景。与此同时,微软将分析用户反馈并推出改进方案。这种循序渐进的方式使我们能够在不影响整体用户体验的前提下,衡量改进效果并优化用户体验。

与此同时,微软预计将在 Copilot Labs 及其已应用的产品中进一步开发 MAI-Voice-1。通过增加更多语音场景和示例,微软将能够更好地验证该模型对不同风格和实际生产挑战的响应能力。

未来方向的迹象

微软的立场非常明确:他们雄心勃勃地希望通过产品触达数十亿用户,并在模型和计算能力方面不断进步。MAI-1 只是一个开端,未来会有更多衍生产品和迭代版本推出,以进一步优化质量、成本和延迟之间的平衡。

在竞争方面,微软在文本模型方面的创新策略表明,它将继续探索高效的推理架构,这对于大众市场产品的大规模应用至关重要。MAI-Voice-1案例进一步证实,语音作为未来助手交互方式的优先考虑因素。

与生态系统和公众立场的关系

与 OpenAI 的合作关系仍将保持重要性,但微软已经表明,它并不想被单一的创新来源所束缚。只要能够为产品和客户创造价值,微软就会继续整合其团队、合作伙伴和开放社区的精华。与此同时,微软也在战略性地将自身品牌(MAI)定位为实现自主化的目标平台。

这种平衡策略——既要兼顾当下的共存,又要兼顾未来的更大独立性——可能会加速助手和生产力领域的竞争。对用户而言,其预期效果显而易见:更多样化的工具,以及针对真正解决日常问题而进行的更多实用迭代。

微软的 MAI-Voice-1 和 MAI-1-preview 兼具实用性和速度:高效且富有表现力的语音模型已应用于 Copilot 等产品,而大规模的 MoE 型文本模型也已开始在受控环境中部署,可在 LMArena 进行测试,并通过 API 向受信任的测试人员开放。其目标清晰明确:将定制化的模型集成到产品中,使其能够适应每个人的日常需求。

微软 deepseek-0
相关文章:
微软通过 AI DeepSeek 拓展视野:来自中国的技术突破