- MAI-Voice-1(超快速语音)和 MAI-1-Preview(带有 MoE 的文本)作为微软的首批内部模型问世。
- MAI-Voice-1 使用 GPU 在不到 1 秒的时间内生成 1 分钟的音频,现在可以在 Copilot Daily、Podcasts 和 Labs 中使用。
- MAI-1 预览版已在约 15.000 架 H100 上进行了训练,正在有限度地集成到 Copilot 中,并且正在 LMArena 中进行测试。
- 策略:减少对 OpenAI 的依赖,并以用户为中心协调专门的模型。

微软已经采取行动,并展示了其首批内部开发的人工智能模型,这一举措标志着其战略的转变,并直接面向普通大众 MAI-Voice-1 和 MAI-1 预览.
MAI 品牌代表着“微软人工智能”,并提出了两个非常明确的方案:一个专注于超快语音,另一个专注于具有专家架构的文本。所有这些都使该公司比 OpenAI 走上了更加自主的道路,在保持合作的同时,也将其未来导向 拥有能够与 ChatGPT、Gemini 和公司竞争的模型 en 生成式人工智能.
什么是 MAI-Voice-1 和 MAI-1-preview?

据微软称,MAI-1 预览版是 采用混合专家(MoE)架构的内部模型 在约 15.000 块 NVIDIA H100 GPU 上分两个阶段(预训练和后训练)进行训练。这种“专家”配置仅激活每个任务所需的子组件,以追求效率并更好地与用户意图保持一致。
在产品方面,该公司表示,该文本模型是为 按照指示 并为日常问题提供有用的答案因此,其初始推出将受到控制:它将在未来几周内推广到 Copilot 中的一些文本场景,目标是根据反馈从现实生活中的互动中学习。
除了这种逐步整合之外,微软还启用了 LMArena 平台上的公开测试 收集更多优质信号。同时,它计划通过API向开发人员开放,从而加强模型的评估和持续改进流程。
该公司强调不会放弃其他AI引擎: 将继续使用其团队和合作伙伴的最佳模型,例如 人类的 以及开源生态系统 在有意义的地方。短期内,MAI-1 预览版并非旨在取代 Copilot 中的 GPT-5;相反,它将服务于能够提供明显优势的特定用例。
另一方面,MAI-Voice-1 是微软的语音提案: “高度表现力和自然”的生成模型 现已在 Copilot Daily 和播客上线,也可在 Copilot Labs 中体验全新功能。其愿景清晰明确:“语音是未来的界面”,旨在打造更实用、更人性化的 AI 助手。
其技术前景十分引人注目: 只需使用单个 GPU,即可在不到一秒的时间内生成一分钟的音频这种速度,加上高保真音色以及处理一个或多个扬声器场景的能力,使 MAI-Voice-1 成为当今最有效的语音合成系统之一。
在公开测试和演示中,音频听起来出奇的流畅,语调和节奏令人信服,尽管语言支持仍然缺乏。 仅限于英语微软正在通过 Copilot Labs 探索风格和声音的个性化,并首次推出了“Copilot Audio Expressions”等体验。
一个有趣的细节:选定的名称(MAI-Voice-1 和 MAI-1-preview)是 清晰且“非常像工程师”除了这个轶事之外,重要的是他们正在制定一份路线图,以消费者为中心,优先考虑速度、效率和易用性,推出一系列专业模型。
MAI-Voice-1:功能、用途以及试用场所

MAI‑Voice‑1 是一个 高保真生成音频 能够快速完成配音、旁白和画外音的创作。其主要卖点是低延迟:使用单个 GPU 即可在不到一秒的时间内生成长达一分钟的音频,从而实现近乎实时的应用程序。
初步整合已于 Copilot 日报和播客人工智能已经能够合成摘要或口语。为了探索不同的风格和细微差别,Copilot Labs 推出了“Copilot Audio Expressions”,其中包含旁白和富有表现力的语音演示,供用户探索各种可能性。
在这些体验中,微软引入了以下选项: 情绪模式(音调和节奏控制) 或更具戏剧性叙事的故事模式。目标是提供一系列可灵活调整的声音和风格,既适用于单人叙述,也适用于多人场景。
该公司强调,该模型是 资源高效:它仅需单 GPU 即可运行,却实现了卓越的表现力。这种成本与质量的平衡使其对消费级产品以及缺乏广泛推理基础设施的团队极具吸引力。
微软提出的最清晰的用例包括讲故事、生成 引导冥想、创建画外音脚本或提供实时对话协助。所有这一切都通过力求自然且适应语境的声音实现。
- 叙述和讲故事: 故事、语音指南、语言学习或具有多个角色的故事。
- 内容制作: 自动播客、产品预告片、宣传片或每日摘要。
- 协助和无障碍设施: 阅读文本、支持有视觉障碍的用户或快速创建口头指示。
- 互动体验: 语音应答助手、应用程序和游戏中的上下文指南或具有不同音调的支持机器人。
重要的一点是 多扬声器容量,适用于戏剧表演、模拟采访或在单个音频录制中扮演不同角色。这种灵活的音场设计,无需录音棚或人声协调,即可创作出更丰富的内容。
在演示中,只需输入“关于 X 的故事”,就能在一秒钟内播放出一分钟的音频,其中包含不同的声音和语调。虽然现在评估所有细微之处还为时过早,但初步结果显示 令人信服的自然性 适合日常使用。
目前,MAI-Voice-1 面向 英语如果您的主要受众是西班牙语用户,请务必注意这一点。无论如何,随着培训和公开测试的推进,其架构和性能将支持更广泛的语言。
值得记住的是,在安全和道德方面,微软已经重申,它将消除任何使人工智能出现的功能 仿佛它有自己的感情或目标其目的是在不拟人化的情况下增强实用性,这在基于语音的对话助手中尤其敏感。
MAI-1 预览:架构、部署和策略

MAI-1 预览版是 微软创建的第一个文本基础模型 在其 MAI 部门内部。该模型已进行过大规模训练(约 15.000 台 H100),并采用了 MoE 方法:“专家混合”,即每次输入仅激活模型的相关部分。
这种设计允许在专家之间分配能力并提高任务的绩效 按照指示微软的目标是提供实用的、以生活为导向的解决方案,优先考虑最终用户的体验,而不是纯粹以业务为导向的方法。
在实践中,部署将分为两个阶段。首先,模型到达 Copilot 中部分文本场景的预览并以受控的方式进行遥测并收集反馈。然后,根据反馈,调整行为并扩大影响范围。
其次,该公司已在 LMArena 上开放了测试访问权限, 公众评价该流程加速了改进周期,提供了输入多样性,并使得在更广泛的集成之前能够发现微调机会。
微软明确表示 MAI-1-preview 目前不会取代 Copilot 内部的 GPT-5该策略是“使用正确的模型来完成正确的工作”,将 MAI-1-preview 集成到特定任务中并不断比较它们的性能。
与此同时,该公司保证将继续押注于多种引擎的组合:自己的引擎、OpenAI 等合作伙伴的引擎以及 来自开源社区的创新这样,Copilot 既可以受益于 MAI 的自主性,又可以受益于每个领域的最佳可用模型。
整个运动是更广泛转变的一部分: 减少对 OpenAI 的技术依赖 并构建自身具有弹性的人工智能基础设施。微软人工智能负责人穆斯塔法·苏莱曼 (Mustafa Suleyman) 坚称,目标是针对最终用户进行优化,依靠使用信号(遥测、行为)来提供更实用、更个性化的助手。
微软的愿景是“协调 一系列专业模型”涵盖不同的意图和场景,为用户创造“巨大的价值”。该公司将其描述为“通往知识世界的大门”,这一雄心壮志最终转化为将人工智能融入到定义类别的产品中。
在负责任的设计方面,苏莱曼还强调了 避免拟人化:为人构建人工智能,但并非将其视为“数字角色”。这对于能够展现情感的语音模型和助手尤其重要。
对于组织和专业机构而言,这波新模式既带来了机遇,也带来了责任。短期内,预计会出现以下情况: 自动化的真正好处、摘要、决策支持和口头内容生成,并调整推理成本。
- MAI-语音-1 可以启用咨询助手或语音内容(播客、专门讲解),效果自然,可立即制作。
- MAI-1 预览 为自动回复、摘要、草稿和文本任务支持打开了大门,这些功能可以逐步集成到 Copilot 中。
挑战在于确保 隐私、安全和合规 监管。为了避免失误,最好从有限的试点开始,对提示和输出进行内部审核,培训团队,并监控数据使用情况(包括输入和遥测),以避免出现意外。
如果您的操作依赖于语音,MAI-Voice-1 的延迟和质量差异非常有吸引力。如果您关注的是文本,MAI-1-preview 会很有吸引力,因为它专注于 按照指示 以及加速模型学习的公共测试框架。
这也有助于明确当前的限制: MAI-Voice-1 专注于英语 MAI-1-preview 仍处于测试阶段,部署仅限于特定情况。即便如此,微软提出的迭代速度很快,也预示着快速的改进。
最后,值得注意的是,微软表示将继续整合 它的模型、合作伙伴的模型和开源的模型这种混合方法旨在让 Copilot 为每个任务选择最佳引擎,而不局限于单一技术,并旨在为最终用户实现价值最大化。
MAI-Voice-1 和 MAI-1-preview 的发布体现了微软更加自主的战略,专注于速度、效率和实际应用。如果 Copilot 的集成和 LMArena 的评估能够巩固微软的预期,我们将拭目以待。 MAI 生态系统的两大关键支柱 在消费品和专业产品领域。
