- تعتبر MAI‑Voice‑1 (الصوت فائق السرعة) وMAI‑1‑Preview (نص مع MoE) أول طرازات داخلية من Microsoft.
- يقوم MAI-Voice-1 بإنشاء دقيقة واحدة من الصوت في أقل من 1 ثانية باستخدام وحدة معالجة الرسوميات وهو متاح الآن في Copilot Daily وPodcasts وLabs.
- تم تدريب MAI‑1‑preview على ما يقرب من 15.000 طائرة من طراز H100، ويتم دمجه في Copilot على أساس محدود، ويتم اختباره في LMArena.
- الاستراتيجية: تقليل الاعتماد على OpenAI وتنظيم نماذج متخصصة مع التركيز على المستخدم.

قامت مايكروسوفت بخطوة حيث تقدم أول نماذج الذكاء الاصطناعي التي طورتها داخلياً، وهي خطوة تمثل تغييراً في وتيرة استراتيجيتها وتستهدف بشكل مباشر عامة الجمهور من خلال MAI-Voice-1 و MAI-1-preview.
يرمز اسم MAI إلى "Microsoft AI"، ويأتي بمنتجين واضحين للغاية: أحدهما يركز على معالجة الكلام فائق السرعة، والآخر على معالجة النصوص باستخدام بنية متخصصة. هذا يضع الشركة على مسار أكثر استقلالية مقارنةً بـ OpenAI، مع الحفاظ على التعاون وتوجيه مستقبلها نحو نماذجها الخاصة القادرة على منافسة ChatGPT وGemini وغيرها في مجال الذكاء الاصطناعي التوليدي.
ما هما MAI-Voice-1 وMAI-1-preview؟

وفقًا لمايكروسوفت، فإن MAI-1-preview هو نموذج داخلي ذو بنية "مزيج من الخبراء" (MoE)، تم تدريبه على مرحلتين (التدريب المسبق والتدريب اللاحق) باستخدام ما يقارب 15.000 وحدة معالجة رسومية من نوع NVIDIA H100. يُفعّل هذا التكوين "الخبير" المكونات الفرعية الضرورية فقط لكل مهمة، سعيًا لتحقيق الكفاءة وملاءمة أفضل لغرض المستخدم.
فيما يتعلق بالمنتج، تشير الشركة إلى أن نموذج الرسائل النصية هذا مصمم لاتباع التعليمات وتقديم إجابات مفيدة للاستفسارات اليومية . ولذلك، ستكون عملية إطلاقه الأولية مُحكمة: حيث سيتم تقديمه لبعض سيناريوهات الرسائل النصية في Copilot خلال الأسابيع القليلة القادمة للاستفادة من التفاعل والتعليقات الواقعية.
إضافةً إلى هذا التكامل التدريجي، أتاحت مايكروسوفت إمكانية الاختبار العام على منصة LMArena لجمع المزيد من البيانات عالية الجودة. وفي الوقت نفسه، تخطط لإتاحتها للمطورين عبر واجهة برمجة التطبيقات (API)، مما يعزز عملية تقييم النموذج وتحسينه المستمر.
تؤكد الشركة أنها لن تتخلى عن محركات الذكاء الاصطناعي الأخرى، بل ستواصل استخدام أفضل النماذج من فريقها الخاص، ومن شركاء مثل Anthropic ، ومن بيئة المصادر المفتوحة حيثما كان ذلك مناسبًا. على المدى القريب، لا يُقصد من MAI-1-preview أن يحل محل GPT-5 في Copilot، بل سيُستخدم في حالات محددة حيث يُمكن أن يُقدم مزايا واضحة.
في الوقت نفسه، يُعدّ MAI-Voice-1 منتج مايكروسوفت الصوتي: نموذج توليدي "معبر للغاية وطبيعي" متوفر بالفعل في Copilot Daily والبودكاست، ويمكن الوصول إليه أيضًا كتجارب جديدة ضمن Copilot Labs. والرؤية الكامنة وراءه واضحة: "الصوت هو واجهة المستقبل" لمساعدين ذكاء اصطناعي أكثر فائدة وسهولة في الاستخدام.
إنّ الإمكانات التقنية مذهلة: إذ يمكنها إنتاج دقيقة واحدة من الصوت في أقل من ثانية باستخدام وحدة معالجة رسومية واحدة . هذه السرعة، بالإضافة إلى جودة الصوت العالية والقدرة على التعامل مع سيناريوهات تضمّ ممثلاً صوتياً واحداً أو أكثر، تجعل MAI-Voice-1 من بين أكثر أنظمة توليف الكلام كفاءةً المتوفرة اليوم.
في الاختبارات والعروض التوضيحية العامة، يبدو الصوت سلسًا بشكلٍ مدهش، مع نبرة وإيقاع مقنعين، على الرغم من أن دعم اللغة يقتصر حاليًا على اللغة الإنجليزية . يتم استكشاف تخصيص الأنماط والأصوات من خلال مختبرات Copilot، حيث أطلقت مايكروسوفت تجارب مثل "Copilot Audio Expressions".
ومن التفاصيل المثيرة للاهتمام: أن الأسماء المختارة (MAI-Voice-1 و MAI-1-preview) واضحة و"تشبه أسماء المهندسين إلى حد كبير ". وبغض النظر عن هذه الحكاية، فإن النقطة المهمة هي أنها تحدد خارطة طريق نحو كتالوج من النماذج المتخصصة مع التركيز على المستهلك، مع إعطاء الأولوية للسرعة والكفاءة وسهولة الاستخدام.
MAI-Voice-1: القدرات والاستخدامات وأين يمكنك تجربته

يُقدَّم نظام MAI-Voice-1 كنظام صوتي توليدي عالي الدقة قادر على الدبلجة والتعليق الصوتي وإنشاء التعليقات الصوتية في لمح البصر. وتتمثل ميزته الرئيسية في زمن الاستجابة المنخفض: إذ يُتيح توليد ما يصل إلى دقيقة من الصوت في أقل من ثانية باستخدام وحدة معالجة رسومية واحدة إمكانية تشغيل التطبيقات شبه الفورية.
تم تطبيق التكامل الأولي في تطبيق Copilot Daily والبودكاست ، حيث يقوم الذكاء الاصطناعي حاليًا بتوليف الملخصات والمقاطع الصوتية. ولتجربة الأساليب والفروق الدقيقة، تُطلق Copilot Labs خدمة "Copilot Audio Expressions"، التي تتضمن عروضًا توضيحية للسرد والكلام المعبر ليتمكن المستخدمون من استكشافها.
في هذه التجارب، تُقدّم مايكروسوفت خيارات مثل الوضع العاطفي (الذي يتحكم في النبرة والإيقاع) أو وضع القصة مع سرد أكثر درامية. والهدف هو توفير مجموعة متنوعة من الأصوات والأساليب القابلة للتعديل، سواءً لراوٍ واحد أو للمشاهد التي تضمّ ممثلين صوتيين متعددين.
تؤكد الشركة على كفاءة النموذج في استخدام الموارد ، إذ يعمل بوحدة معالجة رسومية واحدة فقط، ومع ذلك يحقق مستوىً مذهلاً من التعبير. هذا التوازن بين التكلفة والجودة يجعله جذابًا للمنتجات الاستهلاكية وللفرق التي تفتقر إلى بنية تحتية واسعة للاستدلال.
من أبرز استخدامات مايكروسوفت المقترحة: سرد القصص، وإنشاء جلسات تأمل موجهة ، وكتابة نصوص التعليق الصوتي، وتقديم المساعدة الصوتية الفورية. كل ذلك بصوت مصمم ليكون طبيعيًا وقابلًا للتكيف مع السياق.
- السرد والحكي: القصص، الأدلة الصوتية، تعلم اللغة أو القصص التي تحتوي على عدة شخصيات.
- إنتاج المحتوى: المدونات الصوتية الآلية، ومقاطع دعائية للمنتجات، أو المواد الترويجية، أو الملخصات اليومية.
- المساعدة وإمكانية الوصول: قراءة النصوص، ودعم المستخدمين الذين يعانون من صعوبات بصرية، أو إنشاء تعليمات منطوقة بسرعة.
- التجارب التفاعلية: مساعدين للاستجابة الصوتية، وأدلة سياقية في التطبيقات والألعاب، أو روبوتات الدعم ذات النغمات المختلفة.
من أهم ميزاته إمكانية استخدام أصوات متعددة ، وهي ميزة مفيدة في التمثيل الدرامي، والمقابلات المُحاكاة، أو أداء أدوار مختلفة ضمن التسجيل الصوتي نفسه. تتيح هذه المرونة في مجال الصوت إمكانية إنشاء محتوى أكثر ثراءً دون الحاجة إلى استوديو أو تنسيق أصوات بشرية.
في العروض التجريبية، يكفي طلب "قصة عن X" لإنتاج دقيقة من الصوت بأصوات ونبرات مختلفة في غضون ثانية واحدة. ورغم أنه من المبكر تقييم جميع الفروق الدقيقة بشكل كامل، إلا أن النتائج الأولية تُظهر طبيعية مقنعة مناسبة للاستخدام اليومي.
يركز برنامج MAI-Voice-1 حاليًا على اللغة الإنجليزية ، وهو أمر يجب مراعاته إذا كانت شريحة جمهورك الأساسية ناطقة بالإسبانية. ومع ذلك، تشير بنيته وأداؤه إلى إمكانية دعم لغات أوسع مع تقدم التدريب والتقييم العام.
من الجدير بالذكر أن مايكروسوفت أكدت مجدداً، فيما يتعلق بالأمن والأخلاقيات، أنها ستزيل أي ميزة تجعل الذكاء الاصطناعي يبدو وكأنه يمتلك مشاعر أو أهدافاً خاصة به . والهدف من ذلك هو تعزيز فائدته دون إضفاء صفات بشرية عليه، وهو أمر بالغ الحساسية، لا سيما في مساعدي المحادثة الصوتية.
معاينة MAI-1: الهندسة المعمارية والنشر والاستراتيجية

يُعدّ MAI-1-preview أول نموذج نصي أساسي أنشأته مايكروسوفت ضمن قسم الذكاء الاصطناعي التابع لها. وقد تم تدريبه على نطاق واسع (حوالي 15.000 H100) ويعتمد على منهجية MoE: وهي "مزيج من الخبراء" حيث يتم تفعيل الأجزاء ذات الصلة فقط من النموذج لكل مدخل.
يُتيح هذا التصميم توزيع المهارات بين الخبراء ويُحسّن الأداء في المهام التي تتطلب اتباع التعليمات . تهدف مايكروسوفت إلى توفير حلول عملية يومية، مع إعطاء الأولوية لتجربة المستخدم النهائي على حساب التركيز على الجانب التجاري البحت.
عملياً، سيتم إطلاق النموذج على مرحلتين. أولاً، سيتم نشر نسخة تجريبية من النموذج في عدد قليل من السيناريوهات النصية في منصة Copilot ، بطريقة مضبوطة لقياس البيانات عن بُعد وجمع الملاحظات. ثم، بناءً على تلك الملاحظات، سيتم تعديل سلوك النموذج وتوسيع نطاقه.
ثانيًا، أتاحت الشركة إمكانية الوصول التجريبي إلى منصة LMArena للتقييم العام . تُسرّع هذه القناة دورة التحسين، وتوفر مدخلات متنوعة، وتتيح تحديد فرص التحسين قبل التوسع في التكامل.
توضح مايكروسوفت أن MAI-1-preview لا يحل (في الوقت الحالي) محل GPT-5 ضمن Copilot . وتتمثل الاستراتيجية في استخدام "النموذج المناسب للمهمة المناسبة"، وذلك بدمج MAI-1-preview في مهام محددة ومقارنة أدائه باستمرار.
في الوقت نفسه، تؤكد الشركة أنها ستواصل الاعتماد على مزيج من المحركات: محركاتها الخاصة، ومحركات شركاء مثل OpenAI، والابتكارات من مجتمع المصادر المفتوحة . وبهذه الطريقة، يمكن لـ Copilot الاستفادة من استقلالية MAI وأفضل نموذج متاح في كل مجال.
تُعدّ هذه الخطوة جزءًا من تحوّل أوسع نطاقًا يهدف إلى تقليل الاعتماد التكنولوجي على OpenAI وبناء بنية تحتية مرنة ومملوكة للذكاء الاصطناعي. وقد أكّد مصطفى سليمان، رئيس قسم الذكاء الاصطناعي في مايكروسوفت، أن الهدف هو تحسين تجربة المستخدم النهائي، من خلال الاستفادة من بيانات الاستخدام (القياس عن بُعد، وسلوك المستخدم) لتقديم مساعدين أكثر فائدة وتخصيصًا.
تتمثل رؤية مايكروسوفت في "تنسيق مجموعة من النماذج المتخصصة " التي تغطي مختلف الأهداف والظروف، مما يُولّد "قيمة هائلة" للمستخدمين. وتصف الشركة ذلك بأنه "بوابة إلى عالم من المعرفة"، وهو طموح يترجم إلى دمج الذكاء الاصطناعي في منتجات رائدة في فئتها.
وفيما يتعلق بالتصميم المسؤول، أكد سليمان أيضاً على أهمية تجنب التجسيم : بناء الذكاء الاصطناعي للبشر، ولكن ليس كما لو كانوا "أشخاصاً رقميين". وهذا الأمر ذو أهمية خاصة في نماذج الصوت والمساعدين الذين قد يعطون انطباعاً بأن لديهم مشاعر.
بالنسبة للمؤسسات والشركات المهنية، يُمثل هذا الجيل الجديد من النماذج فرصًا ومسؤوليات في آنٍ واحد. فعلى المدى القريب، يُتوقع تحقيق فوائد ملموسة في مجالات الأتمتة ، والتلخيص، ودعم اتخاذ القرارات، وإنتاج المحتوى الصوتي بتكلفة استدلال أقل.
- ماي-فويس-1 يمكنك تفعيل مساعدي الاستشارة أو المحتوى الصوتي (البودكاست، والشروحات المتخصصة) مع نتائج طبيعية وإنتاج فوري.
- معاينة MAI-1 يفتح الباب أمام الاستجابات التلقائية والملخصات والمسودات ودعم مهام النص، والتي يمكن دمجها تدريجيًا في Copilot.
يكمن التحدي في ضمان الخصوصية والأمان والامتثال للوائح. ولتجنب أي انتكاسات، يُنصح بالبدء ببرامج تجريبية محدودة، وإجراء عمليات تدقيق داخلية للتنبيهات وعمليات الإطلاق، وتدريب الفرق، ومراقبة استخدام البيانات (المدخلات والقياس عن بُعد) لمنع أي مفاجآت.
إذا كانت عملياتك تعتمد على الصوت، فإن ميزة زمن الاستجابة وجودة الصوت في MAI-Voice-1 تُعدّ جذابة للغاية. أما إذا كان التركيز على النصوص، فإن MAI-1-preview خيارٌ مثير للاهتمام نظرًا لتركيزه على تتبع التعليمات وإطار الاختبار العام الذي يُسرّع عملية تعلّم النموذج.
من المفيد أيضًا إدراك القيود الحالية: يركز MAI-Voice-1 على اللغة الإنجليزية ، ولا يزال MAI-1-preview في مرحلة الاختبار، ويقتصر استخدامه على حالات محددة. ومع ذلك، فإن وتيرة التطوير المقترحة من مايكروسوفت سريعة، مما يوحي بتحسينات سريعة.
وأخيرًا، من المهم أن تُعلن مايكروسوفت أنها ستواصل دمج نماذجها - نماذج الشركاء والبرمجيات مفتوحة المصدر . يشير هذا النهج الهجين إلى نظام Copilot الذي يختار أفضل محرك لكل مهمة، دون الالتزام بتقنية واحدة، ويهدف إلى تحقيق أقصى قيمة للمستخدم النهائي.
يُظهر الإعلان عن MAI-Voice-1 وMAI-1-preview استراتيجية أكثر استقلالية تركز على السرعة والكفاءة والفائدة العملية. إذا حقق التكامل مع Copilot والتقييم في LMArena النتائج التي تتوقعها مايكروسوفت، فسيكون لدينا ركيزتان أساسيتان لنظام MAI البيئي، سواءً للمنتجات الاستهلاكية أو الاحترافية.
