MAI-Voice-1 og MAI-1-preview: Disse er Microsoft AI's første AI-modeller.

Sidste ændring: 2 September 2025
Forfatter: TecnoDigital
  • MAI-Voice-1 genererer udtryksfuld stemme i høj kvalitet med ultralav latenstid ved hjælp af en enkelt GPU.
  • MAI-1-preview er en MoE-model trænet med ~15.000 H100'er, med fokus på at følge instruktioner.
  • Begge bliver gradvist integreret i Copilot og kan testes i Labs og LMArena.
  • Strategi: Orkestrer specialiserede modeller, der sameksisterer med OpenAI.

Microsoft AI-stemmemodel
Fremragende billede

Microsoft har taget et skridt med lanceringen af ​​sine første proprietære kunstige intelligens-modeller under Microsoft AI-paraplyen: MAI-Voice-1 og MAI-1-preview . Med dette skridt sigter virksomheden mod en produktstrategi, hvor dens assistenter og tjenester drager fordel af specialiserede modeller, der er designet til både tale og tekst.

Teknologivirksomhedens mål er at gøre AI til "porten til et univers af viden" ved at orkestrere et sæt pålidelige systemer, der forstår hver bruger. Dette resulterer i to centrale innovationer: en meget hurtig og udtryksfuld stemmemodel og en tekstmodel baseret på en blanding af eksperter, der fokuserer på at følge instruktioner og give nyttige svar til daglig brug.

Hvad er MAI, og hvorfor nu?

MAI er akronymet for Microsoft AI , det brand, som den Redmond-baserede virksomhed omfatter sine egne grundlæggende modeller under. Kontekst betyder noget: Forholdet til OpenAI fortsætter, men det er stadig mere konkurrencepræget, i en sådan grad, at Microsoft har inkluderet OpenAI på sin liste over konkurrenter . Alligevel insisterer virksomheden på, at den fortsat vil bruge "de bedste modeller" fra partnere og det åbne fællesskab, hvor det giver mening.

Bag disse lanceringer står Mustafa Suleyman , administrerende direktør for Microsoft AI og medstifter af DeepMind, som har gjort målet klart: at skabe "AI anvendt som en platform for produkter." Med andre ord specialiserede modeller , der integreres i Copilot og andre oplevelser og effektivt dækker specifikke behov inden for tale og tekst.

MAI-Voice-1: Stemmemodellen, der prioriterer hastighed og udtryksfuldhed

Det første system, der afsløres, er MAI-Voice-1 , et stemmesyntesesystem, der er i stand til at generere udtryksfuld, hi-fi-lyd med ekstremt lav latenstid. Dets vigtigste salgsargument er, at det kan producere et minuts lyd på mindre end et sekund , samtidig med at det bevarer naturlighed og intonationsvariationer.

Ud over hastighed er en af ​​dens styrker udtryksevne: modellen understøtter forskellige stilarter, toner og nuancer i voice-over, designet til fortælling eller talte vejledninger . I scenarier med én eller flere stemmer er resultatet, hvad Microsoft beskriver som en "meget udtryksfuld og naturlig" stemme.

Effektivitet er også en nøglefunktion: MAI-Voice-1 fungerer med en enkelt GPU til inferens, hvilket placerer det blandt de mest effektive stemmesystemer, der findes i øjeblikket. I et økosystem, hvor computeromkostningerne er betydelige, er denne optimering afgørende for at skalere funktionalitet til forbrugerprodukter.

Med hensyn til tilgængelighed er MAI-Voice-1 allerede integreret i Copilot Daily og Podcasts , og tilbydes også som en ny oplevelse i Copilot Labs . Der er det muligt at eksperimentere med fortælling og udtryksfuld tale, justere stilarter og udforske forskellige stemmer inden for laboratoriets rammer.

Hvordan det lyder, og hvad du kan gøre med det i dag

De, der har prøvet det, siger, at lyden lyder meget naturlig , med god kontrol over intonation og rytme. Det er dog værd at bemærke, at det i øjeblikket kun er tilgængeligt på engelsk . Microsoft tilbyder typiske eksempler: bed om "en historie om dinosaurer", og du får hurtigt en fortælling på et minut med passende stemmevariationer og toner.

I Copilot Labs giver funktionen " Audio Expressions " dig mulighed for at generere lyd fra et manuskript og ændre fortællestilen. Den inkluderer tilstande som en følelsesmæssig tilstand (til justering af tone og rytme eller tildeling af forskellige stemmer) og en historietilstand rettet mod udtryksfuld fortælling. Ideen er at lette testning og prototyping for dem, der ønsker at udforske muligheder uden at oprette et komplekst miljø.

  Hvad er Replit AI? Komplet guide til AI til cloudprogrammering

Blandt use cases nævner Microsoft alt fra historiefortælling og narration til guidede meditationer, samt potentiale for virtuelle assistenter med samtaler i realtid. Reduceret latenstid kombineret med udtryksfuldhed åbner døren for mere jævne oplevelser i stemmegrænseflader, hvor naturlighed er afgørende.

  • Dynamisk fortælling til historier, podcasts eller uddannelse.
  • guidede meditationer og wellness-indhold med tonevariationer.
  • Samtaleassistenter i (næsten) realtid, kontekstafhængigt.
  • Hurtig prototyping i Copilot Labs med stil- og stemmejusteringer.

Computereffektivitet: et minuts lyd på mindre end et sekund

Det kræver teknisk kunnen at generere hi-fi, udtryksfuld lyd, men MAI-Voice-1 kan prale af at opnå dette med en enkelt GPU og med ultralav latenstid. Tallet er imponerende: et minuts lyd på mindre end et sekund . For forbrugerprodukter er denne kombination - lav latenstid og overkommelig pris - afgørende for at levere problemfri og skalerbare oplevelser.

I dagens landskab, hvor stemmesystemer konkurrerer på kvalitet og hastighed, placerer Microsoft MAI-Voice-1 blandt de mest effektive systemer på markedet. Denne effektivitet omsættes ikke kun til omkostningsbesparelser, men muliggør også anvendelsesscenarier, der tidligere var upraktiske på grund af omkostninger eller latenstid.

Hvor kan man prøve MAI-Voice-1

I dag testes MAI-Voice-1 af brugere via Copilot Daily (nyhedsresuméer) og Copilot Podcasts , samt Copilot Labs . I Labs viser demonstrationer af udtryksfuld tale og fortælleteknik omfanget af kontrol over stil, rytme og tone, alt sammen med løftet om high-fi -output.

Hvis du er interesseret i at eksperimentere, er den mest direkte rute at åbne Copilot Labs og få adgang til stemmesektionen for at eksperimentere med fortællemetoderne . Selvom forventningerne er høje, er det værd at huske, at dette kun er den første batch; Microsoft vil fortsætte med at iterere med feedback fra fællesskabet, justere parametre og udvide funktioner over tid.

MAI-1-forhåndsvisning: den storskala trænede tekstmodel

Sammen med stemmemodellen kommer MAI-1-preview , Microsoft AI's første proprietære sprogmodel designet til at følge instruktioner og besvare hverdagsforespørgsler effektivt. Den valgte arkitektur er mixture-of-experts (MoE), en strategi, hvor flere eksperter specialiserer sig og aktiveres selektivt afhængigt af opgaven, hvilket forbedrer effektivitet og ydeevne.

Med hensyn til træning forklarer Microsoft, at MAI-1-preview blev forud- og eftertrænet ved hjælp af cirka 15.000 Nvidia H100 GPU'er . Denne skala giver et solidt fundament for instruktionstilpasning og for at levere praktiske svar i almindelige chat- og produktivitetsscenarier.

MoE-tilgangen minder om de seneste tendenser inden for avancerede modeller: opdeling af systemet i specialiserede komponenter og aktivering af kun det nødvendige pr. forespørgsel. Denne metode er set i projekter som DeepSeek og Qwen , hvor effektivitet under inferens bliver en differentierende faktor sammenlignet med traditionelle tætte arkitekturer.

Tilgængelighed, offentlig evaluering og gradvis implementering

MAI-1-preview er nu tilgængelig til test på LMArena- fællesskabets evalueringsplatform . For at teste det skal du blot logge ind, vælge Direct Chat- tilstand og vælge "mai-1-preview", så alle kan opleve dets opførsel i rigtige samtaler og sammenligne det med andre modeller.

Microsoft er også begyndt at implementere MAI-1-preview i Copilot til visse tekstbrugsscenarier. Målet er dobbelt: at indsamle brugerfeedback og yderligere forfine modellen i et virkeligt miljø, der sameksisterer med andre systemer, der i øjeblikket understøtter centrale aspekter af virksomhedens assistent.

  Sådan tjener du penge på YouTube uden at være influencer

Parallelt har virksomheden aktiveret API-adgang for betroede testere og udviklere i tidlig adgang. Denne kontrollerede fase vil give dem mulighed for at indsamle feedback om robusthed og ydeevne, før den åbnes op for et bredere publikum, med særlig vægt på svarkvalitet og overholdelse af instruktioner.

Er det en erstatning for OpenAIs modeller? Sameksistens og dens egen ambition

Microsoft har gjort det klart, at de indtil videre vil fortsætte med at kombinere deres modeller med partneres og innovationer fra lokalsamfundet. I praksis betyder det, at MAI-1-preview ikke er beregnet til at erstatte de systemer, der i øjeblikket driver Copilot. Faktisk planlægger virksomheden at bruge det til specifikke opgaver , måle resultater og justere implementeringen baseret på feedback.

Nogle rapporter tyder på, at det ikke vil erstatte mere avancerede versioner af GPT-familien i Copilot; under alle omstændigheder er det vigtige punkt, at Microsoft bevæger sig mod større teknologisk uafhængighed . Samarbejdet med OpenAI fortsætter, men er mere nuanceret, hvor begge parter nu anerkender hinanden som konkurrenter på AI-markedet.

Dette kapitel foregår på baggrund af et komplekst forhold til OpenAI. Microsoft investerede kraftigt, og i en periode var alliancen central for deres strategi, men sidste år inkluderede de OpenAI som en rival sammen med Amazon, Apple, Google og Meta. Samtidig har OpenAI udtrykt forbehold over for at dele fremtidige banebrydende teknologier, såsom en hypotetisk AGI, hvilket understreger behovet for, at Microsoft har sine egne muligheder.

Designfilosofi: Nyttig AI, ikke en "digital persona"

Ud over metrikker og benchmarks har Microsoft AI taget stilling til den oplevelse, som konversationel AI bør tilbyde. Suleyman har advaret om risikoen ved at bygge systemer, der tilsyneladende har deres egne følelser eller mål , hvilket kan skabe uønskede forventninger eller forvirring.

Køreplanen involverer at eliminere funktioner, der antropomorfierer systemet, og styrke en AI, der er et nyttigt og ansvarligt værktøj, uden bivirkningerne ved at foregive bevidsthed. I tilfældet med MAI-Voice-1 betyder det at prioritere udtryksfuldhed og naturlighed i stemmen uden at overskride grænsen til vildledende simulering af menneskelige følelser .

Strategi: Orkestrer specialiserede modeller med produktfokus

Microsoft insisterer på, at deres mål er at orkestrere et økosystem af modeller designet til specifikke intentioner og kontekster. I praksis dækker MAI-Voice-1 den talte grænseflade med hastighed og kvalitet, mens MAI-1-preview fokuserer på tekstopgaver, hvor instruktionssporing og øjeblikkelig brugervenlighed skinner igennem.

Denne modularitet gør det muligt for Copilot og andre tjenester at kombinere det bedste fra hver model afhængigt af den enkelte sag, uanset om det drejer sig om at fortælle et nyhedsresumé med en overbevisende stemme, præcist besvare et hverdagsspørgsmål eller justere stilen på et talt output til en podcast eller meditationsguide.

Brugsscenarier og muligheder for brugere og udviklere

For slutbrugeren betyder dette mere nyttige svar og forbedrede stemmeoplevelser i produkter, de allerede bruger. For indholds- eller podcastteams betyder en stemmemotor med høj kvalitet og lav latenstid at producere mere og bedre indhold med mindre teknisk friktion.

For udviklere åbner tidlig adgang via MAI-1-preview API'en døren for prototyping og kontrolleret testning, hvilket giver dem mulighed for at evaluere, hvor denne model tilbyder fordele i forhold til andre. LMArena-fasen muliggør også kontekstuelle sammenligninger og indsamling af virkelige metrikker om responskvalitet og evnen til at følge instruktioner.

  • brugereForbedret stemme på Copilot Daily og podcasts; mere naturlig interaktion.
  • SkabereFortællinger og manuskripter med stil- og rytmekontrol.
  • virksomhederStemmeassistenter med meget lav latenstid og høj udtryksevne.
  • UdviklereLMArena-testning og tidlig API-adgang til hurtig iteration.
  5 grunde til, at DJI-droner ændrer fotografering

Hvad man kan forvente på kort sigt

På kort sigt vil vi se MAI-1-preview sameksistere med andre modeller i Copilot for udvalgte tekstbrugsscenarier, mens Microsoft analyserer feedback og implementerer forbedringer. Denne trinvise tilgang giver os mulighed for at måle effekten og finjustere oplevelsen uden at gå på kompromis med den samlede brugeroplevelse.

Parallelt forventes virksomheden at videreudvikle MAI-Voice-1 inden for Copilot Labs og de produkter, hvor det allerede er implementeret. Ved at tilføje flere talescenarier og eksempler vil Microsoft bedre kunne validere modellens respons på forskellige stilarter og produktionsudfordringer i den virkelige verden.

Tegn på den fremtidige retning

Microsofts tone er utvetydig: der er en ambition om at nå milliarder af mennesker gennem deres produkter, med fremskridt inden for modeller og computerkraft. MAI-1 er starten på en familie, og det er rimeligt at forvente variationer og nye iterationer, der finjusterer balancen mellem kvalitet, omkostninger og latenstid.

På konkurrencefronten antyder MoE-strategien inden for tekstmodeller, at Microsoft vil fortsætte med at udforske effektive inferensarkitekturer, en nøglefaktor i skalering til store mængder i massemarkedsprodukter. MAI-Voice-1-sagen bekræfter yderligere, at stemme er en prioritet som fremtidens grænseflade for assistenter.

Forholdet til økosystemet og den offentlige holdning

Forholdet til OpenAI vil fortsat være relevant, men Microsoft har allerede vist, at de ikke ønsker at være bundet til en enkelt innovationskilde. De vil fortsætte med at integrere det bedste fra deres team , partnere og det åbne fællesskab, så længe det tilfører værdi til produkter og kunder. Samtidig positionerer de deres eget brand (MAI) som et middel til at opnå autonomi, hvor det er strategisk.

Denne balancegang – sameksistens nu og større uafhængighed i morgen – kan fremskynde konkurrencen inden for assistenter og produktivitet. For brugerne er den ønskede effekt klar: et bredere udvalg af værktøjer og mere praktisk iteration af, hvad der virkelig løser hverdagsproblemer.

Microsofts tilgang med MAI-Voice-1 og MAI-1-preview kombinerer pragmatisme og hastighed: en effektiv og udtryksfuld stemmemodel, der allerede understøtter oplevelser i Copilot, og en storstilet tekstmodel af MoE-typen , der er begyndt at blive implementeret i kontrollerede miljøer, kan testes i LMArena og åbnes via API for betroede testere. Det nye mål er klart: specialiserede modeller, integreret i produkter, der tilpasser sig hver enkelt persons daglige behov.

microsoft deepseek-0
Relateret artikel:
Microsoft udvider sin horisont med AI DeepSeek: et teknologisk gennembrud fra Kina