Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Microsoft erweitert KI-Modellfamilie MAI um drei Audio-Modelle

Дата публикации: 02-10-2026 11:23:00

Mit MAI-Transcribe-2-Streaming, MAI-Voice-2.1 und MAI-Voice-2.1-Flash erweitert Microsoft seine eigene KI-Modellfamilie um Audio-Funktionen für Voice-Agents.

Основное содержимое страницы с новостью.

Eigene große KI-Modelle hat Microsoft erst spät entwickelt – aber nicht, weil man das Thema in Redmond verschlafen hat, sondern ganz im Gegenteil: Der Windows-Hersteller setzte mehrere Jahre lang vor allem auf die Kooperation mit OpenAI. Inzwischen baut Microsoft mit der MAI-Familie eine eigene Modellreihe auf. Mit MAI-Transcribe-2-Streaming, MAI-Voice-2.1 und MAI-Voice-2.1-Flash kommen nun drei weitere Modelle hinzu, die Microsofts Ambitionen im Audio-Bereich unterstreichen.

Der Schwerpunkt der Veröffentlichung vom 1. Oktober liegt auf dem Bau von Voice-Agents. Dafür sollen die drei Modelle Echtzeit-Transkription und Sprachausgabe liefern.

Erstes Streamingmodell der MAI-Familie

MAI-Transcribe-2-Streaming ist das erste Streamingmodell der MAI-Familie. Es beherrscht 60 Sprachen und erkennt die gesprochene Sprache automatisch und fortlaufend – ein Sprachwechsel während der Transkription ist also möglich. Erste vorläufige Ergebnisse verspricht Microsoft nach gut 100 Millisekunden. Sobald mehr Kontext vorliegt, korrigiert das Modell diese Zwischenergebnisse. Auf der Benchmark-Plattform Artificial Analysis liegt das Modell bei der Genauigkeit auf Platz 1, sowohl bei finalen als auch bei vorläufigen Transkripten. Laut internen Messungen erscheinen Wörter im Transkript doppelt so schnell wie beim „engsten Konkurrenten“, den Microsoft nicht benennt. Bei der Genauigkeit folgt auf Artificial Analysis Grok Voice Transcribe 2.0 von xAI auf Platz 2.

Als mögliche Anwendungsfälle beschreibt Microsoft Voice-Agents, die schon mitten im Satz Reasoning anstoßen oder Tools aufrufen, sowie Live-Untertitel und Diktierfunktionen. Bis Ende des Jahres bietet Microsoft das Modell zum Einführungspreis von 0,54 US-Dollar (rund 48 Cent) pro Audiostunde an. Was es danach kostet, ist noch offen. Seine ersten Audio-Gehversuche unternahm Microsoft bereits im August 2025 mit dem Sprachgenerierungsmodell MAI-Voice-1.

Text-to-Speech in 23 Sprachen

Das Text-to-Speech-Modell MAI-Voice-2.1 beherrscht 23 Sprachen, kann ebenfalls während der laufenden Ausgabe zwischen Sprachen wechseln und soll laut Microsoft jeweils mit muttersprachlichem Akzent sprechen. In unseren Versuchen mit der Demo-App „Chatter“ im MAI Playground bestätigte sich das für die deutsche Sprachausgabe. Der Preis beträgt 22 US-Dollar pro 1 Million Zeichen.

Die Flash-Variante ist mit 15 US-Dollar pro 1 Million Zeichen günstiger, beherrscht die gleichen Sprachen und Stimmen und soll für 45 Sekunden Audio eine Ende-zu-Ende-Latenz von 150 Millisekunden schaffen. Damit wären recht flüssige Gespräche möglich. Microsoft positioniert Flash entsprechend für Echtzeit-Agents, Callcenter und Telefonmenüs, das teurere Modell dagegen für längere Inhalte wie Hörbücher, Podcasts und Voice-over, bei denen die Stimme über lange Passagen konsistent bleiben soll. Messbare Qualitätsunterschiede zwischen beiden Varianten nennt Microsoft nicht.

Voice-Cloning mit Sicherheitsvorkehrung

Beide Modelle sollen Stimmen in allen Sprachen klonen können. Dafür genügen laut Microsoft 5 bis 60 Sekunden Referenzaudio. Um Missbrauch zu verhindern, ist die Funktion zugangsbeschränkt: Entwickler müssen eine Prüfung durch Microsoft durchlaufen und eine Audio-Einwilligung der Person hochladen, deren Stimme geklont werden soll.

Verfügbar sind alle drei Modelle über Microsoft Foundry, den MAI Playground, Vercel und Azure Voice Live, die beiden Voice-Modelle zusätzlich über OpenRouter. Eine Integration in LiveKit soll folgen.

Microsofts Modellfamilie wächst schnell: Zuvor waren bereits MAI-Transcribe-2, MAI-Image-2.6, MAI-Thinking-1 und MAI-Code-1.1-Flash erschienen – Modelle, mit denen Microsoft unabhängiger von OpenAI wird. Ihre Zusammenarbeit haben beide Unternehmen im Oktober 2025 mit veränderten Partnerschaftsregeln neu aufgestellt. MAI-Code-1.1-Flash steckt bereits in GitHub Copilot und VS Code. Für den Security-Bereich hat Microsoft zudem mit MAI-Cyber-1-Flash ein spezialisiertes Modell zur automatisierten Schwachstellensuche vorgestellt. Unklar bleibt, wann und wie die neuen Audio-Modelle in Microsoft-Produkte wie Copilot, Teams oder Windows einfließen. Echtzeit-Spracherkennung bietet Microsoft über Azure Speech in Foundry Tools zwar schon lange an, mit dem eigenen Streamingmodell tritt der Konzern nun aber direkt gegen spezialisierte Anbieter an. In diesem Markt konkurrieren unter anderem ElevenLabs, Deepgram, AssemblyAI, Google, OpenAI und xAI.

(mki)

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Microsoft представила голосовую ИИ-модель MAI-Transcribe-2: в тестах она превосходит решения от Google и OpenAI012.5602-10-2026
2Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed015.7903-09-2026
3KI-Update kompakt: MAI Audio-Funktionen, Apple, KI-Bademeister, Mondforschung033.9105-10-2026
4Microsoft launches new AI model claiming No. 1 spot for real-time transcription accuracy018.7502-10-2026
5Microsoft transforme Copilot en « IA d’exécution des tâches » et dévoile Home, Code et Autopilot05.2628-09-2026
6Wasserzeichen für KI-Texte: Anthropic weitet Anwendung aus019.1725-09-2026
7heise-Angebot: M365 Copilot im Unternehmen – Agents mit Copilot Studio und Foundry entwickeln08.5625-09-2026
8heise-Angebot: M365 Copilot im Unternehmen – Agents mit Copilot Studio und Foundry entwickeln08.5625-09-2026
9Ready or not, here come the AI gadgets, from "charms" to smart speakers07.7225-09-2026

Классификация: Пресс-релизы. Схожих патентов: 0. Схожих новостей: 9. Тональность: 0. Информативность: 37.39. Источник: www.heise.de.