Новые модели от компании Microsoft отличаются низкой задержкой и возможностью работы в режиме реального времени
Компания Microsoft представила сразу три новые модели для работы с голосом — MAI-Transcribe-2-Streaming, MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Они рассчитаны на голосовых ассистентов и другие приложения, где важны скорость обработки и небольшая задержка.
MAI-Transcribe-2-Streaming предназначена для транскрибации речи в реальном времени. Первые фрагменты текста появляются чуть больше чем через 100 мс после поступления аудио, а затем модель уточняет результат по мере продолжения разговора. Она поддерживает 60 языков и умеет автоматически определять язык во время записи. Microsoft заявляет, что в её тестах модель показала лучшую точность среди конкурирующих решений от Google и OpenAI. Стоимость использования до конца 2026 года составит 0,54 доллара за час аудио.
MAI-Voice-2.1 отвечает за преобразование текста в речь и поддерживает 23 языка в 26 языковых версиях. Один и тот же голос может говорить на разных языках, сохраняя особенности звучания и используя соответствующий акцент. Цена модели составляет 22 доллара за миллион символов.
Для задач, где особенно важна скорость, Microsoft выпустила MAI-Voice-2.1-Flash. Она способна генерировать 45 секунд аудио примерно за 150 мс. По данным компании, обработка стала на 55 % быстрее, а стоимость снизилась примерно на 60 % по сравнению с аналогичными решениями. Использование модели обойдётся в 15 долларов за миллион символов.
Все три новинки доступны через Microsoft Foundry, MAI Playground и Vercel. Голосовые модели также можно использовать через OpenRouter и Azure Voice Live, а поддержку LiveKit обещают добавить позднее. Новые решения поддерживают и клонирование голоса на разных языках по нескольким секундам исходной записи.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed | 0 | 15.79 | 03-09-2026 |
| 2 | Microsoft launches new AI model claiming No. 1 spot for real-time transcription accuracy | 0 | 18.75 | 02-10-2026 |
| 3 | Microsoft erweitert KI-Modellfamilie MAI um drei Audio-Modelle | 0 | 37.39 | 02-10-2026 |
| 4 | Российский ИИ обошел OpenAI и Nvidia в работе с задачами на русском языке | 0 | 9.48 | 06-10-2026 |
| 5 | MWS AI открыла свой инструмент для оценки моделей распознавания речи | 0 | 6.6 | 06-10-2026 |
| 6 | MWS AI открыла свой инструмент для оценки моделей распознавания речи | 0 | 6.6 | 06-10-2026 |
| 7 | Российская нейросеть обошла модели OpenAI и Nvidia в работе на русском языке | 0 | 9.03 | 06-10-2026 |
| 8 | OpenAI выпустила ИИ-модель GPT 6.1 Sol | 0 | 30 | 29-09-2026 |
| 9 | Google представила Gemini 4 Argon после нескольких месяцев задержек | 0 | 17.47 | 01-10-2026 |
| 10 | Künstliche Intelligenz: Diese Berliner Firma baut günstigere und schnellere Modelle als OpenAI | 0 | 13.41 | 01-10-2026 |