本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]
マイクロソフト AIは2026年9月3日付の公式発表で、音声を文字に起こすモデル「MAI-Transcribe-2」を公開した。競合モデルを性能や価格で上回ると主張しており、マイクロソフト Foundryでパブリックプレビューとして提供している。
60言語の評価で首位と説明
マイクロソフトは新モデルを「最も高速・高精度・安価な音声認識モデル」と位置付けた。同社によるFLEURSベンチマークの60言語評価では、平均単語誤り率(WER)5.2%を記録し、比較対象中で首位だったという。
競合にはGemini 3.5 Transcribe、GPT-Transcribe、Whisper Large-v3、Scribe v2を挙げた。Artificial Analysisの評価を基に、処理速度はGPT-Transcribe比で最大10倍、Scribe v2比で最大7倍、Gemini 3.5 Transcribe比で最大5倍としている。Artificial Analysisの現行ランキングでは、MAI-Transcribe-2はWER 2.0%で精度2位となっている。
話者分離を追加、年末まで1時間0.10ドル
対応言語は60言語。前世代のMAI-Transcribe-1.5にはなかった話者分離と単語単位のタイムスタンプを追加し、逐語・整形済みの文字起こしスタイルや自動言語識別にも対応する。
価格は2026年12月31日まで音声1時間当たり0.10ドル。前世代の0.36ドルから約72%低い期間限定価格となる。
Microsoft Learnでは、Azure SpeechのMAI-Transcribeをパブリックプレビューとし、SLAはなく、本番ワークロードには推奨しないとしている。
参考・出典
- MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world | Microsoft AI
- MAI-Transcribe-2 | Microsoft AI
- MAI-Transcribe-2: Highest quality transcription, at the fastest speed and lowest cost | Microsoft Community Hub
- MAI-Transcribe in Azure Speech (preview) | Microsoft Learn
