マイクロソフト AI、音声認識「MAI-Transcribe-2」公開 60言語対応、年末まで1時間0.10ドル

マイクロソフト AI、音声認識「MAI-Transcribe-2」公開 60言語対応、年末まで1時間0.10ドル

※記事を視覚化したイメージであり、実際の事象とは異なります。

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

マイクロソフト AIは2026年9月3日付の公式発表で、音声を文字に起こすモデル「MAI-Transcribe-2」を公開した。競合モデルを性能や価格で上回ると主張しており、マイクロソフト Foundryでパブリックプレビューとして提供している。

60言語の評価で首位と説明

マイクロソフトは新モデルを「最も高速・高精度・安価な音声認識モデル」と位置付けた。同社によるFLEURSベンチマークの60言語評価では、平均単語誤り率(WER)5.2%を記録し、比較対象中で首位だったという。

競合にはGemini 3.5 Transcribe、GPT-Transcribe、Whisper Large-v3、Scribe v2を挙げた。Artificial Analysisの評価を基に、処理速度はGPT-Transcribe比で最大10倍、Scribe v2比で最大7倍、Gemini 3.5 Transcribe比で最大5倍としている。Artificial Analysisの現行ランキングでは、MAI-Transcribe-2はWER 2.0%で精度2位となっている。

話者分離を追加、年末まで1時間0.10ドル

対応言語は60言語。前世代のMAI-Transcribe-1.5にはなかった話者分離と単語単位のタイムスタンプを追加し、逐語・整形済みの文字起こしスタイルや自動言語識別にも対応する。

価格は2026年12月31日まで音声1時間当たり0.10ドル。前世代の0.36ドルから約72%低い期間限定価格となる。

Microsoft Learnでは、Azure SpeechのMAI-Transcribeをパブリックプレビューとし、SLAはなく、本番ワークロードには推奨しないとしている。

参考・出典

ニュースはAIで深化する—。日々の出来事を深掘りし、次の時代を考える視点をお届けします。

本サイトの記事や画像はAIが公的資料や報道を整理し制作したものです。
ただし誤りや不確定な情報が含まれることがありますので、参考の一助としてご覧いただき、
実際の判断は公的資料や他の報道を直接ご確認ください。
[私たちの取り組み]