マイクロソフト AI、音声認識「MAI-Transcribe-2」公開 60言語対応、年末まで1時間0.10ドル
マイクロソフト AIは2026年9月3日付の公式発表で、音声を文字に起こすモデル「MAI-Transcribe-2」を公開した。競合モデルを性能や価格で上回ると主張しており、マイクロソフト Foundryでパブリックプレビューとして提供している。
本ページでは「音声認識」をテーマとした記事を一覧で掲載しています。
マイクロソフト AIは2026年9月3日付の公式発表で、音声を文字に起こすモデル「MAI-Transcribe-2」を公開した。競合モデルを性能や価格で上回ると主張しており、マイクロソフト Foundryでパブリックプレビューとして提供している。
FNNプライムオンラインによると、警察庁は110番通報や各種相談を文字起こしし、緊急性に応じた対応の優先度判断を支援するAIシステムを開発する方針だ。AIが緊急対応を最終決定するのではなく、通信指令員らの判断を補助する位置付けとなる。
Metaは2026年9月1日(現地時間)、Meta Superintelligence Labs(MSL)初のリアルタイム音声知覚モデル「Muse Voice Transcribe」を発表した。ストリーミング音声認識に加え、話者分離と発話終了検出を単一モデルで処理し、同日から提供を始めた。
Googleは2026年8月26日付の公式ブログで、音声を文字に変換するAIモデル「Gemini 3.5 Transcribe」を発表した。言いよどみや言い直しを整える機能を備え、開発者向けにGemini APIなどで公開プレビューを開始した。
特殊詐欺の手口が番号偽装や話術の高度化で見分けにくくなる中、NTTドコモが「通話内容」そのものを材料に生成AIで詐欺可能性を判定し、利用者へ警告する新技術を開発した。電話番号ブロック中心だった対策を、会話の文脈理解へ拡張する点が特徴だ。