本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]
Metaは2026年9月1日(現地時間)、Meta Superintelligence Labs(MSL)初のリアルタイム音声知覚モデル「Muse Voice Transcribe」を発表した。ストリーミング音声認識に加え、話者分離と発話終了検出を単一モデルで処理し、同日から提供を始めた。
20人超の話者をリアルタイムで区別
Muse Voice Transcribeは、音声を受け取りながら文字起こしし、発言ごとに話者を区別してラベル付けする話者分離と、利用者の発話終了を判定する機能をリアルタイムで実行する。1時間を超える音声と20人超の話者を、後処理なしで扱えるとしている。
音声は80ミリ秒単位で処理する。単語の難易度に応じて出力までの待機時間を変える「適応的遅延」を採用し、認識精度と応答速度の両立を図った。文中や文間で言語が切り替わる発話にも対応し、言語、キーワード、文脈を指定して認識を補助できる。
学習対象は70を超える言語で、このうち初期リリースで検証済みとされたのは日本語を含む25言語。Meta AI for MacとMuse Codeの音声入力にも同モデルが使われている。
Meta、音声認識と話者分離で首位と表明
Metaは9月1日時点で、Artificial Analysisのストリーミング音声認識ランキングと、公開されている話者分離ベンチマークで首位だとしている。
ITmediaによると、同日時点の比較で、確定文字起こしのWERは3.1%、発話終了後の遅延は0.16秒、話者分離の平均誤り率は17.5%だった。Meta Model APIの料金は1時間当たり0.18ドル。Muse Voice Transcribeは同API、Meta AI for Mac、Muse Codeで利用できる。
