ニュース
Meta、リアルタイム音声認識モデル「Muse Voice Transcribe」発表
2026年9月3日 12:48
Meta Superintelligence Labsは9月1日、リアルタイム音声認識モデル「Muse Voice Transcribe」を発表した。現在、Meta Model API、Meta AI for MacおよびMuse Codeを通じて利用できる。
Muse Voice Transcribeは、ストリーミングによる自動音声認識(Automatic Speech Recognition)、20人以上の話者分離および発話区間の検出をリアルタイムで実行する。Meta AIとMuse Codeの音声入力機能に対応しており、この機能は画面上の任意のウィンドウやアプリケーションで動作する。
対応言語については、70以上の言語を学習しており、そのうち25言語で動作が検証されている。文脈の偏りを利用した認識精度の向上や、単一の文中における複数言語の切り替えをそのまま処理する仕様となっている。また、1時間を超える長時間の音声入力にも事後処理なしで対応する。
技術的な基盤として、Muse Sparkファミリーの自己回帰型マルチモーダルモデルが採用されている。入力された音声は80ミリ秒の単位で処理され、モデルは次の音声を待つか、テキストを出力するかを判断する。文字起こしの速度と精度の均衡を保つため、単語の難易度に応じて処理の待ち時間を動的に変更する「適応型遅延」という仕組みを導入している。
話者分離や発話区間の検出においては、話者の切り替わりや発話の開始・終了を示す専用のトークンをテキストの流れに挿入することで対応している。









![Claude Code実践入門 [生成AI深掘りガイド] 製品画像:6位](https://m.media-amazon.com/images/I/41onRRY91KL._SL160_.jpg)































