米MicrosoftはMicrosoft Foundryに、3つの新たなMicrosoft AI(MAI)モデルを導入した。リアルタイム文字起こしと音声合成を組み合わせ、音声エージェントの開発に新たな選択肢を提供する。
文字起こしと音声合成の新モデルが登場
2026年10月1日に導入されたのは、「MAI-Transcribe-2-Streaming」「MAI-Voice-2.1」「MAI-Voice-2.1-Flash」の3モデルだ。Microsoftは3モデルを組み合わせることで、音声を聞き取り、推論やツール利用を進めながら応答する音声エージェントを構築できるとしている。
MAI-Transcribe-2-Streamingは、ライブ音声を受信しながら継続的に文字起こしするモデルで、自動言語検出と60言語に対応する。音声受信から数百ミリ秒以内に部分的な文字起こしを生成し、発話終了後に結果を確定する仕組みだ。
同社によると、Artificial Analysisのリーダーボードでは部分・最終文字起こしの双方で精度1位となり、多くの場合は320ミリ秒程度で単語が表示されるという。
MAI-Voice-2.1は23言語で自然かつ表現力のある音声を生成し、対応言語間で一貫した音声IDを利用でき、言語に応じて発音や話し方も調整する。
一方、MAI-Voice-2.1-Flashは応答時間と処理量を重視したモデルで、同社の比較では同クラスの競合モデルより55%高速、60%安価とされる。
3モデルはAzure Speechを介してMicrosoft Foundryで利用可能で、Microsoft Foundryから直接APIにもアクセスできる。OpenRouter、Vercel、LiveKitを通じた利用も可能にするとしている。
価格は、MAI-Transcribe-2-Streamingが年末まで1時間0.54ドルの特別価格、MAI-Voice-2.1が100万文字22ドル、Flashが100万文字15ドルとなっている。
リアルタイム音声AIがもたらす利点と課題
3モデルを組み合わせれば、音声エージェントは利用者の話し終わりを待たずに動き出せる可能性がある。発話の途中から推論やツール利用の準備を進められるため、対話全体の待ち時間を縮める効果が期待できる。
特に顧客対応や音声アシスタントのように、リアルタイム性が重視される場面では、認識と応答の速さが体験品質に影響しやすい。応答時間と処理量に強いFlashと、表現力に強いVoice-2.1があるため、優先したい点に応じて使い分けやすくなると考えられる。
一方、部分的な文字起こしは確定前の暫定的な結果であり、これに基づいて処理を進める場合は、途中段階の認識結果をどう扱うかが重要になる。
また、体験の質は文字起こしと音声合成だけでなく、推論やツール利用にかかる時間にも左右されるため、個々のモデル性能だけでは判断しにくい。
こうした課題をクリアできれば、用途に応じてモデルを組み合わせる設計は広がっていくだろう。推論やツール利用を含めた全体の応答速度がどこまで縮まるか、今後の展開に注目したい。
関連記事:
マイクロソフト、文字起こしAI「MAI-Transcribe-2」プレビュー開始 話者識別・60言語対応

Microsoft、自社開発AI「MAI」7モデルを発表 企業向けAI最適化機能「Frontier Tuning」も公開
