会議の文字起こしでは、言葉を認識するだけでなく「誰が話したか」を分ける処理も必要です。NTTは9月28日、音声と言語の国際会議 Interspeech 2026 に研究論文14件が採択されたと公表しました。長時間音声を速く認識する手法や、軽量な音声認識の研究が含まれています。
NTT、音声AI研究14件が国際会議に
Interspeech 2026 は9月27日から10月1日までシドニーで開催。NTTの発表によると、研究所の論文14件が採択され、チュートリアルも行われます。長時間音声向けの論文「Non-Autoregressive Minimum Bayes’ Risk Decoding for Fast Speech Recognition」では、自己回帰型モデルと比べ、精度を同程度に保ちながら最大43.1倍高速化したと報告しています。NTTの発表内容はこちら。
この数字はNTTが論文内の実験条件で得た結果です。市販の会議アプリや一般的な音声認識が一律に43倍速くなることを意味しません。
もう一つの「LLM-as-Joiner」は、音声と文章の対応づけを音声認識モデルが担い、文脈や語の関係をLLMが処理する構成です。NTTは英語と5言語を含む多言語データセットで評価し、精度と処理効率の改善を報告。スマートフォンなど日常機器での利用を見据えた軽量モデルの性能向上も示しています。
車やスマート機器の中で動く音声AI
端末側のAI処理では、SoundHound AIが9月24日に音声エージェント基盤「OASYS Edge」を発表しました。同社は、LLMを使う音声AIを車載機器やスマートデバイスのハードウェア上で動かす構想と説明しています。ネットワーク接続がない状態でも会話できること、プライバシーを考慮して端末内で処理することは、同社の発表上の説明です。提供開始は2026年後半の予定で、発表時点ではライブデモ段階です。SoundHound AIの発表には、対応チップや消費電力、対応言語などの詳細仕様は記載されていません。

使う側が確認したいこと
今回の発表は、NTTの学会採択論文とSoundHoundの製品構想という別段階の情報です。会議の文字起こしを選ぶときは、話者ごとに分けて書き出せるか、音声データをどこで処理するか、ネット接続が切れた際に何が使えるかを確認すると、業務に合うか判断しやすくなります。今回紹介した研究が一般向けサービスに入る時期は、NTTの発表では明らかにされていません。


コメント