音声を文字に変えるAIを、手元のPCやアプリに組み込むための選択肢が増えています。NVIDIAの2026年10月1日付技術解説と、Microsoftの同日発表を取り上げます。本記事の公開・情報確認日は10月3日(日本時間)です。
NVIDIA、Windows・Linux向けのローカルAI実装例を公開
NVIDIAは10月1日付の技術ブログで、オープンソースのC++サンプル集「Do Inference Now(DIN)Deploy」を紹介しました。ONNX RuntimeとTensorRT RTX実行プロバイダーを組み合わせ、Windows・LinuxのネイティブアプリでAI推論を実行するための資料です。この日付は技術解説の公開日であり、各モデルの発表日ではありません。NVIDIAの10月1日付解説
PythonでモデルをONNX形式へ書き出す工程と、C++で推論する工程を分けています。音声認識のWhisper、Parakeet TDT、Nemotron ASR Streamingに加え、画像・動画の領域を切り出すSAM 2.1、画像生成のFLUX.2-klein-4Bを扱います。Windows・Linux、x86-64・Arm64向けのCMake設定も用意されています。公式サンプルリポジトリ
同社がDGX Sparkで測定したParakeet TDTの処理速度は、GPUで実時間の206.41倍、CPUで14.44倍でした。「206倍」はGPUがCPUの206倍速いという意味ではありません。SAM 2.1はGPUで38.3FPS、CPUで0.5FPSと報告しています。いずれも特定の機器・処理での測定値で、手元のPCにそのまま当てはめられません。測定表と条件
録音の文字起こしや画像編集をローカルアプリへ組み込みたい開発者には、モデル変換から実装までを追える出発点になります。導入前には、使うモデルの条件とGPU・実行環境の対応を個別に確認したいところです。
Microsoft、60言語のストリーミング文字起こしを発表
Microsoftは10月1日、「MAI-Transcribe-2-Streaming」と音声生成モデル「MAI-Voice-2.1」「MAI-Voice-2.1-Flash」を発表しました。文字起こしは60言語に対応し、言語を継続的に自動検出します。音声を受け取ってから100ミリ秒強で最初の暫定結果を返し、その後の文脈で修正して確定する、と同社は説明しています。Microsoftの公式発表
文字起こしの導入価格は音声1時間当たり0.54米ドルで、2026年末までの設定です。音声生成は23言語・26ロケールに対応し、MAI-Voice-2.1は100万文字当たり22米ドル、Flashは15米ドルと案内されています。文字起こしの音声時間と、音声生成の文字数では課金単位が違います。対応範囲と料金の説明
3モデルはMicrosoft FoundryやMAI Playgroundなどから利用でき、音声生成の2モデルはOpenRouterでも提供するとしています。LiveKit連携は今後の予定です。リアルタイム字幕や音声アシスタントを作る人には、発話が終わる前の暫定結果を使う設計が検討材料になります。ただし、暫定文は後から変わるため、表示や後続処理で確定結果と区別する必要があります。今回の発表を、モデルをダウンロードして家庭のPCだけで動かせる案内として扱うことはできません。提供先と利用例
実在製品の写真や実際の操作画面ではありません。


コメント