AI
Sarvam AI、インド22言語対応の音声認識モデル「Saaras V4」をリリース——初期トークン生成150ms以下、月額換算での廉価APIも提供
2026/09/28
Sarvam AIが「Saaras V4」を正式リリース
インドのAIスタートアップSarvam AIは、音声認識モデルの最新世代「Saaras V4」を正式にリリースした。インド憲法に定められた22のスケジュール言語すべてに加え、グローバルな英語アクセントにも対応しており、同社は22言語すべてにおいて最先端(state-of-the-art)の精度を達成したと報告している。現時点でモデルの重みは非公開で、Sarvam APIを通じて model="saaras:v4" として即日利用可能となっている。
アーキテクチャ:音声エンコーダー+3Bハイブリッドデコーダー
Saaras V4はエンコーダー・デコーダー構成を採る。音声エンコーダーが波形を音声・音響情報を保持した埋め込みに変換し、続く時間的ダウンサンプリングアダプターがシーケンスを短縮してデコーダーの埋め込み空間に投影する。この設計により、長時間録音でもデコーダーのコンテキスト枠に収まるよう工夫されているという。
デコーダーには、同社が社内でスクラッチから学習した3Bパラメータのハイブリッド状態空間言語モデル「Sarvam-3B」を採用している。音声特徴量とテキストプロンプトを同時に読み込み、トークンを自己回帰的に逐次出力する設計だ。
ベンチマーク結果(ベンダー報告値)
以下の数値はすべてSarvam AI自身が公表したものであり、独立した第三者による再現検証はまだ公開されていない点に注意が必要だ。
-
英語: Hugging FaceのOpen ASR Leaderboardに含まれるAMI・GigaSpeech・LibriSpeech(clean/other)・SPGISpeech・VoxPopuliの6データセットと、AI4BharatのインドアクセントデータセットSvarahの計7セットで評価。Sarvam社が比較した他モデルの中で最低の平均WERを記録したと報告している。
-
インド語: AI4BharatのVistaarベンチマークで10言語を対象に評価。WERに加え、意味的な誤りと表記上の揺れを区別する独自指標「LLM-WER」でも計測している。
-
ノイズ音声: 圧縮・クリッピング・背景雑音を含むKathbath Noisyデータセットでは、LLM-WERベースでDeepgram Nova-3やGPT-4o TranscribeのエラーレートのÂ半分以下だったと同社は述べている。
-
言語識別: IndicVoicesの検証済み発話を用いた言語識別エラー率は、上位10言語で2.9%、全22言語で5.22%と報告されている。
1モデルで5種類の出力形式
Saaras V4は mode パラメーター一つで、同一の音声から以下5種類の出力を切り替えられる点が特徴だ。
| モード | 内容 |
|---|---|
| transcribe(デフォルト) | 数字・日付を正規化したネイティブスクリプト |
| verbatim | フィラーや話し言葉の数字をそのまま保持した逐語記録 |
| codemix | 英語語彙を英語のまま残したネイティブスクリプト |
| translit | 発話全体をラテン文字で表記 |
| translate | 数字を正規化した英語翻訳 |
Sarvamは「モデル内部でこれらを処理することで、後段の誤り連鎖を防げる」と説明している。
新機能:キータームプロンプティング
V4で新たに追加されたキータームプロンプティングは、saaras:v4 専用の機能だ。keyterms フィールドにJSONリスト形式で最大50語(1語につき最大64文字)を渡すことで、固有名詞やブランド名の認識精度を高められる。ただし「認識をバイアスするものであり、出力を保証するものではない」と同社は注記している。
Interspeech 2026向けに公開されたIndicContextEvalベンチマークのL5キーワードプロンプティング設定において、Saaras V4は16.03%のWERを記録し、これがベンチマーク上の最低スコアだとSarvamは述べている。
ストリーミング・バッチ処理・価格
利用形態は3種類が用意されている。
- ストリーミング: WebSocket経由で部分的な文字起こし結果を返し、初期トークンレイテンシーは150ms未満と報告されている。
- REST: 最大30秒のクリップを対象とした同期型文字起こし。
- バッチ: 最大2時間のファイルに対応した非同期ジョブ。話者分離(ダイアライゼーション)のオプションも利用可能。
SDKはPython 3.9以上とNode.js 18以上に対応するほか、LiveKit Agents・Pipecat・Vercel AI SDKとの統合も提供される。
価格はリアルタイム・ストリーミング・バッチいずれも1時間あたり₹30(約55円相当)、話者分離オプションありでは₹45と、同社の価格ページに記載されている。
既存のSaaras v3はデフォルトモデルとして引き続き提供されており、V4への切り替えはリクエストコードの1行変更で済むとSarvamは案内している。
出典: Sarvam AI Releases Saaras V4: A Speech-to-Text Model for All 22 Indian Languages and Global English