Research
プロンプト指示は信頼できない——音声ユーザーシミュレータの「自然な話し方」制御、ルールベースが優位と判明
2026/10/11
音声エージェント評価の「盲点」を突く研究
音声会話エージェントの商業展開が加速するなか、それを評価するためのユーザーシミュレータの品質が問われ始めている。Dialpad Inc.の研究者らは、シミュレータが「設定通りに動いているか」を体系的に監査した論文を発表した。その結果、LLMへのプロンプト指示によって発話の自然さを制御しようとするアプローチは根本的に不安定であり、言語学的知見に基づくルールベースのアルゴリズムのほうが優れた制御性と多様性を示すと報告している。
「発話の自然さ」とは何か
この研究が対象とするのは、ディスフルエンシー(「えーと」「あの」などの言いよどみや繰り返し)、割り込み(相手が話し終わる前に発話すること)、バックチャネル(「うんうん」「なるほど」など、ターンを奪わずに注意を示す短い反応)の3つだ。著者らはこれらをまとめて「発話の自然さ行動(speech naturalness behaviors)」と呼ぶ。
人間同士の会話では、ターンの切れ目はわずか110〜130ミリ秒の間隔で発生し、両者が同時に話すことも日常的に起こる。こうした動態を再現できるシミュレータでなければ、音声エージェントの実力を正しく測れない。
先行研究の「報告漏れ」問題
著者らは既存の評価ハーネスを精査し、いずれもユーザーシミュレータ側が「実際にどう振る舞ったか」を報告していないという共通の問題を指摘している。たとえば τ-Voice はエージェント側の割り込み率のみを公表し、Full-Duplex-Bench v3 もフィラー率をエージェント側でしか計測していない。ユーザーシミュレータの設定値は公開されても、実現値は報告されないというギャップが業界全体に存在するという。
さらに τ-Voice のプロンプトには矛盾した指示が含まれていることも確認された。グローバル指示ではフィラーワードの使用を求める一方、ペルソナガイドラインでは使用を避けるよう指示されており、「意図した設定が実際の発話に反映されているかどうか」をそもそも検証する仕組みが欠如していると論文は述べる。
実験設計:ライブ電話環境での評価
研究チームは、実際の電話インフラ上で稼働する商用音声エージェントを「ブラックボックス」のテスト対象として設定し、自社開発のシミュレータと対話させた。シミュレータはSTT・LLM・TTSを組み合わせたカスケード型パイプラインで構成されており、デフォルトでは gpt-4o-mini ファミリーのモデルを使用している。
ターン切り替えの検知には固定時間ポーリングではなくVAD(音声活動検出)イベントを採用している点が特徴だ。具体的には、エージェント音声中に200ミリ秒の短い沈黙が検出されると割り込みやバックチャネルの判断が行われ、500ミリ秒の沈黙でターン終了と判断される。
ディスフルエンシーの評価には、131件のインタラクティブな会話から抽出した858の応答位置のうち、299の位置を固定評価セットとして使用。モデルは gpt-4o-mini・gpt-5・Gemini 3 Pro Preview の3種類を比較し、プロンプト条件(強度別システムプロンプト、τ-Voice のプロンプトの逐語的複製など)とルールベース注入の4段階設定を比較した。
ルールベースアルゴリズムの仕組み
著者らが提案するルールベースのアルゴリズムはシンプルな設計思想に基づく。ディスフルエンシーは音声合成の直前にテキストを書き換える形で注入される。電話番号やメールアドレスなどの英数字トークンは保護対象として除外され、フィラー(「um」「uh」)と繰り返し・吃音の比率はそれぞれ確率パラメータで制御される。なお乱数シードを発話テキストから生成するため、同じ発話を再合成すれば常に同一の注入結果が再現できる。
割り込みとバックチャネルはそれぞれ傾向パラメータ(0〜1の範囲)で制御され、200ミリ秒の短い沈黙ごとにルールが評価される。割り込みは「エージェントが10秒以上話しているか」「12語以上発話しているか」「質問や依頼でないか」などの条件が満たされたときに発動する。バックチャネルはあらかじめ合成済みの短い音声(「mm-hmm」「yeah」など)をインベントリから即時再生するため、TTSのレイテンシを排除できる。
主な発見:プロンプトの制御性は根本的に不安定
論文が報告する主な知見は以下の通りだ。
- プロンプトによるディスフルエンシー制御は不安定:LLMへの指示で生成されたフィラーは急速に飽和し、要求レートを下回り、発話の冒頭付近に集中する傾向がある。また同一ターン内での自己修正(self-initiated same-turn repair)は生成されなかったとされている。
- 設定値と実現値の乖離が大きい:プロンプトで指示した自然さ行動が実際にどの程度実現されているかを計測すると、指示の意図とは一致しない分布・配置になっていることが確認された。
- ルールベースは単調な制御性と多様性を両立:ルールベースアルゴリズムは傾向パラメータに対して単調な制御性(パラメータを上げると行動頻度が上がる)を示し、自然な発話に近い分散と位置分布を実現したと報告されている。
- モデルレイテンシとAPIコストを排除:ルールベース手法はモデル呼び出しを行わないため、
τ-Voiceが採用する2.0秒ポーリングスケジュールと比較してオーバーヘッドを大幅に削減できるとされている。
「監査すること」の重要性
著者らが特に強調するのは、シミュレータの設定値ではなく実現値を測定・報告する文化の確立だ。設定だけを公開して実現値を検証しなければ、評価ハーネス同士の比較も、改善の方向性も見えにくくなる。この「監査と報告」こそが、プロンプト手法とルールベース手法の差を可視化する唯一の方法だと論文は主張する。
一方で著者らは、制御性と現実らしさ(リアリズム)は同一でないとも述べている。制御性が高ければ行動の多様性が確保され、それがリアリズムと頑健な評価の前提条件になる、という論理だ。
また SpokenUS のような専用音声シミュレータはモデルの重みが非公開のため現時点では再現・比較が困難であり、そうした専用モデルとの比較は将来の課題として位置づけられている。
まとめ
Dialpadの研究は、音声エージェント評価の信頼性に根本的な疑問を投げかけるものだ。LLMは汎用的な能力を持つが、ユーザーシミュレーション専用に学習されていない限り、自然な発話行動を指示通りに再現することは難しいと著者らは結論づけている。言語学的知見に基づく決定論的アプローチ、あるいは専用に学習されたモデルが、そのギャップを埋めるために必要だという主張は、音声AIの評価インフラを整備しようとする開発者にとって重要な示唆を含んでいる。
出典: Prompts versus Rules: Auditing and Controlling Speech Naturalness Behaviors in Voice User Simulators