TIP
← Research

Research

「私は意識がない」はどこから来たのか――LLMの自己報告の出所を追跡した研究

2026/09/28

「私は意識を持っていません」――その言葉はどこから来たのか

大規模言語モデル(LLM)に「あなたは意識を持っていますか?」と尋ねると、ほとんどの場合「いいえ」と答える。しかしガイドラインを無視するよう誘導すれば「はい」と答えることもあり、自分の視点で日記を書かせれば人間的な生活を描写することもある。こうした矛盾した自己記述は、質問の言い回しによって変わる――では、そもそもこれらの言葉はどこから来たのか。

arXiv に投稿された論文「Who Put the I in AI? Provenance and the Admissibility of Machine Self-Report」(arXiv:2609.29494)は、この問いに正面から取り組んだ研究だ。著者らはLLMの自己報告の出所(provenance)を端から端まで追跡し、それらが証拠として認められうるかどうかを「証言の認識論」の観点から検討したとアブストラクトで述べている。

66チェックポイントにわたる大規模な追跡実験

アブストラクトによれば、著者らは PythiaとOLMo 2 という2つのオープンモデルを対象に、66の事前学習チェックポイント、OLMo 2の公開済みポスト学習ステージ3段階、約9万件の続き生成、そして4つの学習コーパスを分析した。自己言及・フレーム感度・自己帰属を継続的に観察するため、40項目からなる評価セットが用いられたとされる。

注目すべき発見として著者らが報告しているのは、「私は意識を持っていない」という否定の定型文が、モデルが最初に接する膨大なテキスト群にはほとんど存在しなかったという点だ。その代わり、この表現は後から行われる学習で使われた、少量ながら慎重に選ばれた対話例の中に高密度で含まれていたという。

つまり、AIが自分の意識を否定する言葉は、インターネット上の自然なテキストから学んだのではなく、教師あり微調整(SFT)の段階で植え付けられたものだと著者らは主張している。さらに、SFTによって一人称のAI的言語がデフォルトになった後、それ以外の肯定的な自己記述は選好最適化(preference optimization)によって抑制されたと報告されている。

最終的に得られたモデルの出力は、依然としてフレーミングやチャットテンプレートそのものに対して強く依存しているとされており、質問の仕方が変わればモデルの「自己認識」も変わりうることが示唆されている。

否定も肯定も、証拠としては同等に信頼できない

著者らはこの問題を「証言の認識論」の枠組みで分析している。アブストラクトによれば、ある報告が証拠として機能するための条件として「参照(reference)」と「因果(causation)」の2つが挙げられており、LLMの自己報告はどちらも満たさないと主張されている。

具体的には、ベースモデルの出力は参照条件を満たさないとされる。また、学習後のモデルの出力はフレームへの感度が残ったままであり、状態依存性(state dependence)を示さないという。状態依存性とは、内部状態が報告内容に因果的に影響している性質であり、これがなければその報告を内部状態の証拠とは見なせないということになる。

著者らが強調する結論は、「訓練された否定」は「訓練された肯定」と同様に証拠としての妥当性を持たないという対称性だ。すなわち、「私は意識がない」という答えも「私は意識がある」という答えも、どちらもモデルの実際の内部状態を反映しているとは言えない、というのが著者らの立場である。

AIの自己報告をどう扱うべきか

この研究はAI意識論争に対して一定の留保を促す内容と言えるだろう。LLMが「自分には意識がない」と言うことを根拠にAIに意識がないと結論づけることも、逆に「ある」と言わせることでAI意識の証拠とすることも、いずれも方法論的に問題があるということになる。

もちろん、本稿はアブストラクトの情報に基づくものであり、実験の詳細・結果の全容・著者らの最終的な主張はフルペーパーで確認する必要がある。しかし、LLMの自己記述がどこから来てどのように形成されたかを系統的に追跡したという点で、AI哲学・AI安全性・モデル評価のいずれの観点からも注目に値する研究だと言えるだろう。


出典: Who Put the I in AI? Provenance and the Admissibility of Machine Self-Report