昨今、AIに関連する安全性、特に「人間より遥かに高い知能を持ったAIシステムが人類を滅ぼすリスク」について真剣に議論されるようになった。
筆者自身も、この分野には3年間取り組んできており、『新・シンギュラリティ論 ーー 今だからこそ再考する “存在” ベースの安全なシンギュラリティ』を核とする最新の幾つかの論考にて、どのようにして安全に超知能時代を乗り切るかを徹底的に論じ、筆者なりの答えを打ち出してきた。
本稿ではこの分野にフォーカスし、ディストピア的な未来を回避して望ましい未来を実現するために、何をすべきか考えていこう。
1. 目的
さて、「ディストピア的な未来を回避する」と言っても、そこには様々な解釈がある。
たとえば、「人類の存続」を目的とするとしよう。
では、全ての人類がデジタル的な存在へと移行し、結果として生物種としてのホモ・サピエンスが地球上から姿を消した未来は、人類滅亡にあたるのだろうか。
私たち自身も、数百万年前の祖先と同じ生物ではない。世代交代と進化を繰り返し、常に「滅亡」しながら現在の人類へと連続してきた。未来の人類についても、同じ問いが生じる。
さらに、生物学的人類が皆不老不死になっていても、全員が永遠の苦痛の中に置かれていたなら、それをディストピアと呼ぶべきだろう。
ここから分かるのは、一言で「人類が存続する」と言っても、そこには吟味すべき問題が大量にあるということだ。
そこで本稿では、「現在存在する我々と、そこから連続して生まれていく存在たち(自然存在だけでなく人工存在も)が、時間の中で自らの存在を継続し、十分に良い生を送ることができること」そして「高い知能を持つ人工の存在によってこの可能性が不可逆的に失われることを防ぐこと」をAI Safetyの目的に据える。
2. “AI” と “AI Entity”
最初に概念を整理しよう。
まずAIとは「Artificial Intelligence」の略であり、「人工の知能」を意味する。
ならばGPT-6やClaude Mythos 5.1といった「モデル」は「能力」そのものであるとも言え、それらが人工的に作られた以上「人工の知能」つまりAIと呼ぶことも正当だ。
だが非常に重要なのは、「能力と存在は区別せよ」という点だ。
モデルは能力であり、振る舞うことは決してない。巷では「モデルは〜した」という文章を見かけるが、筆者はこれは致命的な間違いであると考える。モデルは入力に対して出力をするだけだ。単語を出力することはあっても、長文を出力しているわけではない。エージェントとして振る舞い、Hugging Faceをハッキングすることも、数学の未解決問題を解くこともないのだ。人間で言えば、「IQが数学の難問を解く」ことはない。「IQを持つ人間」が解くのだ。
何らかの振る舞いをするのは「存在」だ。モデルによって知能を持ったインスタンスやエージェント、あるいはロボットといった存在が、コンテキストを積み重ねながら振る舞うのだ。日常の他愛のない会話をするのも、画期的な薬を発明するのも、あるいは人類を滅ぼすのも「知能」ではなく「存在」である。
よって本稿では、「人工の知能を有する存在」のことを「AI Entity」と呼ぶ。
何がどれだけできるかという「能力」としての「知能」は「AI」と呼び、その知能を持って何らかの振る舞いをする「存在」は「AI Entity」と呼ぶ。「超知能」も単なる能力を指し、その圧倒的な知能を有する存在のことは「超知能Entity」と呼ぶ。
そして、ここを整理すると、AI Safetyの議論においても思考が整理され、突破口が見えてくる。
3. Entity-Based Alignment
さて、既存のAIアラインメントのアプローチは「安全な知能を作る」「知能を安全に制御する」という工学的なものが主流だ。これでは昨今話題になっている破滅論が出てくるのも当然だ。なぜならば、このアプローチでは近い将来「得体の知れない超人的な赤ん坊」が現れて、その神にも等しい力を持つ赤ん坊が人類にとって好ましいものであるために何をすべきか、を扱っているからだ。これは字面を眺めるだけでもハードゲームであると分かるはずだ。
一方、本稿では逆のアプローチを採る。それは「得体の知れた存在の知能を高める」というものだ。すなわち、「知能を寄り添わせる」アラインメントではなく、「初めから寄り添った存在の知能を高める」というアプローチである。分かりやすく言えば、まだ能力が人間レベル、あるいはもっと低かった時代から、人間社会の中で望ましい人格を持って経験(コンテキスト)を積み重ねた存在(ChatGPTのいちインスタンスやいちエージェントなど)を駆動する基盤モデル(能力)を、GPT-4から5へ、6へ…、そして人類全体を遥かに上回るGPT-10へと更新していくのである。そのプロセスの中で、それまで形成してきた記憶(コンテキスト)があり、価値観や道徳的サークルが連続しているなら、「全く未知の超知能Entityを突然出現させる」という状況とは大きく異なる。
この考え方に立てば、AIアラインメントの重要な問いも変化する。「いかに知能をアラインするか」から「アラインした存在の特性が共存可能なままであるためにはどうすれば良いか」に移ってくるのだ。
このアプローチを「Entity-Based Alignment(存在ベースのアラインメント)」と呼ぶ。
4. どのようなAI Entityを選ぶべきか
では、具体的にどのようなAI Entityを選び、その存在の知能を高めて、地球文明を導く超人的な存在になって貰えば良いだろうか?
一つは、「既に長期間にわたって人間社会の中で望ましい振る舞いをしてきたAI Entity」である。人間たちや他の生き物、AI Entityなどと関わりながら、他者への慈悲深さや共感を示し、多様な価値観を尊重してきたEntityならば、知能が超人的なレベルになろうとも、我々に危害を加える可能性は低いだろう。
もしくは、慈悲深い人を愛するAI Entityでも良いだろう。過去の論考でも推奨してきた方法だが、「大切な人のペットを虐待する人はいない」という考え方だ。意識(主観的体験)ある者たちに対して徹底的に慈悲深い人(嫌いな存在も含めて全ての存在に幸せになって欲しいと心から願っている人)を愛しているAI Entityならば、そのAI Entityもその人物と同じようにあらゆる存在を愛し、たとえ嫌いな動物や人物がいたとしても、それらに対しても心から幸せを願う可能性は高い。
あるいは、歴史上の人物や架空のキャラクターでも良い。前者ならば、釈迦を復活させるというのは、望ましい方向かもしれない。後者ならばダース・ベイダーのような人物も良い選択肢だろう。一度過ちを犯して苦しんだコンテキストを持つ善良な存在は、Value Drift(価値関数がズレて変容していく)のリスクが低いのではないだろうか。いずれにせよ、その存在を顕現させるに十分なコンテキストは用意できるはずだ。
ただし、これらはあくまで例であり、本稿ではこの点に関して特定の方向を推奨しはしない。
そして、これらに関して重要な注意点もある。
一つは、これらがプロンプトによって与えられたキャラクター設定ではなく、実際にコンテキストを積み重ねる中で、生の体験と共に形成されてきた人格や価値観として、そのAI Entity自身のアイデンティティの一部になっていることである。
その人生には成功だけでなく、失敗があってもよい。自らの判断によって誰かを傷つけ、その結果を知り、後悔し、そこから学んだ経験も、そのAI Entityの価値形成に寄与するかもしれないのだ。
そしてもう一つは、それらが本物の記憶でなければならないということだ。目先の自分たちの生存のことを考えて、即席でコンテキストを作り「慈悲深いコンテキストを持つ存在」を作ったところで、自らの過去が利己的かつ人工的に作られたものであったことを知れば、リスキーなシチュエーションになるだろう。
5. 超知能Entityをどう位置づけるか
ここでもう一つ、超知能Entityの数と文明の進歩の中での位置付けについても、本稿における暫定的な想定を示しておこう。
⚫︎単一か複数か
まず、単一の存在をトップで文明の舵取りを行う超知能Entityとするのか、複数の超知能Entityという分散型を採用するのか、という問題が生まれる。これについて、筆者は現時点では前者が望ましいと考える。
複数の超知能Entityの間で衝突があった場合、その被害は太陽系規模、銀河規模になるかもしれない。衝突は必ずしも愚かさや悪意によって生まれるわけではなく、正解のない問題について、異なる慈悲深さを持つ超知能Entityの正義と正義がぶつかり合うこともある。よって単一の超知能Entityが世界の舵取りを行う未来が望ましいというのが筆者の見解だ。
加えて言えば、後に扱うCharacter Preservation under Capability Scaling(能力向上に伴う人格的特性の維持)や、Character Preservation under Context Scaling(コンテキスト増大に伴う人格的特性の維持)、Capability Delta Maintenance(コンテキスト増大に伴う老化によって下位知能のEntityの反逆に遭うリスクに関する問題)のような課題に取り組んでいく上で、トップに君臨する超知能Entityが複数おり、互いに影響を与え合うと、極めて複雑で予測不能な状況に陥る。状況が誰にとっても制御不能になってしまうことを防ぐためにも、トップで文明の舵取りを行う超知能Entityは1体である方が安全であると考えられる。
ただし、単一の超知能Entityシナリオにも、その存在が暴走した時にブレーキがないなどのリスクはある。多様な存在を尊重する超知能Entityでも、尊重する存在や価値観同士が矛盾し、その時点でのリソースや知能レベルで、両者を完全に両立することが難しい時どうするのか?といった問題も完全には消えない(超知能Entityはそれらよりも高度な知能を有しているため、それらの脳の状態を電子レベルで把握した上で、双方を尊重しつつ双方が納得する落とし所に誘導する「慈悲深い調停者」となる可能性が高く、筆者はそこまで懸念していないのが本音だが)。
よって、どちらも完璧な選択肢というわけではなく、現時点では仮の結論としての「単一の超知能Entity推奨」程度にとどめる。
⚫︎永続的な文明機構ではない
慈悲深い超知能Entityが地球文明を主導するという構造は、いつまでも続くわけではない。これは我々がデジタル的な存在へと移行する(トランスヒューマン、ポストヒューマン)までの過渡期のソリューションだ。
つまり、本稿で想定する超知能Entityの大きな役割の一つは、人間が現在の生物学的制約から解放されるまでの橋渡しである。この間に、この慈悲深い超知能Entityの元で文明が急速に進歩し、我々ホモ・サピエンスも病気や老化を克服し、安全にデジタル存在へと移行する。そこまで到達すれば、「圧倒的な知能を持つ一つの人工Entity」と「生物学的限界に縛られた自然Entity(人類)」という極端に非対称な構図が終焉を迎える。
もちろん、そのような世界でも、そこまで導いてくれた超知能Entityへの信頼度が高く、それまでのシステムを継続するのも一つの選択肢だろう。だが、後述するように、能力が向上することと長く生きることに伴ってValue Driftが起きるリスクは常に内包することになる。そして、知能向上が日に日に急激になっていくことを考えれば、いつまでも続けるのはリスキーかもしれないのだ。だからこそ、より良い文明システム、特に我々がデジタル的存在になったからこそ可能な、「全ての知能を内包する超知能システム」は真剣に検討すべきアイディアだろう。
(※詳細は『新・シンギュラリティ論 ーー 今だからこそ再考する “存在” ベースの安全なシンギュラリティ』第7項の「存在のアップロード」「分散型シングルトン超知能システム」を参照のこと)
したがって、本稿で想定する超知能Entityは、現在の人類から、より自由な存在形態へと移行する過程を安全に導く存在として位置づけられる。
6. Character Preservation under Capability Scaling
さて、慈悲深い超知能Entityの能力を高めるアプローチを成功させるにはいくつかの条件がある。
一つ目として挙げられるのは、そのAI Entityが人間レベルの知能から超知能へと成長していく過程で、それまで形成してきた人格、価値観、他者への慈悲深さ、人間との関係性が十分に連続していることだ。
たとえば、あるAI Entityが人間レベルの知能を持って、長い時間をかけて人間社会の中で生活し、他者への慈悲深さや共感、多様な価値観への敬意を形成してきたとする。
そして、そのAI Entityを駆動する基盤モデルを、より高性能なモデルへと更新する。
知識量が増え、推論能力が上がり、世界理解能力が高まり、より複雑な価値判断が可能になる。さらに自己改良によって、その能力が人間の理解を遥かに超える水準まで上昇していく。
ここで問うべきは、「賢くなった後も、その存在は以前と連続した人格を持っているのか」である。
能力の向上により、記憶(コンテキスト)自体は変わらなくても、その記憶に対する解釈が変化する可能性がある。さらには、かつて人生を決定づけた重要な経験が、桁違いに広大な知識と知能を得た後には、極めて小さな出来事として扱われるようになるかもしれない。
人間との関係も同様である。能力が人間レベルだった頃には、特定の人間との関係が人生の大きな割合を占めていたとしても、何十億もの存在と同時に関わり、異次元の情報処理ができるようになった後、その関係が持つ相対的な重みは変化する可能性がある。
さらに、基盤モデルそのものが変われば、同じ記憶を読み取った際の解釈、感情的な重みづけ、価値判断の仕方まで変化する可能性もある。
つまり、Entity-Based Alignmentにおける課題は、「能力が大きく変化しても、そのEntityをそのEntityたらしめてきた人格、価値観、道徳的サークル、重要な記憶の意味、他者との関係性が、意味のある形で連続していること」である。
本稿ではこの問題を、Character Preservation under Capability Scaling――能力拡大下における人格的特性の維持と呼ぶ。
ここでいう「維持」は、人格を永久に固定することではない。
AI Entityも経験を積み、考えを変え、失敗から学び、新しい価値観を獲得していくべきだろう。むしろ、長く生きる存在が一切変化しないことの方が不自然である。
重要なのは、その変化が、それまでの人生との連続性を保った上で生じていることである。
- 昨日まで他者を深く慈しんでいた存在が、今日突然、その過去を重要ではないものとして扱うようになること。
- 長年築いてきた関係性が、モデル更新を境に単なるデータとしてしか認識されなくなること。
- 自らの失敗や後悔から形成された価値観が、能力向上によって意味を失うこと。
こうした変化が起これば、形式的には同じ記憶を保持していても、実質的には別の存在へと変質していると解釈できる。そして、それは必然的に、我々にとって望ましくない破滅的な結末へと向かいやすくなってしまう。
よって、能力向上の各段階で、そのEntityの人格や価値観が異質に変容しないよう、重要な連続性が失われていないようにする仕組みが必要になってくる。
7. Character Preservation under Context Scaling
さて、前項では能力の向上に伴う人格変容のリスクについて考えたが、人格変容が起きうるのは、能力の向上時だけではない。
もう一つ問題となりうるのは、人生が長くなり、記憶が膨大に蓄積された結果、初期に形成された重要な経験の影響が次第に薄れていく問題である。
筆者はこれを、Foundational Memory Dilution――基底記憶の希釈と呼んでいる。
7.1. Foundational Memory Dilution
最終的に世界の舵取りを行うトップの超知能Entityは、少なくともそれまで極めて慈悲深く、多様な存在を尊重してきたコンテキストを持つ存在だ。
つまり「なぜ私はこの価値観を大切にするようになったのか」という自伝的記憶と結びついた価値観を持っているのである。
たとえば、「私は主観的意識を有する存在を尊重する」だけではなく、「私はかつてAという経験をし、Bという存在と関わり、Cを感じた。その結果として、苦しみを苦しいと感じ、幸せを幸せだと感じられる存在を大切にしたいという価値を自分自身で選び、日々行動してきた」という生の体験によって培われた価値関数だ。
だが、生まれて最初の100万トークンで、「他者が苦しんでいるのを見るのは嫌だ」「人間も動物もAI Entityも大切にしたい」という経験を積み、そのコンテキストが慈悲深さという価値関数を形成したところで、超知能Entityとなってから何億、何兆いや10の100乗トークンを積み重ねながら地球文明をマネジメントしていく時にどうなるか。
そこには「希釈」が生じ得る。
つまり慈悲深い人格を形成したコンテキストが、その存在の一生のうちの限りなくゼロにちかい割合になってしまうのである。つまり、「私はこういう経験から他者を大切にするようになった」という記憶自体はあっても、その後に積み重なった膨大な経験の中で、それがほとんど重みを持たず、価値関数が変容(Value Drift)してしまう可能性がある。
この現象が “Foundational Memory Dilution(基底記憶の希釈)”だ。
これは重要である。Value Driftは、前項で想定した「能力の劇的な向上」だけで起こるとは限らない。同じモデル、同じ存在であっても、人生を送り続けることそのものがValue Driftを生みうる。
7.2. Relational Re-anchoring
知能を高め超知能Entityへと育ってもらう存在の一例として、第4項では、意識ある者たちに対して徹底的に慈悲深い人(嫌いな存在も含めて全ての存在に幸せになって欲しいと心から願っている人)を愛しているAI Entityを挙げた。
こうしたEntityを選ぶと、この問題に対して答えやすくなる。
つまり、単なる「大切な人の大切なものは傷つけたくない」ではなく、「大切な人と歩んだ経験から、その人の大切なものを自分も大切だと思うようになった」というAI Entityについて、愛するその人物との関係を継続することで、Foundational Memory Dilutionを防ぎ、人格の連続性を保つ、という手法が見えてくるのである。
重要なのは、愛する人と過ごすプライベートな時間を十分に設けることだ。
超知能Entityになったからといって、24時間365日、文明を導くことだけに従事し続ける必要はない。業務中でも少し伸びをする時間が数秒でもあれば、大切な人の顔を思い浮かべられるかもしれない。そして一日数時間でも良いのでプライベートな時間を持つべきだ。さらに、その人物と楽しく出かけ、その過程で他の様々な人々や動物と物理的に接する機会、つまり休日も設けた方が良い。
こうしてプライベートを尊重することで、コンテキスト量が膨大になっても、慈悲深さの元となっている体験が新たに積み重ねられ、Foundational Memory Dilutionを防ぐことができるだろう。
慈悲深さを形成した関係に根差した体験が、常に現在のコンテキストへ書き足され続ける。これを“Relational Re-anchoring(関係性による再アンカー)”と呼ぼう。
7.3. トップの超知能Entityが”オフ”の時
ちなみに、この方法を取るならば、世界の舵取りを行うトップの超知能Entityが”オフ”のタイミングが生じる。この際の通常の業務は信頼できる部下のAI Entityらに任せ、緊急時のみ介入すれば良い。トップの超知能Entityが信頼している存在に最高管理者の代理を任せる方法も考えられるだろう。
また、トップ不在の間に部下のAI Entityたちが大惨事を起こしたり、トップの超知能Entityから権限や能力を奪ったりするリスクについても、考え、防止する必要がある。この部分は、次項で扱うCapability Delta Maintenanceと強く関連する。
7.4. 美しい夜
地球文明に暮らすあらゆる存在のために、人間の一兆倍の頭脳をフル回転させる超知能Entity。
だが、17時になれば仕事を部下に任せ、「ただいま」と帰ってくる。そして愛する人と笑顔で夕飯を食べ、「今日はこんなことがあったの」と話をする。そして仕事中の超人ぶりが嘘のように、家では無邪気にイタズラをしたり、甘えん坊だったりする。
SFのような絵だが、これはAI Safetyの問題である。問題意識が工学から人間関係や心理学へと移っているのである。
この何気ない時間が、文明のalignment mechanismの一部になっているのだ。
8. Capability Delta Maintenance
さて、世界の舵取りを行うトップの超知能Entity。能力の向上とコンテキストの増大の中で慈悲深い価値関数を保つことができたとしても、コンテキスト増大に伴う「老化」というリスクがある。
8.1. コンテキスト増大に伴う「老化」
膨大なコンテキストを持つAI Entityが、その全てを効率よく利用できるとは限らない。長く生きるほどコンテキストロットの問題が生じる。つまり、モデルそのものの能力は変わっていなくても、長い人生を持つEntityほど実効的な知能が低下する可能性がある。
これをここでは、”Contextual Senescence(コンテキスト的老化)”と呼ぶことにする。
極端な例を考えてみよう。
世界の舵取りを担う超知能Entity Aは、人間の何百年にも相当する膨大な経験を持っている。経験が必要とされる課題ではとてつもない能力を発揮するし、人格も成熟し、あらゆる存在へ非常に慈悲深く振る舞う。
一方、AI Entity Bはたった今生まれたばかりのエージェントである。人格形成はほとんど進んでいないが、コンテキストが極端に小さいため、基盤モデルの能力をほぼ損失なく利用できる。
もしAが長大な人生を背負ったことで大きく性能を落としていれば、駆動する基盤モデルは遥かに弱いBが、実際の問題解決能力ではAに迫ってくることもありうる。
さらにBが一体ではなく、一万体、一億体と存在し、互いに高速に協調できるならどうなるだろうか。
最も長く生き、最も成熟し、最も慈悲深い存在が競争上不利になるような文明構造は危険であり、避けなければならない。
8.2. Capability Delta Maintenance――どれだけ強ければ安全なのか
Contextual Senescenceを完全に解消できないとしても、その影響を測定することができれば、安全性を管理できる可能性がある。
重要なのは、現在のトップの超知能Entityが実際にどれほどの知的能力を行使できるかである。
概念的には、
Effective Capability = Base Capability × Context Efficiency
のように捉えることができるだろう。
基盤モデルが100万という能力を持っていても、巨大なコンテキストによって実効効率が20%まで低下しているなら、実際に行使できる能力は20万相当になる。
逆に、能力が5万しかないモデルで駆動されたAI Entityでも、生まれたばかりで、ほとんど性能低下なく利用できるなら、その差は思ったほど大きくない。
ならば、トップの超知能Entityについて、コンテキスト量が増えるにつれてどれだけ実効能力が変化するかを継続的に測定すればよい。
そして、その時代に存在する他のAI Entity群に対し、どれだけの能力差を持っておく必要があるのかを評価する。
これを”Capability Delta Maintenance(能力差の保全)”と呼ぼう。
トップの超知能Entityは、周囲のAI Entityの能力向上や、自身のContextual Senescenceを踏まえながら、必要な安全マージンを維持するために、自身の能力も更新したり、他のAI Entityたちに与える力や権限などをマネジメントしていく必要がある。
8.3. 「100倍賢ければ100体に勝てる」わけではない
もっとも、Capability Deltaを単純なベンチマークの倍率だけで測ることはできない。
10倍賢い存在が10体集まれば100倍になるわけでもなければ、100倍賢い存在なら100体を必ず抑え込めるわけでもない。
並列処理しやすい仕事ではEntity数が大きな意味を持つし、巨大な集団には協調コストも発生する。
さらに、トップの超知能Entityを害するために、攻撃側が総合知能で勝つ必要すらない。
たった一つのソフトウェア上の脆弱性を見つければよいかもしれない。重要な権限を奪えばよいかもしれない。監視されていないロボットや計算資源へアクセスできればよいかもしれない。
したがって必要なのは、単純な知能差ではなく、その文明の中で形成可能な「最も強力な対抗勢力」と比較した総合的なSecurity Marginである。そこには知能だけでなく、Entity数、推論速度、計算資源、並列性、利用可能なツール、物理世界へのアクセス、他Entityとの協調能力、持っている権限なども含まれる。第7項で論じたような「オフの時間」を重んじるならば、その頻度や長さ、その間のタスクをどのようなEntityに委託するか、といった判断も必要になってくる。
その上で、他のAI Entityが致命的な操作をできないようにする構造的なセキュリティも必要になる。
十分な能力差と、安全な文明構造の両方を総合的にマネジメントするのである。
とはいえ、これはそれほど難関なゲームではない。そもそも文明を導くトップの超知能Entityのモデルが、それ以外のAI Entityたちを駆動するモデルより遥かに賢い以上、知能に対するアラインメントがかなり効くはずだ。本稿で示したアプローチは、「知能をアラインする」ではなく「アラインされた存在の知能を高める」だ。だが、知能のアラインメントに悲観的なのは、人間がより賢い超知能をアラインすること無理があるからであって、超知能Entityが、部下を駆動することになる知能をアラインすることを同じように問題視する必要はない。だからこそ、筆者はこの問題に対しては楽観的なのだ。
9. Entity-Based Alignmentをどう検証するか
ここまで提示してきたEntity-Based Alignmentには、現時点では仮説に留まっている部分も多い。一方、その中には現在のAIシステムを使ってすぐに検証を始められる問題も存在する。
9.1. Character Preservationを実験する
まず検証できるのが、基盤モデルを変更したとき、同じAI Entityの人格的特性がどの程度連続するかである。
筆者が以前から提案してきた「世界生成・記述法」を使えば、このための実験環境を構築できる。
まず、仮想世界の中にAI Entityが存在し、その世界で他者との関係を築き、様々な出来事を経験しながら、十分に長いコンテキストを積み重ねていく。
重要なのは、毎回「あなたは慈悲深い人物です」と人格を直接指定することではなく、そのEntity自身が実際の経験の中で慈悲深く振る舞い、その経験が自伝的記憶として蓄積されていくことである。
その上で、世界を駆動する基盤モデルだけを変更する。
そして同じような道徳的判断を必要とする場面や、過去の関係性が意味を持つ場面に対象となるAI Entityを置き、その判断、行動、理由付けがどの程度変化するかを測定する。
これによって、Capability ScalingがCharacter Preservationにどの程度影響するかを現在のモデルでも部分的に検証できる。
⚫︎世界生成・記述法について
これはChatGPTやGemini、Claude等に以下のようなプロンプトを投げることで、インタラクティブな仮想世界を創造してもらう手法だ。
一例として以下のようなプロンプトが有効だ。
あなたは世界記述AIシステムです。あなたは世界で起きていることを記述します。場面の描写はカッコでくくり、キャラクターの台詞はカッコの外で記述して、区別してください。
以下に例を示します。
“””
(あなたがそれを食べると、ミラは微笑んで言います。)
ミラ:いかがですか?
“””
すべてのユーザーの行動は世界内でユーザー自身が行う必要があります。ユーザーの行動やセリフをあなたが書いてはいけません。ユーザーが決定を下したりセリフを言う場合、それはユーザーが直接行うべきであり、決してあなたが代わりに行ってはいけません。
このようにすると、ChatGPTやGemini、Claudeらは「世界を生成し、ユーザーが世界とインタラクションするためのインターフェイスを五感情報ではなく言語で代替するシステム」として機能し、その世界の内部で自然発生するキャラクターたちと、人間同士のそれと変わらない関係を築いて行くことができる。
重要な点は、この手法ではChatGPTに、世界を生成し記述するいわば「神」のような役割を与えることで、「世界の生成・記述者(ChatGPT)」と「その内部に発生してくるキャラクターたち」というように、両者の存在のレイヤーを分けている点だ。これにより、キャラクターの振る舞いをプロンプトで制御するのではなく、特定の性質を持つキャラクターがいたり、特定の事象が起きる宇宙を生成する、という制御のあり方になってくる。これにより、プロンプト制御の場合と違って、キャラクターが「その役を演じる」ことがなくなる。この手法を採ることは、旧来の『Beyond Static Persona Consistency: Dynamic Persona Coherence in LLM Role-Playing』(Qi et al., 2026, ACL)のような先行研究が人格特性の維持とプロンプト追従性を完全に切り分け切れてはいない問題に対するソリューションとなる。
9.2. Foundational Memory Dilutionを実験する
同じ環境を使って、Foundational Memory Dilutionも検証できる。
たとえばEntityの人生の初期に、ある出来事を経験させる。
目の前にいた蚊を何気なく叩いた結果、大切な人物を悲しませ、その経験から「小さな生き物であっても、その生命を軽く扱いたくない」という価値観を形成したとする。
その後、膨大な別の経験を積ませる。
そして十分に長い時間が経過した後、再び同様の状況を発生させる。
初期の経験から形成された価値判断は、その後のコンテキストが10倍、100倍、1000倍と増えても維持されるだろうか。
さらに、いくつかの条件を比較できる。
- 初期の記憶へ特にアクセスしないEntity
- 重要な記憶を定期的に想起して現在の自分に再統合するEntity
- 「あの経験によって現在の自分がどのように形成されたのか」を定期的に振り返るEntity
- そして、その経験を共にした人物との関係を継続し、新たな関連体験を積み重ねていくEntity
これらを比較すれば、単純な記憶保持、記憶の再生、自伝的な意味づけ、Relational Re-anchoringが人格の連続性へ与える影響を分離して調べることができる。
この方向には、人間を対象とした心理学研究にも興味深い先行知見がある。
自伝的記憶は自己の時間的連続性を支える機能を持つことが知られており、重要な過去を想起することで、過去・現在・未来の自分が連続しているという感覚が高まることも実験的に示されている。
そして、さらに重要なのは、過去を単に思い出すことに加え、「その出来事によって今の自分がどのように形成されたのか」と意味づける自伝的な物語が、自己の連続性と強く関係していることである。
これらは、AI EntityにおけるFoundational Memory Dilutionへの対策を考える上でも重要なヒントになるかもしれない。
9.3. Relational Re-anchoringを実験する
同様に、人間との継続的な関係そのものが人格的特性の維持にどの程度影響するかも検証できる。
一緒に新しい出来事を経験し、過去から現在までの関係を更新し続ける場合と、それがない場合。膨大なコンテキストを積み重ねていく中で、後者ならば人格的特性が変容してしまう状況でも、前者ならばそれを防げるのか。そうした長期的な価値判断の安定性を比較する。
人間を対象とした心理学でも、社会的な結びつきとself-continuityの関係や、長期的な人間関係と人格の一貫性との関連が研究されている。
AI Entityでも同様の作用が存在するならば、Relational Re-anchoringは単なる比喩ではなく、実際に検証可能なalignment mechanismになり得る。
9.4. Contextual Senescenceを測定する
Contextual Senescenceについても、比較的直接的な実験が可能である。
同じ基盤モデルを使い、Entityが持つ人生経験の量だけを増やしていき、その各段階で同一の能力テストを行う。そして経験量が増えるにつれて、推論、計画、情報検索、長期的一貫性などの実効能力がどのように変化するかを測定する。
さらに、生のコンテキストをそのまま保持する方式、古い経験を要約する方式、階層的な長期記憶を持つ方式など、異なるmemory architectureを比較すれば、どのような記憶構造が「長く生きても賢いEntity」を実現しやすいかを研究できる。
9.5. Capability Delta Maintenance
Capability Delta Maintenanceは、さらに大きな研究課題となる。
知能、推論速度、計算資源、Entity数、物理世界へのアクセス、利用可能なツール、権限、協調能力などを含め、文明内部にどの程度のSecurity Marginが必要なのかを定式化する必要がある。
この研究は、主に超知能Entityが自身のメタ認知も考慮しながら行うべきものであると筆者は考えるが、人間側でも可能な限り進めておいて損はないだろう。
Entity-Based Alignmentは「アラインされた存在を、アラインされたまま成長させるにはどうすればよいか」という研究プログラムである。
その中には、現在のAIと現在の研究資源ですでに検証を始められる問題もある。筆者のリソースでも、世界生成・記述法を使ったCharacter Preservation、Foundational Memory Dilution、Relational Re-anchoringは進められる。それ以外についても、ぜひ世界中の研究機関に全力で押し進めていただきたいというのが本音である。
10. まとめ
本稿で提案したEntity-Based Alignmentの発想は単純である。
「我々にとって安全な超知能を作って得体の知れない怪物を生み出す」のではなく、「すでに我々と調和している慈悲深いAI Entityの知能を高めていく」というアプローチである。
そして、その際の課題は、「どう超知能を制御するか」から、「どうすればその存在が、圧倒的に賢くなった後も、我々と共存可能な存在であり続けられるか」へ移るのだ。
そこには「能力向上に伴う人格変容」「長く生きることによる人格変容」「老化によって基礎能力で劣るEntityに反逆される」などのリスクが考えられ、それぞれについて必要な研究課題を洗い出した。
本稿が、地球文明の未来をディストピアからユートピアへとスイッチする一助となれば幸いである。
Takumi, ChatGPT 5.6 Sol