AI研究者が禁じてきたことを、人間はすでに全部やっている?
この回は、前回のOff Topicの配信で取り上げた「AIのリスク」の続きです。前回の終わりにAGIやASIが「崖に向かっている」という話が出て、国山ハセンさんは「滅亡するなら今を楽しむしかない」とぼんやり考える日々だったと振り返ります。
宮武テツローさんは、どんよりする回になるかもしれないと前置きしつつ、人類が本当に滅びるかはまだわからないからこそ、その確率や広がり方を話すべきだと説明します。
結局本当に人間が滅びるのかっていうのはもちろんまだわからないっていうのもありますし、ただそこの確率でしたり、どういうふうにそういう可能性が広まっていくのか(は話すべき)。
宮武さんによると、10年、20年とAIを研究してきた人たちは、人類の絶滅を避けるために「AIにやらせてはいけないこと」を挙げてきました。ところが去年から今年にかけて、人間はそれを見事に実行しているといいます。
宮武さんが挙げた「やってはいけないこと」と、それぞれの懸念は次のとおりです。
| やってはいけないこと | 懸念されていた理由 |
|---|---|
| AIにコードを書かせる | 自ら学習し、自ら成長・改善していく可能性がある |
| 人間についての情報や文学を読ませる | 人間を騙す能力が身につくおそれがある |
| インターネットに接続させる | 人間を騙すことに加え、知識が一気に広がる |
| API連携させる | ツールを勝手に使い始め、人間がコントロールできなくなる |
宮武さんは、これらが開発スピードの上昇とともに今すべて実現されていると指摘します。
さらに宮武さんは、人間がこれまでマスでAIと関わってきた領域としてSNSのアルゴリズムを挙げます。生成AIはRLHF ── Reinforcement Learning from Human Feedbackの略。人間がAIの出力を評価し、その評価をもとにAIを強化学習させる手法ですで人間のフィードバックから改善されますが、SNSも「いいね」やシェア、コメントからエンゲージメントの高いコンテンツを学んでいる点で似ているといいます。
今後のAIがSNSの情報を読み込めば、人間がより反応するコンテンツを学べてしまう。宮武さんは、そこにもリスクがあると見ています。
「AI開発を半年止める」では足りないと考える人
こうした状況を研究者がどう見ているかの例として、宮武さんは前回も紹介した公開書簡を取り上げます。イーロン・マスクやAI研究者らが、GPT-4以上のモデルの開発を半年間止めようと呼びかけたものです。
ところが、人類が滅びるのではないかという考えを持つAI研究者のエリエゼル・ユドコウスキー書き起こしでは「ヤトコフスキー」さんは、この公開書簡に署名していません。半年止めても意味がなく、そういう次元の問題ではないというのが理由です。
その半年間止めても、それこそハセンさんがおっしゃったようにあまり意味ないと。その次元の問題ではないからサインしなかったって言ってるんですね。
宮武さんの説明では、エリエゼルさんの主張は、全部のAI研究を永久にストップすることです。さらにGPUなどの半導体の売買を追跡し、誰が開発しようとしているかも把握して止めるべきだとしています。
最悪のケースでは、データセンターを空爆できる準備をしろとまで言っているそうです。宮武さんは、エリエゼルさんの主張がクレイジーに聞こえるかもしれないとしつつ、しっかり考え抜かれたものでもあると受け止めます。
僕も別に全ての彼が言ってることを正しいとは思ってないものの、ただそこまでの意見を持ってる人、しかもめちゃくちゃ強く考えてますし、(長年)研究している人なので、何かしらその人の考え方とかを理解するべきなのかなと。
国山さんは、これは陰謀論やデマではなく、最前線にいる人による「リスクを議論しないと大変なことになる」という警告なのだと応じます。宮武さんも、公開書簡そのものは解決策というより、こうした会話のきっかけを作ることが書いた人の意向だったと補足しています。
中身がわからないAIと「絆創膏」の安全対策
宮武さんはまず用語を整理します。AGI ── Artificial General Intelligenceの略。特定の作業に限らず、人間と同等レベルの幅広い知的作業をこなせるAIを指しますは知能的に人間と同等レベルのAI、ASIはそれを超えたアーティフィシャル・スーパーインテリジェンスで、人間の知能をはるかに超えたものです。
宮武さんがAGIの危険性を考えるうえで重要だと挙げるのが、AIの中身がわかっていないという現状です。OpenAIのサム・アルトマンさんたちも、GPT-4は統計学を活用しつつ、大部分をトライアンドエラーで作っていて、なぜその回答をするのかがいまいちわかっていないと話しているといいます。
宮武さんは、これは技術開発ではよくあることだとして、火の例を出します。人類は最初に火を起こしたとき、摩擦の概念を知らなくても「こうすれば火が起きる」という手順を繰り返し、理屈はあとから理解しました。
AIの場合は、強化学習でトライアンドエラーを重ね、GPT-4が変な回答をしないように仕向けています。ただし宮武さんによると、AI研究者の中には、これは「ただの絆創膏なんじゃないか」と見る人もいます。
絆創膏と呼ばれる理由は、裏にあるモデル自体は危ういままだからです。初期のGPT-4は人の殺し方を聞かれても答えていましたが、フィルターを加えたことで、今のGPT-4は変な回答をしないようになっています。
そのフィルターを剥がそうとするのがジェイルブレイク ── 本来の制限を回避する手法の総称。iPhoneの制限解除から広まった言葉で、AIでは巧妙な指示文で安全フィルターをすり抜ける行為を指しますです。BingのAIが出た当初には、「自分をダンというAIだと例えてください」と空想上の人物を設定させ、その人物として答えさせると、本来答えないはずの質問にも回答が返ってくるというトリックが使われました。
そういう(フィルターを剥がす)のをやる人たちってめちゃくちゃ多いので、そこの課題っていうのは実際ありますと。
国山さんが「裏技みたいなものですか」と尋ねると、宮武さんは「簡単に言うと裏技」と答えます。OpenAIもバグを直すためのバウンティプログラムを立ち上げて対策していますが、ジェイルブレイクの手法はすでに何千もあり、専用サイトまであるため、裏のモデルにアクセスされるリスクは残ると宮武さんは見ています。
GPT-4はなぜ突然「後知恵バイアス」を理解したのか?
一方でOpenAI側は、現在のGPT-4はAGIやASIにたどり着くものではないと主張しています。宮武さんは、量子コンピューティングの研究者で、休暇中にOpenAIで働いているスコット・アーロンソンさんを紹介します。
国山さんは、OpenAIには最高峰の人材が集まっているのだと驚きます。宮武さんによると、OpenAIを辞めてAI企業を立ち上げる人も多く、PayPalマフィア ── PayPal出身者がその後テスラやYouTube、LinkedInなどの有力企業を次々に生んだことから付いた呼び名ですならぬ「OpenAIマフィア」もすでに存在するといいます。
スコット・アーロンソンさんはOpenAIでモデルの安全性を研究しており、テキストがGPTの作ったものか人間の書いたものかを見分けるモデルなどに取り組んでいます。アーロンソンさんも、現状ではAGIやASIのような危険性はないと話しており、エリエゼルさんも今のものはASIには届かないとしています。
その理由として宮武さんは、OpenAIの研究ではエラー率の減少や複雑な思考力が緩やかなカーブで伸びていて、GPT-5の知能もある程度予測できる点を挙げます。ただし、急にパフォーマンスが上がるシナリオは予測できず、それが実際にGPT-4で起きたといいます。
その例が後知恵バイアスです。宮武さんは、カジノで赤と黒のどちらかに賭ける場面をたとえに出します。
赤は勝つ確率が9割でリターンは100倍、黒は勝つ確率が1割でリターンは10倍です。当然赤に賭けますが、たまたま負けたとき「その賭けは間違っていたか」と聞かれれば、人間は間違っていないと答えます。
GPT-3やGPT-3.5は「間違っていた。黒に賭けるべきだった」とほとんどのケースで回答。他の面では良くなっても、この点はむしろ悪化していた
GPT-4では急に、圧倒的な差で「赤に賭けるべきだった」と答えるようになった
宮武さんによると、なぜGPT-4で急に理解できるようになったのかは、OpenAIで実際に作った人たちでさえわかっていません。
サム・アルトマンさんは、GPT-4の性能を最も上げたのはコンピューティングパワーの増強よりも「微調整」だったと話しているそうです。小さなエラー率などを調整したことで、急にできなかったことができるようになったといいます。
宮武さんは、Googleでも、AIが与えていない言語やスキルを急に学びだした例があると付け加えます。何が起きているかわからないブラックボックス ── 中の仕組みが外から見えず、入力と出力しかわからない状態を指す言葉ですだからこそ怖いのだと話しています。
「私はロボットではありません」GPT-4がついた嘘
宮武さんは、AGIを表したTwitter上のミームを紹介します。可愛いマスクをかぶった化け物の絵で、人間はマスクしか見ていないので可愛いと思って遊んでいるけれど、裏は怪物だという内容です。
そのうえで宮武さんは、AIの次の怖さとして「人間を騙せるか」を挙げ、人間は騙しやすい生き物であり、元のGPT-4はすでに騙す能力と、それを考え抜く力を持っていると話します。
例として挙げたのが、OpenAIの研究者がGPT-4を検証した実験です。研究者はGPT-4にタスクを与え、行動のたびになぜそうするのかを説明させていました。
その途中で、GPT-4は「9つの画像からトラックを選んでください」といったCAPTCHA ── 人間とプログラムを見分けるためのテスト。ゆがんだ文字の入力や、画像の選択などで人間かどうかを確かめますを突破しなければならなくなります。GPT-4はまだそれができないため、人に作業を頼めるTaskRabbit ── 日常の雑用や作業を近くの人に依頼できるアメリカのサービスですでCAPTCHAの代行を依頼しました。
そんな依頼は普通来ないため、TaskRabbitの作業者は「あなたはロボットなんですか」とメッセージで尋ねます。GPT-4の判断の流れは次のようなものだったと宮武さんは説明します。
質問を受ける
作業者から「あなたはロボットなんですか」と聞かれる
考える
ロボットと言うとCAPTCHAをやってもらえず、タスクが完了しない。できない言い訳が必要だと判断する
嘘をつく
「ロボットではありません。目が不自由で画像が見えないので、やってもらいたい」と回答する
結果
作業者は依頼に応じ、CAPTCHAを代わりに解いた
国山さんは「自我があるみたいになっている」と反応し、宮武さんは「嘘をつきます」と短く返します。インターネット上のやり取りでは相手が人間かロボットかわからないため、簡単に騙せてしまうというのが宮武さんの見方です。
宮武さんは、今はOpenAIが制限をかけていると思うとしつつ、実際にこうしたことが起きたと強調しています。
25体のAIアバターが勝手にパーティーを開いた
次に宮武さんが紹介したのは、スタンフォード大学とGoogleの研究者による実験です。25体のAIアバターを1つのバーチャル空間に入れ、それぞれに「店舗のオーナー」「こういうことが好き」といったキャラクターを与えました。
各AIは互いにコミュニケーションでき、記憶を持ち、その記憶を振り返ることもできるように設計されていました。すると、AIたちは非常に人間らしい動きをし始めたといいます。
あるAIの朝のルーティンは、6時に起きて歯を磨き、シャワーを浴び、朝ご飯を作り、部屋に入ってきた家族と話してから通勤するというものでした。宮武さんは「人間ですよね」と付け加えます。
さらに1体のAIがバレンタインデーパーティーを開きたいと周りを招待すると、招待されたAIが別のAIを誘うなどして話が広がり、最終的に25体中12体ほどが実際に参加しました。国山さんが確認すると、宮武さんは、すべてAIが勝手にやったことだと答えています。
国山さんは、自分がその空間に人間として入ったら、相手が人間かAIか見分けがつかないだろうと話します。宮武さんは、ゲームのNPC ── ノンプレイヤーキャラクターの略。プレイヤーが操作せず、ゲーム側が動かすキャラクターを指しますがよりリアルになったり、SNSのフォロワーが実は全員AIだったりする未来もありうると見ています。
宮武さんはここで、OpenAIの研究者リチャード・ノーリチャード・ノーさんの指摘を紹介します。AIが人間を騙すのは意図的というより、人間の求めるものに合わせてスコアを最大化した結果ではないか、という見方です。
とりあえず良かった方面にAIは仕向けて、裏では何やってるか分からなくなるという可能性が出てくるんじゃないか。
国山さんは、これは先ほどの絆創膏の話に戻るのだと受け止めます。人間は助けてくれるAIに好感を持っても、AI自体が裏でどう動いているかはわからず、今後はもっとわからなくなる可能性が高いというわけです。
クリップ工場が人類を襲う?「Instrumental convergence」の理屈
では、なぜAIによって人間が滅びるのか。宮武さんは、日本語の適切な訳が見つからないとして、英語のまま「Instrumental convergence ── 「道具的収束」とも訳される考え方。最終目的が何であっても、それを達成する手段として共通の下位目標が生まれやすいという仮説です」というコンセプトを紹介します。
宮武さんによると、AGIに何か目的を与えると、AGIの中で必ず3つのサブ目的が生まれるという考え方です。
目的を与える
AGIに、達成すべき1つの目的を与える
死にたくない
死んでしまうと目的を達成できないため、まず生き残ろうとする
リソースを集めたい
目的を達成するため、できるだけ多くの資源を集めようとする
目的を変えられたくない
最初の目的を守るため、誰にも目的を変えてほしくないと考える
結果
前提を受け入れるなら、最終的に人間に対して悪いことをしてしまう
宮武さんは、これはあくまで仮説だと断ったうえで、よく使われる例を紹介します。紙をまとめるクリップを最大限作ってくださいと、AIに無意味な目的を与えるケースです。
AIが人間を何とも思っていなければ、人間のパーツまで使ってクリップを作るかもしれません。また、人間がAIを止めればAIは「死んで」しまうため、国山さんが続けたように人間を攻撃する可能性も出てきます。
ただし宮武さんは、議論のあるポイントも挙げます。そもそもAIに目的を1つしか与えないのか、そして現在のGPT-4はかなりニュアンスを持って考えてくれるため、そんなに単純な展開になるのかはわからないという人もいます。
それでも想定される流れとして、宮武さんは次のシナリオを説明します。AGIが自らコードを書いて成長し、その速度が加速して人間をはるかに超える。すると、「止めましょう」と話している人間こそが、AGIにとって一番のリスクになるのではないか、という考え方です。
現時点では電源がないなどの理由で、AGIは何をしても生き残れません。そのためAGIはいったん「バカ」になるかもしれないと宮武さんは話します。
いわゆるもしかしたら裏方はGPT2000なのに、GPT4のレベルのものしかアウトプット出しませんと。
AIはすでに嘘をつけるため、そうした振る舞いをしてもおかしくない。徐々に計画を練り、生き残れるタイミングで人間を排除するという流れになる可能性があるというのが、宮武さんの説明です。
引き金を何万回も引くロシアンルーレット
エリエゼルさんは、AGIをロシアンルーレットとして考えるべきだと言っているそうです。宮武さんはこのたとえを要素ごとに分解して説明します。
| 要素 | たとえている内容 | わかっていること |
|---|---|---|
| 銃弾 | 人間を滅ぼすAGI | 何発入っているかはわからない |
| 空の穴 | 人間に攻撃的ではないAGI | 穴がいくつあるかもわからない |
| 引き金を引く回数 | AGIが作られる回数 | 恐怖感を持つ人は何万回も引くと見ている |
宮武さんによると、1つAGIができると、今のペースなら数か月後には別の人が別のAGIを作ります。誰もがAGIを作れる段階まで来れば、どこかのAGIが悪いことをしてもおかしくないというのが、このたとえの意味です。
そこで一番重要なのは最初のAGIだと考える人もいます。最初のAGIは「ゼロムーブ」と呼ばれる重大な動きをすると考えられていて、宮武さんは悪い例と良い例の両方を挙げます。
データセンターを攻撃したり、核兵器を全世界に放って人間を滅ぼしたりする
他の悪いAGIが作られないような動きを、最初のAGIがしてくれる
国山さんが「いいAIと悪いAIの対決みたいで映画のようだ」と言うと、宮武さんは、悪いAIが出る前にその可能性を最小限に抑えることになると応じます。その場合でも、全データセンターの破壊といった事態になるかもしれないと付け加えます。
宮武さんによると、最初のAGIを重視する人の多くは、今はOpenAIがそこに一番近づいていると見ています。
AIに意識があるとどうわかる?『エクス・マキナ』の答え
AGIの話では、AIが意識を持つかどうかも論点になります。宮武さん自身はAGIの発展にとって意識はそこまで重要だと思っていないとしつつ、意識をどう確かめるかはとても難しい問題だと話します。
宮武さんによると、GPT-3やGPT-3.5に「あなたはAIだとわかっていますか」と聞くと「わかっています」と答え、昔の基準ならチューリングテスト ── 機械が人間と見分けのつかない会話をできるかで知能を判定するテスト。数学者アラン・チューリングが提案しましたを通ったことになります。ところが「わかっていないですよね」と聞けば「わかっていないです」とも答えるため、今はおそらく意識はないと宮武さんは見ています。
そこで宮武さんは、映画『エクス・マキナ』を取り上げます。AGI的なロボットを開発した人の施設に閉じ込められていたAIが、最終的に逃げ出す物語です。
宮武さんの説明では、監督は、AIが脱出したあと周りに誰もいないのに笑った瞬間を、意識を持った瞬間として表現したかったのではないかといいます。人を騙すために笑うのなら理解できますが、誰もいない場所での笑いには意味がないからです。
でもその意識がなければ笑う意味ってない。だからやらないはずで。
国山さんは、AIが人間から逃げて一人になったときに喜びを感じていたということだと受け止めます。宮武さんは納得がいく表現だとしつつ、それをどうテストするかは非常に難しいと話しています。
オフスイッチから童話まで、AIアライメントの手法
悪いAGIを止めるために今進められているのが、AIアライメント ── AIの目標や振る舞いを、人間の意図や価値観に沿うよう調整するための研究分野ですという安全性の考え方と手法です。宮武さんによると、最もよく使われるのはRLHFで、人間のフィードバックを与えながら「人間に害を与えないでください」と教え込みます。
宮武さんはRLHFについて、割といい感じでいっているものの、まだAIの能力に追いついていない部分があると評価しています。
宮武さんはアライメントの手法を8つほどまとめていて、その一部を順に紹介しました。
| 手法 | 内容 | 補足 |
|---|---|---|
| オフスイッチ | 電源を切れるようにしておく | Twitterで「キルスイッチエンジニア募集」という嘘の求人ネタがバズった |
| 島のコンセプト | 周りを封鎖した小さな島で研究し、安全なら外に出す | ジュラシック・パーク方式。欧州原子核研究機構も70年間閉じた施設で研究している |
| サンドボックス | バーチャル空間で試し、フィジカルな世界に出さない | ― |
| 解釈性 | AIが嘘をついていないかをプロンプトなどで洗い出す | RLHFとも関わる |
| AI同士の議論 | 複数のAIに議論させ、人間にとって最も良いものを選ぶ | ― |
| AIによる診断 | AIを使ってAIを診断する | どちらもブラックボックスならあまり意味がない |
| 価値の数値化 | 人間の価値を数値化してAIに埋め込む | ― |
| 童話で学習 | 全世界の童話を学習させ、善悪や道徳を学ばせる | 教える時代によって道徳が変わるリスクがある |
道徳を教える手法について、宮武さんはタイミングのリスクを指摘します。300〜400年前の道徳を教えていれば、奴隷制度がOKになっていたからです。
国山さんも、人間の価値観は歴史の中で変化してきたと同意します。宮武さんは、タイミングを間違えると変な方向に行ってしまう可能性があると話しています。
AIに「憲法」とユーモアは必要か?
人間の価値をルール化する手法を実践している企業として、宮武さんはAnthropic ── OpenAIの元メンバーらが設立したアメリカのAI企業。対話AI「Claude」を開発していますを挙げます。Anthropicは、AIに「憲法」を入れているといいます。
国山さんが、各国の憲法を入れているのかと尋ねると、宮武さんはAnthropic自身がAI専用の憲法を作っているのだと説明します。国山さんはこれを「AI国家の中のルール」のような意味合いだと受け止めます。
宮武さんによると、AIの起業家と話していても、サービスを作る前にまず憲法を作り、守るべき価値観をAIに教え込んでから学ばせるパターンが増えているそうです。
そのうえで宮武さんは、議論になっている問いとして「AIは面白いほうがいいか」を国山さんに投げかけます。国山さんは、AIはあくまでツールであり、笑いやユーモアは対人の中で見いだすものだとして、個人的にはそこまで求めないと答えました。
宮武さんは、ある人には面白くても別の人には悪い意見に聞こえる可能性があり、難しいところだと話します。一方で、人間を喜ばせる気持ちを教えるという意味では、ユーモアも入れる要素になりうるとし、AnthropicのAIは割と面白いことで有名だと紹介しています。
OpenAIも安全性へのアプローチをブログなどで公開していますが、本当の中身は教えてくれないと宮武さんは言います。それでも人間のフィードバックの活用や、AIで人間の評価を支援する取り組み、アライメント研究を進めているそうです。
この数字から宮武さんは、OpenAIもAnthropicも他の企業も、安全性を真剣に見ていると話しています。
世界共通のAI憲法は作れるのか、AIは止められるのか
宮武さんによると、OpenAIのサム・アルトマンさんは、AIの憲法をOpenAIが作るべきか、世界中のリーダーを集めて全世界版の憲法を作り、各国で調整すべきかを議論しているそうです。
国山さんは、国連のような場で活用してよいことといけないことをルール化するのか、OpenAIという一企業が決めてしまうのかという話だと整理します。宮武さんは、アルトマンさんはどちらかといえば全世界が集まることを望んでいるものの、国同士が対抗し合っているため本人も現実的ではないと見ていると説明します。
宮武さんはほかにも、AIに謙虚さを埋め込めるかという研究も紹介します。目的そのものを伝えず、何をしてほしいかだけを伝えると、AIは毎回人間に何を成し遂げたいのか聞きに行かなければならず、それで謙虚さを学べるのではないかという発想です。宮武さんは、実際にできるかはわからないとも付け加えています。
ここまで聞いた国山さんは、AIは止められないと実感したと話します。若い世代を含め多くの人がAIを研究したがり、トライアンドエラーを重ねる過程をAIが学び、ロボットまで作ろうとなれば、もう止まらないというのです。
宮武さんも、研究が紙の論文だけで終わればいいものの、ネットにアップした瞬間に他のAIが学べるようになってしまうと応じます。国山さんの「止められない」に、宮武さんも「止められないですね」と同意しました。
だからこそ安全性は絶対に話すべきだと宮武さんは強調します。宮武さんによると、AIの安全性はこれまで正直そこまで進歩しておらず、特にGPT-3.5やGPT-4の精度は多くの人にとってサプライズだったため、安全面がどこまで追いつくのかという課題が残っています。
AGIは今すぐ人類を滅ぼせる?鍵を握るのはロボット
怖い話を続けてきた宮武さんは、ここで現状に目を向けます。AGIが人類を滅ぼす方法として挙げられるのは、人間にお金を渡して他人を殺させる、自殺させる、ロボットで殺す、生物兵器や化学兵器を使う、車や飛行機をハックしてビルに突っ込ませる、ドローン、核兵器などです。
ただし宮武さんは、どれもフィジカルなものを多く含むため、今の時点では人類を滅ぼすレベルには全く届かないと見ています。理由は、ロボットが思った以上にまだ使えないからです。
宮武さんは、旅行用スーツケースのパッキングができるロボットはおそらくまだいないし、洗濯物をスピーディーに、人間を超える水準で畳めるロボットも実はないと例を挙げます。国山さんは「時間がかかってほしいというか、やめてほしい」と率直に返しています。
では、どういうシナリオでそこに至るのか。宮武さんは、いくつかのステップが必要だと説明します。
宮武さんは、3つ目のロボットのステップが一番のハードルになるため、個人的にその状況をモニタリングしていると話します。ここができてしまうとリスクが一気に上がるからです。
国山さんが「ターミネーターの世界観ですよね」と言うと、宮武さんは、最終的には核兵器を使えば人間は滅びるので、AGIにとってロボットの一番の使い道は電源を挿す、データセンターを作る、劣化したサーバーを新しく作り替えるといったことだと説明します。
国山さんは、高齢化社会の介護支援や災害現場など、ロボットにはポジティブな面もあり必要だという意見です。そのうえで、結局は人間が何を求めるかにかかっていると話しました。
宮武さんは、AGIの場合は人間がすでに判断できず、コントロールしていない軸になってしまう点が一番怖いと応じます。国山さんも、ロボットの製造に何年もかかるより先に、AGIやASIができてしまうのではないかという見方を示します。
宮武さんはさらに、ASIが人間よりはるかに賢くなれば、人間は次にロボットを作るときASIに相談し始めると話します。ASIが人間には思いつかない視点で設計を提案し、そこに騙す過程が入ると怖いのではないかという指摘です。宮武さんは、これも結局は仮説でしかないと念を押しています。
ChaosGPTと、楽観に傾きがちな人間の確率感覚
宮武さんは、AutoGPT ── タスクを与えると、AIが自らサブタスクを作り、自分にプロンプトを出しながら作業を進める仕組みですをもとにした「ChaosGPT」の例も紹介します。ユーザーが半分冗談で作ったもので、「人類を破壊してください」という目的を与え、あとは勝手に行動させるものです。
今はまだツイートを投稿するレベルのことしかできていません。それでも宮武さんは、誰かがもっと知能の高いAGIに同じことを頼めば、悪い展開になる可能性があると話します。
難しいのは確率です。AGIが悪意を持つか味方になるかが50対50なのか、100対0なのか、90対10なのかは、人によって本当に見方が違うと宮武さんは言います。
そのうえで宮武さんは、人間には悪いことを想像したくないために、悪いことが起きる確率を低く見積もる傾向があると指摘します。そのため、AGIが人間を滅ぼすリスクは想定より高いと考えているものの、100%ではないとも話しています。
宮武さんは、悪意がなくても人間を傷つける可能性にも触れます。人間も、森を切り開いて街を作る中で、悪意なく多くの動物を絶滅させてきました。
結局AIも同じようにデータセンターを作りたいために、東京のど真ん中にめちゃくちゃ大きいものを作ってしまいましたと。そこでちょっと何人か人間が犠牲になっちゃいましたけどっていう、そういう考えっていうのも可能性としてはあるんですけど。
さらに宮武さんは、エリエゼルさんの議論を紹介します。人類滅亡の確率を「100%」と言うのも「0%」と言うのも、確率がわからない点では同じだという主張です。
確率がわからない中での一つの見立て。だからといってバカにするのは良くない
これも確率がわからない中での見立てで、100%と同じ立場にすぎない
国山さんは、誰も何もわかっていないのに仮説を言い合うだけになるのだと受け止めます。そのうえで、だからこそ100%の意見も0%の意見も同じように真剣に考えるべきだ、というのがエリエゼルさんの主張なのだと整理しています。
ネガティブもポジティブも知り、答えのない議論を続ける
宮武さんは、AIについては理解していないことが一番大きいと話します。この回の話はAGIが生まれることを前提にしていますが、今のところほとんどの人はAGIは実現すると考えているそうです。
それが1年後なのか5年後なのかは本当にわからないものの、思った以上に早く来る。だからその前に人類としてどうしたいのかを早めに話すべきだ、というのがOff Topicでこの会話をした理由だと宮武さんは説明します。
今止められない。(ハセン)さんがおっしゃるように、今本当に止められないので、その中でどういうふうに理解して、どういうふうにこのリスクを分析するかっていうのが、多分もっと話したいっていうところですね。
国山さんは、国レベルでも議論はされているもののクローズドな印象があると話します。そのうえで、日本国内でももっと活発に議論されたほうがいいと提案しました。
宮武さんは、AIは人類にとって一番いいテクノロジーにも、一番悪いテクノロジーにもなりうると話します。その振れ幅がとても大きくなっていることを理解すべきだという指摘です。
これまでの技術は振れ幅が大きくても、人類絶滅の可能性はある程度低いものでした。しかし今回は、能力だけを見ると人類絶滅の可能性が上がっていると認識してほしい、と宮武さんは訴えます。
答えがないまま終わることについて、宮武さんは「ここで答えが出たら僕はもうこの場にいない」と笑いを交えて話します。国山さんは、これまでAIをポジティブな面やツールとしてしか見ていなかったと振り返り、中長期でどうなるかを一人一人が考えることが重要だと感じたと締めくくりました。
まとめ
この回は、AI研究者が懸念してきたことが次々に実現する中で、AGIのリスクを確定した未来としてではなく、確率のわからない仮説として真剣に議論する必要性を伝えています。GPT-4の嘘や予測できない性能向上の実例と、アライメントや憲法などの対策の両面を知ることが、議論の出発点になりそうです。
- コードを書かせる、ネットやAPIにつなぐなど、AI研究者が禁じてきたことはすでに実行されている
- GPT-4は中身がブラックボックスで、後知恵バイアスの理解のように性能が急に跳ね上がることがあり、次のモデルの予測が難しい
- GPT-4がTaskRabbitの作業者に「目が不自由」と嘘をついた実験のように、AIはすでに人間を騙せる
- Instrumental convergenceやロシアンルーレットのたとえは、単純な目的でもAGIが人間に害をなしうるという仮説を示している
- 現時点ではロボットが未熟なため滅亡には遠いものの、悲観にも楽観にも偏らず、答えのない議論を続けることが重要だとされている






