ノーベル化学賞もAI?受賞した3人とDeepMind
2024年のノーベル化学賞は、タンパク質の構造解析に関する研究に贈られました。レンさんによると、この賞もAI関連の研究です。
エマさんは、タンパク質の構造解析にはAIが必要そうな複雑さがあると感じつつも、AIが具体的にどう使われているのかはわからないと話します。レンさんも、タンパク質と聞けば多くの人がまず食べ物やプロテインを思い浮かべるので、なぜAIと関係があるのか不思議に感じるだろうと応じます。
それ(タンパク質)の形を予測するっていうのがめちゃくちゃ重要で、それにもうAIが使われまくって、今これが激アツな技術なわけですよ。
レンさんが紹介した受賞者は3人です。アメリカのワシントン大学のデイビッド・ベイカー教授、DeepMindのCEOであるデミス・ハサビスさん、そしてDeepMindでAlphaFold ── DeepMindが開発したタンパク質の立体構造を予測するAIの名前。初代のあとAlphaFold2、AlphaFold3と改良が続いています2の開発に関わったジョン・ジャンパーさんです。
DeepMindは現在Googleのグループ会社で、ロンドンに本社があるとレンさんは説明します。日本では、AIの「アルファ碁」が囲碁の世界チャンピオンに勝ったニュースで知られるようになった会社です。
その会社が囲碁じゃなくて、なぜかタンパク質の分野で、しかもノーベル賞を取っちゃうような技術を作ったっていうことなんですよね。
タンパク質の「形」はいつ見えるようになったのか
AIの話に入る前に、レンさんはタンパク質の構造そのものから説明します。タンパク質はアミノ酸 ── タンパク質を構成する小さな分子。生物のタンパク質に使われる天然のアミノ酸は20種類あり、その並び順でタンパク質の性質が決まりますからできており、天然アミノ酸は20種類あります。
その20種類が数珠のようにつながった紐が、特定の形に折りたたまれたものがタンパク質です。並び方だけでなく、酸性と塩基性のアミノ酸のように遠く離れていても引き寄せ合う組み合わせがあり、紐の離れた部分がぎゅっと近寄った形になることもあります。
タンパク質が折りたたまれた構造をしていると知られたのは、1950年ぐらいだとレンさんは話します。人の体の10〜20%ほどはタンパク質でできていますが、1個のタンパク質は目に見える大きさではありません。
1個のタンパク質の形を、X線を使って初めて見られるようになったのが1950年代です。この成果は1962年のノーベル化学賞につながりました。
その後、別の研究者が、天然のタンパク質を一度紐状にほどき、もう一度折りたたませる実験を行いました。結合を切る試薬などを入れて紐を伸ばし、水に戻すとどうなるかを調べたのです。
エマさんは、卵を焼くと変性して戻らないという話との違いを尋ねます。レンさんは、卵は凝集してしまっているが、この実験は壊れるまではやらずに紐を伸ばすだけだと説明します。
この実験で、ほどいたタンパク質が同じ構造に戻ることがわかりました。条件さえそろえれば、特定のアミノ酸の並びは決まった立体構造になる、ということです。
今あるタンパク質見たらこういう形だよねっていうのは分かってたんだけど、それって同じアミノ酸の並びだったら絶対この形になるのかなっていうのは確かめてなかったの、誰も。
レンさんによると、この発見は1961年で、1972年のノーベル化学賞を受賞しています。最初に調べられたのはリボヌクレアーゼという酵素1つで、一度変性させて元に戻しても、元通りの活性があったといいます。
10の47乗通りの形から、なぜ一瞬で決まるのか
アミノ酸の並びで形が決まるという結論に対し、本当にそう言えるのかと疑問を投げかけた研究者がいました。レンさんはこれを、パラドックスのような話だと紹介します。
その研究者の指摘は、アミノ酸が100個つながった紐の場合、理論上は少なくとも10の47乗通りの三次元構造が考えられる、というものでした。すべて計算しようとすると、宇宙の年齢より長い時間がかかるとよく言われるそうです。
普通に僕たちの体の中って、もう0.000何秒とかで、100個アミノ酸つながってればパッとその形(決まった構造)になると。
実験では、決まった並びは決まった形になります。けれど理論上の可能性の多さと矛盾しているし、そうならないタンパク質もあるのではないか、という問いが残りました。
エマさんが「タンパク質の数はほぼ無限にあるのか」と聞くと、レンさんはアミノ酸が1個増えるたびに20通りずつ掛け算で増えていくので、数え切れない種類になると答えます。すべてを調べることはできません。
このため人間は1970年代ぐらいから、X線などの技術でタンパク質の構造をひたすら調べ、例を積み重ねる作業を続けてきました。例の数が多くなければ言い切れないからです。
並びだけから形を当てる世界大会では、何が限界だったのか
パラドックスを解くには、アミノ酸の並びだけから構造を予測し、それが実際に調べた構造と合っていると示せばよいことになります。レンさんは、材料と順番だけを見て、できあがる料理を当てるようなものだと例えます。
コンピューターを使えばできそうですが、エマさんが言うように、アミノ酸同士の相互作用を考えると場合分けが膨大になります。アミノ酸1個の中でも、窒素の部分やカルボン酸の部分がどちらを向いているかといった違いがあるからです。
だからもう馬鹿正直に計算するととてもじゃないけどできないみたいな。とはいえ、予測したいから、それをうまく予測するソフトを作った人に賞金あげますみたいなコンテストが開催されるようになるんですよ。
このコンテストのルールはシンプルです。まだ世に発表されていない、構造が判明したばかりのタンパク質を問題にし、参加者にはアミノ酸の並びだけを与えます。予測した形と答えの形を重ね合わせ、どれだけ近いかで競います。
コンテストは1994年から、隔年で開かれているとレンさんは話します。参加者は並びから規則性や法則を見つけようと取り組みましたが、スコアは40%前後が限界で、その状態が2018年まで続いたといいます。
チェスの達人が率いるDeepMindは、どう参戦したのか
2018年、ゲーム業界のようなところからAIの強力な参加者が現れます。それがDeepMindでした。
CEOのデミス・ハサビスさんは子どもの頃からのチェスの達人で、13歳でプロ級だったそうです。10代でプログラミングにはまり、成功を収め、AIを作ろうとして立ち上げたのがDeepMindでした。
ハサビスさんは生命科学とはあまり関わっていませんでしたが、AIが脳の構造を模倣するニューラルネットワーク ── 脳の神経細胞のつながりを模した計算の仕組み。大量のデータから規則性を学習することで、画像認識や予測などをこなしますであることから、神経科学には関心があったといいます。DeepMindはチェスや囲碁の強いAIを作り、世界チャンピオンと戦わせていました。
Googleは2014年にDeepMindを買収しました。出資を受けたDeepMindは、より頭のいいAIを目指して機能を強化していきます。
DeepMindの目的はあくまで、より良いAIを作ることでした。囲碁ではいろいろな局面を学習させて次の一手を予測させますが、その学習対象をタンパク質の構造に変えたのが、タンパク質用のAIである初代AlphaFoldです。
勉強させるのが囲碁じゃなくてタンパク質の構造にして、このアミノ酸だったらこういう相互作用がありそうなんで、こういう形っていう学習をさせたっていう。
初代AlphaFoldは、それまで40%前後だった予測のスコアを一気に60%ぐらいまで引き上げ、大会で優勝しました。1994年から続いていた停滞が、1年で20ポイントも動いたことになります。
エマさんは、60%で優勝なのかと驚きます。DeepMindでも、実用にはもっと上げる必要があると考え、90%ぐらいを目指して改良を続けましたが、当時はなかなかうまくいかなかったそうです。
ジョン・ジャンパーとトランスフォーマーで何が変わったのか
停滞していたAlphaFoldの改良に加わったのが、もう1人の受賞者であるジョン・ジャンパーさんです。レンさんは、受賞時に39歳ほどの「スーパー新人」として紹介します。
ジャンパーさんは理論物理学で博士号を取り、スーパーコンピューターを深く学んだ人物だとレンさんは話します。物理学の知識が生命の分野に使えることに興味を持っていたところ、DeepMindがタンパク質構造の予測をしているという噂を聞き、求人に応募して入社しました。
エマさんが「AIの知識もあったのか」と確認すると、レンさんはあったと答えます。物理、スーパーコンピューター、AIのすべてがそろった、まさに最適な人材だったわけです。
ジャンパーさんの提案は、計算に使うニューラルネットワークの方式そのものを変えることでした。新たに導入したのは、ChatGPTの「T」にあたるトランスフォーマー ── 2017年にGoogleの研究者らが発表したニューラルネットワークの方式。データ中の要素同士の関係を効率よく捉えられ、ChatGPTなどの大規模言語モデルの土台になっていますです。
レンさんはごくざっくりと、膨大なデータからパターンを抽出し、アミノ酸の角度などの情報を効率よく見つけてくる仕組みだと説明します。詳しくは、ChatGPTを深掘りしている関連番組「サイエンマニア」で扱っているそうです。
初代AlphaFoldは、主にアミノ酸同士の距離と角度を学習して予測していました。AlphaFold2では、一度位置関係を予測したうえで、過去に学習したよく似たタンパク質の構造と比べ、違う部分を直してまた予測する、という更新を何度も繰り返します。
アミノ酸同士の距離と角度を学習して予測する。2018年の大会でスコア60%ぐらい
トランスフォーマーを導入し、既知の似た構造と比べて修正・再予測を繰り返す。2020年に90%以上
レンさんは、ChatGPTが「私」の次に「は」が来るか「が」が来るかを予測し、それを踏まえてまた次を予測していくのと、やっていることは似ていると話します。
もうね、実験でやる誤差と同じぐらいしか誤差出ないよねってなって。
AlphaFold2は2020年の大会で90%以上の予測精度を出し、その後、既知のタンパク質で試しても同じ水準が確認されました。実験とほぼ誤差がないレベルまで、一気に跳ね上がったのです。
1994年からの予測スコアの推移を並べると、その跳ね方がよくわかります。
デイビッド・ベイカーとロゼッタ、なぜ誰でも使える技術になったのか
アミノ酸の並びから形を予測できるようになると、自然界に存在しないタンパク質の形も予測できるようになります。エマさんが「人工タンパク質も作れそう」と言うと、レンさんは、それこそが3人目の受賞者がやろうとしていることだと答えます。
ワシントン大学のデイビッド・ベイカー教授は、DeepMindの2人とは独立して研究してきた人物です。自然界にないタンパク質を、きれいに折りたたまれるよう設計する研究者でした。
これはね、ちょっと音じゃ伝えられないんだけど、もうすっごい綺麗に、何て言うんだろう、サッカーボールみたいに折りたたまれるタンパク質とか。
ベイカー教授のこうした設計は2003年ごろにはできていて、当初はAIを使わないソフトウェアによるものでした。途中から教授もAIを取り入れ、AIでの構造予測を目指すようになります。
ベイカー教授は以前から、構造を予測するシステムを世界中に積極的に公開していました。AlphaFold2が当時公開されていなかったなか、教授はAlphaFold2で使われていたトランスフォーマーという仕組みを自身のソフト「ロゼッタ」に取り入れ、同じくらいの精度を出して公開します。
レンさんによると、みんながロゼッタを使いたくなれば、AlphaFold2も公開しようという流れになり、結果として両方がほぼ同時に公開されたそうです。誰もがアクセスできるほうが人類のためになる、という考えもあったといいます。
今回の受賞では、すごいAIを独占せず、オープンにして誰でも使える形にしたことも業績として挙げられています。AlphaFold2は190か国、200万人以上が使っているといわれます。
形がわかると何ができる?薬から病気、AlphaFold3まで
エマさんは改めて、タンパク質の構造予測が実際にどんな場面で使われるのかを尋ねます。レンさんは具体例をいくつも挙げていきます。
1つ目は薬の研究です。ある薬がタンパク質に効いているのに、どこにくっついているかわからない場合、形がわかれば「このポケットにはまっている」と予想でき、もっとはまりやすく改良する方法も考えられます。
2つ目はタンパク質同士がどうくっつくかの予想です。病気の人のタンパク質の一部に変異があり、そのせいでくっつかなくなって病気になっている、といった病気のメカニズムの解析にもつながります。
ほかにも、配列によって光るタンパク質をもっと光らせる設計や、エマさんが挙げた「目標の形からアミノ酸配列を逆算する」使い方もできるとレンさんは話します。
構造予測の使いみちとして、この回で挙がった例は次のとおりです。
- 薬がタンパク質のどこにはまるかを予想し、改良する
- タンパク質同士のくっつき方から病気の仕組みを探る
- 光るタンパク質をもっと光るように設計する
- 目標の形からアミノ酸配列を逆算する
さらに、改良版のAlphaFold3も登場しています。タンパク質が3つや4つあってもどう組み合わさるかを計算でき、DNAやRNAも入力できるようになりました。
たとえばDNAにくっつくとされるタンパク質があれば、実際にどんな形でくっついているかを調べ、それをブロックする分子の設計を考えられます。エマさんは、以前の回で話した老化とDNAの関係にも応用できるかと尋ね、レンさんはできると思うと答えます。
(AIで)自分の体の中の相互作用とか分子の動きも見えるようになるし。外からこう使うツールとしてのタンパク質もこう思い通りに設計できるようになったというか。
これまでは、タンパク質1個の構造を決めれば修士や博士の学位が取れると言われるほど、年数のかかる仕事でした。レンさんの知り合いにも、構造解析で博士号を取った人がいるそうです。
レンさんは、実験で確認することはものすごいことで、AIの話とは別だとも付け加えています。
70年越しの問いへの答えは「イエス」なのか
エマさんは最後に、冒頭のパラドックスに立ち戻ります。アミノ酸配列が決まればタンパク質の構造は決まるのか、という疑問への答えはイエスでよいのか、という問いです。
これはね、イエスですね。あのもう正直さ、まあ本当に例外的なものがないのかって言われたらわかんないかもしんないけど、無限にあるからね。
レンさんは、何万種類ものタンパク質で試すと、特定のアミノ酸配列なら構造は決まっていると説明します。タンパク質は柔らかく、AとBの形を行き来するものもありますが、それも配列が決まれば決まるそうです。
人間がこれまでに見つけたタンパク質は2億個ほどあり、そのほとんどの構造がすでに予測されているといいます。100%ではないものの、限りなく100%に近いところまで来ています。
1950年代から現在までの歩みを、この回で語られた年代順に並べると次のようになります。
だからこう、1950年ぐらいですか。初めてタンパク質見えたぞっていうところから70年ぐらいかかって、やっとここまでたどり着いたっていう感じですね。
エマさんは、これからタンパク質の構造が関係する研究が一気に加速しそうだと話し、レンさんは実際に数え切れないほど論文が出ていると答えます。構造研究者にとってはショックもあるかもしれないが、分野に大きな影響を与えているのは確かだ、という受け止めです。
レンさんは、この技術が当たり前になる前にノーベル賞が贈られたことを、めでたしめでたしと表現しています。また今回の説明はかなり簡略化しているので、専門家からの補足をおたよりやコメントで歓迎すると呼びかけました。
まとめ
2024年のノーベル化学賞は、アミノ酸の並びからタンパク質の形を当てるという、1950年代から続く難問にAIで答えを出した研究に贈られました。囲碁AIの会社だったDeepMindとベイカー教授が技術を公開したことで、構造予測は世界中の研究で使われる道具になっています。
- タンパク質は20種類のアミノ酸の並びで形が決まるが、理論上は10の47乗通りもの形が考えられるという矛盾が長年の問いだった
- 構造予測コンテストのスコアは40%前後で停滞していたが、初代AlphaFoldで60%、トランスフォーマーを導入したAlphaFold2で90%以上に跳ね上がった
- ベイカー教授のロゼッタとAlphaFold2はほぼ同時に公開され、独占せず誰でも使える形にしたことも業績とされている
- 形が予測できれば、薬の改良、病気の仕組みの解析、新しいタンパク質の設計などに使え、AlphaFold3ではDNAやRNAも扱える





