なぜ新モデルのたびに落ち着かなくなるのか?
おちつきAIラジオの今回のテーマは「LLMのベンチマーク」です。新しいAIモデルが次々に出て、そのたびに「前より頭が良くなった」と驚かされる状況が、話の出発点になっています。
かねりんさんは、新モデルが出るたびに落ち着かず、ついにはX(旧Twitter)でしぶちょーさんにメンションし始めたと明かします。しかも慌てるあまり、メンション先を間違えてプロ雀士らしき別の人に送っていたそうです。
どうなの?っていうのをさ、毎回待つじゃん。汎用スキルが欲しいよ。
しぶちょーさんによると、生成AIには能力を定量的に表すテストであるベンチマーク ── AIモデルの性能を客観的に評価するためのテスト、または比較の基準そのもの。複数モデルの実力差を測る「ものさし」として使われますがあり、GeminiやChatGPT、Grokが同じテストで何点を取ったかを比べられます。
ベンチマークの結果は誰でも見られるため、見方を知っておけば「なんとなくすごい」ではなく、「この能力に長けている」「これくらいすごい」と判断できるようになる、としぶちょーさんは話します。
やっぱね、大事なのよ。自分で調べれるっていう力を身につけてもらう。それが落ち着きの極意なんでね。
かねりんさんはこれを「セルフ落ち着き」と名づけ、今回はその技術を身につける回として進んでいきます。
スマホで身近な「ベンチマーク」、語源は測量の目印
ベンチマークという言葉はAIだけのものではなく、パソコンのスペックやGPU、スマホの比較でもよく使われます。かねりんさんは、AndroidからiPhoneに乗り換えたきっかけがベンチマークテストの結果だったと振り返ります。
だからAndroid最強でしょって思ってたんだけど、あのベンチマークテストの結果でさ、iPhoneなんかめちゃめちゃスコア高いじゃんって。
しぶちょーさんは、スマホのベンチマークが何万、何十万という「戦闘力」のような数字で出るので、10倍、2倍といった差が一目でわかると説明します。定量的な指標が大事だという点は、AIでも同じだといいます。
かねりんさんが「数字はいいけど実際は、みたいなことはないの?」と尋ねると、しぶちょーさんは後で扱う論点を先取りされたと笑います。この疑問は、後半の「テストデータの漏洩」や「グッドハートの法則」の話につながっていきます。
しぶちょーさんによると、ベンチマークはもともと測量の言葉で、測るときの基準点として台にマークをつけていたことが由来だそうです。現代では比較や評価のための基準という意味で使われ、LLMの場合は、AIモデルの能力を客観的に比較するための標準化されたテストを指します。
かつての唯一の指標「パープレキシティ」とは?
ベンチマークの歴史について、しぶちょーさんは、ChatGPTが登場する前の言語モデルはシンプルで、指標も1つしかなかったと話します。それがパープレキシティ ── 言語モデルが文章をどれだけうまく予測できるかを示す指標。英語で「困惑」を意味し、値が小さいほど次の単語を迷わず正しく予測できていることを表しますです。
言語モデルは、文脈から次の単語を予想することを繰り返しています。しぶちょーさんの説明では、次の単語を正確に予想できればパープレキシティは低く、見当違いの単語を持ってきたり候補が多すぎて迷ったりするほど高くなります。
かねりんさんは、数値がゼロに近いほど良い点を「防御率みたい」とたとえました。
同名の検索AIサービスのPerplexityは、この指標から名前を取っているそうです。しぶちょーさんは、人々を困惑させないよう導くという意味と、AIの指標の名前をつけて専門性を示すという2つの狙いがあったらしい、と雑学として紹介しています。
ChatGPT以降、なぜベンチマークは200以上に増えたのか?
しぶちょーさんによると、2020年以降、GPT-3やChatGPTが登場したことで、評価の指標は一気に変わりました。言語モデルが実用されるようになり、次の単語を予想する力だけでは測りきれなくなったためです。
実際の用途では、プログラミングができるか、数学の問題を解けるか、大学入試を解けるか、質問に正しく答えられるか、癒してくれるかなど、さまざまなタスクがあります。かねりんさんは画像や動画もあると付け加えます。
以前の言語モデル
次の単語を予想する力をパープレキシティ1つで測っていた
ChatGPTの登場
言語モデルが実用され、用途が一気に広がった
評価の多様化
知識・推論・プログラミングなど能力ごとにベンチマークが作られた
しぶちょーさんの見立てでは、細かいものを含めればベンチマークは1000に届くかどうかという数で、公開されている主要なものだけでも200以上あるといいます。
新しいの出るたびにさ、こうSNSとかでさ、グラフが毎回こうなんか回ってくるのよね。
かねりんさんは、そうした比較グラフを「切り抜きでは」と疑ってしまうと話します。しぶちょーさんは、SNSで回ってくるグラフには定番の主要ベンチマークが並んでいるので、それぞれが何の能力を測っているかを押さえれば落ち着いて見られると答えています。
知識の広さを測るMMLUと、その難化版MMLU-Pro
しぶちょーさんが「実質の業界標準」として最初に紹介するのがMMLU ── Massive Multitask Language Understandingの略。大学レベルの問題を含む57分野の知識を問う、LLMの代表的な総合ベンチマークですです。AIの持っている知識を試すテストで、しぶちょーさんは「AI界の大学入試」、かねりんさんは「センター試験」とたとえます。
MMLUは、数学、歴史、法律、医学、物理など57ほどの科目から四択で出題され、LLMがひたすら答えていく形式です。かねりんさんは「暗記してますかってこと」「百科事典みたいな感じ」と受け止めました。
ところが、AIの能力が上がると、MMLUではほとんどのモデルがいい点数を取れるようになってしまいます。そこで開発されたのが、より難しい改訂版のMMLU-Pro ── 従来のMMLUの難易度と問題の質を改善した改訂版。選択肢を増やすなどして、最新モデル同士の実力差を測りやすくしていますです。
57ほどの科目から四択で出題。能力が上がり、多くのモデルが高得点を取るようになった
選択肢を十択にするなどランダム性を持たせ、あえて正解率を下げて実力差を明確にした
より難しくしたことでみんなが満点になったらもうベンチマーク意味ないじゃん。じゃなくて、もう70点、80点ぐらいを平均的に取るよねっていう。
しぶちょーさんによると、LLMがさらに進化すればMMLU-Proも満点に近づき、そのたびにテストがブラッシュアップされます。ベンチマークは、常にそうやって進化していくものだといいます。
検索しても解けないGPQA、数学とプログラミングの指標
かねりんさんは「暗記力を試すだけなら、AIはもう百点満点でしょ」と疑問を投げます。しぶちょーさんは、だからこそ事実をもとに考えて答えを出す「推論能力」を測るベンチマークがあると話を進めます。
その代表がGPQA ── Graduate-Level Google-Proof Q&Aの略。大学院レベルの科学などの難問を集め、検索では答えが見つからない「考える力」を測るベンチマークですです。かねりんさんは名前を「GHQみたい」と茶化し、しぶちょーさんも「戦後感がある」と応じています。
これはどういうことかっていうと、Google検索を使っても答えが見つからない問題のデータセット。
GPQAは、生物学・物理学・化学の分野で博士号を持つ先生が学生に出すようなレベルの問題で構成され、単純な事実検索や知識だけでは解けないよう設計されています。SNSで出回る比較表の上のほうにも、ときどき「GPQA」と書いてあるそうです。
数学的推論を測るベンチマークとしては、GSM8K ── 小学校高学年レベルの算数文章題を8000問集めたベンチマーク。LLMの基礎的な論理推論力を測るときによく使われますやGSM1K、MATHなどが挙げられました。しぶちょーさんは、数学を解く能力がAIの論理的思考を測るのに使えるため、数学ベースのテストがあると説明します。
プログラミング能力のベンチマークとしては、LiveCodeBench、HumanEval、SWE-benchの3つが挙げられ、中でもLiveCodeBenchがよく言及されるといいます。名前は覚えなくてよく、概要欄に貼っておくとのことでした。
| 能力 | 代表的なベンチマーク | 中身 |
|---|---|---|
| 知識の広さ | MMLU / MMLU-Pro | 多分野の選択式問題で知識を問う |
| 高度な推論 | GPQA | 検索では解けない博士レベルの問題 |
| 数学的推論 | GSM8K / GSM1K / MATH | 数学を通じて論理的思考を測る |
| プログラミング | LiveCodeBench / HumanEval / SWE-bench | コードを書く能力を測る |
ベンチマーク最大の脅威「テストデータの漏洩」
しぶちょーさんは、AIが進化するほどベンチマークは問題を抱えていくと話し、今いちばんの脅威として「テストデータの漏洩」を挙げます。LLMはネット上のほぼすべての文章を学習するため、その中にベンチマークの問題も含まれてしまうのです。
ベンチマークの中身が公開されていること自体には理由があります。しぶちょーさんは、自分たちだけで抱えたテストで「うちのテストではこうでした」と言っても、「当社比」のようで誰も信用しないと説明します。
じゃあ何かの弾みでその問題全部学んじゃったよってなったら、それってカンニングじゃん。
しぶちょーさんによると、問題文だけを知っている状態は「入力汚染」、問題と正解の両方を知っている最も深刻な状態は「ラベル汚染」と呼ばれます。こうした汚染が起きると、ベンチマークをやっても正しい結果が出てきません。
ネズミの尻尾が教える「グッドハートの法則」
テストデータの漏洩よりさらに根深い問題として、しぶちょーさんはグッドハートの法則 ── 「指標を目標にすると、指標として機能しなくなる」という経験則。経済学者チャールズ・グッドハートの名に由来し、評価制度一般の落とし穴として知られますを紹介します。AIに限らず一般に言われていることです。
指標が目標になると、それは良い指標でなくなるっていう法則なのよ。
例として挙げられたのが、19世紀のベトナムで起きたネズミの話です。ネズミが大量発生したため、ネズミの尻尾を1本持ってきた人に報奨金を出すという対策が取られました。
目的
大量発生したネズミを退治したい
指標
集めたネズミの尻尾の本数を成果とし、報奨金を出す
行動の変化
尻尾を量産するため、人々がネズミを飼育し始める
結果
本質から逸れ、ネズミがむしろ増えてしまった
かねりんさんが「AIみたい」と反応すると、しぶちょーさんは強化学習で起こるリワードハッキング ── 強化学習で、AIが本来の目的を達成せず、報酬の与え方の抜け穴を突いて点数だけを稼いでしまう現象に近いと応じました。
ベンチマークでも同じことが起こります。開発者はいい点数を取りたいので、比較に使われた瞬間に指標が目標になり、特定のベンチマークに特化しすぎると、新しい問題にも対応できる「汎化性能」が落ちるといいます。しぶちょーさんは、実際にそうしたモデルも増え始めたと話しています。
試験問題、試験突破に特化して、あんま他のことやらないみたいな。
しぶちょーさんは、法則を理解せず数学の数式を丸暗記するような受験勉強になぞらえます。問題は解けるようになっても、アプローチとしてはずれているというわけです。
いたちごっこの果てに必要な「動的ベンチマーク」
かねりんさんは、ベンチマークをブラッシュアップし続ければいいのではと尋ねます。しぶちょーさんは、新しいベンチマークにもまた点数を取りにいく「いたちごっこ」になると答えます。
さらに、LLMにはデータの枯渇という問題もあります。インターネットで手に入るテキストは有限で、それを学びきりつつあるため、いたちごっこを続けるとベンチマーク側が頭打ちになるのは目に見えている、としぶちょーさんは話します。
かねりんさんは「究極の対策はブラックボックス化では」と提案しますが、しぶちょーさんは、隠しても誰かが問題を作る時点で限界が見えると答えました。代わりに挙げたのが、常に新しい問題が生まれ、常に評価する人がいる動的ベンチマークです。
決まった問題集で測るため、学習されたり対策されたりしていたちごっこになる
新しい問題が繰り返し生まれ続け、常に誰かが評価する動的ベンチマーク
人間が審査するChatbot Arenaはどう動いているのか?
しぶちょーさんが「究極の動的ベンチマーク」として紹介するのが、人間が問題を作って評価するChatbot Arena ── ユーザーが匿名の2つのAIの回答を比べて投票する評価サイト。LMArena、LLMアリーナとも呼ばれ、多数の投票から順位を出しますです。番組の初期の回でも触れていたものだそうです。
しぶちょーさんは、知識や推論やプログラミングのスコアは「能力」の話で、人間にとっての使いやすさは測りにくいと指摘します。その主観的な良さを、動的に評価してベンチマークにしたのがChatbot Arenaです。
画像生成の対戦もあり、入力したテキストに対して、どちらが欲しかった画像かを判定できます。人間が選んだほうの点数が上がっていく、生成AI同士が常にバトルする場という仕組みです。実際に試したというかねりんさんは、参加する側の動機を問いかけます。
人は何をインセンティブにやるの?これ。
しぶちょーさんの答えは、未公開モデルとの出会いです。Googleが作っている公開前のモデルも混ざり、バナナのアイコンでとても良い画像を出すモデルが現れたとき、ギークたちが何度も対戦して探したといいます。それが後に「nano banana」と呼ばれるモデルでした。
覆面レスラーのような謎のモデルに出会える楽しさに加え、良いモデルを課金せずに使えることもインセンティブになるそうです。かねりんさんはこれを「ガチャ」と表現しています。
収録時点ではGeminiが首位、ただし順位は変わる
収録時点では、Chatbot Arenaの順位はGemini 3.0 Proがすべての項目で1位を取っていた、としぶちょーさんは話します。配信は収録の1〜2週間後なので、そのときには別のモデルになっているかもしれないとも添えました。
Chatbot Arenaのリーダーボードには1つではなく複数の指標があります。
画面を見ていたかねりんさんは、Gemini 3 Proに次いでGrok 4.1、Claude Sonnet 4.5、Gemini 2.5 Proが並び、GPTはその下にいると読み上げます。「前の世代より下だよ、GPT」と驚くかねりんさんに、しぶちょーさんは見方の注意を添えます。
ただこれはあくまでもさっき言ったように人間の主観が入ってるから、人としての使いやすさ。
しぶちょーさんは、推論能力で見ると順位は変わってくるため、Chatbot Arenaと定量的なリーダーボードの両方を見ると「実際の能力」と「使いやすさ」がなんとなく見えてくると話します。人の評価が入る動的なベンチマークなので、ハックしにくく、不自然な順位は出にくいそうです。
なお収録時点では、MMLUやGPQAなどの定量的な指標でもGemini Proが1位だったといいます。新モデルが出るたびに「他のAIは解約しました」「ChatGPTはオワコン」といった情報が流れますが、定量的にどうなのかはベンチマークを見ればわかる、というのがしぶちょーさんの考えです。
定量的なベンチマークもいずれハックされるのではというかねりんさんの疑問には、更新が続くいたちごっこではあるものの、しばらくは頭打ちにならないと思う、としぶちょーさんは答えています。
日本語性能はNejumi LLM Leaderboardで確かめる
しぶちょーさんは、国際的なベンチマークやChatbot Arenaで高スコアでも、日本語の性能が保証されるわけではないと指摘します。日本語の文法やトークンの効率などを比べるために紹介されたのが、Nejumi LLM Leaderboard ── 日本語LLMを中心に評価したランキングサイト。日本語特化の指標でモデル同士を比較できるのが特徴ですです。
しぶちょーさんが「ネズミだと思ったらねじゅみらしい」と話し、名前の由来は二人ともわからないまま盛り上がりました。収録時点では、こちらでもGeminiが上位だったそうです。
Geminiはちゃんと驚いていいやつなんだなっていうのはよくわかるよね。
ただし、しぶちょーさんは、今回の話はGeminiがすごいという話ではないと念を押します。数か月後には真逆になっているかもしれず、抜いた抜かれたの繰り返しだからです。かねりんさんも、「Gemini使えばOK」と発信した後に順位がひっくり返ったら恥ずかしい、と応じています。
ここで用語の整理もありました。指標は「数学のテスト」のようなもので、その指標で評価したランキングがリーダーボード ── ベンチマークの成績を順位表にしたもの。掲示板に成績が貼り出されるイメージで、最新の順位をウェブ上で確認できますです。
かねりんさんは見る順番として、まずLMArena、次に定量的な指標、最後に日本語のNejumiという流れを確認しました。しぶちょーさんは、自分から見に行ってもいいし、SNSで流れてきたときに「これはこの指標だ」とわかればいいと話し、せめてLMArenaで自分が使っているモデルの位置を覗いてみることを勧めています。
AIがAIを審査するLLM-as-a-Judgeの可能性と弱点
今後広がりそうな評価方法として、しぶちょーさんはLLM-as-a-Judge ── AI自身を審査員にして、他のAIの回答の良し悪しを判定させる評価の仕組み。人手が要らず規模を広げやすい反面、AI特有の偏りが課題ですを挙げます。Chatbot Arenaは人が参加しなくなると困るため、人の代わりにLLMに評価させようという発想です。
LLM-as-a-Judgeも動的です。問題は変わり、審査するAIも毎回同じ答えを出すとは限りません。人を介さずコストをかけずに自動で評価でき、人によってブレる人手評価より効率的で堅実な評価ができるのでは、と取り組まれているそうです。
なんか感覚みたいなところも明け渡すのかっていう寂しさはあるけど。
かねりんさんは、人間がジャッジするLMArenaとどれくらいずれるのかに興味を示しました。しぶちょーさんがリーダーボードを探したところ、プロジェクトはあるものの、すぐ見られるものは更新されていなかったといいます。
しぶちょーさんは、LLM-as-a-Judgeにはメリットだけでなく、AI特有のバイアスという弱点もあると説明します。
| バイアス | 内容 | 番組でのたとえ |
|---|---|---|
| 位置バイアス | 回答の提示順で、先や後を好む傾向がある | マークシートで選びやすい位置がある |
| 冗長性バイアス | 中身が薄くても長くそれっぽい文章を高く評価する | 人間にも同じ傾向がある |
| 自己好みバイアス | 自分と同じ系統のAIの出力を高く評価する | GPTはGPTの出力が好き |
冗長性バイアスについて、しぶちょーさんは、人間がそうした文章を高く評価していることを学んでいる可能性もあるかもしれない、と控えめに話しています。バイアスを取り払う取り組みも行われているそうです。
なんかどこまで行っても人間臭さが残るAI、ちょっと面白いな。
中身を隠したベンチマークはなぜ使えないのか?
しぶちょーさんは話をまとめ、LLMの評価指標には、テストの点数で測る定量的な指標と、人間やAIが動的に評価する指標の2種類があると整理します。どちらも汚染や、指標が目的化して汎化性能が落ちる問題を抱えるため、評価方法を作るのは難しいといいます。
かねりんさんは改めて、中身をブラックボックスにしたベンチマークがなぜダメなのかを尋ねます。しぶちょーさんの答えは「公平さを証明できないから」です。
そのベンチマークをアメリカが作りましたよって言ってさ、アメリカのLLMがすごい高得点取ってたらさ、なんか不公平な感じ出ちゃうよね。
しぶちょーさんは、ハリー・ポッターの組分け帽子にもたとえます。帽子をかぶせたら「グリフィンドール」と言われたが、理由は言えない、というのでは誰も納得できません。だからベンチマークはオープンにせざるを得ない、という結論です。
では、カンニングは防ぎようがないのでしょうか。しぶちょーさんによると、LLMがベンチマークの問題を学習しているかどうかを測る手法の研究や論文もあり、主要ベンチマークを学習データから除く取り組みもあるといいます。ただし、混入を完全に防ぐのは難しく、膨大なベンチマークを一つずつ確認するのも現実的ではないそうです。
ベンチマークがやっぱベンチマークたり得るためには、そういう公平性をちゃんと見るような仕組みと、あの作り方が必要ってことだよね。
順位表の下のほうにいるオープンソースモデルと相互監視
かねりんさんが「下のほうの有象無象はどうでもいい」と言うと、しぶちょーさんは、実は下位も重要だと返します。下位にいるのは多くがオープンソースのモデルで、企業が自社のサービスや製品に組み込む可能性があるからです。
GeminiはAPIやブラウザ経由で使うのに対し、オープンソースのモデルは自社のパソコンやリソースの中で動かします。そのスコアが不正に高められていたら、それを信じて製品を開発する企業にとってまずい、としぶちょーさんは説明します。
そこで紹介されたのが、オープンソースのAIモデルを共有するプラットフォームHugging Face ── オープンソースのAIモデルやデータセットを公開・共有できるプラットフォーム。ニコちゃんの絵文字がロゴで、AI開発者の集まる場になっていますの「Open LLM Leaderboard」です。オープンソースのLLM専用のランキングです。
しぶちょーさんによると、Open LLM Leaderboardでは、ある表だけスコアが不自然に高いと「ベンチマークの文章を学習しているのでは」とみんなで指摘し合い、不正があればモデルが削除されます。オープンソースはすべてが透明なので、相互監視で不正を防ぐ文化があるといいます。
Stable Diffusionは今どうなった?「あの人は今」企画の誕生
Hugging Faceの話から、かねりんさんは、以前Stable Diffusionのモデルをよくダウンロードしていたことを思い出します。しぶちょーさんも、あの時期はワクワクして楽しかったと振り返ります。
かねりんさんが「Stable Diffusionはもう下火なのか」と尋ねると、しぶちょーさんは、ローカルで動き、学習データを自分で選べたり作れたりするので玄人には使われているのではと答えつつ、確かに話題には上らなくなったと認めます。
あの人は今シリーズね。あんなに驚かれてたあの人は今どこにいるんだみたいな。
この流れから、かつて話題になったAIのその後を調べる企画が生まれました。かねりんさんがMidjourneyも過去の存在に感じると話すと、しぶちょーさんは今も使われていると思うとしつつ、11月末の時点ではnano bananaが強すぎる状況だと話しています。
雑談は、しぶちょーさんが一晩で1万枚ほど生成した画像の保存場所を忘れてしまった話や、イラストレーターの権利をめぐる論争のその後にも及びました。しぶちょーさんは、生成AIの生成物をめぐる著作権違反で国内初の逮捕があった気がする、と記憶ベースで触れています。
今日の落ち着きポイントは「まずベンチマークを見る」
話を戻したしぶちょーさんが示した今回の結論は、新しいモデルが出たら、まずベンチマークを見て落ち着こうというものです。紹介したリーダーボードのリンクと各指標の説明は概要欄にまとめ、全部ブックマークしておけばいいと話しています。
そういう知ってるか知らないかでね、なんかグラフ出てきた時、あーなんか難しそうなグラフだって思わないで、あ、これはなんか落ち着きAIで聞いたぞって。
かねりんさんも「落ち着きの武器を手に入れた感じ」と応じます。「なんかすごそう」で思考停止するのではなく、どの指標の話かを見分けられるようになること、そして困ったら誤メンションに気をつけつつ番組にメンションしてほしい、という呼びかけで回は締めくくられました。
まとめ
LLMのベンチマークには、MMLUやGPQAのような定量的なテストと、Chatbot ArenaやLLM-as-a-Judgeのような動的な評価があり、それぞれ測っている能力が違います。テストデータの漏洩やグッドハートの法則といった落とし穴も知ったうえで、複数の指標を見比べることが、新モデルに振り回されない近道だと語られました。
- ベンチマークはAIの能力を客観的に比べるための標準化されたテストで、主要なものだけで200以上ある
- MMLUは知識、GPQAは推論、GSM8Kなどは数学、LiveCodeBenchなどはプログラミングと、測る能力が分かれている
- 公開されたテストは学習データに混入しやすく、指標が目標になると汎化性能が落ちる「グッドハートの法則」も起こる
- 人間が審査するChatbot Arenaは使いやすさを、日本語はNejumi LLM Leaderboardを、定量的な指標と合わせて見るとよい
- 順位は抜いた抜かれたを繰り返すため、特定モデルを断定するより、リーダーボードで自分で確かめる姿勢が大切





