「旋盤のゲームを作って」の一言で何がわかる?
おちつきAIラジオの今回は深掘り回で、テーマは「自分なりのAIベンチマークテストを作ろう」です。しぶちょーさんは、AIモデルが次々に出てくる今だからこそ、自分なりの指標を持っておくことが「落ち着きのため」に大事だと話します。
ゴールは、まだ自作ベンチを持っていないかねりんさんのオリジナルベンチを完成させることです。かねりんさんは、しぶちょーさんが新モデルのたびに自分のベンチで試し、「正しく驚いている姿」をうらやましく見ていたといいます。
しぶちょーさんが毎回使っているのは、自作の「旋盤ゲームベンチマークテスト」です。旋盤 ── 材料を回転させながら刃物を当てて削る工作機械。円筒形の部品などを加工するのに使われ、ものづくりの現場では基本的な機械の一つですをテーマにしたHTMLベースのゲームをAIに作らせ、その出来で性能を比べます。
旋盤ゲームなら、削りカスがモーションとして出るか、削るにつれて形状が変わるか、どんなパラメーターでゲーム性を持たせているかなど、いろいろな視点で評価できます。驚いたことに、プロンプトは「旋盤のゲームを作ってください」の一言だけだそうです。
なんかめちゃめちゃ凝ったプロンプト作んなきゃいけないかと思ってた。
ある程度固定した部分はあった方がいいんだけど、俺の場合も旋盤のゲームを作ってくださいで、一言。
しぶちょーさんによると、旋盤ゲームベンチは1年前には「てんでダメ」でしたが、今はクオリティの高いものがだいぶ作れてしまい、ベンチとして機能しなくなるほど頭打ちになってきたといいます。
「月10万円稼いできて」はなぜベンチに向かない?
話の途中で、かねりんさんが「月10万円稼いできてください」というベンチを思いつきます。10万円という絶妙な額なら、AIごとに稼ぎ方の差が出そうだという発想です。
しぶちょーさんは計画を立てさせるならいいかもしれないとしつつ、実行までやらせるのは難しいと答えます。結果が出るまで1〜2週間かかると、モデルが良かったのか、ほかの何が良かったのか分からなくなるからです。
結局30分ぐらいで試せるやつがいいベンチマークなのよ。
しぶちょーさんは、時間がかかりすぎると、モデル同士やeffort(推論の設定)ごとに比べたいときに並べられなくなると説明します。さらに、発信をする立場なら、結果をビジュアルで見せられるものが好ましいといいます。
「月10万円」ベンチと旋盤ゲームベンチを並べると、しぶちょーさんの考える良いベンチの条件が見えてきます。
結果が出るまで長くかかり、要因が切り分けにくい。成功も失敗もビジュアルで表現しにくい
30分以内に結果が出て、同じ条件で何度も比べられる。出来上がったゲームを見せて共有できる
かねりんさんは「そういう考え方するんだって勉強になった」と受け止めます。しぶちょーさんも、AIを発信する身として1日かかるベンチは厳しいと話し、すぐ試せて自分なりの視点が入っていることを重視しています。
専門家にしか見えない「違和感」こそ物差しになる
かねりんさんは、以前の話を覚えていて、自分の専門領域でベンチを作るべきだと先回りします。専門外だと、AIが細かいところを分かっているのか、良いのか悪いのかを評価できないからです。
かねりんさんの専門は刑事司法の実務なので、刑事が犯人を探すゲームのような案は浮かぶものの、ピンとこなかったといいます。しぶちょーさんのように、ビジュアルで分かる専門領域がないことが悩みでした。
しぶちょーさんは、サイエンストークのレンさんと話したときの例を挙げます。レンさんは、生成AIが描くDNAの螺旋の巻き方向を確認していたそうです。
巻き方向は決まってるんだって。だけどAI的にさ、結構逆も出てくるのよ。遺伝子の画像生成してってやるとさ、右巻き左巻きみたいな両方出てくる。
科学系の書籍を出す出版社も、DNAの巻き方向が逆だと正しくないため、とても気にしているといいます。素人には気にならない部分でも、専門家の目には明らかな誤りに見えるということです。
かねりんさんは、刑事ドラマを見て細かいところが現実と違って気持ち悪いと感じるのと同じだと理解します。しぶちょーさんは、製造業でも同じで、細かな文脈をどこまで把握しているかがベンチとして有効になると話します。
「自分にはそんな専門はない」と思うリスナーに向けて、しぶちょーさんは、仕事をしている以上、誰でも何かしらの専門的なことをしているはずだと語ります。
脱線:ビデオポッドキャストに意味はあるのか
かねりんさんの「専門は顔芸かも」という冗談から、話はビデオポッドキャストの価値に脱線します。しぶちょーさんは、一人で配信している自分のポッドキャストで、ビデオに意味があるのか疑問を感じているといいます。
しぶちょーさんによると、YouTubeライクに振った動画を出すと、ポッドキャストの再生数が露骨に減るそうです。視聴がYouTubeに分散し、その回はパスされてしまうといいます。
手間の問題もあります。しぶちょーさんは、家からだとアップロードに8時間かかったうえ途中でエラーになることがあり、9時に閉まる図書館まで行ってアップロードしているそうです。
いや、めんどくせえんだって本当にさ。
一方で、Apple Podcastsでおすすめに表示されるなど、ビデオをやっていた恩恵もあったとしぶちょーさんは認めています。ただ、その恩恵は今のところAppleくらいだといいます。
しぶちょーさんは、対談のポッドキャストなら表情が映る価値があると考えています。けれども一人喋りの場合、動画があることで身振り手振りに頼った話し方になってしまうのが気になると話します。
音よりも画像を頼りにする話術になる部分がやっぱあって、動画があるってことで。
かねりんさんも、「動画を見ている人だけなんですけど」と言いながら何かを見せるのは、音声だけで聞く人には忍びないと同意します。しぶちょーさんは、音声で完結させる方向にきちんと取り組もうと考えたそうです。
ショート動画がインスタで3〜4万再生されたわけ
しぶちょーさんが最近気づいたのは、動画に振るなら動画に振り切ったほうが伸びるということです。YouTube向けに作った動画をショート動画にしてInstagramに出したところ、大きく伸びたといいます。
バズったのは、案件として作ったKENZOの動画で、図面を見ながら部品の形を語るマニアックな内容でした。しぶちょーさんは、動画を作る段階からショートに展開できるようセクションを分けていたそうです。
しぶちょーさんのアカウントで共同投稿しているため、バズった動画の前後にあるおちつきAIのショートも引っ張られて伸びたといいます。かねりんさんは「ちゃんと共同投稿してる意味あるんだね」と反応します。
しぶちょーさんは、ながらAIのウルフさんが出している「赤ちゃんのコンサル」のようなショートにも触れ、プラットフォームに合わせたコンテンツで認知を取る技も必要だと考えています。一人喋りのポッドキャストは、最初から縦で撮ってもいいのではないかとまで話します。
ただし、しぶちょーさんがショートを研究して分かったのは、伸びているショートは普通に面白いということでした。切り抜きは労力が少ない一方、プラットフォームにAIの量産コンテンツとして見られているのかもしれない、という推測も出ます。
かねりんさんは、ポッドキャストはSNSが嫌でたどり着く島のはずなのに、伸ばすためにまたSNSに戻るのは「逆流性食道炎」だと例えます。しぶちょーさんも、エンゲージメントと無縁の世界に来たのに、という矛盾を口にします。
エンゲージメントみたいなものとは無縁の世界のためにポッドキャストに来たはずなのに、ポッドキャストを伸ばすためにまたそういう世界に行かなければならないという矛盾。
声の切り貼りでAIを試す「手動ボイスクローン」案
SNSの話から、かねりんさんが一つの案を思いつきます。番組の膨大な音声から1文字ずつ切り取ってつなぎ、昔のニコニコ動画の音声素材遊びのように、面白いことを言わせるというものです。
(切り貼りは)ボイスクローン作るよりよっぽど面白いよね。
しぶちょーさんは、これを「手動ボイスクローンベンチマーク」として使えると話を戻します。素材は番組の音源で基本的に固定され、やることとアウトプットは明確なので、あとはモデルに好きにやらせて比べられるからです。
しぶちょーさんは、かねりんさんのクリエイター視点で評価できるうえ、投稿後の反応もスコアとして見られると評価します。かねりんさんは、長くポッドキャストを続けてデータを持つ人にしかできないベンチになると喜びます。
自作ベンチは「定性」でいい。ペリカンベンチが示したこと
しぶちょーさんは、自作のベンチマークは定量的でなくてよく、定性的でよいと話します。かねりんさんの「それ何?」という質問に、しぶちょーさんが説明します。
数値で測る評価。スコアがいくつ、のように確実に数字で出る
ここが良くなった、のように感覚で判断する評価。かねりんさんいわく「エモいね」
新しいモデルが出るたびに発表される主要なベンチマークは、多くが用意されたテストでどれだけできるかを数字で示します。人がどちらの回答を好むかを投票するLMアリーナ ── 2つのAIの回答を人が見比べて投票し、その結果からモデルの順位をつけるサイト。数字のテストとは違う角度の評価として参照されますのような形式もあります。
しぶちょーさんは、主要ベンチの問題として、テスト内容に特化してしまうことと、すでに飽和していて90点を95点に上げるような勝負になりがちなことを挙げます。そのため、自分の実際のタスクでどれだけ性能が上がったかは分からないといいます。
だから自分ベンチみたいなやつを一個持っておくといいよねっていう話なんだよね。
個人の自作ベンチにも有名なものがあり、代表例が「ペリカンベンチ」です。自転車に乗るペリカンのSVG ── 線や図形を座標とコードで表す画像形式(ベクター形式)。拡大しても粗くならず、テキストで書けるためAIが生成しやすい特徴がありますを作らせるというものです。
しぶちょーさんによると、ペリカンベンチは2024年ごろから行われていて、適当に始めたわりにAIの実力と比例してクオリティが上がり、性能との相関が取れていたそうです。ペリカンなのは、ウサギと違って自転車に乗っている姿を見たことがないからではないか、としぶちょーさんは推測します。
しかし、そのペリカンベンチも今はほぼ引退宣言をしているといいます。どのモデルも良すぎて違いが出なくなり、性能との相関が取れなくなったためです。
しぶちょーさんの旋盤ゲームベンチも同じ状況で、上か下かではなく「ただ種類が違う」という出力になってきたため、作り直さなければと考えているそうです。
自分流AIベンチマークを作る5つの視点
ここから本題として、しぶちょーさんが自分流ベンチマークを作るうえで必要なことを整理します。前提は、テストである以上、何を見て判断するかを先に決め、評価しやすいアウトプットを出させることです。
旋盤ゲームベンチの場合、旋盤という機械がちゃんと表現されているか、ゲーム性はどうか、バグがなく遊べるか、クリア後に次へ進むか、どれだけリアルの旋盤を表しているかなど、評価軸がいくつもあります。見るだけでなく実際に遊んで試せるのも特徴です。
しぶちょーさんが挙げた視点は次の5つです。
「任せたい仕事の縮小版」の例として、しぶちょーさんは、ポッドキャストのコンテンツ作りにAIを使いたいなら、さっきの声の切り貼りベンチが当てはまると話します。かねりんさんは、どれぐらいのデータ量があれば滑らかに何でも言えるのか、という見方もできると広げます。
段階評価について、しぶちょーさんは旋盤ゲームなら、起動する、主軸が回る、工具を当てられる、削れる、と段階があると説明します。切り貼りなら「作れたけど言葉を間違える」のように段階で見られるといいます。
できるできないの中にここまでできたよねっていう、このランクがつけれるようなもの。
「一目で分かる」の最たる例がペリカンで、並べたときのコレクション性もあり、SNSにも投稿しやすいといいます。しぶちょーさんは、絶対的な正解はないとしつつ、この5つの視点で作り、頭打ちになったら作り替えるのがよいとまとめます。
固定課題・派生・3〜5回の試行で「ナーフ」も見抜く
しぶちょーさんはさらに、いつも同じお題で試す「固定課題」と、それを少し変えた「派生」を作れるようにしておくとよいと話します。旋盤ゲームならフライス盤やボール盤のゲーム、ペリカンなら一輪車に乗るペリカンといった具合です。
かねりんさんの切り貼りベンチなら、おちつきAIではなく別の番組「おちつき地方創生」のデータでやってみるのも派生になるとしぶちょーさんは例を挙げます。派生でも違いが出なくなったら、また作り直していくのがよいそうです。
表に出さない秘密のお題は「シャドウ」と呼ばれます。しぶちょーさんによると、ペリカンベンチは有名になりすぎて急にうまくできるようになり、ペリカンに最適化されて学習に取り込まれたのではないか、という説が出たそうです。
その説を確かめるため、ペリカン以外のものに移し替えて試す検証も行われたといいます。有名になったベンチは最適化されやすいということです。
| 種類 | 中身 | 役割 |
|---|---|---|
| 固定課題 | 毎回同じお題(旋盤のゲームを作って) | モデル間や時期による違いを比べる |
| 派生 | 少し変えたお題(フライス盤、一輪車のペリカン) | 展開して違いを見る |
| シャドウ課題 | 表に出さない秘密のお題 | お題への最適化を見抜く |
かねりんさんはこれを、映画『インセプション』のトーテムに例えます。夢か現実かを判定するための自分だけの小道具で、他人が知ると機能しなくなるという設定です。
評価の観点として、しぶちょーさんは、できたかどうかやどれくらいできたかに加え、かかった時間、消費したトークンなどのコスト、UIやUXの良さを自分の感覚で点数化することを挙げます。そうすると前のモデルと比べてどこが良くなったかがつかめるといいます。
もう一つ大事なのが、1回で判定しないことです。偶然良い結果が出る場合もあるため、会話のセッションを分けて3〜5回ほど走らせるのがよいとしぶちょーさんは話します。
かねりんさんが、それでナーフ ── もとはゲーム用語で、キャラクターや武器が弱く調整されること。AIでは、提供中のモデルの性能が公開当初より下がったように見える現象を指しますも分かるのかと尋ねると、しぶちょーさんは分かると答えます。最近は3Dモデルを作らせるベンチで、公開直後と1週間後で性能が全然違う、という報告がXで出回っているそうです。
都市伝説じゃないよ。もう露骨だよ。
しぶちょーさんは、ペリカンの後継者はまだいないとしつつ、自作ベンチは必ずしもAIの性能そのものを測れるわけではないが、相対評価として1つ持っておくと落ち着きにつながると話します。
かねりんさんのベンチ探し:工場シミュレーター、名古屋弁、刑事
後半は、かねりんさんのベンチ探しです。しぶちょーさん自身も、旋盤ゲームでは差がつかなくなったため次を探していて、工場シミュレーターを試したものの、渋すぎてビジュアル的に分かりづらかったといいます。
しぶちょーさんは、ビジュアル系のお題はだいぶ飽和しているが、情報が少ないマニアックなもので、意外と違いが出て、自分が判定できるものなら差が出ると話します。かねりんさんは「超むずじゃん」と頭を抱えます。
しぶちょーさんが「名古屋弁」を挙げ、かねりんさんは刑事シミュレーションゲームしかないと返します。しかし刑事ものはドラマの情報に引っ張られ、「みんなバンバン銃撃っちゃう」ことになりそうだと二人は話します。
そこから、AIで自分の部屋が家宅捜索されたような押収品の写真を作るのがXで流行った話や、警察が押収品をきれいに並べて話題になった事件の話へと脱線します。かねりんさんは、AIの画像は「ぽいけど違う」と感じたそうです。
Web3もビジュアルがないため難しく、しぶちょーさんは「やっぱポッドキャストじゃない?」と提案します。ただ、AIに喋らせるとTTSの性能を測ることになってしまうという懸念も出ます。
しぶちょーさんは、SVGの動画はコードを書いて作るため、実質はコーディング能力を試しているようなものだと説明します。そのためClaudeでもペリカンベンチが試せるそうです。
かねりんさんは「すっげえ難しい夏休みの宿題」だと嘆きます。しぶちょーさんは、今日浮かばなくてもいいし、AIに自分の専門性を生かせるベンチを相談してみるのも手だと勧めます。
しぶちょーさんは最近、CADを使っておもちゃの旋盤を設計させるベンチも試しているといいます。かねりんさんは、5分ほどの音源を渡して面白い番組を作らせるのはどうか、と案を出し始めます。
伝説の欠損回をAIに補完させるという発想
かねりんさんが思いついたのは、自分の声が入っていない伝説の回を、AIに面白い番組にしてもらうというお題です。録音機材のトラブルで、しぶちょーさんの声しか残らなかった回のことです。
なかなか失敗しないから。失敗はお宝だよね。
確かめると、その回は収録日が2026年1月5日の新年1回目、第31回で、Manusの買収、Grokの暴走、AIチューバーのネウロ様などを扱った回でした。
しぶちょーさんは、同じ範囲の音源を使い、欠けた相方のセリフを補完して、ビジュアルも含めたビデオポッドキャストに復元できるかを試すとよいと具体化します。セリフの補い方はモデルに考えさせ、使える素材だけは指定しておくと結果がばらけにくいといいます。
二人は、このお題で測れる能力を整理していきます。
かねりんさんは、これは業務でAIを使いたい最終着地点だと受け止めます。しぶちょーさんは、今のモデルでバリバリできるものだと先の性能を測れないので、現行モデルでも満足なアウトプットが出ず、ばらつきがあるくらいの難しさがよいと話します。
尺について、かねりんさんが1分を提案すると、しぶちょーさんは1分では会話の流れが分からず、しぶちょーさんの部分が切り抜かれて終わってしまうと返します。5分や10分が候補になります。
人間より面白い対話ができたら?「引退ベンチマーク」
かねりんさんが本当に気にしているのは、AIが人間同士より面白い対話をできるかどうかです。そうなれば、人間同士で話す必要がなくなるからです。
しぶちょーさんは、欠損回でなくても、毎回どちらか片方の音源だけを使い、AIに代わりのしぶちょーさんやかねりんさんをやらせて面白いかを測ればよいと広げます。「AIかねりんVSかねりん」のような形です。
かねりんさんは、自分のことだから自分が一番の専門家で、ちょうどいいと気づきます。再現性より面白さを優先すべきだという点で、二人の意見は一致します。
かねりんの代替をするんじゃなくて、この文脈だったらこういう言葉がいいんじゃないかと思ってるような言葉を入れて。
(AIに)超えられたら、まあちょっと俺はMC引退を考えるってことだよね。
かねりんさんの声はTTSで用意しておき、文脈を補完したセリフと画像で動画を作らせる、というのが具体的な形です。TTS ── Text to Speechの略で、文字を音声に変える技術。声の質はどのTTSを使うかで決まるため、このベンチでは主に評価の対象外になりますの部分は切り離し、会話の中身を評価します。
しぶちょーさんは、「これは全然ダメ」「これは鋭いことを言ってきた」という度合いを、かねりんさんの視点で測ると面白いと話します。かねりんさんは自分のトレーニングにも使えそうだと感じ、しぶちょーさんも「俺これ視点なかったな」という発見があるはずだと応じます。
SVGの動画は長尺には向かず、GIFのような短い繰り返しが基本だという点は課題として残りますが、かねりんさんのベンチは「自分を超えてくるか」を測るものとして形になりました。
公式スコアは「お勉強」、自作ベンチは自分の物差し
何を作ればいいか分からない人へ、しぶちょーさんはペリカンベンチを自分の好きなものに派生させればいいと勧めます。かねりんさんは「カタツムリがスクーターに乗っている」、しぶちょーさんは「カブトムシがスケボーに乗っている」と例を出します。
最後に、しぶちょーさんは公式ベンチと自作ベンチの違いを整理します。
新モデルの公開時に出るスコア。あくまでAIのテスト結果、お勉強の結果
AIと自分の距離を測る物差し。自分の業務での性能向上を体感できる
自己流のベンチってのは、なんかAIと、ある種自分の距離を測るような、そういう物差しかなって。
かねりんさんは、スコアでは向こうが上らしいが自分のタスクではこちらが調子いい、という選び方ができると付け加えます。しぶちょーさんも、だからこそやらせたいタスクに近いお題がよいと結論づけます。
番組では、リスナーが作ったベンチをお便りやSNSで教えてほしいと呼びかけています。また、テーマごとに15分前後で切り出した回を毎日出す切り抜きチャンネルも始まったと告知されました。
アフタートーク:おもちゃの旋盤を設計させるベンチ
アフタートークで、かねりんさんは長年の夢だった自作ベンチができたと喜びます。ただ、変数が多いという自覚もあり、しぶちょーさんも、理想はチャットだけで試せるシンプルなものだと話します。
しぶちょーさん自身は今、世の中に存在しない「おもちゃの旋盤」をゼロから設計させ、コンセプトと設計を60〜90秒のSNS投稿用ショート動画にまとめさせるベンチを使っているそうです。自分が作っている設計は渡さずに試します。
(自分のアイデアよりいいのが)出てきた。あ、なるほどねって。
しぶちょーさんは、AIの出した設計に取り入れたいと思う箇所が何か所かあったといいます。ベンチは測るだけでなく発見の場にもなることが、最後の会話から伝わってきます。
まとめ
新しいAIモデルの良し悪しは、公式スコアだけでは自分の仕事に役立つかまで分かりません。しぶちょーさんは、専門分野で短時間に回せて結果が一目で分かる自作ベンチを持ち、頭打ちになったら作り直すことを勧めています。
- 自作ベンチは定性評価でよく、「旋盤のゲームを作って」の一言のようにシンプルでかまわない
- 良いベンチの条件は、目利きが利く・任せたい仕事の縮小版・段階評価・一目で共有できる・30分以内に回せる、の5つ
- 固定課題に加えて派生やシャドウ課題を持ち、3〜5回走らせると、最適化やナーフも見抜きやすい
- ペリカンベンチのように、どんな良いベンチもいつかは差が出なくなり「死ぬ」
- かねりんさんは、欠損回を補完させ人間より面白い対話ができるかを測る「引退ベンチマーク」にたどり着いた






