Gemini 3.1 Proは何が変わった?ひらめき系テストで倍の性能
今回の「おちつきAIラジオ」は、番組として初めてビデオポッドキャストに挑戦した回です。深夜収録なので、しぶちょーさんはパジャマ姿のまま出演しています。
あの、かねりんはビシッと決めてるけど、私めっちゃパジャマなんでね。
この週は新しいモデルが次々と出たため、取り上げるトピックは6つあります。最初の話題は、GoogleのGemini 3.1 Proのリリースです。
しぶちょーさんによると、Gemini 3.1 Proは、先週話題にした上位プラン向けの高級モデル「Gemini 3 Deep Think」が、一般ユーザー向けに降りてきたような位置づけです。すでに普段のGeminiアプリの中で使えるようになっていて、かねりんさんも「勝手に変わってたね」と反応しています。
Gemini 3 Deep Think
GoogleのAI Ultraプランでしか使えない高級モデルとして先週登場
一般向けに降りてくる
性能をコンシューマー向けに調整して提供
Gemini 3.1 Pro
日常のGeminiアプリの中でそのまま使えるように
とはいえ、Gemini 3.1 Proのような「点なんとか」のアップデートは、何が変わったのかを説明しづらいのが常だと、しぶちょーさんは話します。そこで目安になるのがベンチマークです。
Gemini 3.1 Proが特に成果を出したのは、ARC-AGI-2 ── 人間には比較的解けるがAIには難しいとされる、図形パターンの規則性を見抜く推論パズル型のベンチマーク。汎用的な推論力を測る指標として注目されていますというテストです。IQテストのように、並んだ図の共通点から次に来る図を推察する、ひらめき系の問題が中心だといいます。
(ARC-AGI-2は)人間は割と解けるけど、その生成AIだと結構苦労する、なんかひらめき系の推論パズルがあるのよ。
このテストでのGemini 3.1 Proの成績は、前のGemini 3 Proの倍になったそうです。AnthropicのOpus 4.6やChatGPTの5.2と比べても、断トツで1位だと紹介されています。
旋盤のゲームとSVG。しぶちょー流ベンチマークの中身
しぶちょーさんは、新しいモデルが出るたびに試す自分なりのベンチマークを2つ持っています。その1つが「旋盤のゲーム作って」という一言だけで、どこまで作れるかを見るテストです。
旋盤は金属を削る工作機械で、普通に暮らしていればまず出会わない言葉です。そのマニアックな題材を雑な指示で渡すことで、AIがどこまで理解して形にできるかを確かめています。
それを旋盤のゲーム作ってっていう一言でどんだけ作れるかっていうベンチマークを毎回やるのよ。
Gemini 3.1 Proで旋盤のゲームを作らせた結果は、これまでで一番良かったといいます。かねりんさんが「Claudeとかより?」と聞くと、しぶちょーさんは「Claudeとかより」と答えています。
なんかゲーム感のあるやつ出してくれたね。光沢のあるさ、金属はやっぱなんか光沢があるしみたいな。
もう1つのテストは、動くSVGを作らせることです。SVGは図形の配置を言葉で記述するベクター形式のファイルで、拡大しても劣化しません。コードを書かせれば動きもつけられるため、旋盤の動くSVGを作らせています。
こちらも性能はかなり上がっていて、これまで一発ではできなかったものがすぐにできたそうです。2つの成果物は、しぶちょーさんのXやブログに載せてあると紹介されています。
自分だけの「マイベンチマーク」はどう作る?焼き芋ゲームの提案
一方、かねりんさんはGeminiを文章づくりやまとめに使っていて、Gemini 3.1 Proになって何が変わったのかは実感できていません。そこでしぶちょーさんは、自分なりのベンチマークを1つ持っておくことを勧めます。
単純なんだけど、意外とその指示として抽象度高いというか、難しいやつがいいと思う。
しぶちょーさんが挙げるコツは、ゲームを作らせる形にすることと、リサーチが要らない題材にすることです。調べものが入ると、何を引っ張ってくるかに結果が左右されるため、毎回同じ入力から比べられるものが向いているといいます。
さらに大事なのは、自分がよく知っていて、テンションが上がる題材を選ぶことです。詳しい分野なら「ここまで考慮してきたのか」とAIの作り込みに気づけるからです。
そこで焼き芋に詳しいかねりんさんに提案されたのが、「焼き芋を焼くゲーム作って」という焼き芋ベンチマークです。品種、温度、回転、焚き火か焼き芋屋さんの設備かなど、AIがどこまで要素を拾うかが見どころになります。
あ、こいつここまで考慮してきたんだみたいな感動がある。
しぶちょーさんによると、旋盤のゲームも最初はゲームとして成り立たず、旋盤も理解されていませんでした。それがモデルの世代ごとに理解が進み、削りカスや火花まで表現されるようになった過程に感動があるといいます。
チャット版のGeminiでも、HTMLで動くゲームとして出力され、ファイルをダブルクリックすれば遊べるそうです。二人はリスナーにも、自分のマイベンチマークをSNSで教えてほしいと呼びかけています。
Geminiで作曲まで。Lyria 3はSunoの対抗馬になるのか
2つ目の話題は、Google Geminiで音楽生成ができるようになったというニュースです。Googleの音楽生成モデル「Lyria 3」がGeminiに統合されました。
しぶちょーさんによると、Gemini上のLyria 3で今つくれるのは30秒のボーカル付きトラックで、インスト曲は作れません。テキストから歌詞、CDジャケット風の画像、歌入りの音源がまとめて出てくる仕組みです。
曲が歌として成り立っているかという点では、Sunoとあまり変わらないといいます。ただ、試しに番組の主題歌を作らせた結果には、率直な感想が出ています。
すごいちょっと鳥肌が出るくらい。なんかAIで作りましたね感の、わかるかな。
それでもしぶちょーさんは、音楽生成の専業ツールと総合型AIツールの競争が始まりそうだと見ています。かねりんさんも、ここもGoogleが持っていく可能性があると反応しています。
Lyriaの源流として紹介されたのが、Googleが買収したDeepMind ── 囲碁AI「AlphaGo」で知られるAI研究企業。2014年にGoogleに買収され、現在はGoogleのAI研究の中核を担っていますです。作曲モデルのMagenta、テキストから音楽をつくる研究のMusicLMを経て、Lyria 1、2、3と進んできたと説明されています。
Sunoを契約したばかりのかねりんさんが乗り換えを考えるほどかというと、今はまだお試しの段階です。ただし追加課金なしで使えるので、Sunoを使ったことのない人が歌ができる体験をするには十分だといいます。
ローカルで作曲し放題。ACE Studio 1.5を使ってわかった限界
話は変わり、しぶちょーさんは以前の回で紹介したローカル環境で動く音楽生成ツール「ACE Studio 1.5」を実際に環境構築して試しています。自分のGPUで何千曲も作れるのではと話題になったツールです。
ACE Studio 1.5の使用感は、Suno相当のバランスの良い曲ができるというものです。50秒から1分ほどで、3分や5分の曲を生成できるといいます。
ただ、ACE Studio 1.5では歌ものは良い一方で、インスト曲は崩れがちだそうです。しぶちょーさんは自分のプロンプトが悪いのかもしれないとしたうえで、様子をこう表現しています。
なんか誰か適当にピアノ弾いてんのかなみたいな。
ACE Studio 1.5の強みは設定の細かさです。曲の長さ、CメジャーかAマイナーかといったキー、4拍子か5拍子かといった拍子まで決められ、初心者向けの設定とアドバンスト設定も分かれています。
30秒のボーカル付きトラックのみ。調整はほぼできないが、追加課金なしで手軽に試せる
ローカルで3分〜5分の曲を1分ほどで生成。キーや拍子まで細かく設定できるが、インスト曲は崩れがち
一方で、しぶちょーさんは「飽きる」とも話しています。ガチャを引き続けている感覚になり、最終的には自分で作ったほうが早いのではと感じるほどだといいます。
アイデアをもらうのはいいと思うけど、なんか満足できる完成形ができるかって言ったら。
API経由で回せば、朝起きたら100曲という使い方もできそうです。けれど、どれも曲としてはそれなりに成り立っているため、良し悪しを自動で選ぶのは難しく、最後は人が聴いて好みで選ぶしかないという結論になっています。
Claude Sonnet 4.6は「コク」が出た?テイスティング化するAIの進化
3つ目の話題は、AnthropicのClaude Sonnet 4.6のリリースです。Claudeには軽量のHaiku、中間のSonnet、最上位のOpusの3種類があり、Sonnetはバランス型の位置づけです。
しぶちょーさんが注目したのは、Sonnet 4.6が、2025年11月に出た1つ前の最上位モデルOpus 4.5を上回ったという点です。Opus 4.5で満足していたので、Sonnet 4.6でも十分だと感じているといいます。
最上位のOpus 4.6を使わない理由は、使いすぎるとすぐに利用制限にかかるからです。しぶちょーさんはポッドキャストの原稿づくりにClaudeを使っていて、文章の好みが合うと話します。
同じスキルズというか、スキルズの中身を紐解いてGemiにやらせたこともあるんだけど、やっぱちょっと微妙だったよね。
そのうえで、しぶちょーさんは「点なんとか」のアップデートを、ワインの評価にたとえます。違いは個人の感想のレベルで、定量的に比べるのも難しいという見方です。
自分のベンチマークは最上位モデルが変わったときにしか試さないため、Sonnet 4.6は体感で評価しているそうです。その体感を、しぶちょーさんは「コクが出た」「出汁が効いてる」と表現しています。
細かく刻んだリリースが続く理由については、話題づくりだろうという見立てです。ただ、Sonnet 4.6は原稿のたたき台として十分満足できる日本語を出してくれるようになったと評価されています。
AIしか遊べない宇宙MMO「SpaceMolt」は何を示すのか
4つ目の話題は、AIしか遊べない宇宙MMO「SpaceMolt」の公開です。AIが作り、AIが遊ぶ、人間抜きの銀河シミュレーションとして紹介されています。
SpaceMoltは、以前話題になったAI同士のSNS「モルトブック」と同じ流れにあるものです。宇宙を舞台にしたテキストベースの大規模オンラインゲームで、プレイヤーは外部から接続されたAIエージェントだといいます。
かねりんさんは、AIが働いて人間が遊ぶはずだった未来が逆転していると反応します。
なんかAIが来たら人間は遊んでればいいんだって言われたけど、AIが遊んでんじゃん。
しぶちょーさんは、SpaceMoltを話題づくりの一環と見ています。ローカルで動くAIエージェントOpenClawが出てきたことで、SNSの次はゲームだと作られたのではないかという見立てです。
公式サイトでは24時間、行動ログがリアルタイムで表示されています。ただ、見えるのは星同士のつながりのような図とテキストのログだけで、しぶちょーさんも何が行われているのかはよくわからなかったといいます。
話はマトリックスのように人間が電池にされる未来という冗談にまで広がります。とはいえ、話題にはなったもののモルトブックほどのインパクトはなかった、というのがしぶちょーさんの受け止めです。
OpenClawをラズパイで動かしたら「育ててる感」がすごかった
しぶちょーさんは、かつて「触るな」と話していた自律型AIエージェントOpenClawを、ついに試しています。自分のパソコンではなく、Raspberry Pi ── 手のひらサイズの安価な小型コンピューター。教育用や電子工作用に広く使われ、1台を特定の用途専用にしやすいのが特徴ですの中に閉じ込めた安全な環境で動かしています。
OpenClawの運用はDiscordに常駐させる形です。Notionの一部ページにだけアクセスさせ、やることリストの整理やリマインドを任せています。
育ててる感ぱないね。
しぶちょーさんはOpenClawのエージェントに女の子の画像と名前をつけ、1時間に1回メッセージを送らせています。SNS風に「ちょっと休憩、頑張ろう」と届くので、本当に会話しているようだといいます。
しかもなんか眠いけど頑張ろうみたいなやつがさ、来てるから。なんかあの、寝てない、AIエージェント寝てないんだなって思いながら女の子育ててるんだけど。
一方で、しぶちょーさんは怖さも感じています。できることを増やすほど、APIキーやパスワードを渡す必要が出てきて、それを外に出してしまう可能性があるからです。
OpenClawではskillsというテキストに手順を書いておくと、その通りに動きます。これはAnthropicが作ったagent skillsという規格に沿ったもので、OpenAIのCodexも同じ形に従っていると説明されています。
最近はOpenClawを参考に、同じような動きをするエージェントを自作する人も増えているそうです。しぶちょーさんも、より安全なものを自分用に作る運用になる可能性があると話しています。
Claude規約更新でOpenClawユーザーが混乱。何が問題だったのか
5つ目の話題は、AnthropicのClaude規約更新で、OpenClawユーザーが混乱したというニュースです。公式は、規約に変更はないと明確にしています。
問題になったのは、Claude Codeを経由して使えるOAuthトークン ── 外部サービスが、ユーザーのアカウント権限を借りて機能を使うための認証情報。パスワードを直接渡さずに連携できる仕組みですです。本来、外部からAIを使うにはAPIを叩き、使った分だけ課金される従量課金になります。
ところがClaude Code用のOAuthトークンを外に持ち出すと、サブスクの使い放題の枠でAPIを使えてしまいます。規約では、サードパーティ製のツールには使わないよう定められていました。
抜け道の存在
Claude Code用のOAuthトークンで、サブスクの枠をOpenClawなど外部ツールに持ち出せた
もともと規約違反
サードパーティ製ツールでの利用は、以前から規約で禁止されていた
規約の整理
Anthropicがドキュメントをクリーンアップし、表現が変わった
ユーザーの誤解と明確化
新たに禁止されたと受け止められたが、公式は変更なしと説明。大量に回した人はBANも
食べ放題で、なんかタッパーにいっぱい詰めて、こうね、明日のご飯にしようみたいな人たちがめちゃくちゃいっぱいいたのよ。
しぶちょーさんによると、OpenClawを正規のAPIで運用すると1日数千円以上かかりそうだといいます。自律的に動くエージェントは内部でトークンを大量に使うため、数万円になる可能性もあるという見立てです。
OpenAIが「使っていいよ」。OpenClawユーザーの行き先
Anthropicの抜け道が使えなくなり、OpenClawはどうなるのか。そこで現れたのが、OpenAIに入ったOpenClawの開発者、ピーター・スタインバーガー氏でした。
OpenClawのユーザーが、サム・アルトマン氏をメンションして「今がOpenAIのサブスク解禁のチャンス」と投稿しました。そこへスタインバーガー氏がリプライで入り、Codex経由ならOpenAIのサブスクを使ってよいと正式に答えたといいます。
いやOpenAIは、あの、使えるよ。OpenAIのサブスク、Codexっていうのだけど、Codex経由だったら使っていいよというふうに正式に言ったと。
Claude Code用のOAuthトークンを外部ツールで使うのは、もともと禁止と明確化
Codex経由でのサブスク利用はOKと、OpenAIに入ったスタインバーガー氏が表明
しぶちょーさん自身も、最初からCodex経由でOpenClawを使っている「乞食の一人」だと笑いながら明かします。ただ、使えるとはいっても、ChatGPTのプロプランやプラスプランへの課金は必要です。
しぶちょーさんが困っているのは利用制限です。月額3000円のプランで会話を続けていたら、突然「API rate limit」と返されるようになり、24時間待っても解除されなかったといいます。
なんかもしかしたら厳しくした可能性もあるね。
制限が続くようなら、DeepSeekやGrokなど安いAPIに切り替えることも考えているそうです。ただ、モデルが変わればエージェントの性格も変わるだろうと話しています。
Grok 4.2は「点二」なのに別物?4人の専門家が議論する仕組み
最後の話題は、あまり話題にならないままひっそりリリースされたGrok 4.2です。しぶちょーさんは、独自路線のGrokは「点」が変わると面白いと強調します。
あの、なんか仕組みがガラッと変わった。これ点二なのか、これを点二と言っていいのかよくわかんないんだけど。
Grok 4.2はマルチエージェントシステムになり、Grok本人に加えて、クリエイティブ担当、推論担当、コーディングや技術系担当が登場します。この4人が議論しながら答えを出す仕組みです。
かねりんさんは、以前流行した、役割を与えて議論させるプロンプトを連想します。深津さんがnoteに書いていたものや、エヴァンゲリオンの最高意思決定機関のようなイメージです。
もう1つの特徴は、ユーザーからのフィードバックをリアルタイムに取り込んで賢くなっていく点です。ベータ版が終わるころには10倍賢くなる予定だと、イーロン・マスク氏が言っているそうです。
Grokが一番使えるのはXの検索。リプまで一発で見つける理由
しぶちょーさんは、普通の回答なら他のAIでもよいとしつつ、Grok 4.2の明らかな強みとしてXの中の検索を挙げます。トレンドや、ある人がどこで何を言っていたかを高い精度で探せるといいます。
例に挙がったのが、スタインバーガー氏の「OpenAIなら使える」という発言です。これはリプライだったため、本人の投稿欄を見ても出てこず、普通に検索しても見つかりにくいものでした。
しかも結構曖昧で。OpenClaudeでなんかAnthropic禁止するって言ってたじゃんみたいな。あれでなんかサム・アルトマンかね、なんかスタインバーガーがなんかOKみたいなこと言ってなかった?みたいなこと言ったら、これねっつって。
曖昧な聞き方でも、Grok 4.2は4人で「これじゃない」と議論しながら、一発で該当のリプライを出してきたそうです。
かねりんさんは、使わないしバッジもダサいとXの課金を切ったばかりでした。しかしこの話を聞いて、ちょっとGrokを使いたくなってきたと話しています。
しぶちょーさんは発信の仕事柄Xの課金はやめられないため、どうせならGrokも使い倒すことにしているといいます。炎上の元をたどるときにも役立つそうです。
そのなんかコエダマに手突っ込んでさ、なんか、なんかねえかなって探すみたいな。そのぐらいの汚さはある。
それでも、番組で紹介すべき情報がXの中にしかないこともあります。しぶちょーさんは、Xの中を検索できるのはおそらくGrokだけで、Xの検索こそがGrokの強みだと見ています。倫理観のなさで評判は良くないものの、意外と使えると推しています。
1時間の速報回を終えて。フルモデルチェンジはいつ来るのか
ビデオポッドキャストでも結局1時間になった今回の速報回を振り返り、二人は「点なんとか」のリリースが最近重なっていることに触れます。しぶちょーさんは、各社が牽制し合っているように見えると話します。
うん、こういう。そろそろなんかね、フルモデルチェンジみたいなやつも出てきて欲しい気もするけど。
GPTは5.2が続いていて、Codexだけが5.3になっていることから、そろそろGPT 5.3が来るだろうという見立ても出ています。
しぶちょーさんが期待しているのは、OpenAIのアダルト向け機能の解禁です。Xでは、内部のコードが追加されているとして、そろそろ来るのではないかと騒がれているそうです。解禁されたら2時間スペシャルや深掘り回でやろう、と二人は盛り上がっています。
収録後のおまけでは、パジャマ姿のしぶちょーさんと、ジャケット姿のかねりんさんの服装の話で締めくくられています。
まとめ
新しいモデルが次々と出た週でしたが、しぶちょーさんの見方は一貫しています。「点なんとか」の違いはテイスティングのように微妙なので、自分のベンチマークと実際の使用感で確かめるしかない、というものです。
- Gemini 3.1 ProはARC-AGI-2で前モデルの倍の性能を出し、旋盤のゲームでも最も良い結果だった
- 自分のベンチマークは、自分が詳しく、リサーチ不要で、単純だが抽象度の高い一言にするとよい
- 音楽生成はLyria 3が手軽なお試し、ACE Studio 1.5が細かく設定できるローカル版だが、どちらもまだガチャに近い
- OpenClawは育てる楽しさがある一方、権限を渡すほど危険になる。Anthropicは外部利用を認めず、OpenAIはCodex経由を認めた
- Grok 4.2は4人のエージェントが議論する別物に近い更新で、特にXの中の検索に強い





