SLMはなぜ「驚き屋」にスルーされるのか
今回のテーマは「ちっちゃい言語モデルSLMで驚こう」です。SLMはスモールランゲージモデルの略で、しぶちょーさんは、今後AIがシフトしていく方向の可能性の一つだと位置づけます。
かねりんさんは、ふだん皆が驚いているのはLLM、つまりラージランゲージモデルのほうで、SLMがすごいという話はあまり見ないと指摘します。しぶちょーさんによると、まさにそこがポイントで、SLMはAI驚き屋さんにとって驚きにくい題材だといいます。
SLMってのはさ、基本的にそれ(LLM)をちっちゃくしたモデルだから。LLMにできてたこと以上のことはできないわけ。
なんだけど、ちっちゃいから、ちっちゃいこんなモデルでもこんなことできましたよっていう話になるわけ。だからそれって正しい知識がないと驚けないですね。
SLMの価値は「新しいことができる」ではなく「LLMでできていたことを小さなモデルでもできる」点にあります。インパクトが伝わりにくいため、今回はその価値に正しく驚ける知識をつけ、さらに番組の方針である行動変容、つまり具体的なアクションまで落とし込むと予告されます。
ClaudeCodeと同じ構造の「地味なすごさ」とは
しぶちょーさんは話を少し広げ、驚き屋さんが驚けないものの代表格としてClaudeCodeを挙げます。今では「使えないとダメ」と言われるほどですが、出始めた当初はほとんど話題にならなかったそうです。
かねりんさんは、父親からClaudeCodeの使い方を聞かれ、使っていないと答えたところ、番組であれほど話しているのにと叱られたというエピソードを披露しています。
だってコマンドラインで動くっていうことが、何なのかよくわかんないって人が多くて。
しぶちょーさんによると、エンジニアは「これは使える」とすぐに気づいた一方、エンジニアではない驚き屋さんはClaudeCodeに反応しなかったといいます。SLMも「何に驚けばいいのか分からない」という点で、ほぼ同じ構造を持っていると説明されます。
さらに、驚き屋さんが取り上げないと技術が広がりにくいという面もあります。しぶちょーさんは、驚き屋さんは不安をあおる部分もあるものの、話題を作り出すのはうまいと評価します。
彼らのそういう発信を利用し、我々が是正し、正しい知識とするっていうところがやっぱ一番いいんじゃない。
かねりんさんが「表でプロレス」と表現すると、しぶちょーさんも共生関係のようなものかもしれないと応じ、SLMの本題へ移ります。
LLMとSLMは何が「大きい」のか?パラメータの正体
LLMとSLMの違いは名前のとおり大きさですが、何が大きいのかという問いに、かねりんさんは前回の話を覚えていて「パラメーター数」と答えます。
しぶちょーさんによると、LLMはパラメータが数兆個規模とされる一方、数百万から数十億ほどのものをSLMと呼びます。ただし厳密な定義はないそうです。
パラメータを理解する前提として、しぶちょーさんはニューラルネットワーク ── 脳の神経細胞のつながりを数理モデルとして模した仕組み。多数の計算の単位を層状につなぎ、つながりの強さを調整することで学習しますを説明します。脳ではニューロンという神経細胞がシナプスでつながり、電気信号のやり取りで思考や判断をしており、それを真似て作られたのがニューラルネットワークです。
どれぐらいの強さでつなぐんですかっていう、そのシナプスの強さ。これがパラメータです。
専門用語では「重み」と呼ばれるこの数値が、つながり一つひとつに設定されています。かねりんさんが「閾値みたいなもの」と言い換えると、しぶちょーさんはそれを肯定しています。
学習とは、この数値を更新していくことです。問題を解かせ、間違えた分だけバックプロパゲーション ── 出力と正解のずれをもとに、出力側から入力側へさかのぼって各パラメータの修正量を計算する手法。ディープラーニングの学習の基本技術ですで正しい答えに近づくようパラメータを微調整し、それを何度も繰り返すのがディープラーニングの学習だと説明されます。
問題を解かせる
入力を与え、つながりを通して答えを出す
正解と比べる
答えが合っていたか間違っていたかを確認する
パラメータを微調整
間違えた分だけ、正しい答えに近づくよう数値を更新する
繰り返す
何度も計算を重ね、正しい答えを出せるようになる
「点」には何が入っている?層で捉える特徴
かねりんさんは、つながりの数値がパラメータだとして、つながれる「点」そのものには何が入っているのかと繰り返し質問します。
しぶちょーさんによると、点にも数字が入っていて、入力された情報が次々と伝わっていきます。点の並びは層状になっていて、この層がたくさんあるのがディープラーニングです。
入ってきた画像入ってきました。じゃあまず色見ましょうねとか、テクスチャー見ましょうねとか、形の輪郭見ましょうねみたいなものが、層ごとに分かれていくわけ。
犬の画像の例では、色、テクスチャー、輪郭などを層ごとに捉え、最後に統合して「犬」と判断します。こうした役割は人が設計するというより、学習の中で自然に作られていくそうです。
しぶちょーさんは、脳にも意識をつかさどる特定の部位はなく、ニューロンのつながり全体の中に意識があると言われている点を挙げ、ニューラルネットワークも点の一つひとつより、つながり全体が機能を持つとイメージしてほしいと話します。
パラメータが多いほど細かく調整でき、できることが増えます。しぶちょーさんはこれを写真の画素数に例え、画素数が多いと解像度が上がるように、パラメータ数が多いほど言語の解像度も上がると説明します。ただし、画素数だけで良い写真が撮れないのと同じく、パラメータ数だけで性能が決まるわけではないと補足しています。
ChatGPTはどこまで巨大化したのか
しぶちょーさんは、公開されている範囲でGPTシリーズのパラメータ数の変遷を紹介します。最近のモデルは厳密な数を公開しておらず、推測値も含まれます。
パラメータが多いほど頭が良くなるというスケーリング則 ── モデルの規模、学習データ量、計算量を増やすほど性能が予測可能な形で向上するという経験則。LLMの巨大化競争の根拠になってきましたに沿って、モデルはどんどん巨大化してきたとしぶちょーさんは説明します。
F1カーでコンビニに行く?LLMのオーバースペック問題
SLMが注目される理由について、しぶちょーさんは、これまでのAI開発は「札束で殴り合う戦い」で、とにかくモデルを大きくすれば性能が上がるという方向だったと振り返ります。
しかし巨大化には消費電力、環境負荷、コストの面で限界が見え始め、「この大きさは本当に必要か」という議論になっているそうです。
まさにF1カーでコンビニ行きますよみたいな感じで。それ無駄、それ無駄じゃない?みたいな。
かねりんさんが自分の例えのように言ったのに対し、しぶちょーさんは前回自分が使った例えだと抗議し、かねりんさんは「鶏を割くに焉んぞ牛刀を用いん」のことわざで返すなど、掛け合いも弾みます。
しぶちょーさんによると、現状はノーベル賞を受賞した科学者にデータ入力をさせているような無駄が発生しており、用途に合わせたエコカーのようなモデルが必要だといいます。実際の利用を見ると、大きなモデルにやらせる必要のないタスクが90%以上だという話になっているそうです。
数兆規模のパラメータを持つ汎用モデル。何でもできるが、電力やコストが莫大で、用途によってはオーバースペック
数百万〜数十億規模の小さなモデル。用途に特化させることで、同じ処理を安く速くこなせ、小さな端末でも動く
SLMのもう一つの利点は、スマホなどのエッジ端末や、クラウドにつながないローカル環境で動かせることです。しぶちょーさんは、十徳ナイフより専用の道具のほうが使いやすいように、専門のタスクには専門のモデルを使う考え方が広がっていると話します。
モデルを小さくする技術:知識蒸留・量子化・プルーニング
しぶちょーさんは、SLMを作るための技術をトピックとして3つ紹介します。
1つ目は知識蒸留 ── 大きな教師モデルの出力を手本に、小さな生徒モデルを学習させる手法。小さなモデルでも大きなモデルに近い能力を得られますです。大きなモデルを先生にして、小さなモデルに知識を移すことで、能力を保ったまま小さくできるといいます。
2つ目は量子化で、パラメータの数字の桁数、つまりビット数を落とす方法です。しぶちょーさんによると、精度は少し劣化するものの、情報の劣化以上に軽くなるため、結果としてとても軽いモデルになります。
3つ目はプルーニングで、ほとんど使われていないつながりを切り落とす方法です。人間の脳でも幼少期にシナプスが一気に増え、成長の過程で使わないものが削除されていくそうで、それをうまく利用したような方法だと説明されます。
人間の脳みそはもう大きさ決まってるから、切り落としたらね、してもなんか頭ちっちゃくなることないけど、AIはね、ほら、それで頭ちっちゃくできるからさ、すごくこの刈り込みっていうのが大事なわけ。
| 技術 | やること | 番組での補足 |
|---|---|---|
| 知識蒸留 | 大きいモデルを先生として小さいモデルに知識を移す | 大きいモデルの能力を小さいモデルに移せる |
| 量子化 | パラメータの数字のビット(桁数)を下げる | 精度の劣化以上に軽くなる |
| プルーニング | ほぼ使われていないつながりを切り落とす | 人間の脳のシナプスの刈り込みに似ている |
関連して、しぶちょーさんは、あえて一部のニューロンを一時的に止めて学習させるドロップアウト ── 学習時にランダムに一部のニューロンを無効化する手法。特定のつながりへの依存を減らし、未知のデータへの対応力を高めますも紹介します。これは軽量化ではなく、汎化性能を上げるための手法です。
汎化性能とは、いろいろな問題に対応できる力のことです。しぶちょーさんは、ドリルをやりすぎて答えを暗記し、別の問題が解けなくなる状態を過学習と呼ぶと、テスト勉強に例えて説明しています。
同じドリルばかり学習して答えを暗記し、違う問題が解けない(過学習)
脳の一部を封じて学習し直すことで、違う問題にも対応できる(汎化性能が上がる)
覚えておくべきSLMは?MetaのLlamaとAlibabaのQwen
代表的なSLMはほぼ決まっていて、しぶちょーさんは基本的にLlamaとQwenを押さえておけばよいと話します。
1つ目はMetaが公開しているLlama ── Metaが公開している言語モデルのシリーズ。モデルの重みが公開されており、研究や独自の調整のベースとして広く使われていますシリーズです。商用利用ができ、使い勝手が良く、オープンソースで公開されているといいます。
かねりんさんは、日本では広告詐欺問題で印象が悪く、AIサービスのイメージもないMetaの名前がなぜいつも挙がるのかと疑問を投げかけます。しぶちょーさんによると、LlamaはOpenAIよりある意味オープンで、研究やファインチューニングの事例が多いため、情報が多いことでさらに使われるという循環が起きているそうです。
2つ目はAlibabaのQwen ── 中国Alibabaが開発する言語モデルのシリーズ。小型でも高い性能を持つモデルが多く、ローカル環境で使われることも増えていますです。しぶちょーさんは、SLM単体では最も性能が良いと言われ、Llamaよりも優れているとしています。サイズは10ビリオン、つまり100億パラメータ以下のモデルが多いそうです。
GoogleもGemmaというモデルを出しており、OpenAIも昨年GPT-OSSの120ビリオンと20ビリオンを出しています。ただし、しぶちょーさんはGPT-OSSについて、中身を公開していなかったと記憶しているという言い方をしています。
結局SLMって何したいかっていうと、チューニングしたいのよ、自分で。
オープンであることが大事な理由は、データセットを用意して特定のタスクに特化させるファインチューニングをしたいからです。LLMは大きすぎて、ファインチューニングしても焼け石に水になってしまうといいます。
モデルのファイルサイズについて、しぶちょーさんは20ビリオンで6〜7ギガほどだろうと話します。ファイル自体は数字の羅列なので極端に重くはなく、問題になるのは展開するためのメモリと、計算のためのGPUといったマシンスペックだと説明されます。
自分のPCでAIが動く?LM Studioの使い方
しぶちょーさんは、ここからが本番だと話を切り替えます。SLMは小さいため、自分のパソコンのローカル環境で動かせることが大きな強みです。
自分の環境だけで動くオンプレミス ── サーバーやシステムを自社や自分の環境内に置いて運用する形態。外部のクラウドを使わないため、データを外に出さずに済みますなら、ネットにつながないので機密情報を入れても漏洩の心配がなく、医療や金融でも使えるとして注目されているそうです。
驚きましょうっていうことは自分で使いましょうって話。
しぶちょーさんがおすすめするのが、LM Studioというソフトです。最近のMacBook程度なら余裕で動くといいます。
メモリは16ギガ程度が目安で、8ギガでは少しきついかもしれないそうです。16ギガあれば14ビリオン、つまり140億パラメータほどのモデルが載ると言われているといいます。
しぶちょーさんによると、モデルを載せられるかどうかはメモリの問題で、回答の速度はGPUやCPUの性能で変わります。爆速で回答させたいのでなければ、GPUは必ずしも必須ではないそうです。
使い方はチャットで、質問やコードを書いてもらうことができます。かねりんさんが最近のLLMに慣れた人には物足りないのではと聞くと、しぶちょーさんは、限られたタスクなら実は使えることもあると答えています。
ローカルAPIでClaudeCodeが「無料で使い放題」?
LM Studioのもう一つの利点は、開発者向けにAPIを叩ける点です。自作ツールから、ChatGPTなどのAPIではなく、自分のパソコンのローカルモデルにアクセスできるといいます。
自分たちのパソコンの中だけで電気使えば、いろんなことが実はできますと。
大量の要約やテキスト処理のように、APIを使わなくてもローカルでこなせるタスクがあるというのが、しぶちょーさんの説明です。
かねりんさんは、メモリ128ギガ、GPUはRTX 3090を積んだ昔のWindows PCを持っていると明かします。しぶちょーさんは、それならGPT-OSSの120ビリオン程度も動くのではないかと話しています。
しぶちょーさんによると、GPUがないCPU推論もできますが、速度はかなり落ちるそうです。
ファインチューニングについては、実行自体は難しくないものの、データセットの設計や大量のデータの用意、正しく学べたかの評価が大変だといいます。今年の年始に番組で取り上げた大喜利AIも、7ビリオン程度のSLMをPythonでファインチューニングしたものだったそうです。
さらに、しぶちょーさんはClaudeCodeの中で動くモデルを、ローカルのQwenに切り替えられる話も紹介します。驚き屋さんが「ローカルでClaudeCodeが無料で使い放題」と騒いでいたそうですが、しぶちょーさんは語弊があるとしています。
Qwenじゃんって思ったんだけどね。
中身はClaudeではなくQwenであるものの、そうした使い方ができるほどQwenの性能はそこそこ良いと言われている、というのが、しぶちょーさんの受け止めです。
LM Studioで得る「自分の指標」とは
この回の結論は、SLMを自分の環境で体験してみることです。しぶちょーさんは、動かしてみることで自分なりの基準ができると話します。
体験していないと、何ビリオンと言われてもよく分からないままになってしまいます。しぶちょーさんは、LM Studioでチャットしても最初はインパクトがないかもしれないと認めつつ、LANケーブルを抜いても動くこと自体が面白いと話します。
新しいQwenが出たと聞いたら、LM Studioで入れてみようと思えるようになる。そうした環境を作っておくことが、今回の落ち着きポイントです。
かねりんさんは、やらないとスマホのアプリが分からないおじいちゃんのように取り残されるのではと話します。二人はおじいちゃんにLINEを教える場面を再現し、自分たちも老人になりつつあると笑い合います。
その時にSLMっていうものがどういうものかって感覚を持ってるか持ってないかでだいぶ差がつくと思うのね。
今後は小さなモデルを使っていく流れになるため、SLMの感覚を持っているかどうかで差がつく。しぶちょーさんはこれを「先取り落ち着き」と呼んでいます。
ローカルLLMとSLMは同じもの?
最後に、しぶちょーさんはローカルLLMとSLMという、混同されやすい2つの言葉を整理します。
ローカルLLMは、自分のパソコンの中で動かす言語モデルのことです。多くはSLMですが、スーパーコンピューター並みの環境があれば大きなモデルも動かせるため、大小を問いません。
一方でSLMは「小さい言語モデル」という意味なので、必ずローカルで動くとは限らず、APIやネット経由で使うこともあります。
自分のパソコンの中で動かす言語モデル。大きさは問わないが、実際にはSLMであることが多い
パラメータ数が小さい言語モデル。ローカルで動かすことが多いが、ネット経由で使う場合もある
しぶちょーさんは、軸が違うだけで概念は近いため、とにかく「ローカルで動かす言語モデル」くらいの感覚で捉えておけばよいとまとめています。
行動変容:LM Studioを入れてネットを切ってみよう
今回の行動変容は、LM Studioを入れることです。しぶちょーさんは、それほど使わないかもしれないとしつつ、動かしたという実績が役に立つはずだと話します。
で、ちょっとインターネットとかも切ってやりましょう。あ、でも動くやん。
かねりんさんは、MacBook Proと例のWindows PCに入れてみると宣言します。しぶちょーさんは、いろいろなモデルを試してみるとよいと勧めています。
収録後のおまけトークでは、腰痛を訴えるかねりんさんに対し、しぶちょーさんは駅までの約900メートルを走ったり、あえて遠い駅で降りて3〜4キロ歩きながら音声配信を収録したりと、隙間時間の運動を紹介します。かねりんさんは、防塵ゴーグルと医療用のN95マスクによる「ガチ」の花粉症対策を明かしています。
まとめ
SLMは、LLMでできていたことを小さなモデルで実現する技術で、インパクトが伝わりにくいぶん、正しい知識がなければ驚けません。パラメータの仕組みと軽量化技術を理解し、LM Studioで実際に動かしてみることで、今後のSLMのニュースに正しく驚ける感覚が身につくと語られました。
- SLMはLLMより小さい言語モデルで、パラメータ数が数百万〜数十億規模とされるが、厳密な定義はない
- 巨大化したLLMはコストや電力の面で限界が見え、大半のタスクではオーバースペックだとされる
- 知識蒸留・量子化・プルーニングといった技術で、モデルを小さく軽くできる
- 代表的なSLMはMetaのLlamaとAlibabaのQwenで、オープンさがチューニングしやすさにつながる
- LM Studioを入れてネットを切っても動くことを体験すると、新モデルのニュースを自分の基準で判断できる





