ローカルLLMを動かすPCには、何が必要なのか
この回のテーマは「ローカルLLMを日常活用するために必要なPCとはどんなものか」です。これまで番組ではローカルLLMの話をしてきたものの、動かすためのハードウェアの話はあまりしてこなかったため、しぶちょーさんが調べてきた内容を紹介します。
しぶちょーさん自身は、ローカルLLMを本格的に動かしている人ではないと前置きしています。そのため、この回の解説は実体験というより、調べた内容をもとにしたものです。
かねりんさんが使っている文字起こしAIのWhisper ── OpenAIが公開した音声認識モデル。手元のPCで動かせ、音声を文字に起こす用途で広く使われていますもローカルで動きますが、LLMではありません。しぶちょーさんは、ChatGPTやClaudeのようなものを自分のPCで動かすのがローカルLLMだと説明します。
なんかもう100万円ぐらいのパソコンがいるんでしょ?ぐらいしか知らないんでね。
まあね、いるんだけど、まあ最安値で言ったら多分二、三十万でいけるんじゃないかなみたいなところもある。
しぶちょーさんがこのテーマを選んだきっかけの1つは、AIエンジニアのからあげ先生を自分のポッドキャストにゲストで招いたときの会話です。からあげ先生は、AIの番組をやるならローカルLLMを動かしていないとダメだ、という趣旨の話をしていたといいます。
しぶちょーさんはそこから、ローカルLLM用のPCも「AIポッドキャストの収録機材」だという理屈で、スタジオを営むかねりんさんに買ってもらうのがいいのでは、と冗談まじりに持ちかけます。かねりんさんは、活用のイメージが湧けば検討の余地はある、と返しています。
本命モデルはQwen3.8-27B。なぜ「ちょうどいい」のか
しぶちょーさんが今回の目標に据えたのは、ローカルLLMの界隈で「これだよね」と言われているQwen3.8の27B版です。Qwen ── 中国のAlibabaが開発するAIモデルのシリーズ。重みが公開された版もあり、手元のPCで動かせますは、中国のアリババが作っているモデルです。
しぶちょーさんによると、Qwen3.8-27Bが好まれる理由は、研究所レベルの大規模サーバーがなくても動かせるギリギリのサイズでありながら、性能もかなり高い点にあります。
(性能は)多分そのOpusよりはいかないけどSonnetぐらいはあるよねみたいな。
ただし、しぶちょーさんが言う「個人で使えるPC」とは、いま家にあるPCという意味ではありません。個人の資産で手が届くPC、という意味です。
非常に重要ですよ。個人PCと個人で買うことができるPCの間には無限の差があるので。
どれくらいの価格感かを聞かれたしぶちょーさんは、個人でも車は買えるので、そのくらいの感覚だと答えています。
R32 GT-Rの車検代とパソコン代
「車の代わりに買うPC」という話から、話題はしぶちょーさんの趣味である車に移ります。しぶちょーさんはホンダのビートのほかに、日産のR32 GT-Rを持っていて、こちらが一番好きな車だといいます。
R32 GT-Rは30年以上前の車ですが、しぶちょーさんの見立てでは、いま買おうとすると600万や700万では買えないそうです。特殊な車なのでディーラーには出せず、車検は専門のショップに頼んでいます。
今年の車検では、6気筒エンジンのうち1気筒が動いておらず、5気筒で走っていることがわかりました。直すにはスパークプラグやコイルの交換が必要で、通常の車検代10万円ほどに加えて、さらに20万円ほどかかる見込みです。
まあ人間に例えるだったら80歳のおじいちゃんに全力疾走させてるようなもんだからさ。
ほかにも樹脂製のガソリンタンクが割れてくる可能性があり、交換すれば100万円コースになることもあるといいます。しぶちょーさんは、この金額があればいいPCが買えると思いながらも、メカが好きなので車は売らないと話しています。
PCはレンタルしたい? 機材を任せたくなる人の条件
車にお金がかかってPCを買えないしぶちょーさんに対し、かねりんさんは、AIの機材はすぐ古くなるのでむしろレンタルしたいと話します。
もうさ、AI(の機材)なんてさ、もう買って半年でなんか古いですねみたいになっちゃうじゃん。
しぶちょーさんによると、スポンサーとして無期限に貸し出してもらう形はあるそうです。ただ、しぶちょーさんがもらうのは主に3Dプリンターで、PCの提供はありません。SNSではものづくりの話が中心で、AIの話題はエンゲージメントが低いからではないか、と自己分析しています。
そのうえでしぶちょーさんは、PCをもらおうとしている人には、おそらく誰も渡したくないだろうと考えています。
その、あー、いいパソコンあったらこういうことができるのにみたいなこと言ってる人になんか渡したくないよね。
俺はもうちょっと今はパソコンでできるバカなモデルでどこまでできるかってことをやらなきゃいけないんじゃないかなと。
それでも現実には、フロンティアモデル ── 各社が出す最先端・最高性能クラスのAIモデルのこと。ClaudeやChatGPTの上位モデルなどが該当しますに近い性能を求めると、ある程度のモデルが必要になります。その中で一番使いやすいとされているのがQwen3.8-27Bだ、というのがしぶちょーさんの整理です。
みんなが手元でLLMを動かしたがる理由は?
しぶちょーさんによると、Qwenは2023年から公開が始まり、Qwen2、Qwen2.5と進化してきました。Qwen3.8-27Bは今年の8月ごろに公開されたとのことです。
しぶちょーさんは、東京で開かれたQwenのジャパンミートアップにも参加しています。展示会Maker Faire ── ものづくりの作品を展示・発表するイベント。電子工作や3Dプリンターなど、個人や企業のつくり手が集まりますの前日で、参加者はほぼ日本人でした。会場では「Qwen3.8-27Bをどう使いこなすか」という話で盛り上がっていたといいます。
しぶちょーさんは、ローカルLLMを構築したい一番の理由はコストダウンだと説明します。今までのタスクを分解し、Qwenに任せられる部分はQwenに振る使い方ができれば理想的です。
F1カーでコンビニ行ってませんよねみたいな。
ただし、かねりんさんのようにClaudeとOpenAIを月額のサブスクで使っている場合は、ローカルLLMで処理を減らしても出費は減りません。空いた枠で新たにClaude CodeやCodexを使うだけで、出費ではなくAIによるアウトプットが増える形になる、としぶちょーさんは指摘します。
一方、API ── 外部のプログラムからAIを呼び出す窓口。使った量(トークン数)に応じて料金がかかる従量課金が一般的ですの従量課金で使っている人や企業には、金額面のメリットが出ます。ミートアップでも、企業がAPI課金の一部をローカルに置き換える話が出ていたそうです。
出費は変わらず、空いた枠で別の作業が増える。メリットは安全性や実験の意味合いが中心
ローカルに振った分だけ課金額を抑えられる可能性がある
しぶちょーさんは、データを外に送らないためセキュリティ面で安心できることもメリットに挙げています。また、個人でわざわざローカル環境を作る人は、節約より実験的な目的の人が多いとも話しています。
クラウドのAIが止まる日に備える。27Bは「実用」の境目
しぶちょーさんは、障害や政治的な事情でクラウドのAIが使えなくなる可能性にも触れます。例として、Fableが輸出停止になった件を挙げ、ローカルで運用する術を身につけておくことは大事だと話します。
今後はタスク特化の流れが進むかもしれないことも踏まえ、しぶちょーさんの考えは「今のうちにローカルをやっておいたほうがいい」というものです。
Qwenには、27Bより大きいモデルも、8Bのような小さいモデルもあります。しぶちょーさんによると、8B程度なら今の家庭のPCにも入りますが、ファインチューニングして遊ぶ用途に向くサイズです。
やっぱね、その実用に耐えうりそうだなっていうレベルが27ビリオン。
27Bは270億パラメーターという意味です。容量が27GBという意味ではありません。
CPU・GPU・RAM・VRAMの違いは?
PCの構成を考える前に、しぶちょーさんは用語を整理します。CPUは「脳みそ」、GPUは画像を描写する処理ユニットで並列計算が得意、RAMはメモリ、そしてポイントになるのがVRAM ── GPU専用の高速なメモリ。この容量で、GPUに載せられるモデルの大きさがほぼ決まりますです。
ローカルLLMでは、基本的にモデルの全部をVRAMに入れて推論させます。そのため、VRAMにモデルが乗り切らないと、まず動かないというのがしぶちょーさんの説明です。
GPUで処理したい理由について、しぶちょーさんは魚の群れにたとえて説明しています。
CPUほど賢くはないけど、計算能力を持ってるちっちゃい子供たちがいっぱいいて、よーいドンでバーッと計算できるみたいな。
LLMはちっちゃい計算の繰り返しなので。そういう一個一個の計算、そんな難しくないから。
サメのような大きな魚が1匹。賢いが、計算を一つずつこなす
小さな計算役がたくさん。よーいドンで一斉に計算でき、LLMの小さな計算の繰り返しと相性がいい
かねりんさんは、PC本体のメモリは大きいのにグラフィックボードのVRAMは小さく、VRAMの大きいボードは高い、と実感を語っています。落合陽一さんがGPUが燃えたと話していた件も話題にのぼりました。
CPUやSSDで動かすと、どれだけ遅くなる?
モデルを本体のRAMに載せてCPUで推論させることもできますが、しぶちょーさんによると、その場合はかなり遅くなります。速度の指標はtok/s ── トークン毎秒。AIが1秒間に何トークン生成できるかを示す数字で、大きいほど文字が速く出ますで、20〜30あると、使っていてかなり快適だそうです。
しぶちょーさんが調べた例では、RTX 4060で処理すると40tok/sだったのに対し、同じ処理をCPUにさせると7tok/sでした。モデルの条件は少し違うものの、5倍ほどの差があります。
さらに、モデルをSSDなどのストレージに置いたまま動かすこともできなくはありません。しかし、いちいちモデル全体を読み出すため、1文字に20秒ほどかかることもあるそうで、実質的には使えないとしぶちょーさんは話します。
VRAMはパンパンだとダメ。足りない分はCPUオフロードで
VRAMの容量にも注意点があります。VRAMが16GBで、モデルが15GBなら乗りそうに見えますが、実際には乗らないことが多いとしぶちょーさんは説明します。
理由は、推論以外にも容量を使うからです。今まで生成してきた内容や読んだトークンを覚えておくKVキャッシュ ── すでに計算した文脈の情報を取っておく領域。会話や読み込ませる資料が長いほど多くのメモリを使いますのような保存領域も必要になります。
パンパンダメなんだ。
パンパンダメなんですよね。
そのため、24GBや32GBのGPUを積まないと、すんなりとは動かないことが多いといいます。メモリ帯域幅も速度に影響しますが、VRAMほど重要ではない、というのがしぶちょーさんの見方です。
VRAMは後から拡張できません。ただし裏技として、収まらない分を本体のRAMに置くCPUオフロード ── VRAMに入りきらない部分を本体のRAMに置き、その部分の計算をCPUに任せる方法。動きますが、GPUだけより遅くなりますという方法があります。
しぶちょーさんによると、LLMは層状になっているので、ある層まではGPU、それ以降はCPUというように分割できます。たとえば24GBのVRAMが欲しいのに16GBしかない場合、残りをRAMで補えば動く場合があります。
結構お作法ノウハウがある世界だと思うよ。
うまく動かない場合もあり、マシンや組み方にもよるそうです。しぶちょーさんは、一番きれいなのはやはりVRAMの中に収まることだとまとめています。
Qwen3.8-27Bには何GB要る? かねりんさんのPCは動く?
かねりんさんが、Qwen3.8-27Bには何GBのVRAMが必要なのかを尋ねます。しぶちょーさんによると、モデル本体は大きい版で16GBほどです。そのため、16GBのVRAMでは少しはみ出してしまいます。
16GB
少しはみ出す。量子化で小さくするか、CPUオフロードで逃がす
24GB
ギリギリいける見込み。ただし足りなくなる可能性もある
32GB程度
安定して動かせそう
ここでかねりんさんが、自分のWindows機のVRAMが24GBだと明かします。GPUはNVIDIAのRTX 3090で、RAMは128GBあります。以前、360度動画の編集をするために買った「宇宙戦艦ヤマトみたいな」PCだそうです。
え、それローカル動くっしょ。
しぶちょーさんは、RTX 3090は世代が古くそれほど速くはないものの、可能性は十分あると見ています。一方、モデルを動かしている間はVRAMを使い切るため、かねりんさんがそのPCで任せているショート動画の書き出しなどはできなくなるかもしれない、とも付け加えています。
モデルを軽くする「量子化」とは?
しぶちょーさんは、24GBで収まるかもしれない理由として量子化 ── モデルの数値を少ないビット数で表し、モデルを軽くする技術。サイズは小さくなりますが、性能がわずかに落ちることがありますを挙げます。
ローカルLLMの重さは、パラメーターの数と、それぞれのパラメーターが持つ数値の大きさで決まります。量子化では、この数値を8ビットから4ビットにするといった形でビットを落とし、圧縮します。
パラメーターの数値を多いビット数で持つ。精度は高いが、VRAMに載せにくい
ビット数を落として圧縮。VRAMに積みやすくなるが、性能がわずかに落ちる可能性がある
ちなみに、しぶちょーさんのPCはRTX 4070でVRAMは12GB、RAMは32GBほどだそうで、かねりんさんのPCの大きさに驚いています。
ただ、ブログなどを見ると、同程度の構成で動いたという人もいれば、128GBのメモリがあっても動かなかったという人もいるとのことです。しぶちょーさんは、組み方によってだいぶ違うのだろうと話しています。
Appleの統合メモリと、中古のM1 Maxが熱い理由
しぶちょーさんが次に挙げるのがAppleのMacです。Macはユニファイドメモリ ── CPUとGPUが同じメモリを共有する仕組み。Apple Siliconなどが採用し、大容量のメモリをGPUからも使えますを採用していて、CPUとGPUのメモリを区別していません。
そのため、Macでメモリが128GBあれば、GPU側からも128GBを使えて、大きなモデルも乗ります。しぶちょーさんによると、だからこそみんなMacでローカルLLMをやりたがるのだそうです。
しぶちょーさんがリスナーから教わったのが、中古のM1 Max搭載MacBook Proです。メモリ128GBのものが、中古で20万円ほどで売られているといいます。
ちょっとローカルLLMもこう、なんか遊ぶ分にはモデルがとにかく、とりあえず乗っちゃえばこっちもんだから。
世代が古いため処理は遅く、かなり発熱するそうです。それでも、スピードを求めすぎず、どこまで動くかを試したいなら選択肢になる、としぶちょーさんは評価しています。
実際に買ったリスナーは、バッテリーが5時間ほどしか持たず、とても熱くなるものの、持ち運んで使っているそうです。ただ、相場は上がってきているとのことで、しぶちょーさんは、店頭でうまく探さないと難しいかもしれないと話しています。
本命のDGX Sparkは約100万円。AI発信者の背景に必須?
新品で本格的に始めるなら、選択肢に挙がるのがNVIDIAのDGX Spark ── NVIDIAの小型AI開発機。CPUとGPUを1台にまとめ、128GBのメモリを両者で共有する構成ですです。しぶちょーさんによると、こちらもユニファイドメモリと同じような128GBの共有メモリ構成になっています。
価格は100万円ちょっとで、かねりんさんが価格.comで調べた価格も100万円ほどでした。大きさは少し大きめのお弁当箱くらいで、しぶちょーさんは「すげえコンパクトでめっちゃかっこいい」と話します。
ここまでに出てきた3つの選択肢を、番組内の発言をもとに並べると次のようになります。
| 選択肢 | メモリ | 番組での評価 |
|---|---|---|
| RTX 3090の自作PC | VRAM 24GB+RAM 128GB | ギリギリ乗る可能性がある、コスパのよい構成 |
| 中古M1 Max | 統合メモリ128GB | 20万円ほど。遅く熱いが、乗れば動く |
| DGX Spark | 共有メモリ128GB | 約100万円。新品で安心してやるなら本命 |
しぶちょーさんによると、AIをガチでやっているYouTuberの中には、DGX Sparkを6台ほど積んでいる人もいるそうです。からあげ先生も、AIを語るビデオポッドキャストの背景にDGX Sparkがないのはおかしい、と話していたといいます。
ここにDGX Sparkがないと、やっぱあの箔がつかないというか、ああ、こいつらはそのレベルなんだよねみたいな。
からあげ先生自身もDGX Sparkを持っていて、自分のコミュニティで動くAIエージェント「ザンギ」を作っているそうです。OpenClawのオリジナル版のようなもので、コミュニティの質問に回答する用途に使っています。かねりんさんも、自分たちのコミュニティでもこうした実践をしたいと話しています。
ローカルの電気代は? マイニングの思い出とまずはLM Studio
ローカルLLMは「家の電気代だけ」で動かせると言われますが、しぶちょーさんは、電気代も結構かかるのではないかと考えています。
かねりんさんは、同じPCで以前ビットコインのマイニングをしていた経験を話します。電気代は家庭の通常の数倍になり、冬は暖房代わりになった一方、夏は灼熱地獄だったそうです。収支は若干儲かったかどうかくらいでした。
そのぐらい電気かかったらなんか課金した方がいいってなりそう。
しぶちょーさんが調べた資料の中には、RTX 3090でVRAM 24GBの構成を「一番コスパのいい構成」とするものもありました。ギリギリ乗る構成のようですが、しぶちょーさんは、今あるもので試してみるのはいいと話します。
始め方について、しぶちょーさんが一番簡単だと勧めるのはLM Studio ── ローカルLLMを画面の操作で探してダウンロードし、そのまま会話できるアプリ。入門の入口に向いていますです。GUIで動かせるので、ダウンロードして会話したい人の入り口になる、という位置づけです。
MacからWindowsを動かす。メモリ不足と自作PC・水冷
かねりんさんは最近、MacとWindows機をネットワークでつなぎ、AIに直接操作させています。重い処理はWindowsで行い、完成したものをMacに返す仕組みで、出先でも回るようにしてあるそうです。
かねりんさんのMacBook ProはM5 Proでメモリ48GBですが、VS Codeのタブを開きすぎて頻繁に固まるといいます。一方、しぶちょーさんはメモリ16GBのMacBook Airですべての作業をしていて、作業を3つほど並行するとメモリ不足の警告が出るそうです。
しぶちょーさんは、ファイルを見ないならVS Codeを開かず、ターミナルやChatGPTのデスクトップアプリからCodexを使うほうが楽かもしれない、と提案しています。
しぶちょーさん自身は、20万円あれば中古のM1 Maxを買うより、家のデスクトップPCを増設するほうがいいという説も考えています。ただ、GPUは結局高く、自作PCをいじって壊れた思い出もあるため、気が進まないようです。
イキって水冷パソコンとかにしてたから、なんかいじるのめんどくせえんだよな。
水冷にしても他のファンがうるさいことや、大きすぎて東京へ持ってくるのが面倒なことも話題になりました。そのデスクトップPCは30万円ほどで買ったゲーミングPCです。
ゲームする時間がない。睡眠とショートスリーパーの話
しぶちょーさんがゲーミングPCを買ったのは、アーマード・コアとフォルツァをやるためでした。しかし、時間がなくまったく遊んでいないそうです。
多分1日をね、40時間ぐらいで勘定しちゃう癖があって。
しぶちょーさんは、作業を始めるとタスクが増えていき、想定より1時間ほど長くかかることが多いといいます。人間ドックでは肝臓の数値がDからCに改善し、ジムにも通い始めました。ただ、有酸素運動をしようと思い立つのが夜0時半ごろになり、睡眠に悪影響があるのでは、と本人も感じています。
話題はSNSで注目を集めていたショートスリーパーの堀さんにも及びます。かねりんさんは、以前出演した睡眠の専門家に聞いたところ、冷静に「ちゃんと寝てください」と言われたことを紹介しています。
しぶちょーさんは、もともとは「脳は物理的に動いていないから疲れないのでは」と考え、ブドウ糖を補うためにラムネを食べ続けた時期もあったそうです。しかし、どうやらそういうシンプルな話ではないらしい、と振り返っています。
話を戻して。結局はVRAMが大事
睡眠の話から戻り、しぶちょーさんはここまでの内容をまとめます。ポイントは、モデル全体をVRAMに載せて動かしたいので、VRAMの大きさが大事だということです。
VRAMに収まらなくても、CPUオフロードで本体のメモリに載せることはできます。ただし、その部分がボトルネックになって遅くなるため、基本的にはVRAMに載せたほうがいい、としぶちょーさんは説明します。
Apple Siliconのようにユニファイドメモリを持つ機種なら、意外と動くこともあります。最安値は中古のM1 MaxのMacBook Pro、安心してやるならDGX Spark、というのがしぶちょーさんの整理です。
やばすぎるな。これなんか使ってる人いたら話聞かせてほしいな。
しぶちょーさんは、自分の事業のお金で「ちょっと買いました」と言えるくらい稼げるようになりたいと話します。かねりんさんも、AI番組としての伸びに期待を寄せています。
買う前に、小さいモデルとQwenのAPIで試す
しぶちょーさんは、伝え忘れていた結論を付け加えます。大きなモデルを動かせない人も、LM Studioで8B程度の小さなモデルを動かしてみると、使い勝手がなんとなくわかるのではないか、という提案です。
もう1つあえて勧めているのが、QwenのモデルをAPI経由で使ってみることです。ローカルLLMが手元にある前提で、今AIに任せているタスクを試しにQwenへ振ってみる、というシミュレーションです。
イメージ、そうだよな。イメージ湧かないからあんまりやる気せんのだよな。
Qwenには、Claude CodeやCodexのように使える専用ツール「Qwen Code」もあります。しぶちょーさんによると、モデルを自由に選べるOpenCodeでもQwenやDeepSeekは使えますが、Qwen CodeはQwen向けにチューニングされているそうです。
しぶちょーさん自身も、トークンを節約する取り組みの一環として、Qwen Codeを試そうとしています。Qwenは安いので、タスクを分解して一部を投げれば節約できるのではないか、という考えです。ミートアップでも、APIで使うのもいいという話が出ていたといいます。
ただ、どちらにしても追加の出費にはなります。かねりんさんは「節約しているつもりで、どんどん増えていく」というAI節約の罠を指摘しています。しぶちょーさんも、Claude CodeとCodexのそれぞれで200ドルのプランを契約していて、どちらも使い切っているそうです。
しぶちょーさんの近況:YouTubeと登壇
しぶちょーさんは今週、案件のYouTube動画を1本公開し、その編集にもAIを使ったといいます。「しぶちょー技術研究チャンネル」の登録者は7000人ほどで、1万人を目指しています。
また、静岡県の工業技術研究所で、AIエージェントをテーマに基調講演をしました。登壇の場は、高性能なPCの話より、製造業の中小企業の人たちにAIとは何かを伝える場が多いそうです。
かねりんさんは、番組が2年目に入り、10月3日の1周年イベントで2年目の展望を話したいと語ります。しぶちょーさんは最後に、情報の間違いがあれば補足してほしいことと、PCの提供はいつでも受け付けていることを伝えて番組を締めました。
まとめ
ローカルLLM用のPC選びで最も重要なのは、モデル全体を載せられるVRAMの大きさです。Qwen3.8-27Bなら24GBでギリギリ、32GBあれば安定しそうというのがしぶちょーさんの見立てで、量子化やCPUオフロード、ユニファイドメモリといった選択肢もあります。そのうえで、買う前に小さいモデルとQwenのAPIで試すことが勧められていました。
- ローカルLLMはモデルをVRAMに載せて動かすのが基本で、余裕を持った容量が必要
- VRAMが足りない場合は、量子化で軽くするか、CPUオフロードで本体のRAMに逃がす方法がある
- 候補はRTX 3090の自作PC、中古のM1 Max(約20万円)、DGX Spark(約100万円)
- 月額サブスク利用の個人では、ローカル化しても出費が減るとは限らない
- 購入前に、LM Studioの小さいモデルやQwenのAPI、Qwen Codeで使い勝手を試すのがおすすめ







