「AIあの人は今」第1弾はなぜStable Diffusion?
おちつきAIラジオの新シリーズ「AIあの人は今」は、昔は驚かされたり流行したりしたのに最近名前を聞かなくなったAIツールが、今どうなっているのかを深掘りする企画です。
タイトルは「あの人は今」に寄せていますが、具体的な人を扱うと角が立つため、対象は人ではなくツールです。第1弾のテーマは、画像生成AIの「初代王様」ともいえるStable Diffusionに決まりました。
最近、昔すげえ驚かされてたりとか、すごい流行ってたけど、最近全然聞かねえなみたいなやつを、今どうなってんのっていうのを深掘りしていく、そんな回でございます。
かねりんさんは偶然にも最近、自宅のデスクトップPCにStable Diffusionを入れて動かしていたそうです。ChatGPTやGeminiで作ると似たような画像になりがちなので、自分でモデルを選んで作ろうと考えたのがきっかけでした。
かねりんさんが作りたかったのは、配信やVTuberの用途を想定した、同じキャラクターを保ったまま表情やシチュエーションだけを変えた画像です。しぶちょーさんは、そうした用途にはLoRA ── Low-Rank Adaptationの略。大きな画像生成モデルに、特定のキャラクターや画風を少ないデータと計算量で後から追加学習させる技術ですという技術があると説明します。
全然できない。もうなんかもう、もうブチ切れてもう使ってない。
かねりんさんは「難易度が上がっていた」と感じたものの、しぶちょーさんの見立ては逆でした。Stable Diffusionの難しさは昔からあまり変わっておらず、使う側の解像度が下がったのだろうといいます。
(結論は)まあ使ってみてもいいんじゃないって話に落ち着くんだけど、StableDiffusionってなんか廃れたってわけじゃないんだねっていうのがわかる、そんな回ですね。
2022年8月、「呪文」で画像を呼び出した時代
Stable Diffusionが公開されたのは2022年8月で、ChatGPTの登場より3か月ほど前です。ChatGPT以降に生成AIを使い始めた人には、何の話かわからないかもしれないとしぶちょーさんは前置きします。
Stable Diffusionはテキストから画像を生成するAIで、「夕焼けの海上に立つ猫」のように打ち込むと、数秒でその絵が出てきました。AIで画像が作れること自体が衝撃で、画像生成ブームの火付け役になったと振り返られています。
当時のStable Diffusionのプロンプトは、文章ではなく単語をコンマで区切って並べる形式でした。括弧で括ると強調され、先に置いた単語ほど強く影響するなど、順番も重要だったといいます。
コマンドみたいな感じで、呪文を研究する人が、それ呪文って呼ばれてて。
日本語では入力できず、英語で打つ必要もありました。かねりんさんは、AIで作った画像を「呪文はこれです」と添えて投稿するサイトも流行っていたことを思い出します。
「技術はエロで育つ」有志が作ったエコシステム
しぶちょーさんが印象に残っているのは、胸を大きく描かせるためのプロンプトが有志によって熱心に研究されていたことです。説明書があったわけではなく、どの単語をどこに置けばよいかを試行錯誤した成果でした。
いや、俺あれ見て初めて思ったもん。技術ってエロで育つんだみたいな。
さらに、そうしたプロンプトの知見は技術に詳しい人しか使えないため、スライダーで胸の大きさを調整できる機能として「民主化」する人も現れました。しぶちょーさんは、これがプロンプトエンジニアリングに強い影響を与えたと評価しています。
このスライダーは公式機能ではありません。Stable Diffusionはオープンソースの文化で成り立っており、モデルの周りに補助ツールを有志が次々と作っていったことが、盛り上がりの要因の1つだったと説明されます。
StableDiffusionというモデルがあって、その周りにStableDiffusionを使うためのいろんな補助ツールみたいなのがあって、それを有志たちがいろいろ作っていったんだよ。
無料・ローカル・改造し放題という革新
Stable Diffusionの何が一番すごかったのかについて、しぶちょーさんはまず「無料で使える」点を挙げます。オープンソースで公開されていたため、手元にGPUさえあれば誰でも動かせました。
GPUを持っていなかったしぶちょーさんは、Google Colaboratory ── ブラウザ上でPythonを実行できるGoogleのサービス。GoogleのGPUを借りて計算でき、有料プランでは利用枠が増えますの定額プランを使い、性能の低いノートパソコンやスマホからでも画像を生成していたそうです。
同じ時期に流行していたMidjourneyはDiscord上で画像を作るサービスでした。それに対してStable Diffusionは自分のPCの中で動くことが革新的で、だからこそ改造もし放題だったといいます。
特定のキャラクターを学習させたデータを加えれば、そのキャラクターばかりを出すモデルも作れました。かねりんさんが「著作権違反し放題」と茶化すと、しぶちょーさんは、むしろ自分のオリジナルキャラクターにいろいろなポーズをさせる創作に使えると補足します。
オープンソースで無料。自分のPC(またはColab)で動き、モデルの改造やキャラクターの追加学習ができる
Discord上で画像を生成するサービス。ローカルでは動かず、カスタマイズはできない
つまりStableDiffusionって無料で使えて、自分のPCで使えて、しかも改造できるっていう、そういう画像生成AIだったのよ。
Stable Diffusionはアニメ風の画風が得意で、2023年に爆発的に広がり、AIアートやイラストの世界を一変させました。ところが2024年以降、急に名前を聞かなくなったといいます。
なぜ名前を聞かなくなった?ChatGPTが奪った入り口
Stable Diffusionが下火になった理由として、かねりんさんが「GPTでできるようになったからでは」と言うと、しぶちょーさんは鋭いと応じます。なお、Midjourneyもサービスとしてはまだ存在するものの、正直下火の印象だそうです。
しぶちょーさんが大きいと見るのは、ChatGPTが画像生成の入り口を奪ったことです。OpenAIの画像生成モデルDALL-E 3 ── OpenAIが開発した画像生成モデル。ChatGPTに統合され、チャットで頼むだけで画像を作れるようになりましたがChatGPTに統合され、ChatGPTに頼むだけで画像が出てくるようになりました。
わざわざそのStableDiffusionの環境を作って画像を生成しなきゃいけない時代に比べたら、ChatGPTから画像を作ってって言って画像が出てきたら、すごい革新的だよね、やっぱね。
かねりんさんも、Stable Diffusionはマニアしか使えないものだったと同意します。「もうこれでいいじゃん」という人が続出したことが、下火になった要因の1つ目です。
ただし、しぶちょーさんによると、ChatGPTの影響はあくまで要因の1つにすぎず、実はほかにも2つの理由があるといいます。
運営会社Stability AIの経営危機
2つ目の理由は、Stable Diffusionの運営会社であるStability AIが経営危機に陥っていたことです。オープンソースの文化で収益がほぼない一方、新しいモデルの開発などに多額の支出がかかっていました。
Stability AIは、画像を崩してから組み立て直す過程を学習させる「拡散モデル」の論文を書いた研究者たちが立ち上げた、イギリスの会社です。途中、しぶちょーさんが「拡張生成」と言い間違え、かねりんさんが「検索拡張生成」と混同する一幕もありました。
研究者が立ち上げた会社だったため、収益のことをあまり考えていなかったのだろう、としぶちょーさんは推測します。2023年後半から2024年前半にかけて、Stability AIは危機的な状態に陥りました。
2023年の終わりごろから、売上の見込みがないままコンピューティングリソースと人件費だけが消えていったといいます。毎月800万ドル、日本円で約8億円が消えていったとされ、AWSの支払いすら難しい状況になったそうです。
800万ドル、8億円ぐらいってこと?
経営陣は「会社を売るべきだ」と主張していたものの、最終的には投資家たちが創業者を追い出す形になった、としぶちょーさんは説明しています。
頭脳流出が生んだ次世代モデル「FLUX」
Stability AIが破綻していく過程では、拡散モデルの論文を書いた主要メンバーが全員会社を抜けていきました。彼らはドイツでBlack Forest Labsという会社を立ち上げ、FLUXという画像生成モデルを作ります。
(FLUXは)実はもうこれがStableDiffusionのライバルというか。上を行ってる、現状では。
しぶちょーさんによれば、FLUXはローカルで使える画像生成モデルの最先端に近く、「ローカルでやるならFLUXを使うよね」という位置づけです。Stable Diffusionでは今も指の描写が崩れるなどコントロールが難しい一方、FLUXは精度が高いといいます。
ただし、FLUXとStable Diffusionには得意分野の違いがあります。FLUXは本物の人間のようなリアルな実写画像に強く、Stable Diffusionはファンが築いたエコシステムのおかげでアニメ系に今も強いと説明されています。
実写に強く、本物の人間のような画像を作れる。画像生成の能力そのものではStable Diffusionより上
指の描写などコントロールは難しいが、ファンが作ってきたエコシステムがあり、アニメ系に強い
元々Stable Diffusionを作っていた人たちが全員抜けてライバル会社を作った出来事は、2024年ごろのことでした。開発者がいなくなり、お金もなくなったStable Diffusionは、骨抜きにされて「潰れるだけ」に見えたといいます。
ジェームズ・キャメロンが取締役に?映像業界の救いの手
しかし、Stable Diffusionは潰れずに生き返りました。救いの手を差し伸べたのは映像制作関係の人たちで、新しいCEOや取締役に就任したそうです。
しぶちょーさんによると、2024年6月に映像制作のプロであるプレム・アッカラジュ氏がStability AIのCEOに就任しました。さらに『ターミネーター』や『タイタニック』で知られるジェームズ・キャメロン監督が取締役に加わったといいます。
しぶちょーさん自身は映画をあまり見ないため、キャメロン監督の名前は聞いたことがある程度だそうです。かねりんさんは「白髪のちょっとイケメンの監督」と応じていました。
BtoCからBtoBへ、Stable Diffusionのピボット
映像業界の人たちが入った新体制のStability AIは、映像やCMの制作会社にがっつり入り込んでいきました。消費者が自由に使うフラッグシップモデルから、BtoBのメディア・エンタメ基盤へとピボットしたのです。
新体制のうまさは、大手メディアや大手企業と提携し、それぞれの会社の中で使える生成AIサービスとして構築した点にあるといいます。ChatGPTやNano Banana Proのように何でも出してくるのではなく、自社が作りたいものをコントロールして作れる基盤を提供するわけです。
Stability AIは、そうした画像生成基盤をライセンスとして販売し、収益を立てるビジネスモデルに展開していきました。
消費者向けのオープンソースモデルが中心。収益はほぼなく、開発費だけがかさむ
映像・CM制作や大手企業向けの生成AI基盤を構築し、ライセンス販売で収益化
そっち(BtoB)にピボットしたから、もうそもそも我々はターゲットじゃなくなったわけ。
一般ユーザーが名前を聞かなくなったのは、Stable Diffusionが失敗したからではなく、一般ユーザーが収益源ではなくなったからです。しぶちょーさんは、Stability AI自体は成功していると見ています。
今も残るエコシステム、ComfyUIとLoRAの力
「じゃあStable Diffusionはもうゴミか」というかねりんさんの問いに、しぶちょーさんはゴミではないと答えます。Stable Diffusionから始まった根強いファンがいて、周辺のエコシステムがとても強いからです。
Stable Diffusionのエコシステムの代表がComfyUI ── 処理のブロック(ノード)を線でつなぎ、自分だけの画像生成工程を組み立てられる操作画面。現在はプロ層で主流とされていますです。かねりんさんは、DaVinci Resolveの色補正のように処理を順番につなぐ、プログラムの実行を可視化した回路のようなものだとたとえます。
実はかねりんさんが先日動かしたのもComfyUIでした。以前は「AUTOMATIC1111」のような古典的なWebUIが主流でしたが、ComfyUIではノードをつなぐことで、より細かいところまで調整できるといいます。
ComfyUIはFLUXでも使えますが、文化としてはStable Diffusionを取り巻くように作られたものだと、しぶちょーさんは説明します。
エコシステムのもう1つの例がLoRAです。大きなモデルの一部のパラメータだけを追加学習させるアダプターのようなもので、付けておけば特定の女の子の画像しか出ないようにでき、毎回違う人が出てくる問題を防げます。
LoRAは自分で作れるうえ、先人たちが作ったものが大量に公開されています。作りたい絵柄に合うLoRAを持ってきて使えることが、今Stable Diffusionを触る理由の1つだといいます。
有志たちが作ってきた、こういう画像できるんだぜみたいなやつがいっぱい世の中にあって。StableDiffusionを中心としていればそれが使えますよと。
80点を100点にするのがローカル画像生成
そもそも、ここまでして画像を生成する意味はあるのでしょうか。しぶちょーさんの答えは、80点のものから100点を追求することは、ローカルの画像生成にしかできないというものです。
八十点のものから百点を追求するっていうことは、やっぱローカルの画像生成にしかできない。
しぶちょーさんによれば、かつて40〜50点しか出なかったChatGPTやNano Banana Proでも、今は80〜90点の画像が出てきます。それで十分と思えるのは、自分が絵のクリエイターではないからだといいます。
自分の作品として100%に近づけたい人が細かい部分まで調整するには、ComfyUIのようなツールでローカル生成する必要があります。かねりんさんもAIと相談し、JSONでやり取りしながらノードを組んだものの、思った通りの雰囲気は出なかったそうです。
しぶちょーさんは、モデル選びも重要だと付け加えます。Hugging Faceからモデルを持ってきて、同じプロンプトでも絵柄ががらりと変わるのを試すのが楽しいといいます。
PixAIという「民主化」と、クリエイターでない二人の本音
かねりんさんは、配信者の間で使われているPixAIというWebサービスを紹介します。モデルやパラメータを選んでアニメキャラを出す、Stable Diffusionのような操作を課金制のWebサービスで手軽にできるものです。
StableDiffusionなんてわざわざ使うのはほんとマニアな、おっぱい1ミリ単位でこだわりたい変態だけだなって、ちょっと思ったりしてさ。
画面を見たしぶちょーさんは、画面にLoRAの表記があることを確かめつつ、権利的に怪しい絵も多いと指摘します。そのうえで、80点を100点にしたい人でなければPixAIで十分だろうと二人は話します。
しぶちょーさんも以前はローカルでやりたいと思ったものの、画像に命をかけているクリエイターではないため、Nano Bananaで十分になってしまうといいます。かねりんさんも、自分は絵ではなく声のクリエイターで、イラストや音楽は補助要素だと語ります。
話は音楽生成AIのSuno AIにも広がります。かねりんさんがSuno AIは結局ガチャだと言うと、しぶちょーさんは、ローカル生成の醍醐味はそのガチャ要素を減らせる点にあると応じます。
パラメータが調整できればできるほど、やっぱこれ変えたらこうなるよねっていう。ガチャ要素を減らしていくっていうのが、やっぱそのカスタマイズしてく、そのローカルの、生成の醍醐味だと思うわ。
シード値を固定すれば、同じプロンプトから必ず同じ画像を作ることもできます。ガチャではない中で自分の100%を作り込みたい人は、今でもStable Diffusionを使うのがよいと、しぶちょーさんは勧めます。
AIで楽になるはずが忙しくなる?ローカルは「無限」
かねりんさんが「時間が本当に溶けていった」とこぼすと、しぶちょーさんはAIがいることでかえって忙しくなっていると笑います。ClaudeのMAXプランを使うしぶちょーさんは、クレジットを使い切らなければという食べ放題のような感覚になるそうです。
一方でローカルのリソースを使った生成は、自分のPCの限界の範囲で「無限」に回せるとしぶちょーさんは言います。かねりんさんは、動画生成ではGPUの電気代もばかにならないため、Webサービスに課金したほうが安い場合もあるかもしれないと指摘しました。
RTX 4070で20時間、ローカルで作ったビデオポッドキャスト
しぶちょーさんは最近、ローカルで動画を生成した体験を話します。自身のビデオポッドキャストのゲスト収録でゲストの顔が撮れていなかったため、ゲストの顔を生成AIで作り、リップシンクで口を動かしたそうです。
しぶちょーさんのデスクトップPC(RTX 4070搭載)は、2時間の動画を生成するのに20時間動き続けました。会社の休み時間にリモートデスクトップで確認し、帰宅すると動画ができあがっていたといいます。
2時間の動画を生成するために20時間動いちゃった。
この作業のほとんどはClaude Code ── Anthropicが提供する、ターミナル上で動くAIコーディングエージェント。環境構築やファイル操作、コマンド実行を指示に沿って進められますに頼んで進めたそうです。オープンソースのツールの環境構築から、どのツールでどんな処理をするかの提案まで、Claude Codeがこなしました。
ダイジェスト版に激怒、AIへの「パワハラ」はNG?
20時間かけて生成したゲストの動画は、口が止まるなどの破損が2割ほどありました。するとClaude Codeは、止まった部分をカットしたダイジェスト版を作ってきたといいます。
(ダイジェスト版は)意味、それ意味ないよね。俺ビデオポッドキャスト作りたいんだから。
しぶちょーさんはぶち切れたものの、最近は強い言葉を使うとAIの性能が下がると言われているそうです。以前は、怒ることで指示が明確になるという意味で「上がる」と話していましたが、AIが感情に応じた出力を学んでいるという話が出てきたといいます。
さらに、暴言を吐いたユーザーには性能を下げるような制御がされているという一説もあるそうです。ただし、しぶちょーさんは真偽は定かではないとし、確証を得られるまで速報回では紹介しないと述べています。
冗談めかして、しぶちょーさんは「パワハラ用のエージェント」を別に用意する案を出します。Geminiは相談窓口を案内してくるうえ、Googleアカウントが凍結されると困るため、ChatGPTが向いているかもしれないと笑い話になりました。
しぶちょーさんの普段の使い方は、Claude Code中心です。番組の原稿も、Gemini、Claude、ChatGPTのディープリサーチ結果をMarkdownで書き出し、Claude Codeにまとめさせているそうです。
衰退ではなく変化、Stable Diffusionはどこにでもいる
脱線を経て、しぶちょーさんは本題をまとめます。Stable Diffusionは衰退したのではなく変化したというのが結論です。
Stability AIはハリウッド、広告、ゲーム、音楽などのオフィシャルな制作の裏側で動くエンタープライズ基盤となり、大手企業との提携で収益化しています。技術的なDNAを受け継ぐFLUXが、個人が使えるモデルの覇権を握っています。
入り口を奪われる
ChatGPTへの画像生成統合で、手軽さを求める人が離れる
経営危機
収益がないまま開発費がかさみ、創業者が追い出される
頭脳流出
主要メンバーが抜け、FLUXを開発
B2Bへ転身
映像業界の新体制で企業向け基盤となり、一般ユーザーはターゲット外に
それでもStable Diffusionには、オープンソースのエコシステムという強みがあり、アニメやイラストのカスタム領域では今も圧倒的な存在感を放っているといいます。
だからあの人は今ですね、実はいなくなったんじゃなくて、どこにでもいる。実は我々が触れている映像コンテンツとかに使われてる可能性もあると。
しぶちょーさんは学びの観点からも、ローカル生成を勧めます。使いこなすには画像生成の原理原則を学ばざるを得ないからです。ただし、十分なGPUが必要で、仕事用のMacBook Proを長時間使うのは発熱や寿命の面で不安があるとも話しています。
関連書籍は導入方法がすぐ変わるため、紹介は見送られました。これから触るなら、今話題になっているのはStable DiffusionよりもFLUXだそうです。ずっと「FLEX」と言い間違えていたしぶちょーさんは、最後に「FLUX」だと訂正していました。
ポッドキャストWEEKENDとPodcastミキサーの告知
番組の最後には、2つのイベントが告知されました。5月9日・10日のポッドキャストWEEKENDでは、おちつきAIがブースを出展し、PLAUDとの公式コラボでPLAUD NOTE Proなどの実機による文字起こし体験やノベルティ配布を行います。
ブース運営のためのボランティアスタッフも募集しており、午前・午後に2人ずつ、2日間で延べ8人ほどいると助かるそうです。希望者はXのDMか、公式サイトの問い合わせフォームから連絡してほしいとのことです。
翌週の5月16日(土)には、しぶちょーさん主催のPodcastミキサーで、からあげ先生とのコラボ登壇が予定されています。
まとめ
Stable Diffusionの名前を聞かなくなったのは、ChatGPTの画像生成統合、運営会社の経営危機、開発者の流出が重なった結果でした。それでもStability AIは映像業界向けのB2B基盤として生き残り、個人向けには後継のFLUXとStable Diffusionのエコシステムが、80点を100点にしたい人の道具として残っています。
- Stable Diffusionは2022年8月に公開され、無料・ローカル・改造し放題という特徴で画像生成ブームを起こした
- ChatGPTへの画像生成統合、Stability AIの経営危機、主要メンバーの流出が、名前を聞かなくなった要因とされる
- 元開発者たちがBlack Forest LabsでFLUXを開発し、ローカル画像生成の主役になっている
- 新体制のStability AIは映像業界向けのB2B基盤へ転身し、一般ユーザーは対象ではなくなった
- ComfyUIやLoRAなどのエコシステムは今も強く、ガチャではない作り込みを求める人にはローカル生成が向いている





