「Nano Banana超え」は本当?繰り返される逆張り驚き
今回の題材は、ByteDanceが提供する画像生成AI「Seedream4.0」です。Googleの画像生成AI「Nano Banana」を超えたと海外で話題になっており、しぶちょーさんはその騒がれ方自体に「いつものパターン」があると指摘します。
しぶちょーさんはこの現象を、個人的に「逆張り驚き」と呼んでいます。すごいAIが出ると、その1週間後ぐらいに「まだあれ使ってるの?こっちのほうがすごい」と別のサービスが驚かれる、という流れです。
うわ、これ世界変えるぜっていう、すごいAIサービスがバンって出てくると、大体その1週間後ぐらいに、「いや、あれもすごいけど、まだあれ使ってんの?こっちの方がすごいから」みたいな。
そのすごいやつを超えたやつみたいなやつが驚かれるっていう、これもずーっと歴史として繰り返されてきてる。
しぶちょーさんは、Seedream4.0自体が逆張りを狙って出てきたわけではないと言い直しています。あくまで「Nano Bananaはもう古い」という文脈で驚かれているのがSeedream4.0だ、という整理です。
登場
世界を変えそうなAIサービスが話題になる
約1週間後
「まだあれ使ってるの?」と別のサービスが持ち上げられる
繰り返し
すごいものを超えたものが驚かれる流れが、歴史として続いている
かねりんさんが戸惑った理由と、Seedreamの「素直さ」
実際にSeedream4.0を触ったかねりんさんの感想は「いまいちわかりにくかった」というものでした。Nano BananaはUIがシンプルで驚けたのに、Seedream4.0は迷宮入りしそうだったといいます。
しぶちょーさんは、かねりんさんのこの反応を台本に書いていたほど想定していました。Nano Bananaを触った後では、何に驚けばいいかわからないだろうと考えていたそうです。
しぶちょーさんの評価では、Seedream4.0は性能面でNano Bananaと同等か同等以上で、非常に競っている状態です。ただしその差は、高いレベルでの競り合いにすぎないといいます。
98点を99点にするみたいな、そのすごいレベルの高いところで競り合ってるような感じで。
実際ユーザーにとっては意外とそんなに変わらんと。
一方で、しぶちょーさんはSeedream4.0には「使いやすい」という特性があると話します。かねりんさんが使いにくく感じた理由は、Seedream4.0を使える画像生成AIの統合プラットフォームがたくさんあり、それぞれ使い方も料金体系も違うためだと考えられます。
かねりんさんは、統合プラットフォームで無料クレジットがどんどん減っていくのに焦ったり、生成に15分ほど待たされて失敗したりしたといいます。試したのは、夕日の周りを小さな動物が歩く画像を朝日に変えてもらう程度のプロンプトでした。
しぶちょーさんによれば、Seedream4.0は本来「爆速」で有名で、待たされたのはタイミングの問題かもしれないとのことです。そして、使い込むとNano Bananaより明らかに素直だとわかるといいます。
nanobananaはなんかね、こういう風にしてって言っても、そういう風にしてくれなかったりとか、こっちの言葉を正しく理解してくれねえなっていう時がある。
SIDREAM(Seedream)はもうほとんど、ちゃんと言葉で伝えれば言ったことやってくれる。
UIがシンプルで驚きやすいが、指示どおりに動いてくれないことがある
性能はほぼ同等以上。言葉で伝えたことを意図どおりにやってくれる「素直さ」がある
TikTokの会社が作った、Seedreamの歩み
Seedreamを提供しているのは、中国の大手テック企業ByteDance ── 中国・北京に本社を置くテック企業。短尺動画SNSのTikTokや、中国国内向けの抖音(Douyin)などを運営していますです。しぶちょーさんは、動画SNSのTikTokを作った会社で、2012年に設立された会社だと説明します。
Seedreamの最初のバージョン1.0は、2023年の初期に出ていました。ただ、しぶちょーさんによると性能は非常に微妙で、当時Seedreamを知っている人はほぼいなかっただろうといいます。
当時はStable Diffusion ── 2022年に公開された画像生成AI。オープンソースで配布され、個人のパソコンでも動かせることから爆発的に広まりましたやMidjourneyがすでにあり、ChatGPTの中でDALL・Eによる画像生成ができるようになった時期でした。Seedream1.0の特徴は、中国語に強い画像生成モデルだった点です。
中国語ネイティブから4.0のマルチモーダル化まで
しぶちょーさんによると、LLMはもともと、世の中のテキストで一番多い英語を中心に学習しています。そのため英語の理解度は高いものの、細かいニュアンスはネイティブでないと伝わりにくい面があります。
Seedream1.0は、中国語をベースに学習した言語モデルを使って作られた画像生成モデルでした。2.0では中国語だけでは限界があるとして、英語も学ばせるバイリンガル化が進みます。
2.0の更新ではRLHFも行われ、人のフィードバックを取り入れて性能を上げてきたといいます。かねりんさんは以前の回の内容を覚えていて、「強化学習」「アメちゃんあげるから」と答えています。
しぶちょーさんによれば、3.0は2025年3月に出ています。このときは画像生成のSeedream3.0と、画像をテキストで編集するSeedEditが別々に存在していました。
9月に出た4.0では、編集機能と生成機能が統合されてマルチモーダル化しました。Nano Bananaのように、言葉からの生成も、入力した画像同士を組み合わせて別の画像を作ることもできるようになったといいます。
技術資料を読んでも「特殊だ」という点はほとんどなく、しぶちょーさんは「頑張ってコツコツ作り上げてきた」正統派だと表現しています。だからこそ使いやすく、安定しているといいます。
日本人が使いやすく感じる理由は日本語への理解?
Seedream4.0がなぜ日本人にとって使いやすいのか。しぶちょーさんは、明確な論文があるわけではない俗説的な話だと前置きしたうえで、中国語ネイティブのモデルだから日本語の理解が高いのではないか、という考察を紹介します。
日本語でこうしてほしいって打った時の理解度がナドバナナ(Nano Banana)よりも全然高い。
同じプロンプトを打ってもNano Bananaよりよい画像が出るため、性能が高いように感じる。その正体は、日本語への解像度の高さではないかと言われているそうです。
かねりんさんが「英語で打った場合は差を感じないのか」と尋ねると、しぶちょーさんは英語ならそれほど差は出ないだろうと答えます。ただ、日本人がネイティブ並みの英語で細部まで表現するのは難しく、日本語で使いたいのが自然です。
カギは言語間距離と漢字
かねりんさんの「中国語と日本語って近いの?」という問いから、しぶちょーさんは「言語間距離」という概念を持ち出します。AIの文脈ではなく、外国語学習でよく言われる考え方です。
日本語と一番言語間距離が近い言語は韓国語で、その次が中国語だといいます。かねりんさんは、漢文の返り点のように語順が違うのに近いのかと驚きます。
知ってる漢字出てきたらなんとなく意味わかるところあるとよ。
しぶちょーさんのポイントは漢字です。文法は全然違っても、漢字という共通の文字を使い、意味も似ているため、日本語と中国語は近いと言われています。日本人が適当に作った中国語風の漢字の羅列でも、中国人になんとなく伝わるそうです。
Seedreamは中国語をネイティブとして学び、漢字を大量に学習しています。その効果で日本語への解像度も高くなっているのではないか、という考察です。しぶちょーさんは研究ベースではないので本当かはわからないとしつつ、辻褄が合うと話しています。
LLMは、文章の一部を隠して何が入るかを当てる学習を自分で繰り返す中で、漢字の意味を覚えていきます。しぶちょーさんは、「山」という漢字がマウンテンに近いといった位置づけが、学習の中でマップのように形づくられると説明します。
赤ちゃんがこの言語のなんとなく意味を学んでいくように賢くなっていく。
かねりんさんが言語間距離マップを見ると、英語は日本語の真反対にありました。しぶちょーさんは、この距離の遠さが日本人の英語学習の障壁になっていると言われていると話します。
中国語ネイティブ
中国語を中心に学習し、漢字を大量に取り込んでいる
漢字の共有
日本語と中国語は漢字を共有し、意味も似ている
言語間距離が近い
日本語にとって中国語は韓国語の次に近い
使いやすさ
日本語の指示を理解しやすく、思い通りに動くと感じる
中国製AIの壁と、国産LLMへの期待
かねりんさんが「日本は中国企業を応援したほうがいいのでは」と冗談を言うと、しぶちょーさんは日本語のLLMを作るほうがいいと返します。中国のサービスは、安全性の面から企業内では使いにくいのが現実だといいます。
アクセスさせてくださいって言ってもさ、中国のこの企業のって言ったら無理よね。
国産LLMについて、しぶちょーさんは日立やNTTなどの大企業や、NEDO ── 国立研究開発法人新エネルギー・産業技術総合開発機構。エネルギーや産業技術の研究開発を支援・推進する日本の公的機関ですをベースにしたプロジェクトがあると紹介します。ただ、「すごいのができた」というものはまだないそうです。
中国語を学んでて、日本語をちょっと理解してくれるのに喜ぶよりも、日本語でやってんだぜみたいなやつがね、出てきたらもうめちゃくちゃやりやすそうな感じもするけどね。
中国が強い理由について、しぶちょーさんは国家規模で取り組んでいる点を挙げます。アメリカから高性能GPUを渡してもらえない状況を糧に技術開発を進めた例として、DeepSeekを挙げています。
DeepSeekは、高性能GPUがなくても性能が出るよう知識蒸留 ── 大きなモデルの知識を小さなモデルに学ばせる手法。計算資源を抑えながら、元のモデルに近い性能を目指しますをして、小さく高性能なモデルを作ったといいます。しぶちょーさんは、多少盛っていたかもしれないが性能はすごいと話します。
しぶちょーさん自身は、個人ではDeepSeekのAPIを使うそうです。Claudeなどの高性能モデルは使うほどお金がかかって精神衛生上よくないため、お試し用として安いDeepSeekがちょうどいいとのことです。企業では使えないとも付け加えています。
英語で打つ時代は終わった?細部はネイティブ言語が強い
話を戻して、しぶちょーさんは言語間距離の関係もあり、中国語をベースに作られているからSeedreamは使いやすいとまとめます。ただしこれは検証した人がいない諸説で、SNSやネット上の考察を集めた結果だと念を押しています。
LLMが出始めた頃は、日本語を英語に訳してプロンプトを入れたほうがよい回答が得られると言われていました。最近はさまざまな言語をバランスよく学んでいるため、積極的に英語で入れなくてもよいと言われているそうです。
LLMは英語の学習量が多いため、英語に翻訳して入力したほうがよいと言われていた
多言語をバランスよく学ぶようになり、積極的に英語で入れなくてもよいと言われている
それでも、その国の文化や細かい表現までは学べていないとしぶちょーさんは話します。細かい表現を反映させたいなら、自分の言語に近い言語をたくさん学んだモデルがよく、それがSeedreamで表れているのではないかという見立てです。
かねりんさんの「情報は全部吸われる」という言葉に対し、しぶちょーさんは語弊があるとしつつ、中国系に限らずどこのサービスもいろいろな使い方をされていると考えたほうがいいと答えています。
画像生成の土台「拡散モデル」とStable Diffusionの時代
後半は、画像生成AIがそもそもどう画像を作っているのかという話に移ります。しぶちょーさんによると、画像生成AIのほとんど、あるいはすべてが拡散モデル(Diffusion model)という仕組みを基本にしています。
かねりんさんは、Stable Diffusionが流行った時期にローカルのデスクトップで回していたそうです。冬はパソコンがファンヒーターのようになったと振り返ります。
当時のプロンプトは、単語をクォーテーションで囲んで羅列し、先に来るほど優先度が高く、括弧で囲むと強調されるというものでした。二人は、まさに「呪文」と呼ばれていた時代を懐かしみます。
しぶちょーさんは、胸を大きくするプロンプトを真剣に検討するスレッドや、それをスライダーで調整できるようにした人を見て、「技術は変態によって進歩する」と感じたと笑います。
画像を壊しながら学ぶ?拡散モデルの仕組み
拡散モデルの「Diffusion」について、しぶちょーさんはドラゴンボールのフュージョンを例に、合体(fusion)の逆で「拡散する」という意味だと説明します。そして拡散モデルは、学習の過程で画像を壊しながら学ぶという特殊な方法を使っています。
正確には、どのようなノイズが加わったかを推定するモデルを作るのですが、しぶちょーさんは「ノイズを取り除く人がいる」とイメージすればよいと話します。猫の画像ばかり学んだモデルなら、ノイズ画像から、一度も学ばせたことのない未知の猫ができるといいます。
何ができるかわかんないじゃん、そんなね。
かねりんさんのこの疑問を、しぶちょーさんは「大事なところ」と評価します。拡散モデルはよく、崩されていく彫刻を横で見ていた職人が、崩れた粒を接着剤でくっつけて復元する様子に例えられるそうです。
狙った画像を作るカギ「条件付き拡散モデル」
ノイズから何の画像ができるかわからない問題を解決するのが、条件付き拡散モデルです。しぶちょーさんによると、ノイズから復元する際にテキストを使って方向づけします。
学習時には、元の画像と「これはこういう猫です」というテキストを、ベクトルに変換した形で一緒に学ばせます。すると「猫」と入れたときに、猫を復元するためのノイズ除去ができるようになります。
言葉をベクトルにして意味の空間に埋め込むことをエンベディング ── 言葉などのデータを、意味の近さが距離で表れる数値のベクトルに変換すること。似た意味の言葉は近い位置に置かれますと呼びます。かねりんさんは、猫っぽいものが集まる「猫空間」のようなものだと理解しています。
かねりんさんが、Midjourneyなどでモザイクのような状態からだんだん画像がはっきりしていくのは除去しているからかと尋ねると、しぶちょーさんは「まさにそんな感じ」で、あれが逆拡散過程だと答えています。
Stable Diffusionを変えた「潜在拡散モデル」
拡散モデルには、処理が重いという問題がありました。画像そのものに対してノイズ除去を何度も行うため、計算量が非常に多かったといいます。
そこで2022年に登場したStable Diffusionは、潜在拡散モデルという発想を使いました。ピクセルの空間ではなく、次元をギュッと圧縮した潜在空間でノイズ除去を行い、あとで復元するという方法です。
画像のピクセル空間で直接ノイズ除去するため計算が重く、研究室の大きなコンピューターが必要
圧縮した潜在空間で処理して軽くなり、家庭のGPUでも動くように
この軽量化とオープンソース化によって、Stable Diffusionは家庭のちょっといいGPUでも動くようになりました。しぶちょーさんは、紳士たちが胸の大きさを調整できたのもこの技術の過程があったからだと話し、かねりんさんは「技術の無駄遣い」と笑います。
しぶちょーさんのまとめでは、画像生成AIは画像を崩してノイズを除去する学習を繰り返し、テキストと一緒に学ぶことで条件付けができ、軽くなって今に至っています。
話はSeedreamへ。漢字の生成に強い理由
拡散モデルの話はSeedream4.0に戻ります。テキストの部分で中国語が多く使われていると、漢字の解像度が高くなり、意図した形が拡散過程で出てきやすくなるという見立てです。
しぶちょーさんによると、Seedream4.0がNano Bananaより圧倒的によいのは文字の生成です。広告のように文字を入れた画像でも、漢字を破綻なく綺麗に出してくれるといいます。
ただし、日本語と中国語で形の違う漢字が中国語寄りで出てきてしまうことがあり、修正が必要だとも言われています。Nano BananaもSeedreamも、基本は拡散モデルを使っており、大きな基盤モデルに画像生成の機能として付けている形だろうと話されています。
かねりんさんは、ひらがなやカタカナは変な形でしか出ないと指摘します。しぶちょーさんは、漢字は中国語でも使われるがひらがなカタカナは日本独自なので、日本語をたくさん学んだ国産LLMができるといいと話します。
仕組みがわかると、生成を待つ時間が変わる
かねりんさんは、ブラックボックスの中が少しわかったことで、画像が生成されている間も「今ノイズ除去しているんだな」とニヤニヤしながら待てるようになったと話します。
魔法ポーンじゃないっていうところに行けたのが嬉しい。
しぶちょーさんは、生成AIは拡散モデルを知らなくても使えてしまうからこそ、こうした話が大事だと語ります。中国語を学んだモデルがなぜ日本語に効くのかも、ふわっとつかめたのではないかといいます。
二人は、国産LLMで「みんなで驚きたい」と期待を語ります。海外サービスを使うとお金が国外に流れてしまうという点にも触れ、期待のベンチャーもあり「ここからじゃない」と締めくくっています。
まとめ
Seedream4.0は、性能面ではNano Bananaと僅差の競り合いですが、日本語での指示が通りやすいという「素直さ」に特徴があると話されています。その背景には、中国語ネイティブで漢字を学んだことによる言語間距離の近さがあるという、検証前の考察がありました。さらに画像生成AIの土台である拡散モデルを知ると、生成の仕組みと日本語が効く理由がつながって見えてきます。
- Seedream4.0の性能はNano Bananaと同等以上だが、ユーザー体験としての差は大きくないとされる
- 使いやすさの正体は、中国語ネイティブのモデルゆえの日本語理解の高さだという考察がある(諸説あり)
- 日本語と中国語は漢字を共有しており、言語間距離は韓国語の次に近い
- 画像生成AIは、画像にノイズを加えて除去する過程を学ぶ拡散モデルが基本で、テキストによる条件付けと潜在空間での軽量化で普及した
- 漢字には強い一方、ひらがなやカタカナは苦手で、国産LLMへの期待が語られた





