ワンボタンで破綻しない曲ができる時代とは?
今回のテーマは「誰でも音楽クリエイター?音楽生成の仕組み」です。しぶちょーさんによると、Suno AIなどの音楽生成AIはここ数ヶ月でまた大きく良くなっているといいます。
実際に触ってみたかねりんさんは、ワンボタンでそれなりの曲ができると感じたそうです。ポッドキャストのBGM程度なら十分使えるのでは、という感想に、しぶちょーさんも「相当破綻なくできるようになっている」と同意します。
しぶちょーさんはベーシストで、打ち込みで1曲を通しで作ったこともあるそうです。一方のかねりんさんは、DTM ── デスクトップミュージックの略。パソコンを使って作曲や編曲、録音を行う音楽制作のことを始めようとキーボードを買ったばかりの初心者です。
この回は、作曲を少しかじった視点と初心者の視点の両方から、AIに音楽を作らせようとしてきた人たちがどんなアプローチをとってきたのかを、歴史順に掘り下げていきます。
Suno AIだけじゃない、音楽生成AIの顔ぶれ
しぶちょーさんはまず、いま使える音楽生成ツールを紹介します。Suno AIのほかに、画像生成AIのStable Diffusionと同じ会社が出している音楽版のStable Audioがあり、これも出来がよいそうです。
珍しいところでは、日本発のSoundrawもあります。しぶちょーさんは、日本人にとても使いやすく作られた音楽生成AIのサービスとして挙げています。
しぶちょーさんは、AIはあらゆるものを「民主化」しがちだと指摘します。作曲AIも「誰でも音楽を作れる時代になった」という作曲の民主化の文脈で語られることが非常に多いといいます。
では、曲はどうやって自動生成されているのか。かねりんさんは「画像より意味わかんない」と率直に話し、しぶちょーさんも音楽は要素や概念が明らかに多いと応じます。ここから、作曲AIの歴史をたどる本題に入ります。
1960年代の作曲AIは「ルールベース」だった
しぶちょーさんによると、AIで作曲しようという試みが始まったのは1960年ぐらいです。当時はAIというより「ルールベース」と呼ばれる手法でした。
ルールベースとは、「こう来たらこうする」というルールを人が必ず決めておき、その通りにプログラムが動く方式です。しぶちょーさんは、学習をしていないのでAIではない、と整理しています。
音楽にルールベースが使えたのは、音楽には音楽理論というルールがあるからです。キーやスケール、拍子、小節、コード進行など、よほど外さなければ普通に聴こえる組み合わせが決まっています。
Cメジャーのコード進行でバーって流れてるところにドレミファソラシド適当に打てば、なんとなく曲っぽくなるみたいな。
こうしたルールをあらかじめ決め、どこかに乱数を持たせておけば、ボタンを押すたびに破綻のない新しい曲ができます。かねりんさんは「味気なさそう」と反応し、昔の着メロや8bit音楽のようなイメージだと話しています。
犬と猫を見分けられないルールベース、機械学習との違いは?
かねりんさんが「ルールベースは昔の手法なのか」と尋ねると、しぶちょーさんは、ルールベースで成り立つものは今でもルールベースでよいと答えます。人がルールを決めて判断できるものは、そのほうが意図通りに動いて安定するからです。
一方、人がルールを決められない問題では、AIに判断基準を持ってもらう機械学習が強みを発揮します。しぶちょーさんは、画像で犬と猫を見分ける例で説明しました。
犬にはコーギーもボルゾイもパグもいて、鼻の長さもまちまちです。人間は見れば犬か猫かわかりますが、その特徴をすべてコンピューターに言語化して教えるのはほぼ不可能だといいます。
とにかく正解のデータと答えを渡しとくから、自分で学んでっていうのが機械学習っていうのね。
人がルールを全部決め、その通りに動く。意図通りで安定するが、言語化できない判断には使えない
正解のデータを渡し、判断基準をAI自身に学ばせる。犬と猫の見分けのように言語化が難しい問題に強い
しぶちょーさんによれば、ゴールデンレトリバーと猫のように犬種が決まっていればルールでも見分けられるかもしれませんが、「犬」という大きなジャンルになると不可能だそうです。1960年から1990年ぐらいまでは、このルールベースの作曲の時代が続きました。
生物の進化をまねる「遺伝的アルゴリズム」の作曲法
1990年ぐらいから、AIと呼んでよいか微妙ではあるものの、AIに近いものが登場します。それが遺伝的アルゴリズム ── 生物の進化を模した最適化手法。候補の生成、評価、選択、交叉、突然変異を繰り返し、より良い解を探していきますを使った作曲です。
遺伝的アルゴリズムの作曲は、生物が淘汰されながら世代ごとに進化していく仕組みを、パソコン上で再現するものです。しぶちょーさんは、その流れを順に説明しました。
ランダムに作曲
まず大量の曲をランダムに作らせる
指標で選ぶ
「曲っぽい」基準を満たすものをピックアップする
交配と突然変異
選んだ曲同士を混ぜたり、少しだけ変えたりして次世代を作る
世代交代を繰り返す
前の世代を捨て、新しい世代からまた交配させる
良し悪しの判断は、人が介入することもありますが、基本的には基準を設けて自動で合格を決めます。こうして何千曲も試作しながら、人が好むメロディに育てていくのがこの手法で、2000年ぐらいまで流行したそうです。
ただし、遺伝的アルゴリズムは1曲を作るのにとても時間と計算量がかかります。同じような曲に収束したり、逆に発散しすぎたりすることもあるといいます。
そのために世代がどんどん変わって、いっぱいご先祖様が死んでいくんだけどさ。
しぶちょーさんは、ランダムな試行錯誤の積み重ねが音楽の本質なのかという議論があると紹介します。音楽は確率ではなく音のつながりで、前のフレーズを踏まえて次が決まるべきだ、という考え方です。
次の一音を予測する「再帰型ニューラルネットワーク」
2010年ぐらいから、RNNやLSTMと呼ばれる再帰型ニューラルネットワーク ── 出力を自分自身にぐるっと戻して次の計算に使う構造を持つニューラルネットワーク。文章や音のような順番のあるデータを扱うのに使われてきましたを使った作曲が登場します。
ニューラルネットワークは、脳のニューロンを模したネットワークのつながりです。番組のアートワークにある、粒と線のつながった絵がそれを表しているそうです。基礎的な用語は今後の回で1つずつ説明していくと話しています。
しぶちょーさんが特に1時間かけて説明したいのは、GPTの「T」にあたるトランスフォーマーです。2017年に有名な論文が発表されてから、AIが一気に発展したといいます。
再帰型ニューラルネットワークは、前のフレーズを踏まえて次の一音を決めるモデルです。言語生成AIが次に来る単語を確率で予想しているのと、まったく同じ考え方だとしぶちょーさんは説明します。
「私は支部長」で来たら「です」って予想するように、ドレミファソラシドの流れが来たら次の音はこれだみたいな。
この段階で、かねりんさんは「ようやくAIっぽくなってきた」と反応し、しぶちょーさんも「これはAI」と答えています。
永遠にサビが来ない?短期記憶しかないAIの限界
再帰型ニューラルネットワークには、言語でも音楽でも共通する問題がありました。長期の記憶を保存できず、ちょっと前の流れまでしか覚えていられないのです。
(曲の)Bメロの途中ぐらいまでしかこいつは考慮してくれないから。永遠にサビ来ないみたいな。
その瞬間のメロディは自然でも、曲全体で見ると抑揚がなく、ずっとAメロを繰り返したり、ずっとサビが続いたりしてしまいます。二人は「一生イントロみたいな曲」「一生オチがない話」とたとえました。
救世主トランスフォーマーで曲全体を見渡せるように
この限界を超えたのが、2017年に登場したトランスフォーマーです。言語で広く使われた優秀なモデルで、音楽にも使えるのではないかと考えられました。
しぶちょーさんによると、それまでのモデルは予測したい位置の少し前までしか考慮できませんでした。トランスフォーマーは全体を見通し、どこが重要かという重要度をつけて、関係性を瞬時に捉えられます。
再帰型ニューラルネットワークは少し前の流れまでしか覚えられず、サビや展開を組み立てられない
トランスフォーマーは曲全体を見渡し、ここはサビ、ここはAメロと考慮しながら作曲できる
GoogleはMusic Transformerというモデルを出し、Pythonで動くMagentaというライブラリから使えるようになりました。しぶちょーさんが作曲AIを触り始めたのもこの頃で、公開年はMusic Transformerの公開年だとしています。
きらきら星や民謡の途中までを入れて後半を任せると、途中から違う曲になるのに違和感がない、という遊びができたそうです。しぶちょーさんは「超面白かった」と振り返ります。
ギリギリスーパーで流せるか流せんかぐらい。
ただし音はまだチープで、着メロよりはだいぶいいものの、スーパーのBGMとしてギリギリ違和感がないかどうかのレベルだったといいます。
2年前はこのレベル?AIミュージックバトル「弁財天」
しぶちょーさんが友達に教えてもらったのが、2023年に1回だけ開かれたAIミュージックバトル「弁財天」です。日本の大学が主催したイベントで、YouTubeに動画が残っているそうです。
弁財天のルールは、コード進行とバッキングのMIDI ── 音の高さや長さなどを演奏情報として記録するデータ形式。音そのものではなく楽譜に近い情報を扱いますデータだけを当日渡され、それに合う主旋律のメロディを5分でAIに作らせるというものです。参加者は学習済みのモデルや解法を事前に用意して臨みます。
しぶちょーさんは、2年前の動画を見るとみんな「こんなレベルだったのか」と驚くはずだと話します。それでも8組の参加者は、それぞれ違うアプローチで工夫していたそうです。
- 音楽生成をあきらめ、楽譜の画像を生成してから音に変換する
- 生成された音のうち、外れたピッチだけを強制的に修正する
- どう作曲したかという解法を、決勝まで含めて解説している
外れた音を戻す工夫を、かねりんさんは「歯列矯正みたい」とたとえました。めちゃくちゃな創意工夫でなんとか曲を成り立たせていた時期だったことがわかります。
急な進化の正体は、画像と同じ「拡散モデル」
2023年の弁財天から、今ではボーカル入りで日本語の歌まで歌う曲が出てくるようになりました。なぜこれほど急に進化したのかを問われ、かねりんさんは前回の画像生成の話を思い出して答えます。
拡散なんとかだからノイズを、ノイズから来るんでしょ。ザーっていうノイズから逆算して作るんじゃないの?
しぶちょーさんは「マジで正解」と答えます。現在の音楽生成AIも、画像と同じ拡散モデル ── データにノイズを加えて崩していく過程を学習し、その逆をたどってノイズから本物らしいデータを復元する生成手法。ディフュージョンモデルとも呼ばれますを使っているそうです。
音楽の拡散モデルでは、学習時に音へノイズを入れて砂嵐のような音にし、その過程を逆に学んでいきます。そして生成時には、ノイズの音から本物の音を復元していくのです。
音楽は画像より難しい?「濃縮還元ジュース」で考える
しぶちょーさんによると、音楽の拡散モデルは画像より段違いに難しいといいます。まず、データの量が膨大です。
1000×1000ピクセルでも約100万点。1枚の平面として扱える
44.1kHzなら1秒ごとに大量のサンプルがあり、時間軸も考慮が必要
さらに音楽には、メロディ、コード、リズム、拍子といった階層的な構造や、イントロ・Aメロ・サビの展開、左右のステレオ、ボーカルやベースなどの音色もあります。拡散モデルを使えば一発で出るというものではなかったそうです。
研究者たちはこの難しさを、StableDiffusionでも使われた潜在拡散モデル ── データを一度圧縮した潜在空間に移し、その中で拡散モデルの処理を行う手法。計算量を大きく減らせるのが特徴ですで乗り越えていきます。いったん次元を落とした領域に変換し、そこで計算する方法です。
イメージで言ったら、あの濃縮還元ジュースみたいなもんですね。
100%オレンジジュースはたくさん運ぶと重いので、原液だけ運んで現地で水を足します。音楽も同じように、一度ギュッと圧縮した状態でノイズを加える処理をし、終わったら元に戻すと軽く扱えるといいます。
濃縮する
たくさんの要素がある音楽を、AIが扱いやすい形に圧縮する
処理する
圧縮した潜在空間の中で、ノイズを加える拡散の処理を行う
還元する
処理が終わったら、元の音楽のデータに戻す
潜在拡散モデルとトランスフォーマーの組み合わせ
しぶちょーさんは、潜在空間を「AIが本物のデータを理解しやすい軽い形に圧縮した世界」と説明します。人間にとっての圧縮ではなく、AIが学習しやすい形への圧縮だという点がポイントです。
現在の作曲AIは、潜在拡散モデルで生成を担い、入力の部分にはトランスフォーマーを使うという組み合わせが基本構成だといいます。
ただし、Suno AIは中身のモデルを公表していません。Stability AIのStable Audio 2.5はこの構成に近い形で、Sunoも同様だろうと予想されている、としぶちょーさんは話しています。
今回のオチ、すべてのAI進化は2つの技術につながる
しぶちょーさんは、技術パートのまとめとして「全部つながっている」と語ります。動画、画像、音楽と、AIが急にあちこちで噴火したように見えても、実態は違うといいます。
その技術とは、拡散モデルとトランスフォーマーの2つです。新技術が次々に出ているのではなく、1つの技術が派生していると捉えてほしい、というのが今日の技術的なオチでした。かねりんさんは「結構解像度高くなるね」と応じています。
AIの脳みそは1つに?基盤モデルとサービスの未来
しぶちょーさんによると、これらの技術は基盤モデル ── 大量のデータで学習し、さまざまなタスクに応用できる汎用的な大規模モデル。ファウンデーションモデルとも呼ばれますとして1つにつながっていく流れがあります。音楽も動画も画像も言語も出せる、1つの大きな脳みそを作る流れです。
かねりんさんが、Sunoのような音楽特化のサービスはなくなるのかと尋ねます。しぶちょーさんは、特化サービスはUIとして明らかに使いやすく、ビジネス的に統合されることはあっても、という見方です。
何でもできるAIばかりになれば、どこを使っても同じになるのか。しぶちょーさんは、車好きとしては本意ではないと断ったうえで、車にたとえます。
結局AIもそれに近いんじゃない?って思って。別に何でもできるようになったら何でもできるようなサービスが世の中にいっぱいあって、
どれを使うかっていうのはその微妙な差で決めていくみたいな。
同じようなミニバンが各メーカーから出ているように、AIサービスも微妙な差で選ばれていくのではないか、という見立てです。
Suno AIは訴訟中、音楽生成AIと著作権の問題
かねりんさんは、音楽AIはつまらない曲が多く、ガチャのようで使っていても面白くないと打ち明けます。だからこそ自分でDTMを学ぶ道を選んだそうです。
Sunoのような音楽AIが今後どうなるかについて、しぶちょーさんは法的な問題が大きく関わってきそうだと答えます。Suno AIは大手レコード会社などから、学習に音楽を使っているとして訴えられているといいます。
絵も同じ道を通ってきましたが、音楽のほうが問題は顕著だそうです。特定の曲にそっくりな曲調が出てしまうことがあるためです。
利用者が訴えられることはほぼないとしつつも、似すぎた曲を出せば権利者から指摘されるおそれはあり、出した人の責任になるとしぶちょーさんは注意を促します。
(Suno AIで)曲作ってさ、作曲しましたって言ってさ、ドヤってる人見るとさ、すごいモヤっとすんだよね、すごい。
絵は描けないが曲は作ったことがあり、大変さを知っているからこそ、クリエイター側の気持ちが少しわかった、としぶちょーさんは話しています。
AIが作った曲は誰のもの?「創作」の曖昧な線引き
しぶちょーさんによると、生成AIで作ったものの著作権が誰にあるのかは、まだ解決していません。基本的には、生成した人の著作物ではなく、誰の著作物でもない状態だといいます。
著作物は「思想または感情を創作的に表現したもの」で、文芸・学術・美術・音楽の範囲に属するものと定義されています。ポイントは、生成AIの利用が「創作」に当たるかどうかです。
創作のツールとして生成AIを使った。ペンで絵を描くのと同じ扱い
なんとなく生成AIのサービスを使って作っただけ
しぶちょーさんは、ツールとして使ったと本人が主張すれば創作になりうる、と曖昧さを指摘します。かねりんさんは、生成したものをDTMで手直しするなど、より創作らしい行動を入れれば身を守りやすいかもしれない、と整理しました。
Suno AIについては、訴訟の結果で作ったものすべてがだめになるとは考えにくいものの、まだ争っている最中だと知りながら使うのがよい、としぶちょーさんは話しています。
安心して使える日本発の「Soundraw」
すべての音楽生成AIが同じ状況ではありません。しぶちょーさんが挙げたのが、日本発のSoundrawです。
Soundrawは学習に使う音源をすべてフリー音源にしており、最初から著作権的に大丈夫なように作られているといいます。曲調をうまくコントロールでき、クリエイターが安心して使えるツールとして開発されているそうです。
日本人らしい、やっぱ礼儀正しい生成AIですよ、これは。
かねりんさんが、結果的に既存曲と似てしまうことはないのかと尋ねると、しぶちょーさんは、それは人間の作曲でも同じだと答えます。いいメロディを思いついたら既存の曲の一部だった、ということはよくあるそうです。
まるごと同じでなければ許容される気がする、というのがしぶちょーさんの見方です。一方で、AIで作った曲同士が似た場合の権利はさらにカオスになりそうだ、と二人は話しています。
生成AIの使い手を超えるものは作れない
しぶちょーさんは、自分で学ぶことがとても大事だと語ります。民主化とは、クリエイターもどきを量産することではなく、自分の創造のために技術を使いやすくしてくれることではないか、という考えです。
最近読んだ本で知った経験則として、しぶちょーさんは「生成AIは使い手以上のレベルのものを生成できない」という考え方を紹介します。
本人にその分野の知識がなければ、いいものって選び続けられないよねって。
たくさんの成果物から選ぶのは本人の力量やセンスです。プログラムでも、なんとなく動くコードが出てきても、中身がわからなければそれ以上のものは作れない、としぶちょーさんは話します。
かねりんさんが、感覚派のアーティストはどうかと尋ねると、しぶちょーさんは感覚派は今もいると答えます。ツールが1つ増えた、という捉え方ならいいと思う、というのがしぶちょーさんの見方です。
AIが優等生だから、人間に「ぶっ飛んだ発想」が要る
かねりんさんはSoundrawを触った感想として、動かせる変数が限られていて似たり寄ったりの曲しか出ず、ぶっ飛んだ音楽との出会いがないと話します。海外のフリー素材サイトを見ているほうがよほど楽しいそうです。
しぶちょーさんも、音楽は例外が生きる世界で、あえてのコード進行がその人の味になると応じます。生成AIの曲は、お利口にまとまってくるといいます。
二人は、人間が暴走してAIが止める関係になるのかもしれない、アイデアを持つ普通じゃない人が輝くのではないか、と話を広げます。
一方で、ぶっ飛び度合いすらAIのパラメータで設定できるようになるかもしれません。しぶちょーさんは、生成AIにはtemperature ── 生成AIの出力のランダムさを調整するパラメータ。高いと意外性のある回答に、低いと堅実な回答になりやすくなりますという、変な回答か堅実な回答かを決める設定がすでにあると紹介します。
かねりんさんは、AIが計算するようなぶっ飛び方ではぶっ飛んだことにならない、と外れ値としての人間の意味を強調しました。
人間とは何か?AIの進化が突きつける問い
しぶちょーさんは、AIが人間らしくなるほど、知能とは何か、言葉とは何か、人間とは何かを問われる時代になってきていると話します。普段使っているものを深掘りしないとAIに飲まれる気がする、といいます。
本業の製造業でも、しぶちょーさんは工場の自動化に疑問を抱くことがあるそうです。人手不足解消のために自動化を進めても、「人は人ができることをやりましょう」というふわっとした話で終わりがちだといいます。
じゃあそれを一生懸命作ってさ、工場に導入した技術者は人を本当に幸せにしたのかみたいな感じになるよね。
ノウハウを持つオペレーターをいないものとして仕組みを作るのか、その人が活躍できる仕組みを作るのか。しぶちょーさんは、AIの文脈でも同じ議論がたくさん出てくると話しています。
かねりんさんは、AIで効率化しているはずが、出力をコピーして貼り付けるAIのお世話係になっている気がすると明かします。AIとの壁打ちで時間を溶かす人も多いといいます。
AIに魂を入れる、コピペで満足しないために
かねりんさんは、AIは見た目がそれっぽいものを作れすぎるため、本当に思想が入っているのか疑わしくなると指摘します。しぶちょーさんも、全部疑ってかかる視点がないと脳みそを食われてしまうと応じます。
なんか意気揚々とさ、AIに聞いたらこういう回答をいただきましたみたいなことを平気でメールに貼ってくる人いるんだけどさ、
お前の脳みそどこ行っちまったんだって。
しぶちょーさんの考えでは、出力を見ていいと思えばそのまま使えばよく、足りなければ書き加えればよい、というものです。成果物には魂を入れる入魂が要ると話します。
かねりんさんは、AIに驚いて喜んでしまっているからこそ、そのまま上司に出してしまうのだろうと分析します。しぶちょーさんは、生成AIのアウトプットがいかにシステマティックで非人間的なものかを理解すれば、魂を入れたくなるはずだと語りました。
腰を据えて学んでこそ落ち着ける
エンディングで、しぶちょーさんは今回がとても長くなったことに触れます。トピック回が1時間で長くて落ち着けない、という声もあったそうです。
もうこの時代にね、ちょっとやそっとで落ち着けると思ったら大間違いよ。
かねりんさんは、腰を据えないと落ち着けないと返し、中途半端な長さではかえってそわつくだけだと話します。最後にしぶちょーさんは、魂を入れてこそ著作物という言葉を今回のオチにしました。
まとめ
作曲AIは、1960年代のルールベースから、遺伝的アルゴリズム、再帰型ニューラルネットワーク、トランスフォーマーを経て、潜在拡散モデルによる現在の姿にたどり着きました。技術の核を知ると急な進化の理由が見え、そのうえで著作権や人間の役割を考える視点も持てます。
- 作曲AIは約60年前のルールベースから始まり、遺伝的アルゴリズム、RNN、トランスフォーマーへと進化してきた
- 現在の音楽生成AIは、潜在拡散モデルでの生成とトランスフォーマーでの入力を組み合わせる構成が基本とされる
- 画像・動画・音楽のAIの急な進化は、拡散モデルとトランスフォーマーという2つの技術の派生と捉えられる
- Suno AIは訴訟中で、AI生成物の著作権は「創作」に当たるかどうかの線引きが曖昧なまま
- 生成AIは使い手以上のものを作れないため、学んで判断し、成果物に魂を入れることが人間に求められる




