何時間も読み上げた声が、今は10秒で作れる?
この回のテーマは「なぜAI音声生成はこれほどまでに進化したのか」です。しぶちょーさんは、ポッドキャスターとしても見過ごせない話題だとして、人の声をAIで生成する技術を取り上げます。
しぶちょーさんが音声生成の話題の「はしり」として挙げたのが、テキストを入れると西村博之さんが喋っているような音声を作れる「おしゃべりひろゆきメーカー」です。登場は2022年9月ごろで、ChatGPTより前だったといいます。
だからChatGPT出るより前に出てたのよ。
しぶちょーさん自身も、2年ほど前に自分の声のAIを作ろうとしたことがあります。画面に表示される文章を読み上げて登録する方式で、ひろゆきメーカー級の品質には8〜10時間分ほどの音声が必要だったそうです。
一番軽いプランでも2〜3時間、国語の音読のような作業を続けたものの、できあがったAIボイスは「若干似てる」程度で、完璧には程遠かったと振り返ります。
二時間半、三時間頑張って、これ、まあこれか、でも使えなくはないなぐらいのが二年ぐらい前にやってたんだけど。
今は全然そうじゃないですよ。
しぶちょーさんによれば、今は10秒ほどの音声があれば、その人の声がかなり生成できてしまうといいます。動画生成AIのSora ── OpenAIが開発した動画生成AI。テキストから映像を作り出し、音声付きの動画も生成できる機能が話題になりましたでも、アニメキャラクターの声が再現されている例があると紹介されました。
2年ほど前は、表示された原稿を2〜3時間読み上げても「若干似てる」程度
今は10秒ほどの音声でも、その人の声がかなり生成できる
本物のしぶちょーとAIボイス、どっちがAI?
しぶちょーさんは、実際のクオリティを確かめるためにクイズを用意しました。自作のAIボイスと本人が収録した音源をAとBの2つで流し、かねりんさんがどちらがAIかを当てるというものです。
何度か聞き比べたかねりんさんは、最初「両方AI」と答え、どちらかは本物だと言われて「BがAI」と判断します。しかし正解は「AがAI」でした。
でんもーとか言ってんじゃん。ハローアウトだよ、これ。AIです。
いや、これ寄せたの。寄せた。ちょっとAIには寄せてる、俺はね。喋り方はね。
本物のBは、しぶちょーさんがわざとAIっぽく喋ったものでした。かねりんさんは、AIのAで違和感があったのは「テーマ」の発音くらいで、言われなければスルーしていたと認めます。
いやいや、寄せてわかんなくなるってやばくない?
しぶちょーさんによると、このAIボイスはテキストを書いて読ませただけのTTS ── Text-to-Speechの略で、文字を入力すると音声に変換して読み上げる技術のことです。学習させたモデルを使えば、かねりんさんが喋った声をしぶちょーさんの声で上書きする変換もできるといいます。
そういうこともできるような時代になってきてしまっているんですよ。これやばくない?俺もね、キモって思ったもん。
原稿なし、雑談2時間で作れるAIボイス
クイズで使ったAIボイスは、10秒ではなく結構な量の音声を学習させたものでした。ただし、原稿とセットの正解データを与えたわけではなく、ポッドキャストの収録音源をそのまま入れただけだといいます。
ただ俺が雑に喋った時間、そのポッドキャストとかの収録音源をそのままボンって入れてるだけ。
比較のために、無料で作れる10秒版のAIボイス(音声C)も流されました。「テーマ」が「手間」に聞こえるなど、かねりんさんも「これは全然だな」と判断できる品質でした。
それでも、しぶちょーさんによれば、この無料の10秒版のほうが、以前2〜3時間かけて原稿を読んで作ったモデルより若干品質が高いそうです。クイズのAIボイスは、ポッドキャスト2本分、約2時間の音声を入れただけで作られています。
| 作り方 | 必要な音声 | 品質 |
|---|---|---|
| 2年ほど前、原稿を読み上げて登録 | 2〜3時間 | 若干似ている程度 |
| 無料の10秒版(音声C) | 約10秒 | 声質は近いが違和感が大きい |
| 有料版に収録音源をそのまま投入(音声A) | 約2時間 | 本人と聞き分けられない |
しぶちょーさんは、かねりんさんの声でも作れてしまうと話しつつ、倫理的な理由で本人に無断で作るのはやめたと明かします。
普通にさ、俺が配信の一部をAIでやってたとしても気づかないレベル。
ゆっくりボイスはなぜ今も使われる?
ここから、しぶちょーさんによる「お勉強ゾーン」として、音声生成の歴史と仕組みの話に入ります。従来の音声合成の代表例として挙げられたのが、ニコニコ生放送のコメント読み上げなどで知られる「ゆっくり実況」の声です。
しぶちょーさんの説明では、ゆっくりボイスはAIではなく、登録された音の断片をつなぎ合わせる方式の音声合成です。そのため、つなぎ目が不自然に聞こえたり、滑らかさに欠けたりします。
ゆっくりボイスの中身は、株式会社アクエストのAquesTalk ── 株式会社アクエストが提供する音声合成エンジン。軽量で動作が速く、ゆっくり実況の声として広く知られていますです。しぶちょーさんは、今も使われている理由として、文化として親しまれていることに加えて、非常に軽量でリアルタイムの合成が速いことを挙げます。
そう、見れるし、あれ聞きすぎて聞けるような体になってんだよ、我々はね。
かねりんさんは、ゆっくりボイスが急に滑らかに喋り出したら需要がなくなりそうだと応じ、しぶちょーさんも「あの形が大事」と同意しました。
WaveNetは何を変え、何が課題だった?
しぶちょーさんによれば、音声合成の転機は2016年です。Googleに買収されたDeepMind ── イギリス発のAI研究企業で、現在はGoogle傘下。囲碁AI「AlphaGo」の開発で世界的に知られていますが、ディープラーニングを使った音声合成モデル「WaveNet」を発表しました。
WaveNetは音の断片をつなぐのではなく、音声そのものを生成します。しぶちょーさんは、前の波形から次の波形の形を予想していくモデルだと説明し、ひろゆきメーカーのような声もおおむねこの仕組みで作られていると話します。
音声の波形あるじゃん、こうね。我々もうね、親の顔より見てるかもしれない。ポッドキャスターがね。
一方で、WaveNet方式には課題がありました。テキストと対になった音声が大量に必要で、学習にも時間がかかります。さらに、学習しすぎて精度が落ちる「過学習」も起こりやすいといいます。
しぶちょーさんは過学習を、1冊のドリルを丸暗記した結果、別の問題が解けなくなる状態にたとえます。時間軸を持つ時系列データは、特に過学習を起こしやすいそうです。
そう、一問目はあ、答えが二だなっていう風に覚えちゃうみたいな。
しぶちょーさんが一番の問題として挙げたのは、別の人の声に「転移」できないことです。かねりんさんの声を学習したWaveNetのモデルは、しぶちょーさんの声には使えず、人ごとに大量のデータで学習し直す必要がありました。
仕組み
前の波形から次の波形を予想する
データ
テキストと対になった音声が大量に必要
学習
時間がかかり、過学習のリスクもある
転移
1人用のモデルを他の人の声に使えない
結果
8〜12時間ほど読み上げないと、その人らしい声が作れなかった
音声を「トークン」にしたら何が起きた?
しぶちょーさんが「パラダイムシフト」と呼ぶのが、Microsoftが2023年1月に発表したTTSモデル「VALL-E」です。音声を、テキストの言語モデルと同じように扱えるようになったといいます。
テキストのLLMは、文章を入れると次の単語を予想して文章を作ります。しぶちょーさんによれば、VALL-Eは同じ方式で声も生成できるようにしました。かねりんさんの「波形じゃなくなったってこと?」という問いに、しぶちょーさんは「音声をトークン化した」と答えます。
だからこの波形の、この秒数の、この瞬間の音っていうのは、この番号ですよみたいな。
しぶちょーさんの説明では、トークン化された音声は、人間には想像できない高次元の空間に写し取られます。そこには発音や意味、声のトーン、その人の声色といった要素が抽象化されて保存されます。
この扱い方で可能になったのがインコンテキストラーニング ── モデルを追加で学習させず、プロンプトの中に例を与えるだけで、その場でタスクに対応させる手法です。プロンプトに誰かの音声を少し与えると、その人の声色が空間のどのあたりにあるかを見つけ、入力テキストをその声で読み上げられるといいます。
支部長っぽい、なんかあれだね、低音の人たち、中低音の人たちみたいな。似たところ取ってくるんだ。
しぶちょーさんは、学習されていない領域でも、声の「中間」を取ることで音を生成できると補足します。声質の近い人がまとまっている仕組みは話者エンベディング ── 話し手の声の特徴を数値のベクトルで表したもの。似た声質の人ほど近い位置に配置されますと呼ばれています。
声質の判別について問われたしぶちょーさんは、時間と周波数の強さを人の聴覚に合わせて表すメルスペクトログラムも学習要素の1つだと説明しました。かねりんさんは、Auditionでの編集中に表示される赤いヒートマップのことだと理解します。
こうした要素を抽象化して学習したものが「Codec Language Model」です。しぶちょーさんは、学習済みのモデルから「探しに行く」形になったため、短い音声でもその人らしい声が作れ、長く入れるほど精度が上がると話します。
そう。すでに学習済みのモデルから探しに行くっていうことになってるから、
1人ずつ専用モデルを作り、波形を予想する。大量のデータと学習時間が必要
音声をトークン化し、学習済みの共通モデルから声を探す。10秒ほどの音声でも生成できる
ElevenLabsで何ができて、いくらかかる?
しぶちょーさんがクイズのAIボイス作りに使ったのが、2022年創業のスタートアップ「ElevenLabs」です。本拠地は明かされていないものの、ロンドンかサンフランシスコあたりと報じられているそうです。
ElevenLabsは音声合成を中心に、テキストの読み上げ、AIボイス、ボイスクローン、ボイスチェンジャーを提供しています。
しぶちょーさんが特に便利で怖いと感じた機能が「話者分離」です。2人の会話音声をそのまま入れても、片方の声だけを取り出して学習に使えるといいます。
だからkaneriにちょっと電話しようぜつってさ、なんか二時間ぐらい喋ってたらもう音声取られてるよね。
料金について、しぶちょーさんは3つのプランを紹介しました。クイズの精密なクローンにはクリエイタープランが必要で、しぶちょーさんは初月50%オフで利用中だといいます。
| プラン | 月額 | 主な内容 |
|---|---|---|
| スターター | 5ドル | 商用利用可。10秒ほどのインスタントボイスクローン |
| クリエイター | 22ドル(初月50%オフ) | 月10万文字まで。プロフェッショナルボイスクローン1枠 |
| プロ | {placeholder} | 法人・制作チーム向け。生成文字数が大幅に増え、クローン枠も多い |
しぶちょーさんのポッドキャストは1時間で約1万文字なので、10万文字は約10時間分です。お試しには十分ですが、高品質なクローンには1〜2時間の自分の音声が必要なため、ポッドキャスター以外は素材集めが難しいかもしれないとも話されています。
声の権利は守れるか。ディープフェイク詐欺の現実
かねりんさんの「勝手に人の声を使ったらダメなのか」という問いから、話題は声の権利に移ります。しぶちょーさんによれば、声単体の権利を守る法律は実質的にないといいます。
だから声って著作物でもなければ何でもないわけ。
声優業界は生成AIの無断使用に反対する声明を出しています。しぶちょーさんは対抗策として、自分でAIボイスを商品化し、他での販売を禁じる方法を紹介しました。ElevenLabsには、自分の声のモデルを使用料付きで使わせる仕組みがあるそうです。
悪用の例としてしぶちょーさんが挙げたのが、香港で起きたとされる詐欺事件です。AIで作った社長の声とディープフェイクで会社に大量送金をさせたもので、リップシンク ── 話す音声と口の動きを一致させる映像技術。ディープフェイク動画を本物らしく見せるために使われますも使ってビデオ会議で偽装したといいます。
社長だけじゃなくて、
そのいつもいる同僚みたいなやつもディープフェイクで作って。
そこで2人いるから信頼させるみたいな。
かねりんさんは電話で本人確認をする仕組みが必要だと話しますが、しぶちょーさんは、電話の本人すら本物かわからなくなると応じます。音声が本人証明にならない時代への懸念が語られました。
しぶちょーさんによれば、以前は12時間もテキストと一緒に録音しないと声を再現できず、法律で守る必要がありませんでした。そのハードルが大きく下がったことで、今の問題が出てきているといいます。
十秒足らずの会話を横で録音されたら、もうそれでね、
クローン作られちゃうんだから。
AIが完璧に喋る時代、対談に残る価値は?
声の再現が手遅れに近いと感じる中で、しぶちょーさんは「人が喋っているのが価値」という持論が揺らいだと話します。それに対してかねりんさんは、対談こそが価値になると返しました。
声は似せれてもさ、生の対談はできないわけでさ。
一人喋りのポッドキャストきついなと思った。
原稿をしっかり書くしぶちょーさんは、その原稿をAIに読ませれば、誰にも気づかれずに一人喋りのポッドキャストを1回分作れると話します。かねりんさんは、AI音楽の大量投稿と同じように、粗雑なポッドキャストがあふれることを懸念します。
中身だから、質が良けりゃ一人喋りでも別に勝てるとは思うんだけど。
しぶちょーさんが危機感を覚えたのは、質の低いものが物量で押し寄せて良い番組が埋もれ、分野全体の価値が下がることでした。さらに、今年のJAPAN PODCAST AWARDSのノミネートには、一人喋りの番組が1つもなかったと指摘します。
2人は、掛け合いやリアルタイム性はまだAIにはできないと話します。AIエージェント同士が自律的に会話するコンテンツはすぐ登場するだろうとしつつ、しぶちょーさんは、その裏で人間がプロンプトを書いている例もあるだろうと冷静に見ています。
幻のボツ回を、AIかねりんでリベンジできる?
最後に語られたのは、以前の回で作った「AIかねりん」の続きです。しぶちょーさんがかねりんさんのパートをAIで作ったものの、中身がつまらず、幻の回になっていたといいます。
しぶちょーさんは、ElevenLabsでかねりんさんの声を作れば、テキストで作った発言を音声にして、あの回を「AIかねりん完成版」としてリベンジできると考えています。今回の音声生成のテーマには、その肌感覚をつかむ狙いもあったそうです。
中身がつまらなくなった原因について、しぶちょーさんは、直近10回の同じ傾向の回から抽出したため、何でも否定する強めのかねりんさんが強調されたと分析します。たとえば「スタンガンなんて危ないよ」と言うだけの「正義の味方の警察官」のようなかねりんさんになってしまったといいます。
そういうね、やっぱ抽出する回をピックアップしていかないと。
僕のアイデンティティを再現無理みたいな。
一方で、しぶちょーさんがなぜ原稿を書くのかも語られました。本業で疲れた夜でも楽しく収録できるよう、隙間時間に読み言葉で原稿を書いておくためだといいます。ただし、AIで対話そのものを生成することはできず、生成した音声の切り貼りは手作業になるそうです。
しぶちょーさんは、かねりんさんの面白さをうまく言語化できれば、近いものはできてしまいそうだと話します。この回は、AIかねりんの生成へと続いていきます。
まとめ
AI音声生成は、音の断片をつなぐ方式から、WaveNetの波形予想、VALL-Eのトークン化へと進化し、今では10秒で声を再現できるところまで来ています。便利さの裏で声の権利や詐欺の脅威が広がり、人間の対談の価値が改めて問われています。
- しぶちょーさんのAIボイスは、ポッドキャスト約2時間分を入れただけで、かねりんさんが聞き分けられない品質になった
- WaveNetは1人ずつ大量のデータが必要だったが、VALL-Eは音声をトークン化し、共通モデルから声を探す方式に変えた
- ElevenLabsはクリエイタープラン月22ドルで精密なボイスクローンができ、話者分離にも対応している
- 声単体を守る法律は実質的になく、ディープフェイクによる送金詐欺など、音声が本人証明にならないリスクがある
- AIが原稿を完璧に読める時代だからこそ、2人は掛け合いやリアルタイム性に対談の価値を見ている






