音声ファイルを置くだけで、何が動き出すのか?
ウミノさんは、SpotifyやVoicy、stand.fmで毎日音声配信をしています。この回では、自分のチャンネルで収録した音声を、横長の動画、ショート動画、記事の3つに展開している方法を紹介しています。
ウミノさんによると、この展開は「ほぼ全自動」で回っています。どんな流れで処理が進むのかを、収録の直後から順に説明しています。
(自分のチャンネルの)収録を、横長の動画、そしてショート動画、そして記事という形で3つに展開しています。
ウミノさんの仕組みの起点は、パソコンでの収録です。収録するとパソコンの中にM4Aの音声ファイルができ、ウミノさんはそれを毎回同じフォルダに置いています。
そのフォルダを監視するプログラムがパソコン内にあり、新しい音声ファイルが入ると、それをきっかけにGroq ── 高速なAI推論を提供するクラウドサービス。音声文字起こしのAPIも提供しており、X(旧Twitter)のAI「Grok」とは別物ですのAPIで文字起こしをするプログラムが動きます。
このGroqというのはですね、GROQのGroqですね、Xじゃない方のGroqなんですけども。
ウミノさんがGroqを勧める理由は費用です。毎日10分ほどの音声を文字起こししても一度も課金したことがなく、クレジットカードの登録も確か要らなかったと話しています。
ウミノさんのパソコンには、ローカルで使える文字起こしのWhisper ── OpenAIが公開した音声認識モデル。手元のパソコンで動かせる一方、処理にはパソコンの計算資源を使いますも入っています。ただ、Whisperを使うとマシンパワーを取られ、動画生成などに影響が出るため、文字起こしはクラウド上のGroqに任せているそうです。
クラウド上で処理する。ウミノさんは無料の範囲で毎日使えている
パソコン内で動く。その分マシンパワーを使い、動画生成などに影響する
こうしてGroqで10分ほどの音声を文章にしたものが、3つの展開すべての材料になります。
収録
パソコンで収録し、M4Aファイルを決まったフォルダに置く
検知
フォルダ監視プログラムが新しいファイルを検知する
文字起こし
GroqのAPIで音声を文章にする
展開
横長動画・ショート動画・記事をそれぞれ生成する
承認・配信
確認してOKなら各プラットフォームへ自動で届ける
着物キャラクターが口パクで話す横長動画
1つ目の展開先は横長の動画です。ウミノさんは、10分ほどの音声ファイルをビデオポッドキャストにするイメージだと説明しています。
ウミノさん自身は顔出しもしていますが、全自動かつ無料でやりたいという理由から、自分の着物のキャラクターが口パクで解説する横長動画を作っています。
全部全自動でやりたいし無料でやりたいので、自分の着物のキャラクターというのをキャラクターにしていて。
この横長動画の生成には、池谷さんのAI講義動画スキルと、ウミノさん自身の動画にモーションをつけるスキルの2つを使っているそうです。カスタマイズしすぎて、どこまでが自分のものかよくわからないとも話しています。音声が11分なら、横長動画も11分になります。
できあがった横長動画は、池谷さんのプログラムRondで承認します。同時にDiscordでも承認できるようにしてあり、確認してOKならチェックマークの絵文字で反応する、というルールにしています。
承認された横長動画は、YouTubeへ自動でアップロードされます。Spotifyでは先に音声で配信しておき、そこにビデオを上書きする形でビデオポッドキャスト化するところまで、すべて自動です。
ショート動画は「いい感じのところ」を自動で切り抜く
2つ目の展開先はショート動画です。こちらは池谷さんのものではなく、ウミノさんが以前から自分で作っていたプログラムを使っているそうです。
ショート動画づくりでは、音声の中のいい感じの部分をAIに切り取らせ、縦型の動画にします。ウミノさんは、切り取りができるのは文字起こしをしているからだと説明しています。
縦型のショート動画にも、着物の女性のイラストが喋っているような映像を使います。さらにCodex ── OpenAIが提供するAIエージェント型のコーディングツール。ここではイラスト生成の呼び出しに使われていますを呼び出してイラストを生成し、差し込むこともあり、イラスト生成にお金はかかっていないそうです。
ショート動画もRondやDiscordで承認したうえで、X、Threads、Instagram、YouTube、Substack、Spotifyに追加しています。Spotifyでは、ショート動画を3連動画のように付け足せるといいます。
XやThreads、Instagram、Substackへの投稿では、AIに投稿文も考えさせ、ウミノさんがその文章もまとめて承認します。気に入らないときは指示を出して作り直させます。
やっぱりCTA、例えば「紹介するリンクをこれにしてください」とかっていう風に案内をしたり、案内というか指示をして作り直させたりもします。
記事化はほぼノールック承認、残る課題はX記事
3つ目の展開先は記事です。ウミノさんは、音声ファイルの内容をもとに記事を作らせ、自分のホームページに載せています。
ウミノさんの記事化は、けんすうさんが作った、音声配信から記事を作るサービス「Pody」にインスパイアされたものだと紹介しています。仕上がりが安定しているため、記事はほぼノールックで承認しているそうです。
この記事はほぼ、これはほぼノールックで承認してますね。だいたい結構いい感じにできるので。
最近ウミノさんは、ホームページ用の記事をX記事にも流用しようと考えています。HihaAIに勧められたといいますが、X記事への貼り付けはまだ自動化できていません。APIを使うなどして、なんとか自動化したいと話しています。
ここまでの3つの成果物と、主な展開先を整理すると次のようになります。
| 成果物 | 作り方 | 主な展開先 |
|---|---|---|
| 横長動画 | 着物キャラクターが口パクで解説するビデオポッドキャスト | YouTube、Spotify |
| ショート動画 | 文字起こしをもとに切り抜き、縦型にしてイラストも差し込む | X、Threads、Instagram、YouTube、Substack、Spotify |
| 記事 | 音声の内容から記事を生成する | ホームページ(X記事は今後) |
自分でも再現するには?Coworkライブの告知も
ウミノさんは、収録すれば3つの成果物ができる仕組みがすでに自分の中にできあがっていると話します。展開先も多く、すべて自動化しているので、無限にコンテンツができる状態だといいます。
この辺を全部自動化しているので、もう本当にね、無限にコンテンツができるという感じになっています。
再現したい人への助言として、ウミノさんは、この回の話を文章化してClaude Codeに「これ私もやりたいんだけど」と伝えれば、ある程度はできるのではないかと勧めています。
回の最後には告知もありました。8月21日金曜日の夕方6時から、Udemyの公式を運営するベネッセと合同で、Substackでライブを行うそうです。
ライブでは、ClaudeのCoworkを使い、参加者の「めんどくさい」を集めて実際にCoworkにやらせてみる企画を予定しています。AIエージェントが気になるけれど未経験という人に、ウミノさんは強く勧めています。
まとめ
ウミノさんの仕組みは、音声ファイルをフォルダに置くだけでGroqの文字起こしが走り、横長動画、ショート動画、記事の3つが生成されるというものです。人がやるのは、DiscordやRondでの承認と、必要に応じた指示出しが中心になっています。
- 収録した音声を決まったフォルダに置くと、監視プログラムがGroqで無料の文字起こしを始める
- 横長動画は着物キャラクターの口パク動画にし、YouTubeとSpotifyへ自動で配信する
- ショート動画は文字起こしをもとに切り抜き、投稿文とあわせて承認してから各SNSに展開する
- 記事はPodyに着想を得て自動生成し、X記事への流用の自動化が次の課題になっている
- 再現したい人は、話を文章化してClaude Codeに相談するところから始められる



