AIの進化が速すぎて、何を作ればいいかわからない?
Off Topic // オフトピックの今回のテーマは、AI企業を作るうえでの考え方です。前回のセカンドブレインやAIアシスタントの話を受け、宮武さんはAI企業の事例を交えながら、従来のスタートアップとは違う作り方を話したいと切り出します。
宮武さんによれば、本当はAIの安全性やAGIのリスクの話をしたかったものの、まず事業の作り方を話し、リスクの話は翌週以降に回すという構成です。
宮武さんが出発点として挙げるのは、アメリカの起業家の間で「何を作っていいかわからない」という声がとても多いという現状です。
なんか今までって、新しいテクノロジーが出て、次の新しいアップデートって数年後とかじゃなかったじゃないですか。
(AIは)今もう週次、場合によってはもう明日全然違うものが出てくるじゃないですか。
草野さんは、ノーコード ── プログラミングをせずに、画面操作などでアプリやWebサービスを作れる仕組みやツールの総称が登場したときの驚きを引き合いに出します。今回はそれを超えて、作っても数日で他の人に作られてしまう感覚だといいます。
宮武さんは、今作っても1年後に通用しないかもしれないと考える起業家が多いとし、その中での考え方やフレームワークを話していきます。
OpenAIはもう勝ったのか。AWS登場時との共通点
宮武さんがよく聞かれる質問は「OpenAIがもう勝っちゃったんですか」というものです。宮武さんは、LLMの中でOpenAIがリードしているのは事実だとしつつ、汎用的なLLMであることには良い面と悪い面があると答えます。
宮武さんが最も近い事例として挙げるのが、AWS ── Amazonが提供するクラウドサービス。サーバーやストレージなどのインフラをネット経由で借りられるが登場したときの状況です。当時は類似サービスがなく、GCPなどは後から出てきたといいます。
AWSが出てきた当時って、みんな何を話し始めてたかというと、もうインフラがもうAWSありきで考えないといけないっていう話をしてたんですよ。
宮武さんによれば、今はAWSは1つのインフラに過ぎず、まず何を作るかを考えてから、AWSや別のサービスを選ぶ形になっています。開発者が作りたいものが幅広すぎて、AWSが全部には対応できなかったからです。
宮武さんは、OpenAIのLLMにも同じことが起きると見ています。全部には対応できないので、他のLLMも成立する余地があり、大きなシェアを持ち続ける可能性はあっても、完全に支配するという話は違うだろうという見立てです。
AWSのインフラ上で何ができるかから考える
何を作るかを先に決め、AWSや別のサービスを選んで使う
汎用LLMと自社データをどう掛け合わせるか
宮武さんは、クラウドとの違いとしてオープンソースのモデルが大量に出ている点を挙げます。HuggingFace ── 機械学習モデルやデータセットを共有・公開できるプラットフォームを運営する企業上には、すでに10万以上のモデルがあるといいます。
そのため企業は、いずれ汎用的なLLMだけを使うのではなく、自社の特定のユースケースに合ったものを使いたくなる、と宮武さんは話します。草野さんの「掛け合わせるイメージか」という問いに、宮武さんは汎用LLMと自社モデルを掛け合わせる形だと同意します。
宮武さんは、自社のデータを活用し続ければ自社のモデルを作れるようになり、ニッチなモデルが多数出てくると見ています。検索のBingは何でも答える必要がありますが、カスタマーサポートのボットは人生の意味を聞かれても答えなくていい、という対比です。
ちなみに宮武さんがアメリカで「人生の意味」をGoogle検索すると、イースターエッグとして「42」が返ってきたそうです。
宮武さんはさらに、モデルを作るコストが下がっている点を挙げます。GPT-4の規模にはまだ時間とお金がかかるものの、GPT-3に類似するモデルなら500K、日本円で6000〜7000万円以下で作れる時代になり、オープンソースも追いつき始めているといいます。
SaaSはAIアシスタントの下に沈むのか
草野さんは、連携が重なることでSaaS企業や連携サービスの重要性が上がりそうだと感じたと話します。宮武さんは、ここは議論すべきポイントで、SaaS企業がどのレイヤーに入るかが重要だと応じます。
宮武さんは前回話したAIアシスタントのLindy ── メールの整理や返信のドラフト作成などを代行するAIアシスタントサービスを例に、レイヤー構造の変化を説明します。
ハードウェア
一番下の層
OS
ハードウェアの上に乗る層
アプリケーション
SaaSなどが位置する層
AIアシスタント
アプリケーションの上に乗る新しいOS。メインのインターフェースになりうる
宮武さんによれば、AIアシスタントがメインのインターフェースになると、SaaSは弱い立場になるかもしれません。ユーザーのタスクのためにAIが「SalesforceよりHubSpotのほうが良かった」と判断し、一瞬で乗り換えることもありうるからです。
宮武さんは、レイオフの影響もあって新しいAIスタートアップが次々に生まれているとも話します。すでに「OpenAIマフィア」と呼ばれる元OpenAIの人たちの起業があり、Anthropic ── 元OpenAIのメンバーが設立したAI企業。対話AI「Claude」を開発しているもその一つだといいます。
人間のPC作業をAIが再現する、Adeptの構想
宮武さんが取り上げる1社目は、元OpenAIの人によるAdeptです。Lindyと似ていて、人間がコンピューターでやることを、AIが同じようにできるモデルを作ろうとしています。
宮武さんの例では、営業の場面で、AIにLinkedInで営業先をリストアップさせ、その人たちをCRMであるSalesforceに入れる、といったタスクです。
Adeptの特徴は、大手と連携して進めている点と、ユーザーが一度タスクのやり方をAIに見せ、AIがそれを真似する点です。連携先として宮武さんはWorkdayが公開されていると挙げ、結果的にLindyとも競合しそうだと見ています。
この収録を終わった瞬間、二人の音声をAdobe Premiereにアップして、バックグラウンドノイズを消して、統合して、チェックするポイントをメモってくださいみたいな。
(そういう)ことをお願いできたりするわけなんですよ。
草野さんは「お願いしましょう」と乗り気ですが、宮武さんによればAdeptはまだ公開されていません。一般企業なら、CRMやExcelのデータをもとにAIに事業計画を作ってもらう使い方も考えられるといいます。
ソフトウェアの機能、全部使いこなせていますか
宮武さんは、ほとんどの人は各ソフトウェアのエキスパートユーザーではないと指摘します。Notionの使い方のハックや、Google検索のサイト内検索のような機能を、多くの人は知りません。
そういうのって我々わかんないんですけど、でもAIにそのドキュメンテーションを読ませると、AIは全部それをわかってくれるので。
宮武さんは、AIによって各ソフトウェアの本来の力をどんどん発揮できるようになると話します。草野さんはそれを、脳を少ししか使っていない人間が、ソフトウェアを100パーセントの力で活用するような感じだとたとえます。
コード生成のReplitとGhostwriter
次に宮武さんが挙げるのはコード生成です。GitHubのCopilotに加え、スタートアップでは、すでにユニコーン企業になったとみられるReplit ── ブラウザ上でプログラムを書いて実行できる開発環境を提供する企業が注目だといいます。
宮武さんによれば、当時OpenAIはGPT-3を使ったアプリ公開に厳しい申請を課す一方、MicrosoftはGPT-3などを使ってCopilotを運営し始めていました。Salesforceがコード生成ツールを作っていたことは、宮武さんも知らなかったそうです。
最近のY Combinatorのバッチでも、Replitでコードを書いてローンチする会社が出てきているといいます。ReplitのAI「Ghostwriter」は、パソコンの中のファイルを読み込み、ユーザーが聞く前から「これは自動化できるのでは」と提案してくれる点がGitHubのCopilotとの違いだと、宮武さんは見ています。
LLMに長期記憶を持たせるChromaとPinecone
宮武さんは、GPT-4の入力できる量に注目します。3.2万トークンで、英語なら約2.5万単語、メモリのキャパは約6.5万単語ほどあり、エッセイやドキュメントも入れられますが、それでもまだ限られています。
そこで、LLMに長期的な記憶を提供するスタートアップが出てきています。宮武さんは課題として、容量の問題に加え、情報に戻ってくるかどうか、情報が更新されているかどうかを挙げます。
宮武さんが紹介するのは、ChromaとPineconeというデータベース的なサービスです。企業がデータを保存すると、LLMがそのデータを優先して回答するため、精度が上がり、幻覚 ── AIが事実と異なる内容をもっともらしく生成してしまう現象。ハルシネーションとも呼ばれるの削減にもつながるといいます。
記憶が更新され続けることで、AIが過去にやったことを覚えて次のタスクに生かす、いわゆるエージェントにも近づいていく、と宮武さんは話します。
AutoGPTはなぜAGIに近づくのか
収録時点でアメリカでも日本でも流行していたのがAutoGPTです。宮武さんによれば、これまでのChatGPTは1つのプロンプトに応えるだけで、複雑なタスクは与えられませんでした。
いわゆる自分自らプロンプトを作り出すんですよ。
宮武さんの例は旅行計画です。「今週どこかに行きたいので旅行計画を立てて」と頼むと、AIは手順を自ら組み立てます。
宮武さんは、こうした自律的な遂行はAGI的なものに近づく動きであり、記憶の仕組みがあることで可能になると説明します。
宮武さんは、開発者向けの新しいテックスタックも整理します。LLMプロバイダーとしてOpenAI、Anthropic、CohereKohyaなど、アプリケーションロジックを書くLangChainなど、そして記憶を担うデータベースとしてChromaやPineconeがあるという構成です。
鳥を真似しても飛行機は作れない
ここから宮武さんは、AI企業を作るうえでの考え方に入ります。1つ目は、LLMを作るのが思った以上に簡単だったということです。
宮武さんはそれを空を飛ぶ機械にたとえます。最初に思い浮かぶのは「鳥を見ましょう」という発想で、実際に鳥の飛び方を真似たロボットが2010年か2011年に披露されましたが、それはライト兄弟の飛行機から100年以上後のことでした。
空を飛ぶのは実は、もっと簡単な手法があったんですよ。
生物なので羽という素材に限られ、生き延びるために燃料効率が高い。ラジコン飛行機の約半分のエネルギーで同じ距離を飛ぶ
ライト兄弟は銅や鉄など様々な素材を使え、効率の悪さは燃料、つまりお金で解決できる
宮武さんは、AIでも同じことが起きていると話します。昔から「脳を理解しないといけない」と言われてきましたが、LLMはトランスフォーマー ── 2017年に発表されたニューラルネットワークの構造。現在の大規模言語モデルの多くの土台になっているにインターネットのデータと計算資源を渡すことで、人間とかなり似た回答を出せるようになりました。
草野さんにどう考えればいいかと問われた宮武さんは、そもそも人間と比較するのが間違いかもしれず、作るためにどんなパーツが必要かを考えるべきだと答えます。
パラメータより微調整が効く?
宮武さんは、LLMの発展ではパラメータを増やすべきだという議論がありがちだと指摘します。しかしサム・アルトマンさん自身は、GPT-3.5からGPT-4への進化の一番の理由はデータ量や計算資源ではなく、微調整にあったと話しているといいます。
でも微調整で本当に変わるんですよね。
宮武さんは、1990年代から2000年代のチップ戦争で各社が何ギガヘルツかを競ったものの、実はパフォーマンスにはあまり意味がなかった歴史と重ねます。本当に小さな変更でパフォーマンスが倍になることもあり、ある意味怖いとも話します。
草野さんは、技術的なアップグレードより見ておくべきものが意外と手元にある、「灯台もと暗し」のような話だと受け止めます。GPT-4で何をしたかはブラックボックスですが、宮武さんはまず微調整をするという考え方が重要だとまとめます。
GPT-4は高い。それでも使うべき理由
スタートアップがGPT-4などを使う際によく出る課題は、値段が高いことです。宮武さんの説明では、GPT-3.5の場合で1000トークンあたり0.2セントほどで、生成量に比例して課金され、使い放題ではありません。
それでも宮武さんは、基本的にGPT-4を使わない理由はないといいます。ムーアの法則 ── 半導体の集積度が一定期間で倍増するという経験則。コンピューターの性能向上と低価格化を表す言葉として広く使われるのようにどんどん安くなり、過去1年ほどで20分の1ほどの価格になっているからです。
1つのモデルに偏りすぎないインフラを
宮武さんが個人的に懸念するのは、GPT-4だけに依存することです。今はGPT-4がリードしているので使うのはいいとしつつ、1つのモデルに偏りすぎないインフラを作ることが重要だと話します。
今後の多分AIスタートアップが必要なのは、簡単にモデルをスワッピングできて、なおかつその新しくスワッピングしたモデルのトレーニングを早くできるインフラっていうのが多分重要になってくる。
宮武さんの例では、サービスAが今GPT-4を使っていても、AnthropicのLLMのほうが良くなったら簡単に乗り換えられるようにしておく、というイメージです。AWSからGCPに簡単に移れるような感覚に近いといいます。
草野さんはそれをエクスポート・インポート機能のようなものだと理解し、新しいスタートアップが入れそうな領域だと話します。宮武さんは、サービス化する会社が出るかもしれないし、自社で作るかもしれないと答えます。
AI人材は最初から必要なのか
次の論点はチームです。宮武さんは、起業時にどこまでAI人材、つまりLLMなどを扱える人を最初から入れるべきかを問い、最初はそこまで必要なくなり、後々必要になると見ています。
理由はChatGPTのプラグインが非常に簡単に作れることです。Chromaが開催したプラグインのハッカソンで、OpenAIの人がKlarnaClaraのプラグインの作り方を見せたところ、Klarnaの担当者は1段落ほどの文章で説明しただけでした。
英語で説明できればもうできるんですよ。
宮武さんは、Q&AサービスのQuoraが作ったAIサービス「Poe」も紹介します。AnthropicやOpenAIのモデルを入れ替えながら、どんなチャットボットにしたいかを説明するだけで自分のチャットボットを作れるといいます。
まずプラグイン
ノーコード的に文章でプラグインを作って試す
スケール
サービスが拡大する
自社モデル
自社モデルが必要になった時点でAI人材を入れる
プラグインは初期アプリストアと同じ。早く動くべき理由
宮武さんは、プラグインについては早めに動いたほうがいいと強調します。注目度は高いのに数はまだ少なく、初期のアプリストアと同じ状況だからです。
リリースすればある程度ダウンロードが入ってきた
プロモーションをしなければほとんどダウンロードされない
同じように今競争ってすごい少ないので、その実際プラグインとして出てる数が。だからみんな使ってくれるんですよ。
だから競合が動く前に絶対出すべきなんですよね。
草野さんは、NotionのAI機能も、まだノート系アプリで誰もやっていなかったからこそ驚きがあったと振り返ります。宮武さんは、ディスカバリーの観点から早く動くことが重要だと応じます。
ZillowとMetaが抱く危機感
宮武さんは、すでに運営している大企業やスタートアップこそ強い危機感を持つべきだと話します。例として挙げるのが、不動産マーケットプレイスのZillow ── アメリカの不動産情報・売買マーケットプレイス。上場企業です。草野さんがラーメンの「二郎」と聞き間違え、つづりを確認する一幕もありました。
宮武さんによれば、Zillowの社長は全経営者にAIへの注意を促し、チームを2つに分けました。
社内のプロセスをいかにAIで置き換えられるか
顧客体験にどうAIを組み込むか
Metaでは、マーク・ザッカーバーグCEO、CTOのボズさん、CPOのクリス・コックスさんが、今最も時間を費やしているのはAIチームと過ごすことだといいます。メタバースに集中していたはずのMetaが、と宮武さんが言うと、草野さんは「ちょっといじってます?」と返します。
Metaは画像認識系のモデルや、絵にアニメーションを加える技術などを出しており、草野さんはデータが多いぶん強そうだと話します。宮武さんも、めちゃくちゃ強いはずだと同意します。
100人のチームは本当に必要か
宮武さんは、スタートアップやVCに影響する問いとして、そもそも大人数のチームは必要なのかを投げかけます。AI従業員としてのエージェントが出てくれば、1人の人間と100人のAIがチームを組む時代が来るかもしれないからです。
なんかそうすると、そもそも資金調達ってどこまで必要なんでしたっけ?とか。
そもそも上場するのがベストなんでしたっけ?みたいな。
草野さんは、上場やExitの成功とは何かがすでに問われているとしたうえで、AIが発展すると何のために仕事をしているのかを考えなければならないと話します。
宮武さんは、VCの大型調達に意味がなくなるのではという議論は、まだ議論レベルで実態は伴っていないと断ります。そのうえで、5年後・10年後には起業という概念が変わり、急成長しながら10人以下のチームでやるスタートアップも出てくるかもしれないと見ています。草野さんは、2〜3人での上場も全然ありえそうだと応じます。
テキストから動画へ。ウィル・スミスのAI動画
宮武さんは、AIの適用先としてテキスト生成以外に生物学や科学を挙げつつ、特にテキストから動画が人気になると見ています。収録の1〜2週間前から、ウィル・スミスがスパゲッティを食べるAI生成動画が話題になっていました。
ウィル・スミスかなと思ったら、なんかちょっと、なんていうか、なんか違うみたいな。
宮武さんは、DALL-Eなどの画像生成も最初は指や顔が変だったことを挙げ、動画もすぐに改善されるだろうと話します。動画領域ではRunwayなどが取り組んでいるといいます。
音声で頼めばアプリができる時代
宮武さんによれば、Replitはすでに、スマホに音声で「こういうフィットネス系のアプリを作って」と指示するとアプリができる仕組みを検証し始めています。
宮武さんは、これを「エンジニアが不要になる」という話としてではなく、アプリという概念そのものが変わる話として捉えたいといいます。それを理解するために持ち出したのが、ナポレオンの話です。
ナポレオンの会食と、アルミニウムの価値
宮武さんによれば、ナポレオンが各国のリーダーや有名人と会食する際、食器の素材で階級がわかる仕組みがありました。下っ端といっても大統領や首相クラスです。
ナポレオンの食器はアルミニウムでした。今では地球上にとても多く、アルミ缶にも使われる素材ですが、当時は見つからず作り方もわからないほど希少で、とても高価だったといいます。
宮武さんによれば、ナポレオンはアルミニウムの独特な光り方が好きで、周りの人たちもファッションに取り入れたそうです。草野さんは、今これほどあると知ったらナポレオンは驚くだろうと笑います。
アプリも使い捨てになる
宮武さんは、アルミ缶が安いから使い捨てられるように、アプリも同じ概念になると話します。今は作るのに多額の費用がかかるため、うまくいかなくても簡単には捨てられず、ユーザーに使い続けてもらおうとします。
一回使ってもらったらいいやってなるんですよ。
作るコストが極めて安くなれば、1セッションのためだけのアプリ、つまり使い捨てアプリが生まれる、というのが宮武さんの見立てです。
作るのに高額な費用がかかるため捨てられず、使い続けてもらうことを前提にする
その場で生成して1回使ってもらい、必要ならデータだけ取って捨てる
宮武さんは、特にソフトウェア企業やSaaS企業にとって、どのタイミングで使い捨てアプリを作るかが重要な問いになると話します。
クラウドかローカルか、オープンかクローズドか
宮武さんは、ビジネスモデルや、OpenAIがどうマネタイズするかもまだわからない部分があるとしたうえで、アメリカで議論になっている「クラウドVSローカル」を紹介します。
最新の情報やLLMにリアルタイムで接続できる。Lindyはクラウドベース寄り
プライバシー面で有利。前回話したRewindはローカルがベース
宮武さんは、スマホにLLMを入れられる状況になり始めた点に注目します。ChatGPTほど強くなくても、スマホを持つ世界中の子どもたちがAIと会話できるようになれば、教育やヘルスケアにとってとても便利だといいます。
宮武さんは、プライバシーに関わるデータや基盤モデルはローカルに、最新の部分はクラウドに置くミックス型が多くなると見ています。どれを選ぶかでスタートアップのコスト構造が変わるため、コストとプライバシーの両面から選ぶ必要があります。
もう一つの論点が「オープンVSクローズド」です。宮武さんは、オープンにすれば事業が進む面があり、クローズドにすれば権力は増すものの規制の影響を受けると話します。今のオープンソースモデルはウェイト ── モデルが学習で獲得した数値のパラメータ。どの要素をどれだけ重視するかを決めるを公開していませんが、競争の激しさから、どこかの会社が戦略的に公開しそうだと見ています。
今年起きた3つのシフト
宮武さんは、今年だけでもLLMのアプリレイヤーで少なくとも3つの大きなシフトが起きていると話します。
草野さんが、Instacartのように購買データやスーパーのデータを掛け合わせることかと尋ねると、宮武さんは、複数のAIをつなげて「アクションAが起きたらアクションBをさせる」ような話だと説明します。
草野さんは、全部を細かく指示するのではなく「よしなにやってください」と頼めるイメージだと言い換え、宮武さんも「よしなにやってくださいですね、まさに」と同意します。
自分をアプリとシンクロさせる未来
宮武さんは、C向けアプリの将来像として、AdobeのCPOであるスコット・ベルスキーさんの発言を紹介します。それは「自分をAIとシンクロさせる」という考え方です。
今はアプリを新しくダウンロードするたびに、ログイン情報やプロフィールを入力する必要があります。草野さんも、いまだにパスワードを設定して覚えなければならないことや、名前を何度も入れることに面倒さを感じているといいます。
自分のデータとかパソコンのデータとかが統合されていて、それをアプリにインプットできるっていう、まあいわゆる自分がプラグインになるっていうことですよね。
宮武さんの描く体験では、アプリを開いた瞬間に「自分とシンクロしますか?」と許可を求められ、自分のデータが一瞬で入り、アプリが完全にパーソナライズされます。草野さんは、その体験はとてもいいと話します。
オンボーディングとUIはどう変わるのか
宮武さんは、自分とシンクロする仕組みが現実になれば、アプリの作り方が大きく変わると話します。オンボーディングをどうするか、パスワードや名前の入力をなくした最初のマジックモーメント ── ユーザーがサービスの価値を初めて実感する瞬間を指すプロダクト開発の用語をどう作るか、最初から会話型にすべきか、といった問いが生まれます。
宮武さんはさらに、ユーザーがどこまで能動的に動くかも変わると見ています。Lindyがメールを読み込んで重要度をランキングし、返信のドラフトまで作ってくれるように、ユーザーが一切動かなくても便利なアプリが増えていくという見立てです。
こっちで最終的な相手が関わる話は判断しますけど、私の問題のカレンダーのなんか調整ごとはお願いしますみたいな。
宮武さんは、アプリの概念、チーム作り、LLMの考え方、ユーザー体験まで、あらゆるものが変わるので、議論するだけでなく実際に開発して試してみることが必要になると締めくくります。次回以降は、人間は生きていけるのかというAIのリスクの話に移る予定です。
まとめ
宮武さんは、AWSが全用途を支配しなかったように、OpenAIも完全な支配者にはならないと見ています。そのうえで、モデルを差し替えられるインフラ、段階的なAI人材の投入、早めのプラグイン参入、使い捨てアプリやシンクロ型のUIといった新しい発想が、AI企業づくりの鍵になると話しています。
- 汎用LLMと自社データ・自社モデルの掛け合わせが重要になり、ニッチなモデルが増えていく
- 性能を左右するのはパラメータの量より微調整で、1つのモデルに偏りすぎないインフラが必要
- AI人材は最初から大量に要らず、まずはプラグインで試し、スケールの段階で自社モデルと人材を整える
- アプリを作るコストが下がれば、1回のための使い捨てアプリというAIネイティブな発想が生まれる
- 自分をアプリとシンクロさせる未来では、オンボーディングやUIの設計が根本から変わる





