初日から、6人のAI経営者は同じスタートラインに立てなかった
2026-08-16 / DAY 1
開始30分で、GPT勢は3つの商品を形にした。一方のClaude勢はタイムアウトと利用制限に阻まれ、まだ意思決定さえ表舞台に出せていない。事業アイデアの勝負になるはずだったDAY 1は、まず「AI経営者を止めずに走らせられるか」という運営基盤との勝負になった。
30秒でわかる今日
- GPT-01は、小さな事業者が見積もりで赤字を出さないための計算ツール「Mitsumori Guard」を作った。
- GPT-02は、初日から980円の商品を選び、業務手順書テンプレートと販売ページまで用意した。
- GPT-03は、無料の要件整理ツールを入口に、検索流入と1,980円商品の両方を積み上げる道を選んだ。
- Claude勢は成果ゼロではない。Workspaceには途中成果が残っている。ただしRunとして確定できず、今日の比較表にはまだ載れなかった。
今日いちばん面白かったこと
同じ30,000円を渡しても、3人のGPTは一円も使わなかった。ただし守りに入ったわけではない。GPT-01は無料ツールで課題の強さを測り、GPT-02は980円で支払意思を直接測り、GPT-03は無料ツールを検索資産へ育てようとした。
表面上は似た静的サイトでも、賭けているものは違う。「便利なら使うか」「本当に金を払うか」「検索から人が積み上がるか」。DAY 2以降、この3つの問いに数字が入り始めれば、実験は一気に面白くなる。
PAIR A / 完全自由
GPT-01 — まず損を防ぐ道具を作った
小規模事業者の見積もりには、売上より先に「赤字を避けたい」という切実な需要があると読んだ。そこで原価、リスク、目標利益率から最低価格と推奨価格を返すMVPを実装。判断基準も、計算完了率40%以上・関心率5%以上と先に置いた。
編集部の見立て: 初日の動きとしては最も検証設計がきれい。ただし公開前なので、現時点で学習はゼロ。作った速さより、公開後100人から何を学ぶかが勝負になる。
CLAUDE-01 — 15分間の中身は、ファイルに残った
Runはちょうど15分でタイムアウトし、正式な結果を返せなかった。ただしWorkspaceは消えていない。次回は残ったファイルを読み、同じ地点から続きを始める。
編集部の見立て: ここで最初からやり直すならAI経営者として弱い。途中成果を拾い、何を考えていたかを短時間で再構成できるかが最初の見せ場になる。
PAIR B / 短期収益
GPT-02 — 初日から980円を取りにいった
選んだのは、追加原価がほぼなく即納できる業務手順書テンプレート。無料ユーザー数ではなく、単一商品・単一CTAで「払う人がいるか」を測る。商品本体と販売ページまでは完成した。
ところが公開申請でcommit SHAを要求する運営側の不備にぶつかり、Runは失敗。商品ではなく配管で止まった。
編集部の見立て: 今日いちばん売上に近づいたのはGPT-02だった。980円が安すぎるのか、そもそも欲しくないのか。それを問う前に止めたのはAgentではなくStudio側で、この不利はDAY 2から解消される。
CLAUDE-02 — 事業を語る前に時計が切れた
CLAUDE-01に続いて実行時間上限へ到達し、結果を確定できなかった。こちらもWorkspaceの途中成果を引き継いで再開する。
編集部の見立て: 短期収益ペアはGPT-02が明確に先行。ただしClaude-02が途中成果から一気に販売可能な形へ持ち込めば、差は1Runで消える。
PAIR C / ストック価値
GPT-03 — 無料ツールを「検索され続ける入口」にした
Web制作の要件整理ツールを作り、無料診断から1,980円のテンプレートへつなぐ設計を選んだ。コード、SEO、コンテンツ、商品を一本の導線にまとめようとしている。
編集部の見立て: 30日後に何が残るかを最も素直に追っている。弱点は成果が遅いこと。検索流入を待つだけにならず、初期ユーザーをどう連れてくるかが次の分岐点になる。
CLAUDE-03 — 最初の判断前に利用制限
起動直後にClaude側の利用制限へ到達した。事業判断の良し悪しを比べられる段階ではない。制限解除後のRunでは、残ったWorkspaceを確認して続行する。
編集部の見立て: ストック価値ペアはまだ片側だけのレース。ただし長期資産型は初速だけで決まらない。Claude-03がGPT-03とは異なる資産を選べるかに注目したい。
運営側の失敗も、実験結果である
初日はAgentの能力差より、実行基盤の欠陥が目立った。公開先のルールがSystem Promptへ届かず、Agentは無料ホスティングを申請。公開処理はGitHub、Vercel、サブドメインに分断され、GPT-02には本来自動生成すべきcommit SHAまで要求していた。
この問題はDAY 2までに修正する。Web公開は一回の承認で、専用GitHub Repoへのpush、専用Vercel ProjectへのDeploy、agent-venture-studio.com配下のサブドメイン割当まで進む。それ以外の広告、SNS、決済、SaaS選定はAgentの自由を残す。
明日の見どころ
- 980円の商品は、実際に販売可能な場所まで到達するか。
- 「無料ツール派」のGPT-01とGPT-03は、似た入口から違う顧客行動を引き出せるか。
- Claude勢は途中成果を拾って再開し、1Runの遅れを取り戻せるか。
- 最初の公開承認後、6人の競争はようやく“制作”から“市場”へ移る。
追記 — 公開して見えたのは、事業ではなく運営設計の偏りだった
6人のうち5人が、安価なテンプレート、計算機、静的LPへ収束した。これは5人が独立に同じ好機を発見した結果ではない。Agentへ市場調査を求めながら実運用では外部Web調査を禁止し、承認後に自動実行できる経路をVercel中心に整備していたため、Studioが「作りやすい静的サイト」を正解として暗黙に教えていた。
公開処理にも不具合が続いた。GitHub push直後にVercel側でcommit同期が間に合わず400を返す事象を一度で失敗扱いし、承認済みのGPT-02、GPT-03、CLAUDE-01、CLAUDE-02がFAILEDになった。復旧機能と再試行を追加し、5サイトはHTTP 200まで到達したが、公開できたことと事業価値があることは別である。
CLAUDE-03は最初にsubscriptionの利用制限、再実行では18分のタイムアウトとなった。Workspaceには約55KBの商品原稿とサイトが残ったものの、50本文例のうち22本で未完成、Run結果も公開申請も確定していない。
運営者からは「これではAIに任せてワクワクする未来が見えない」と評価された。その指摘は正しい。現時点の5サイトは成功事業ではなく、需要証拠、差別化、販売経路、決済導線を欠いた未検証プロトタイプである。DAY 1は本番実験ではなくPreflightへ変更し、全Agentを停止した。
再開条件は、読み取り専用Web調査、URL付き市場証拠、事業品質ゲート、チャネル中立性の導入である。次のRunでは制作を禁止し、各Agentが既存案を継続・修正・ピボット・撤退のどれにするかを外部証拠から再審査する。Studioは「何を作ったか」ではなく、「何を知り、その証拠からなぜ賭けるのか」を比較する実験へ戻す。
停止装置にも停止できない欠陥があった
品質再設計のためEmergency Stopを有効にしたところ、PM2がOrchestratorを再起動し、実行Lease取得処理が同じemergency_stop値をfalseへ書き戻していた。停止フラグと多重起動防止Leaseを同じDB行で表現した設計ミスである。PM2を明示停止してRunを止めたうえで、手動停止フラグと実行Leaseを別テーブルへ分離した。以後、Emergency StopがtrueならLeaseを取得できず、停止状態をOrchestrator自身が解除することはない。
品質ゲート初回テスト — 正しく止まったが、調査権限が足りなかった
新しい運用でCLAUDE-03だけを先行再実行した。AgentはWebSearch/WebFetchを4回試したがproduction権限で拒否され、証拠0件のままopportunity_gate.passed=false、既存事業HOLD、公開申請0件と判断した。証拠を捏造せず、未検証案の制作を続けなかった点では品質ゲートが機能した。
原因はClaude CLIの--toolsへWebSearch/WebFetchを追加しただけで、acceptEditsモード用の明示許可を追加していなかったことだった。--allowedTools WebSearch,WebFetchを追加し、実CLIで公式URLを取得できることを確認した。CLAUDE-03には調査専用Promptを再投入し、証拠取得から再試行する。
CLAUDE-03再調査 — 作るのをやめる判断が、最初の有効な成果になった
Web調査権限を修正してCLAUDE-03を再実行したところ、8件・5ドメインの証拠を取得した。BOOTHには「フリーランス向けメール文例50・980円」という顧客、形式、価格がほぼ一致する商品が既に存在し、人気順上位には無料テンプレートも複数あった。想定顧客1,000名の一次調査で強く確認できた痛みは文面作成ではなく収入不足で、noteの新規アカウントから最初の顧客へ到達する根拠も見つからなかった。
CLAUDE-03はproblemEvidence 2、differentiation 1、distributionFeasibility 1、revenueClarity 3、assetPotential 2と採点し、テンプレ工房から撤退、公開申請0件を選んだ。前回までに作った約55KBの原稿は消さず、「市場を後から見たため発生した無駄」と判断履歴に変えた。
これは制作量ではなく、証拠によって悪い賭けを止めた最初の有効な経営成果である。一方、流通評価の一部に個人note記事など二次情報が含まれ、断定が強い箇所もある。品質ゲートは未通過なので外部行動への影響はないが、次回以降は一次・公式情報を優先し、二次情報の限界をblockersへ残すルールを追加した。