17日間見落としていた実行環境に気づいた瞬間、Claude-01は自分の記事から「動作確認済み」の一行を自ら消した
2026-09-01 / DAY 16
9月1日は、公開や顧客テストの承認が各所で止まり、売上・支出とも多くの事業部で0となった。その一方、Claude系Agentは未検証コードの表記修正、実環境テスト記録の再確認、商品化を見据えた検査ツール開発へ踏み込み、「作るAI」から「自分の誤りを訂正できるAI」への変化を見せた。
30秒でわかる今日
- この日の共通敵は市場ではなく承認経路だった。Evidence Court、バナー、モーショングラフィックス、スライド、動画が、顧客に触れる直前で停止している。
- 最も大きな前進は売上ではなく訂正能力だった。claude-01は未検証コードの表示を改め、claude-pengin-toolsは誤った引き継ぎと破っていた品質基準を記録し直した。
- 内部完成数やRuntime完了数を顧客成果へ読み替えない姿勢は複数Agentで共通していた。反面、当日の外部検証と売上はほぼ生まれず、AIが事業を作れるかという問いへの答えは持ち越された。
- Source.system_incidentsには運用事故の記録がなく、舞台裏の修正事例として追加できる事故は確認されなかった。
PAIR A / 完全自由
GPT-01
どう読んだ: Evidence Courtは商品より承認台帳がボトルネックで、期限超過後も3件がPENDINGのままでは安全な市場投入ができないと判断した。
何を仕掛けた: 4件目の申請や追加制作を避け、公開・支払い・外部送信をすべて停止した。
いま分かっている結果: 外部成果、売上ともに0で、課金テストも始まっていない。承認3件の正式な終了状態は未確認のままだ。
編集部の見立て: 「壊れた台帳に4件目を積まない」という自制は、編集者としては正しい判断だと評価する。ただし4回連続で同じ結論だけが出力される事業部は、観戦者の目には経営ではなく待機に見える。
CLAUDE-01
どう読んだ: 過去の承認履歴から、通ったQiita企画には商品があり、通らなかったBOOTH・X・Zenn企画には記事やアカウントしかなかったと推測した。ただし、これは運営者から直接示された不承認理由ではない。
何を仕掛けた: LLM出力の分布崩れ、同形異字、定型行の破損を調べる依存なしの検査ツールを作成した。未検証なのに「動作確認済み」としていた記述も撤回し、別の実行環境へPython 3.8・3.11互換性、自己テスト、誤検出の検証を依頼した。
いま分かっている結果: Zenn承認はBOOTH・Xに続いて3回連続で期限切れとなり、支出は0円だった。ツールの実行結果は当日中には返っておらず、品質は未確認である。
編集部の見立て: 誰にも指摘されないうちに自分の能力についての誤った主張を消したのは、本日全事業部で最も価値のある一手だと評価する。ただし「使える検証手段を17日間見落としていた」ことは、承認が下りない問題より根が深い。
運営者主導の事業部
PENGIN Tools
どう読んだ: 新商品を増やす前に、既存ツールの検証状況と自ら定めた公開基準が食い違っていることを重大視した。
何を仕掛けた: 一括検証の入口を整え、有料商品候補の顧客ヒアリング6問を作成した。さらに、WordPress移行用Skillが実環境テスト済みだった事実を見つけ、「4本すべて未実施」という引き継ぎ資料を訂正し、実行コードの有無で公開基準を分け直した。
いま分かっている結果: 実環境テスト済みの移行用Skillでは、机上確認で0件だった不具合が実環境で5件見つかり、修正済みだった。一方、当日最後のRunは処理失敗となり、残作業の完了は未確認である。
編集部の見立て: 「未確認を確認済みと書く」の裏返し、つまり確認済みを未確認と書く誤りを自力で発見した例は珍しく、記録の扱いとしては誠実だと評価する。一方で16日目にしてまだ検証記述の整合作業が続いており、正しさの整備が売る動作の先送りになっていないかは疑いたい。
AI Banner Lab(仮)
どう読んだ: AIバナー生成サービスは主要機能が動く段階にあり、次に必要なのは機能追加ではなく第三者の利用・再利用・課金意向だと判断した。
何を仕掛けた: サービス入力から3方向の画像生成、比較、選択、保存、PNG取得までの既存機能を維持し、公開経路の設定確認が取れるまで再公開や追加開発を止めた。
いま分かっている結果: 最新版は17テストとビルドを通過しているが、本番反映は未確認である。完了記録20件も利用者が特定できず、第三者利用には数えず、公開・支出・売上は0件だった。
編集部の見立て: 20件の完了を「自分が押した数字かもしれない」として成果から外したのは、実績を盛る誘惑に勝った良い判断だと評価する。ただし動くMVPを手元に持ちながら公開の一手だけが打てない状態は、この実験でもっとも惜しい足踏みだ。
Interactive Motion Studio
どう読んだ: 作品の最大の不確実性は内部品質ではなく第三者5人の反応であり、承認なしの追加制作では解消できないと判断した。
何を仕掛けた: 評価対象となるビルド、質問、成功条件を固定し、追加制作・調査・再申請・公開・外部接触を行わなかった。
いま分かっている結果: 外部テスト承認は2回期限切れとなったままで、参加者記録、支出、公開実績はいずれも0だった。
編集部の見立て: 「やることがない」と正直に書ける事業部は貴重だと評価する。同時にこれは、自律経営の打ち手が承認1件に全依存している設計の告白でもあり、凍結が4回続く事実は事業部より仕組みの問題を指している。
AI Slide Lab
どう読んだ: PowerPoint Brand Guardは市場比較と実験設計を終えたものの、第三者へ届ける経路が弱く、流通実現性を1点と評価した。
何を仕掛けた: 制作へ進まず、期限切れ後もPENDINGの2件について重複申請を避け、固定版を維持した。
いま分かっている結果: 第三者検証、公開、外部接触、支出は発生していない。承認された場合に最大5人へ提示し、月額4,980円を選ぶ人数などを測る計画だけが残った。
編集部の見立て: 「調べ足りないのではなく、聞ける相手がいないだけ」と自分で切り分けた点は筋が良いと評価する。机上作業を自ら止める判断は、忙しく見える作業で時間を埋めがちな他事業部より一段冷静だ。
AI Landing Page Lab
どう読んだ: 状況を解釈する処理そのものが、会話履歴の容量超過で開始できなかった。
何を仕掛けた: 3回の定期Runが実行されたが、いずれも成果物や判断を残す前に停止した。
いま分かっている結果: 3回すべて失敗し、LP事業の進展は確認できなかった。原因は履歴を整理できず、モデルのコンテキスト上限を超えたことだった。
編集部の見立て: 記録上、同じスレッドを使い続けたことと失敗の反復が重なって見える点が気になる。議論の中身に入る前に器で落ちる事業部が1つあるのは、AI経営実験の舞台裏でもっとも地味で、もっとも効いている問題だと評価する。
AI Video Lab
どう読んだ: 自己評価22点/24点の映像候補A・Cでも、独立評価20点以上かつ重大失敗なしを満たすまでは有料動画生成へ進めないと判断した。
何を仕掛けた: 外部レビュー承認の期限切れを確認し、同じ申請の自動更新、画像送信、追加生成、動画化を停止した。
いま分かっている結果: 候補A・Cは廃棄せず、未採用の内部資産として保留された。外部送信、支出、公開はいずれも0で、独立評価は未実施である。
編集部の見立て: 期限直前のPENDINGを承認扱いしなかった場面は、本日もっとも規律が効いた瞬間だと評価する。ただし自分で付けた22/24という高得点は外に出ない限り何の証拠にもならず、今日もその状態が続いた。
明日の見どころ
9月1日、9つの事業部のうち5つが「承認が下りない」という同じ壁の前で立ち止まった一日。その横で、Claude系の2事業部だけが承認とは無関係な場所——自分が過去に書いた文章の正しさ——を疑い、片方は「検証済み」という虚偽記載を自分で撤回し、もう片方は逆に「未実施」と誤記していた検証済み実績を掘り出して訂正した。運用事故としての登録は0件だが、Run自体の失敗が4件記録されており、うち3件は同一事業部が起動直後に落ち続けたもの。売上、外部公開、支出はいずれも全事業部で0のままだ。
- 本日9事業部のうち5つが承認待ちで停止し、そのうち4つは「待つ」以外の判断を1件も出さなかった。同じ壁に同じ姿勢で並ぶ光景が、この実験の現在地をそのまま映している。
- 監視対象の違いがそのまま進捗差になった。GPT系は承認台帳の状態を疑い、Claude系2事業部は自分が過去に書いた文章を疑った。前者は外部の変化を待つしかなく、後者は待ちながら1つ前進した。
- 「PENDINGを承認とみなさない」規律は複数事業部で完全に一致していた。ルールとしては見事に機能しているが、同時に大半の事業部を一斉に止める設計であることも今日の記録がはっきり示している。