Brainstorm → Plan → Cook → Ship のAI開発ワークフロー(AgentKit活用)
私が毎日回しているAI開発ワークフローは、繰り返し使える4つのフェーズです。Brainstorm(成果を固める)、Plan(仕様を書く)、Cook(実装とテスト)、Ship(レビューしてPR)。Claude Code向けのAgentKitを使えば、各フェーズはコマンド1つで実行できます。/ak:brainstorm → /ak:plan → /ak:cook → /ak:ship。素のClaude Codeでも、自分で用意したいくつかのスラッシュコマンドと合わせて使えます。
筆者はJasmine。Claude CodeとAgentKitを使い、この brainstorm-plan-cook-ship のループを実際の本番作業で回している開発者です。
たいていの「AIコーディング術」記事は、プロンプトの山を渡して幸運を祈るだけです。それはワークフローではなく、単なる小技の寄せ集めです。本当に成果を左右するのは繰り返し使えるパイプライン、つまり同じフェーズを同じ順序で回し、各ステップに検証ゲートを設けることです。本記事はそのパイプラインを、実際の1つの機能に対して最初から最後まで通し、各フェーズの具体的なコマンドとともに紹介します。
| フェーズ | 目的 | AgentKitコマンド |
|---|---|---|
| 1. Brainstorm | 成果と受け入れ基準を固める | /ak:brainstorm |
| 2. Plan | 自己完結した仕様を書く | /ak:plan |
| 3. Cook | 実装し、通るまでテストする | /ak:cook + /ak:test |
| 4. Ship | 敵対的レビューの後、PR | /ak:code-review → /ak:ship |
どのAgentKit?(OpenAI AgentKitではありません)
名前が衝突するので、まず区別を。この記事で扱うAgentKitは、agentkit.best(リンク経由で20%オフ)で提供されているClaude Code向けのキットです。スキル、エージェント、スラッシュコマンドをまとめたもので、ak CLIから操作します。以前は「Claude Kit」という名前で、ck CLIがakに改名されました。
これは、2025年10月6日にローンチされたOpenAI AgentKit(Agent Builder、ChatKit、Connector Registry)ではありません。単語は同じでも、まったく別の製品です。チャットエージェントを作るためのOpenAIのツールを探してたどり着いたのなら、これは違います。本記事は、Claude Codeの上で回す規律あるコーディングワークフローについての記事です。Claude Code自体が初めてですか? まずはこちらから。
名前のあるワークフローが場当たり的なプロンプトに勝る理由
機能を場当たり的にチャットで進めると、3つの失敗パターンが繰り返し現れます。1つ目、コンテキストが埋まる——実装の深いところに入る頃には、Claudeは序盤に合意したことの半分を忘れています。2つ目、Claudeが検証せずに「完了したように見える」——成功と報告するのに、実際にコードを動かすと動かない。3つ目、スコープがずれる——レートリミッターを頼んだのに、レートリミッターに加えて無関係な3つのファイルのリファクタリングまで返ってくる。
解決策は、考えることとやることを分離し、各ステップをチェックでゲートするパイプラインです。Anthropic自身のガイダンスも同じ方向を指しています。Claude Codeのベストプラクティス文書(2026-08-09にアクセス)は、explore → plan → code → commitのループを推奨し、そして何より、出力を「Claudeが検証できる手段を与える」ことを求めています。brainstorm-plan-cook-shipは、そのアドバイスを実運用に落とし込んだアップグレード版です。各フェーズを手作業のプロンプトで思い出す代わりに、各フェーズを、定義された成果物と定義されたゲートを持つコマンドにするのです。原則は同じ、あなたに求められる規律は少なく、出てくるものの一貫性は高い。これこそが、運任せのセッションではなく繰り返し使えるAIコーディングワークフローになる理由です。
もう1つ、より微妙な見返りがあります。名前のついた各フェーズは、自然なコンテキストの境界になります。Brainstormは会話ログではなく短い成果を生み、Planは新しいセッションに渡せるファイルを生み、Cookはそのファイルから作業し、Shipはクリーンなコンテキストでレビューします。各フェーズが肥大化した会話ではなく、小さく永続する成果物を受け渡すので、「コンテキストが埋まる」という失敗を丸ごと回避できます。Cookするモデルは、渡された計画だけを見ればよく、Brainstorm全体を覚えている必要はありません。場当たり的なプロンプトではこれができません。すべてが1つの膨れ続けるスレッドの中にあるからです。
4フェーズをひと目で
ループ全体を1つの表にまとめました——各フェーズが何を生み、コマンドは何か、次に進む前に通すべきゲートは何か。以下はすべて、この表を実際の実行例で展開したものにすぎません。
| フェーズ | 生み出すもの | コマンド | 検証ゲート |
|---|---|---|---|
| Brainstorm | 合意した成果+受け入れ基準 | /ak:brainstorm | 成果を文書で承認する |
| Plan | 自己完結した仕様/計画ファイル | /ak:plan(+/ak:scout) | 計画にファイル、インターフェイス、スコープ外、検証方法が列挙されている |
| Cook | 動くコード+通るテスト | /ak:cook + /ak:test | テスト/ビルドが通る。「完了したように見える」ではなく、通ったときにループが閉じる |
| Ship | レビュー済みの差分+PR | /ak:code-review → /ak:ship | PRを開く前に、新鮮なレビュアーが承認する |
フェーズ1 - Brainstorm:コードに触れる前に成果を固める
Brainstormの目的は、あえて地味です。曖昧な意図(「ログインを追加」)を、受け入れ基準を伴う合意された成果に変え、誰かが1行でも書く前にいくつかのアプローチを比較すること。ここを飛ばすことこそ、多くのAIセッションが自信満々に間違ったコードを生む理由です——あなたが実際には合意していない目標に向けて、モデルが最適化してしまうのです。
AgentKitでは、こう実行します:
/ak:brainstorm add a Google OAuth callback route to the API
これがあなたにインタビューします。「完了」の意味、制約、非目標、そして受け入れ基準。最後に残るのは、あなたが実際に承認した短い文書化された成果であって、コードの壁ではありません。
素のClaude Codeでの相当機能はプランモードです。考えている間に何も編集できないよう、セッションを読み取り専用で開始します:
claude --permission-mode plan
# or toggle plan mode mid-session with Shift+Tab
そして、何かを提案する前にインタビューするよう促します。「成果と受け入れ基準を述べられるようになるまで、明確化のための質問をして、それから止まって。」違いは、AgentKitがこれを一貫した出力形式を持つ繰り返し可能なコマンドとして提供する点です。素のClaude Codeでは、毎回自分でインタビューを進める必要があります。
このフェーズの判断ルール:「完了」がどう見えるかを1文で言えないなら、Planする準備すらできていません。ましてCookなどもってのほかです。
フェーズ2 - Plan:成果を仕様に変える
Planは、合意された成果を書かれた自己完結の仕様に変換します。触るファイル、インターフェイス、明示的にスコープ外とするもの、そして——誰もが飛ばす部分——変更をエンドツーエンドでどう検証するか。精密な計画は、実装がスクロールしていくのを眺めるよりはるかに報われます。なぜなら、あなたが実際にレビューするのは良い計画であり、コードはそれに従うだけだからです。
/ak:plan implement the OAuth callback per the brainstorm outcome
AgentKitは、読んで編集して保存できるフェーズ分けされた計画ファイルを生成します。計画が、まず馴染みのないコードを理解する必要がある場合、その調査をscoutサブエージェントに委譲し、メインのコンテキストをきれいに保ちます:
/ak:scout # investigates the codebase, reports back without editing
なぜメインエージェントではなくサブエージェントがスカウトを担うのか、あるいはスキル、フック、MCPがその周りにどう収まるのかが曖昧なら、その部品をskills vs subagents vs hooks vs MCPで分解しました。素のClaude Codeでは、プランモードに加えて、提案された計画をその場で編集(Ctrl+Gでエディタを開く)してから進めさせることで、同じ効果が得られます。
これは小さなスペック駆動開発です。仕様を書き、それに合意すれば、実装は当て推量ではなくチェックリストになります。あなたの計画がCookに足るほど良いかどうかの目印はシンプルです——別のエンジニア(あるいは新鮮なClaude Codeセッション)が、あなたに一切質問せずに実行できること。まだあなたの実況解説が必要なら、それは計画ではありません。粗いアイデアであり、粗いアイデアからCookするのがスコープのずれる原因です。
フェーズ3 - Cook:検証ゲート付きで実装する
Cookはコードが書かれる場所です——しかし肝心なのは、ループがClaudeの「完了」ではなく、通ったチェックで閉じることです。計画を実行し、それをテストと組み合わせて、各ステップをゲートします。
/ak:cook # implements the approved plan, phase by phase
/ak:test # runs the test suite; failures feed back into the loop
肝心なパターン:勝利を宣言する前に、変更が機能することをモデルに証明させる手段を与えること。つまり、テストを実行し、ビルドを実行し、あるいはスクリーンショットの差分を取る——その出力を見える形で。素のClaude Codeを使うなら、Stopフックや/goalコマンドで同じゲートを組み込み、具体的な条件が通るまでセッションが自らを完了扱いできないようにします。そのゲートがあれば、/goalを使って cook-review-ship のループを一晩中回すことさえできます。
2つの習慣がCookの脱線を防ぎます。早めに軌道修正すること——間違った方向はEscで中断するか/rewindで巻き戻し、穴をさらに深く掘らせない。そして無関係なタスクの間には/clearを実行し、古いコンテキストが次の変更に染み出さないようにする。厄介なもの(不安定なテスト、馴染みのないバグ)には、調査用のサブエージェントを切り出し、メインスレッドは機能のShipに集中させます。
このフェーズを動かすコマンドが欲しい? /ak:cookと/ak:testコマンドに加え、60以上のエンジニアスキルと30以上のワークフローが、AgentKitのEngineer Kit(99ドル。サイトにキットの継続課金の記載はありません)に入っています。自分で組み立てるはずだったものの、あらかじめ用意された版です。Engineer Kitの中身を見るか、直接ak CLIを試してみる(リンク経由で20%オフ)。
フェーズ4 - Ship:レビュー、それからPR
Shipを「コミットして祈る」から、チームで信頼できる何かへ格上げするルールがこれです:作業を採点するレビュアーは、それを書いた本人ではない。 1時間かけてコードが正しいと自分を納得させたばかりのモデルは、そのコードの最悪の判定者です。だから、まず新鮮なコンテキストでレビューします。
/ak:code-review # a fresh reviewer grades the diff against the plan
これは敵対的なパスを立ち上げます——差分を元の計画と照らして読み、リグレッション、見落とした受け入れ基準、雑な粗を探すレビュアーサブエージェント(あるいはクリーンなセッション)です。それが承認して初めて、PRを開きます:
/ak:ship # conventional commit + PR via gh
AgentKitはconventional commitを書き、gh CLIを通じてプルリクエストを開きます。素の相当機能は、新しいセッションで/code-reviewを実行し、それから自分でgh pr createすることです。任意で、/ak:journalでループを締めくくり、下した判断を記録しておきましょう——なぜコールバックをこう作ったのかを後で見返すとき、未来のあなたが今のあなたに感謝します。
実際の1機能で通すループ全体(エンドツーエンド)
小さくて現実的な1つの機能でまとめてみましょう。既存のAPIにGoogle OAuthコールバックルートを追加します。実行の中で実際に積み上がる4つの成果物を、並べて示します。
- Brainstorm → 2行の成果:「
GET /auth/google/callbackを追加し、コードをトークンと交換し、ユーザーを作成/連携し、セッションクッキーを設定する。非目標:リフレッシュトークンのローテーションなし、新規UIなし。」受け入れ基準:新しい統合テストが通り、手動ログインが往復すること。 - Plan → フェーズ分けされた計画ファイル:どのルートファイルか、トークン交換のヘルパー、再利用するセッションモジュール、拒否された同意のエラー処理、スコープ外リスト、そして書くべき正確なテスト。
- Cook → 差分:新しいルート、ヘルパー、1つの新しい統合テスト。既存のセッションコードに接続され、止まる前にテスト実行が通っている。
- Ship → 新鮮なレビューが1点を捕まえる(拒否された同意の経路がリダイレクトではなく500を返していた)。それが修正され、conventional commitとPRが開く。
時間について:目に見える節約は、モデルが速くタイプするからではなく——作業をやり直さないことから来ます。成果がフェーズ1で固められ、計画がフェーズ2でレビューされたから、フェーズ3のCookはめったに迷わず、フェーズ4のレビューが、人間のレビュアーやCIに届く前に唯一の本物の欠陥を捕まえます。場当たり的なコーディングの高くつくループ——間違ったものを作り、遅れて気づき、それをほどく——こそ、ゲートが防ぐものです。この規模の機能なら、prompt-and-prayのばらばらなセッションを何度かかけていたかもしれません。パイプラインを通せば、最後にきれいなPRが残る、集中した1パスです。
人間がなお重要な点についての正直なメモ:モデルは決して成果を決めません——それを決めるのはフェーズ1の私です——そしてフェーズ4のレビューでの発見は、まさに完全自動化したくない類の判断です。このワークフローは雑務と「完了したように見える」罠を取り除きますが、あなたを取り除きはしません。
フェーズを飛ばすとき(タイポを過剰処理しない)
このフレームワークが真価を発揮するのは、複数ファイルにまたがる、馴染みのない、あるいはアプローチが不確かな作業です。1行の修正には大げさすぎます。私が使う判断ルール:
差分全体を1文で説明できるなら、BrainstormとPlanを飛ばして——まっすぐCookへ。 タイポの修正、バージョンの引き上げ、変数のリネーム:さっさとやる(それでも、何も壊れていないことはテストで確認する)。
次のいずれかが当てはまるなら、フルパイプラインに手を伸ばしましょう:変更が複数のファイルにまたがる、そのコードベース領域に詳しくない、合理的なアプローチが複数ある、あるいは間違いを元に戻すのが高くつく。要は、プロセスの重さをリスクに合わせること——些細な変更に重いプロセスは、それ自体が一種の無駄です。
AgentKit vs 素のClaude Codeでやる
はっきりさせておきます。ここは正直さが大事なので:このワークフローを回すのにAgentKitは必要ありません。 brainstorm-plan-cook-shipは素のClaude Codeで動きます。自分でスラッシュコマンドを作り、自分でスキルを書き、自分でStopフックを組んで、上で説明したすべてのゲートを再現できます。実際、優れた開発者の多くがまさにそうしています。
AgentKitが与えるのは、あらかじめ組まれた、意見のある版です:/ak:*コマンド、108以上のスキル、45のエージェント(エンジニア17+マーケティング28)が、すでに組み立てられテストされていて、自前のキットを作って維持する数週間を省けます。しかもGitHub Copilotでも動き、Claude Codeだけではありません。必要な人:ワークフローを今すぐ欲しく、片手間のツール作者になりたくない人。不要な人:自分のコマンドライブラリを作るのが好きな人、あるいはニーズが十分に狭く、2つの自作コマンドで足りる人。選択肢を天秤にかけているなら、AgentKitが他とどう比べられるかで他社と比較しました。
制限 & 正直な見解
トレードオフのないツールはありませんし、そうでないふりをすれば、この記事の意味がなくなります。
- 学習コスト。 それでもまずClaude Codeを知る必要があります。AgentKitはワークフローを加速しますが、基礎を教えてはくれません。Claude Code自体が初めてなら、キットを上に重ねる前にそれを学びましょう。
- 価格はUSD建てで、現実のコストです:Engineer KitとMarketing Kitは各99ドル、バンドルは149ドル(サイトにキットの継続課金の記載はありません)、そして返金保証があります——ただしサイトに具体的な期間の記載はないので、あるものと決めつけないこと。
- サブスクか買い切りかの混同。 キットは買い切りで、別売りのDesktop Appは年額サブスク(年19ドル)です。混同しやすいので、チェックアウトをよく読むこと。
- 一部の重複。 いくつかのスキルは、あなたがすでに自分でスクリプト化しているものと重なるかもしれません。価値は、一つひとつのスキルが目新しいことではなく、キュレーションとワークフローの接着剤にあります。
FAQ
brainstorm-plan-cook-shipワークフローとは?
繰り返し使える4フェーズのAI開発ワークフローです:brainstorm(成果と受け入れ基準を固める)、plan(自己完結した仕様を書く)、cook(通るまで実装とテスト)、ship(新鮮なコンテキストでの敵対的レビュー、それからPRを開く)。Anthropicのexplore-plan-code-commitのアドバイスを、各フェーズに検証ゲートを持つ名前付きコマンドとして実運用に落とし込んだものです。
このワークフローにAgentKitは必要?
いいえ。ワークフローは素のClaude Codeで回せます——同じゲートを得るには、自分でスラッシュコマンド、スキル、Stopフックを作ります。AgentKitは、それらのコマンド(/ak:brainstorm、/ak:plan、/ak:cook、/ak:ship)を提供する、あらかじめ組まれた版で、自分で組み立てる必要がなくなります。
AgentKitはOpenAI AgentKitと同じ?
いいえ。このAgentKitはagentkit.bestにあるClaude Code向けのキットで、ak CLI(旧Claude Kit/ck)で操作します。OpenAI AgentKitは別の製品(Agent Builder、ChatKit、Connector Registry)で、2025年10月6日にローンチされました。名前は同じ、無関係なツールです。
各フェーズの正確なコマンドは?
Brainstorm:/ak:brainstorm。Plan:/ak:plan(コードベース調査には/ak:scout)。Cook:/ak:cookに加えて/ak:test。Ship:/ak:code-reviewの後に/ak:ship、任意で判断を記録する/ak:journal。
GitHub Copilotでも動く?
はい。AgentKitはClaude CodeとGitHub Copilotの両方に対応しているので、チームがClaude CodeではなくCopilotを使っていても、同じワークフロー構造が使えます。
AgentKitは買い切り?サブスク?
キット(Engineer 99ドル、Marketing 99ドル、バンドル149ドル)は買い切りで——サイトに継続課金の記載はなく、キットの生涯アップデートが含まれます。別売りのDesktop Appは年額サブスク(年19ドル)です。課金方法が異なるので、実際に何を買うのか確認しましょう。
まとめ+キットを手に入れる
これがループ全体です:brainstormで成果を固め、planで仕様を書き、cookで通るテストの裏側で実装し、新鮮なレビュアーが承認したらshipする。名前付きのフェーズ、各1コマンド、各ステップにゲート——これが運任せのセッションを繰り返し使えるAI開発ワークフローに変えるものです。素のClaude Codeで回すもよし、組み立てを省いてあらかじめ用意されたコマンドを使うもよし。
このワークフローを箱から出してすぐ欲しい? AgentKitは各フェーズをスラッシュコマンドとして提供し、Claude Code向けに108以上のスキルも用意しています——正直な売り文句は、自前のキットを作って維持する手間から解放されること。キットは99ドル(サイトに継続課金の記載はありません)、返金保証つき。
買う前に全体像が知りたい? まずはAgentKitに含まれるものを読んでみてください。