Brainstorm → Plan → Cook → Ship AI 개발 워크플로우 (AgentKit 활용)
제가 매일 돌리는 AI 개발 워크플로우는 반복 가능한 네 단계입니다. Brainstorm(성과를 확정), Plan(명세 작성), Cook(구현과 테스트), Ship(리뷰 후 PR). Claude Code용 AgentKit을 쓰면 각 단계가 명령어 하나로 실행됩니다. /ak:brainstorm → /ak:plan → /ak:cook → /ak:ship. 순수 Claude Code에서도, 직접 만든 몇 개의 슬래시 명령어와 함께 쓸 수 있어요.
글쓴이는 Jasmine, Claude Code와 AgentKit으로 이 brainstorm-plan-cook-ship 루프를 실제 프로덕션 작업에서 그대로 돌리는 개발자예요.
대부분의 "AI 코딩 팁" 글은 프롬프트 더미를 건네주고 행운을 빌 뿐이에요. 그건 워크플로우가 아니라 잡기술 모음일 뿐이죠. 실제로 성과를 좌우하는 건 반복 가능한 파이프라인, 즉 같은 단계를 같은 순서로, 매 정거장마다 검증 게이트를 두는 것입니다. 이 글은 바로 그 파이프라인을, 실제 기능 하나에 대해 처음부터 끝까지 돌리며 각 단계의 정확한 명령어와 함께 보여드려요.
| 단계 | 목표 | AgentKit 명령어 |
|---|---|---|
| 1. Brainstorm | 성과 + 인수 기준 확정 | /ak:brainstorm |
| 2. Plan | 자기완결적 명세 작성 | /ak:plan |
| 3. Cook | 통과할 때까지 구현 + 테스트 | /ak:cook + /ak:test |
| 4. Ship | 적대적 리뷰 후 PR | /ak:code-review → /ak:ship |
어떤 AgentKit? (OpenAI AgentKit이 아닙니다)
이름이 겹치니 먼저 구분부터요. 이 글에서 다루는 AgentKit은 agentkit.best(링크로 20% 할인)에서 제공하는 Claude Code용 키트입니다. 스킬, 에이전트, 슬래시 명령어를 묶은 것으로 ak CLI로 조작해요. 예전 이름은 "Claude Kit"이었고, ck CLI가 ak로 바뀌었습니다.
이건 2025년 10월 6일에 출시된 OpenAI AgentKit(Agent Builder, ChatKit, Connector Registry)이 아닙니다. 같은 단어지만 완전히 다른 제품이에요. 챗 에이전트를 만드는 OpenAI 도구를 찾아 여기 오셨다면, 이건 그게 아니에요 — 이 글은 Claude Code 위에서 돌리는 규율 있는 코딩 워크플로우 이야기입니다. Claude Code 자체가 처음이신가요? 먼저 여기부터 보세요.
이름 붙은 워크플로우가 즉흥 프롬프트를 이기는 이유
기능을 즉흥적으로 채팅하며 진행하면 세 가지 실패 패턴이 반복해서 나타나요. 첫째, 컨텍스트가 가득 찹니다 — 구현 깊숙이 들어갈 즈음이면 Claude는 초반에 합의한 내용의 절반을 잊어버립니다. 둘째, Claude가 검증 없이 "다 된 것처럼 보입니다" — 성공했다고 보고하는데, 코드를 돌려보면 동작하지 않아요. 셋째, 범위가 표류합니다 — 레이트 리미터를 부탁했는데 레이트 리미터에 더해 무관한 파일 세 개의 리팩터링까지 딸려 옵니다.
해결책은 생각하기와 실행하기를 분리하고, 매 정거장을 체크로 게이트하는 파이프라인입니다. Anthropic 자체 가이드도 같은 방향을 가리켜요. Claude Code 모범 사례 문서(2026-08-09 접속)는 explore → plan → code → commit 루프를 권하고, 무엇보다 출력에 대해 "Claude가 검증할 수 있는 방법을 주라"고 말합니다. brainstorm-plan-cook-ship은 그 조언을 실전에 옮긴 업그레이드판이에요. 각 단계를 손으로 일일이 프롬프트하려 애쓰는 대신, 각 단계를 정의된 산출물과 정의된 게이트를 가진 명령어로 만드는 거죠. 원칙은 같고, 당신에게 요구되는 규율은 적으며, 나오는 결과의 일관성은 높습니다. 바로 이것이 운 좋은 세션이 아니라 반복 가능한 AI 코딩 워크플로우가 되는 이유예요.
두 번째, 더 미묘한 이득도 있어요. 이름 붙은 각 단계는 자연스러운 컨텍스트 경계가 됩니다. Brainstorm은 대화록이 아니라 짧은 성과를 만들고, Plan은 새 세션에 넘길 수 있는 파일을 만들며, Cook은 그 파일에서 작업하고, Ship은 깨끗한 컨텍스트에서 리뷰합니다. 각 단계가 부풀어 오른 대화 대신 작고 지속되는 산출물을 넘겨주니, "컨텍스트가 가득 찬다"는 실패를 통째로 피할 수 있어요 — Cook하는 모델은 Brainstorm 전체를 기억할 필요 없이 넘겨받은 계획만 보면 됩니다. 즉흥 프롬프트는 이걸 못 해요. 모든 게 끝없이 커지는 하나의 스레드 안에 있으니까요.
네 단계 한눈에 보기
루프 전체를 표 하나에 담았어요 — 각 단계가 무엇을 만들고, 명령어는 무엇이며, 다음으로 넘어가기 전에 통과해야 할 게이트는 무엇인지. 아래 내용은 모두 이 표를 실제 실행 예시로 펼친 것에 불과합니다.
| 단계 | 만들어내는 것 | 명령어 | 검증 게이트 |
|---|---|---|---|
| Brainstorm | 합의한 성과 + 인수 기준 | /ak:brainstorm | 성과를 문서로 승인 |
| Plan | 자기완결적 명세 / 계획 파일 | /ak:plan(+ /ak:scout) | 계획에 파일, 인터페이스, 범위 외, 검증 방법이 나열됨 |
| Cook | 동작하는 코드 + 통과하는 테스트 | /ak:cook + /ak:test | 테스트/빌드 통과. "다 된 것처럼 보임"이 아니라 통과 시 루프가 닫힘 |
| Ship | 리뷰된 diff + PR | /ak:code-review → /ak:ship | PR을 열기 전에 새 리뷰어가 승인 |
1단계 - Brainstorm: 코드에 손대기 전에 성과를 확정
Brainstorm의 목표는 일부러 지루해요. 모호한 의도("로그인 추가")를 인수 기준을 갖춘 합의된 성과로 바꾸고, 누구든 한 줄이라도 쓰기 전에 몇 가지 접근법을 비교하는 것. 이 단계를 건너뛰는 것이 바로 수많은 AI 세션이 자신만만하게 틀린 코드를 내놓는 이유예요 — 당신이 실제로는 합의하지 않은 목표를 향해 모델이 최적화해 버리니까요.
AgentKit에서는 이렇게 실행합니다.
/ak:brainstorm add a Google OAuth callback route to the API
그러면 인터뷰를 해요. "완료"의 의미, 제약, 비목표, 그리고 인수 기준. 끝에는 당신이 실제로 승인한 짧은 문서화된 성과가 남지, 코드의 벽이 남지 않습니다.
순수 Claude Code의 대응 기능은 플랜 모드예요. 생각하는 동안 아무것도 편집하지 못하도록 세션을 읽기 전용으로 시작합니다.
claude --permission-mode plan
# or toggle plan mode mid-session with Shift+Tab
그런 다음 무언가 제안하기 전에 인터뷰하도록 유도하세요. "성과와 인수 기준을 말할 수 있을 때까지 명확화 질문을 하고, 그 다음 멈춰." 차이는, AgentKit이 이걸 일관된 출력 형태를 가진 반복 가능한 명령어로 제공한다는 점이에요. 순수 Claude Code에서는 매번 직접 인터뷰를 이끌어야 합니다.
이 단계의 판단 규칙: "완료"가 어떤 모습인지 한 문장으로 말할 수 없다면, 아직 Plan할 준비도 안 된 겁니다. Cook은 말할 것도 없고요.
2단계 - Plan: 성과를 명세로 바꾸기
Plan은 합의된 성과를 작성된 자기완결적 명세로 변환합니다. 건드릴 파일, 인터페이스, 명시적으로 범위 밖인 것, 그리고 — 다들 건너뛰는 부분 — 변경을 엔드투엔드로 어떻게 검증할지. 정밀한 계획은 구현이 스크롤되는 걸 지켜보는 것보다 훨씬 크게 보답해요. 당신이 실제로 리뷰하는 건 좋은 계획이고, 코드는 그저 그걸 따를 뿐이니까요.
/ak:plan implement the OAuth callback per the brainstorm outcome
AgentKit은 읽고 편집하고 보관할 수 있는 단계별 계획 파일을 만듭니다. 계획이 낯선 코드를 먼저 이해해야 할 때는, 그 조사를 scout 서브에이전트에 위임해 메인 컨텍스트를 깨끗하게 유지해요.
/ak:scout # investigates the codebase, reports back without editing
왜 메인 에이전트가 아니라 서브에이전트가 스카우트를 맡는지, 혹은 스킬, 훅, MCP가 그 주위에 어떻게 맞물리는지 아리송하다면, 그 조각들을 skills vs subagents vs hooks vs MCP에서 뜯어봤어요. 순수 Claude Code에서는 플랜 모드에 더해, 제안된 계획을 그 자리에서 편집(Ctrl+G로 에디터 열기)한 뒤 진행시키면 같은 효과를 얻습니다.
이건 소형 스펙 주도 개발이에요. 명세를 쓰고, 거기에 합의하면, 구현은 추측 게임이 아니라 체크리스트가 됩니다. 당신의 계획이 Cook할 만큼 충분히 좋은지 알아보는 신호는 간단해요 — 다른 엔지니어(혹은 새 Claude Code 세션)가 당신에게 단 하나의 질문도 하지 않고 실행할 수 있는지. 여전히 당신의 실시간 해설이 있어야 말이 된다면, 그건 계획이 아니에요. 거친 아이디어이고, 거친 아이디어에서 Cook하는 게 바로 범위가 표류하는 방식입니다.
3단계 - Cook: 검증 게이트를 두고 구현
Cook은 코드가 쓰이는 곳이에요 — 하지만 핵심은 루프가 Claude의 "완료"가 아니라 통과한 체크에서 닫힌다는 겁니다. 계획을 실행하고 그것을 테스트와 짝지어, 매 정거장을 게이트하세요.
/ak:cook # implements the approved plan, phase by phase
/ak:test # runs the test suite; failures feed back into the loop
중요한 패턴: 승리를 선언하기 전에 변경이 동작함을 모델이 증명하게 만드는 수단을 주는 것. 즉 테스트를 돌리고, 빌드를 돌리고, 스크린샷을 diff하는 것 — 그 출력을 눈에 보이게. 순수 Claude Code를 쓴다면, Stop 훅이나 /goal 명령어로 같은 게이트를 심어, 구체적인 조건이 통과하기 전까지 세션이 스스로를 완료로 부르지 못하게 하세요. 그 게이트가 있으면 /goal로 cook-review-ship 루프를 밤새 돌릴 수도 있어요.
두 가지 습관이 Cook의 탈선을 막아줍니다. 일찍 궤도 수정하기 — 잘못된 방향은 Esc로 중단하거나 /rewind로 되돌려, 구덩이를 더 깊이 파게 두지 마세요. 그리고 무관한 작업 사이에는 /clear를 실행해, 낡은 컨텍스트가 다음 변경으로 배어들지 않게 하세요. 까다로운 것(불안정한 테스트, 낯선 버그)에는 조사용 서브에이전트를 떼어내, 메인 스레드는 기능을 Ship하는 데 집중시키세요.
이 단계를 움직이는 명령어가 궁금하세요? /ak:cook과 /ak:test 명령어에 더해, 60개 이상의 엔지니어 스킬과 30개 이상의 워크플로우가 AgentKit의 Engineer Kit($99, 사이트에 키트의 반복 요금 표기는 없어요)에 들어 있어요. 직접 조립했어야 할 것을 미리 만들어 둔 버전이죠. Engineer Kit 안에 뭐가 있는지 보기, 아니면 곧장 ak CLI를 직접 굴려보기(링크로 20% 할인).
4단계 - Ship: 리뷰 후 PR
Ship을 "커밋하고 기도하기"에서 팀에서 신뢰할 만한 무언가로 끌어올리는 규칙이 이거예요. 작업을 채점하는 리뷰어는 그것을 쓴 당사자가 아니다. 한 시간 동안 코드가 옳다고 스스로를 설득한 모델은 그 코드의 최악의 심판입니다. 그래서 먼저 새 컨텍스트에서 리뷰해요.
/ak:code-review # a fresh reviewer grades the diff against the plan
이건 적대적 패스를 띄웁니다 — diff를 원래 계획과 대조해 읽으며 회귀, 놓친 인수 기준, 엉성한 구석을 찾는 리뷰어 서브에이전트(혹은 깨끗한 세션)죠. 그것이 승인한 뒤에야 PR을 엽니다.
/ak:ship # conventional commit + PR via gh
AgentKit은 conventional commit을 쓰고 gh CLI를 통해 풀 리퀘스트를 엽니다. 순수 대응 기능은 새 세션에서 /code-review를 돌린 뒤 직접 gh pr create하는 거예요. 선택적으로 /ak:journal로 루프를 마무리해 내린 결정을 기록해 두세요 — 콜백을 왜 이렇게 지었는지 나중에 다시 볼 때, 미래의 당신이 지금의 당신에게 고마워할 거예요.
실제 기능 하나로 돌리는 루프 전체(엔드투엔드)
작고 현실적인 기능 하나로 합쳐봅시다. 기존 API에 Google OAuth 콜백 라우트를 추가하는 거예요. 실행에서 실제로 쌓이는 네 개의 산출물을 나란히 보여드릴게요.
- Brainstorm → 두 줄짜리 성과: "
GET /auth/google/callback을 추가해 코드를 토큰과 교환하고, 사용자를 생성/연결하고, 세션 쿠키를 설정한다. 비목표: 리프레시 토큰 로테이션 없음, 새 UI 없음." 인수 기준: 새 통합 테스트가 통과하고 수동 로그인이 왕복한다. - Plan → 단계별 계획 파일: 어느 라우트 파일인지, 토큰 교환 헬퍼, 재사용할 세션 모듈, 거부된 동의에 대한 에러 처리, 범위 외 목록, 그리고 작성할 정확한 테스트.
- Cook → diff: 새 라우트, 헬퍼, 새 통합 테스트 하나. 기존 세션 코드에 연결되고, 멈추기 전에 테스트 실행이 통과한다.
- Ship → 새 리뷰가 한 가지를 잡아낸다(거부된 동의 경로가 리다이렉트 대신 500을 반환했다). 그게 고쳐지고, conventional commit과 PR이 열린다.
시간에 관해: 눈에 보이는 절약은 모델이 더 빨리 타이핑해서가 아니라 — 작업을 다시 하지 않는 데서 옵니다. 성과가 1단계에서 확정되고 계획이 2단계에서 리뷰됐기에, 3단계의 Cook은 좀처럼 헤매지 않고, 4단계 리뷰가 사람 리뷰어나 CI에 닿기 전에 유일한 진짜 결함을 잡아냅니다. 즉흥 코딩의 비싼 루프 — 틀린 걸 만들고, 늦게 발견하고, 되돌리는 것 — 이 바로 게이트가 막아주는 것이죠. 이 정도 크기의 기능이라면 prompt-and-pray로 흩어진 세션 몇 번이 걸렸을지도 몰라요. 파이프라인을 통과하면, 끝에 깨끗한 PR이 남는 집중된 한 번의 패스입니다.
사람이 여전히 중요한 지점에 대한 솔직한 메모: 모델은 결코 성과를 정하지 않아요 — 그건 1단계의 제가 정합니다 — 그리고 4단계 리뷰에서의 발견은 완전 자동화하고 싶지 않은 바로 그런 종류의 판단이에요. 이 워크플로우는 잡무와 "다 된 것처럼 보이는" 함정을 없애 주지만, 당신을 없애지는 않습니다.
단계를 건너뛸 때(오타를 과하게 처리하지 마세요)
이 프레임워크는 여러 파일에 걸치거나, 낯설거나, 접근법이 불확실한 작업에서 값을 합니다. 한 줄짜리 수정에는 과해요. 제가 쓰는 판단 규칙:
전체 diff를 한 문장으로 설명할 수 있다면, Brainstorm과 Plan을 건너뛰고 — 곧장 Cook으로. 오타 수정, 버전 올리기, 변수 이름 바꾸기: 그냥 하세요(그래도 아무것도 깨지지 않았는지는 테스트로 확인하고요).
다음 중 하나라도 참이면 풀 파이프라인에 손을 뻗으세요: 변경이 여러 파일에 걸친다, 그 코드베이스 영역을 잘 모른다, 합리적인 접근법이 둘 이상이다, 혹은 실수를 되돌리기 비싸다. 요령은 프로세스의 무게를 리스크에 맞추는 것 — 사소한 변경에 무거운 프로세스는 그 자체로 일종의 낭비예요.
AgentKit vs 순수 Claude Code로 하기
분명히 해두죠, 여기선 솔직함이 중요하니까요. 이 워크플로우를 돌리는 데 AgentKit이 꼭 필요하진 않습니다. brainstorm-plan-cook-ship은 순수 Claude Code에서 동작해요. 직접 슬래시 명령어를 만들고, 직접 스킬을 쓰고, 직접 Stop 훅을 엮어 위에서 설명한 모든 게이트를 재현할 수 있어요. 실제로 훌륭한 개발자 상당수가 바로 그렇게 합니다.
AgentKit이 주는 건 미리 조립된, 견해가 담긴 버전이에요. /ak:* 명령어, 108개 이상의 스킬, 45개 에이전트(엔지니어 17 + 마케팅 28)가 이미 조립되고 테스트되어 있어, 자기 키트를 만들고 유지하는 몇 주를 아껴줍니다. 게다가 Claude Code뿐 아니라 GitHub Copilot에서도 동작해요. 필요한 사람: 워크플로우를 지금 당장 원하고, 파트타임 툴 저자가 되고 싶지 않은 사람. 필요 없는 사람: 자기 명령어 라이브러리를 만드는 걸 즐기는 사람, 혹은 필요가 충분히 좁아 자작 명령어 두 개면 되는 사람. 선택을 저울질 중이라면, AgentKit이 대안들과 어떻게 비교되는지에서 경쟁 상대들과 비교해 봤어요.
한계 & 솔직한 견해
트레이드오프 없는 도구는 없고, 아닌 척하면 이 글의 취지가 무색해지죠.
- 학습 곡선. 그래도 먼저 Claude Code를 알아야 해요. AgentKit은 워크플로우를 가속할 뿐, 기본기를 가르쳐 주진 않습니다. Claude Code 자체가 처음이라면, 키트를 위에 얹기 전에 그걸 먼저 배우세요.
- 가격은 USD 기준이고 실제 비용이에요. Engineer Kit과 Marketing Kit은 각 $99, 번들은 $149(사이트에 키트의 반복 요금 표기는 없어요), 그리고 환불 보장이 있어요 — 다만 사이트에 구체적인 기간이 적혀 있지 않으니 있다고 단정하지 마세요.
- 구독 vs 일회성 혼동. 키트는 일회성이고, 별도의 Desktop App은 연간 구독($19/년)이에요. 헷갈리기 쉬우니 결제 화면을 꼼꼼히 읽으세요.
- 일부 중복. 몇몇 스킬은 당신이 이미 직접 스크립트로 짜둔 것과 겹칠 수 있어요. 가치는 스킬 하나하나가 참신한 데 있는 게 아니라, 큐레이션과 워크플로우를 잇는 접착제에 있습니다.
FAQ
brainstorm-plan-cook-ship 워크플로우란?
반복 가능한 네 단계 AI 개발 워크플로우예요. brainstorm(성과와 인수 기준 확정), plan(자기완결적 명세 작성), cook(통과할 때까지 구현과 테스트), ship(새 컨텍스트에서의 적대적 리뷰 후 PR 열기). Anthropic의 explore-plan-code-commit 조언을, 각 단계에 검증 게이트를 둔 이름 붙은 명령어로 실전화한 것입니다.
이 워크플로우에 AgentKit이 필요한가요?
아니요. 워크플로우는 순수 Claude Code에서 돌아가요 — 같은 게이트를 얻으려면 직접 슬래시 명령어, 스킬, Stop 훅을 만들면 됩니다. AgentKit은 그 명령어들(/ak:brainstorm, /ak:plan, /ak:cook, /ak:ship)을 제공하는 미리 조립된 버전이라, 직접 조립할 필요가 없어요.
AgentKit은 OpenAI AgentKit과 같은 건가요?
아니요. 이 AgentKit은 agentkit.best에 있는 Claude Code용 키트로, ak CLI(옛 Claude Kit / ck)로 조작합니다. OpenAI AgentKit은 다른 제품(Agent Builder, ChatKit, Connector Registry)으로 2025년 10월 6일에 출시됐어요. 이름은 같고, 무관한 도구입니다.
각 단계의 정확한 명령어는?
Brainstorm: /ak:brainstorm. Plan: /ak:plan(코드베이스 조사에는 /ak:scout). Cook: /ak:cook과 /ak:test. Ship: /ak:code-review 다음 /ak:ship, 결정을 기록할 선택적 /ak:journal.
GitHub Copilot에서도 되나요?
네. AgentKit은 Claude Code와 GitHub Copilot을 모두 지원해서, 팀이 Claude Code가 아니라 Copilot을 쓰더라도 같은 워크플로우 구조를 쓸 수 있어요.
AgentKit은 일회성인가요, 구독인가요?
키트(Engineer $99, Marketing $99, 번들 $149)는 일회성이에요 — 사이트에 반복 요금 표기가 없고 키트 평생 업데이트가 포함됩니다. 별도의 Desktop App은 연간 구독($19/년)이고요. 청구 방식이 다르니 실제로 무엇을 사는지 확인하세요.
결론 + 키트 받기
이게 루프 전체예요. brainstorm으로 성과를 확정하고, plan으로 명세를 쓰고, cook으로 통과하는 테스트 뒤에서 구현하고, 새 리뷰어가 승인하면 ship. 이름 붙은 단계, 각각 명령어 하나, 매 정거장에 게이트 — 이것이 운 좋은 세션을 반복 가능한 AI 개발 워크플로우로 바꾸는 것입니다. 순수 Claude Code로 돌리든, 조립을 건너뛰고 미리 만들어진 명령어를 쓰든.
이 워크플로우를 상자에서 꺼내자마자 쓰고 싶으세요? AgentKit은 모든 단계를 슬래시 명령어로 제공하고 Claude Code용 108개 이상의 스킬도 함께 줘요 — 솔직한 세일즈 포인트는, 자기 키트를 만들고 유지하는 수고를 덜어준다는 거예요. 키트는 $99(사이트에 반복 요금 표기 없음), 환불 보장 포함.
사기 전에 전체 그림을 보고 싶으세요? 먼저 AgentKit에 무엇이 포함되는지 읽어보세요.