SUMMARY
Cursor가 Planner(프런티어 모델)/Worker(저렴한 모델) 역할을 분리한 트리형 에이전트 스웜을 재설계하고, 835페이지 SQLite 매뉴얼만으로 Rust SQLite를 재구현시키는 실험으로 검증했다.
| 역할 | 모델 등급 | 담당 |
|---|---|---|
| Planner | 가장 뛰어난(프런티어) 모델 | 목표를 부분 작업으로 분해, 설계 결정, 하위 위임 |
| Worker | 더 빠르고 저렴한 모델 | 할당된 좁은 작업만 실행 |
| # | 실패 양상 | 증상 | 해법 |
|---|---|---|---|
| 1 | 스플릿 브레인 설계 | 서로 모르는 두 Planner가 같은 개념을 다르게 구현 | Planner가 설계 결정을 직접 내리고, 위임된 하위 트리가 중복 결정하지 않도록 프롬프팅 |
| 2 | Planner 간 경합 | 같은 파일을 두고 두 Planner가 변경을 반복 충돌 | 공유 설계 문서에 결정 기록 → 컴파일 검증 참조로 코드와 연결 → 중립 조정자가 문서 병합 → 참조 통해 다운스트림 전파 |
| 3 | 병합 충돌 | Worker가 충돌 해결을 잘못 처리 (덮어쓰기·포기) | 중립적인 제3 에이전트가 모든 당사자를 대신해 해결 (인간 팀의 머지 큐와 유사) |
| 4 | 메가파일 | 특정 파일(1,000줄+)이 비대해져 모두가 손대며 충돌 폭증 | Worker가 플래그 → 해당 파일 신규 커밋 차단 → 외부 에이전트가 작은 모듈로 분해 |
| 5 | 경직화 (Ossification) | 기존 코드를 건드리길 꺼려 핵심 코드가 화석화 | 의도적 파괴 변경 허용 → 범위 밖은 국소 패치+주석 → 컴파일러가 전파 → 각 에이전트가 주석 읽고 자기 작업 갱신 |
index.md가 모든 에이전트 시작 시 자동 주입됨.| 항목 | 내용 |
|---|---|
| 과제 | 835페이지 SQLite 매뉴얼을 Rust로 구현 |
| 금지 사항 | SQLite 소스코드, 테스트 스위트, SQLite 바이너리, 인터넷 접근 |
| 평가 | sqllogictest — 정답이 알려진 수백만 개 쿼리의 정답률 |
| 블라인드 | 에이전트는 테스트 스위트의 존재를 모름 |
| 검증 | 사람이 직접 검토하여 부정행위 없음 확인 |
| 설정 | Planner | Worker | 의도 |
|---|---|---|---|
| 1 | GPT-5.5 | GPT-5.5 | 프런티어 모델 단일 |
| 2 | Grok 4.5 | Grok 4.5 | 비용 효율적 프런티어 단일 |
| 3 | Opus 4.8 | Composer 2.5 | 프런티어 판단력 + 저렴한 실행 |
| 4 | Fable 5 | Composer 2.5 | 최상위 Planner + 저렴한 실행 |
| 지표 | 기존 스웜 | 새 스웜 | 배율 |
|---|---|---|---|
| 커밋 수 (첫 2시간) | 68,000개 | 약 1/70 수준 | ~70× |
| 병합 충돌 (누적) | 70,000건+ (가속, 중단 전) | 1,000건 미만 (4시간 전체) | ~70× |
| 최다 충돌 파일 | 7,771건 / 에이전트 1,173개 관여 | 47건 | ~165× |
| Crate 수 | 54개 (중복 SQL 패키지 3개 포함) | 9개 (초기 확정 후 추가 없음) | 6× |
해석
기존 스웜 커밋의 대부분은 실질적 진전 없는 소모전(thrash)이었다.
| 모델 조합 | 기존 스웜 | 새 스웜 | 비고 |
|---|---|---|---|
| Fable 5 계열 | 64,305줄 (100%) | 9,908줄 (100%) | 코드 1/6.5 |
| Opus 4.8 계열 | 19,013줄 (97%) | 4,645줄 (100%) | 코드 1/4, 성능은 오히려 ↑ |
| 구성 | 총비용 |
|---|---|
| GPT-5.5 (Planner + Worker 모두) | $10,565 |
| Opus 4.8 Planner + Composer 2.5 Worker | $1,339 (~1/8) |
| Fable 5 Planner + Composer 2.5 Worker | Opus 하이브리드보다 높음 |
| 구성 | Worker 비용 |
|---|---|
| GPT-5.5 Worker 함대 | $9,373 |
| Composer 2.5 Worker 함대 (Opus Planner 하) | $411 (~1/23) |
시사점
Planner의 품질은 Planner 자신의 비용이 아니라 다운스트림 Worker의 효율로 평가해야 한다.
| 단계 | 도구 | 추상화 단위 |
|---|---|---|
| 1 | 자동완성 | 코드 한 줄 |
| 2 | 초기 모델 | 코드 블록 |
| 3 | 에이전트 | 파일 / 기능 |
| 4 | 에이전트 스웜 | 스펙(사양서) 전체 — 835페이지 서술형 문서 → 동작하는 DB |
이 실험에서 가장 부족했던 자원은 컴퓨팅도 모델도 아닌 "의도를 정확히 설명하는 능력"이었다 — 앞으로 소프트웨어 엔지니어링에서 가장 희소한 역량이 될 것이다.