같은 프롬프트를 다른 도구에 넣어 봤어
“같은 프롬프트를 Codex에 다시 줬더니 구성이 통째로 달라진 게임이 나왔어.”
Simon Willison이 8월 7일에 올린 얘기야. 이틀 전 Claude Fable 5에 던졌던 너구리 강도 게임 프롬프트를 그대로 Codex 데스크톱에 넣고, 이번엔 GPT-5.6 Sol Ultra로 돌렸어. Ultra는 Sol이 서브에이전트를 공격적으로 쓴다는 게 Simon의 설명이고, 공식 문서로 따로 확인된 건 아니야. 프롬프트 하나를 두 도구에 한 번씩 넣어본 비교라 도구 순위를 매길 수치는 아니고, 아래 “더 낫다”는 평가도 Simon 개인 총평이야.
결과물 구성이 이렇게 달라졌어
- Fable 5 판: 너구리 한 마리가 뒷마당을 돌며 동전과 생선을 줍는 구성이었어
- Sol Ultra 판: 박물관이 무대고, 동료 너구리
2마리를 구해 서로 올라타야 황금 정어리에 닿아 - 저자 총평: “훨씬 강도다웠다”가 두 판을 비교한 본인 표현이야
실행에 붙은 값
- 시간:
52분 - 비용:
$23.28 - 토큰: 입력
700.7K, 여기에 캐시된32.5M, 출력148K
스크린샷을 봤는데도 못 잡은 버그
원샷으로 나온 첫 결과물에는 너구리마다 눈알 하나가 거대한 구로 부푼 버그가 있었어. 개발 도중 Codex가 스크린샷을 확인했는데도 그걸 못 잡았고, 저자가 후속 프롬프트로 고쳤어. 고친 커밋과 작업 기록은 저장소에 그대로 남아 있어.
도구를 고를 때 이 비교를 어떻게 쓸까
- 표본 확대 전까지는: 같은 프롬프트를 여러 번 돌려 편차를 본 게 아니라서, 이번 결과 하나로 바이브 코딩 도구 순위를 매기진 마
- 비용 감각: 게임 하나에
$23.28이면 한 번 던지고 마는 실험으로는 무겁지 않지만, 하루에 여러 번 돌리는 작업 흐름이라면 계산이 달라져 - 자체 검토의 한계: 눈에 띄는 시각 버그를 스크린샷 검토가 놓쳤어. 코딩 에이전트에 결과 확인까지 맡길 생각이라면 사람 눈이 마지막에 한 번 더 들어가야 해
- 재현 조건: 정적 파일로 배포되는 브라우저 게임이라 실행 환경이 단순해. 로그인과 데이터베이스가 붙는 업무 시스템에 같은 기대를 걸긴 일러