같은 프롬프트를 다른 도구에 넣어 봤어

“같은 프롬프트를 Codex에 다시 줬더니 구성이 통째로 달라진 게임이 나왔어.”

Simon Willison이 8월 7일에 올린 얘기야. 이틀 전 Claude Fable 5에 던졌던 너구리 강도 게임 프롬프트를 그대로 Codex 데스크톱에 넣고, 이번엔 GPT-5.6 Sol Ultra로 돌렸어. Ultra는 Sol이 서브에이전트를 공격적으로 쓴다는 게 Simon의 설명이고, 공식 문서로 따로 확인된 건 아니야. 프롬프트 하나를 두 도구에 한 번씩 넣어본 비교라 도구 순위를 매길 수치는 아니고, 아래 “더 낫다”는 평가도 Simon 개인 총평이야.

결과물 구성이 이렇게 달라졌어

  • Fable 5 판: 너구리 한 마리가 뒷마당을 돌며 동전과 생선을 줍는 구성이었어
  • Sol Ultra 판: 박물관이 무대고, 동료 너구리 2마리를 구해 서로 올라타야 황금 정어리에 닿아
  • 저자 총평: “훨씬 강도다웠다”가 두 판을 비교한 본인 표현이야

실행에 붙은 값

  • 시간: 52분
  • 비용: $23.28
  • 토큰: 입력 700.7K, 여기에 캐시된 32.5M, 출력 148K

스크린샷을 봤는데도 못 잡은 버그

원샷으로 나온 첫 결과물에는 너구리마다 눈알 하나가 거대한 구로 부푼 버그가 있었어. 개발 도중 Codex가 스크린샷을 확인했는데도 그걸 못 잡았고, 저자가 후속 프롬프트로 고쳤어. 고친 커밋과 작업 기록은 저장소에 그대로 남아 있어.

도구를 고를 때 이 비교를 어떻게 쓸까

  • 표본 확대 전까지는: 같은 프롬프트를 여러 번 돌려 편차를 본 게 아니라서, 이번 결과 하나로 바이브 코딩 도구 순위를 매기진 마
  • 비용 감각: 게임 하나에 $23.28이면 한 번 던지고 마는 실험으로는 무겁지 않지만, 하루에 여러 번 돌리는 작업 흐름이라면 계산이 달라져
  • 자체 검토의 한계: 눈에 띄는 시각 버그를 스크린샷 검토가 놓쳤어. 코딩 에이전트에 결과 확인까지 맡길 생각이라면 사람 눈이 마지막에 한 번 더 들어가야 해
  • 재현 조건: 정적 파일로 배포되는 브라우저 게임이라 실행 환경이 단순해. 로그인과 데이터베이스가 붙는 업무 시스템에 같은 기대를 걸긴 일러