독립 평가는 Grok 4.5를 4위로 놨다

“Opus급이지만 더 싸다”는 SpaceXAI 쪽 발언과 별개로, Artificial Analysis는 출시 하루 만에 Grok 4.5를 자체 Intelligence Index에 돌렸어. 결과는 점수 54, 4위다. Claude Fable 5, OpenAI GPT-5.5, Claude Opus 4.8 뒤야. 벤치마킹 회사가 중립 심판 역할을 하는 곳이라, 이 순위는 출시 발언보다 무겁게 봐도 돼.

코딩 숫자는 나쁘지 않아

코딩 에이전트 쪽 숫자는 오히려 준수해. MarkTechPost 기준으로 Grok 4.5는 SWE-bench Pro에서 64.7%를 받았고, 이건 Sonnet 5의 63.2%와 Opus 4.8의 69.2% 사이에 자리해. 같은 작업에서 Opus 4.8보다 출력 토큰을 약 4.2배 덜 쓴다는 측정도 있어. 입력 100만 토큰당 $2, 출력 $6 가격까지 붙으면, 반복 코딩 작업에서 단가 매력은 확실해.

함정은 환각률이야

같은 독립 평가에서 걸리는 게 하나 있어. 정확도는 35%에서 52%로 올랐는데, 환각률이 25%에서 54%로 같이 뛰었어. Artificial Analysis는 이걸 큰 모델에서 흔히 보이는 패턴이라고 정리했어. 아는 건 더 많아지는데, 틀릴 때는 더 자신 있게 틀린다는 거야. 싸고 빠른 모델이 틀린 답을 확신에 찬 문장으로 내놓으면, 그걸 그대로 믿는 쪽이 더 위험해져.

어디에 배치할까

모델을 도입하는 쪽에서 중요한 건 순위 자체보다 역할 배치야. 초안, 후보 분류, 로그 요약처럼 틀려도 검증 단계에서 걸러지는 작업이면, 싸고 빠른 Grok 4.5가 예산을 아껴줘. 반대로 최종 판단이나 사실 확정처럼 환각이 바로 비용이 되는 자리에는 아직 올리기 이르다. 결국 확인할 질문은 “Opus급이냐”가 아니라 “같은 예산으로 결과가 더 나아지느냐”야.