멀티 에이전트가 낫다는 비교는 조건이 섞여 있었어
멀티 에이전트 LLM 구성이 단일 모델보다 낫다는 보고는 많은데, 비교가 대체로 뒤엉켜 있어. 파이프라인을 바꾸면서 토큰 예산과 도구 호출, 프롬프트가 한꺼번에 달라지니까 총점이 올라도 뭐가 기여했는지 안 보여.
8월 27일 arXiv에 올라온 원고는 변수를 하나만 뒀어. 공유 파일 시스템 작업 공간 위에 매니저-워커 구성을 얹는 것 말고는 학습도 벤치마크별 튜닝도 안 했어. 비교 상대는 같은 모델이 한 번에 답한 결과야.
모델 아홉 개 중 하나는 오히려 내려갔어
문제는 LiveCodeBench의 가장 최신 하드 100개야. 모델은 오픈 웨이트 다섯 개가 9B부터 약 2.8T까지, 프런티어 비공개 모델이 넷이야.
- 크게 오른 모델: Qwen3.8-27B가
+23.4야. 추론을 끈 Kimi-K3는+30.4, Minimax-M3는+11.0이고 둘 다p < 10^-4로 나왔어. - 적당히 오른 모델: GPT-5.6-Luna가
+10.6, GPT-5.6-Terra가+8.0이야. - 내려간 모델: 추론을 끈 Qwen3.6-35B는
-1에서-9사이야. - 가장 높은 점수: 매니저를 얹은 Opus-5가 한 번에
91%를 냈어.
갈림길은 같은 점수를 얼마에 사느냐야
매니저를 두면 토큰 청구가 대략 세 배로 뛰어. 그런데 논문이 낸 대비는 다른 얘기를 해. GPT-5.6-Terra에 매니저를 얹으면 85.0점인데 Fable 5 단일 호출은 87.4점이야. 통계적으로 구분되지 않는 차이인데(p = 0.59), 문제 100개를 한 번 도는 비용은 $11.71 대 $61.11이야. 자체 호스팅할 수 있는 Qwen-27B 구성은 $51.75가 들었어.
왜 올랐는지 전사 기록을 뜯어봤어
저자들이 실행 기록을 분석했더니 두 가지가 반복해서 나왔어. 하나는 문맥 관리야. 워커 호출이 짧아지고 공유 노트로 상태를 정리하니까 내용이 잘려 나가는 게 줄어. 다른 하나는 문제를 나누는 것 자체고. 추론을 켠 큰 모델에서는 향상폭이 작았고, 추론을 끈 모델과 추론을 켠 작은 모델에서 컸어.