에이전트를 몇 개 붙일지는 학습 목표에 안 들어 있었어

“정답률은 그대로 두고 토큰만 평균 20.5% 덜 썼어.”

LLM 여러 개를 붙여서 푸는 방식은 어려운 문제에서 정답률이 올라가. 대신 에이전트끼리 주고받는 말이 늘어나니까 토큰도 같이 늘어나고.

누가 누구랑 말할지를 자동으로 정하는 연구는 이미 있었어. ARG-Designer가 그 연결 구조를 그래프로 한 줄씩 생성하는 문제로 바꿔 놨거든. 그런데 그 학습 목표에는 구조를 작게 만들 유인이 없었어.

보상 모델이 정답률과 구조 크기를 같이 봐

arXiv에 8월 20일 올라온 RGA-Designer는 RLHF에서 쓰던 방식을 여기에 붙였어. 보상 모델을 먼저 학습시키고, 그 피드백으로 그래프 생성기를 다시 파인튜닝하는 순서야.

보상 모델이 보는 건 두 가지야. 과제를 맞혔는지, 그리고 그렇게 만든 연결 구조가 얼마나 간결한지. 두 신호를 같이 넣었으니 답을 맞히면서도 필요 없는 연결은 안 만드는 그래프가 높은 점수를 받아.

구현은 잔차 연결이 붙은 GraphSAGE 층으로 그래프를 인코딩해. 노드마다 역할 임베딩 384차원, 질의 임베딩 384차원, 구조 특징 5차원을 이어 붙여서 특징을 만들고.

절감폭은 문제 종류마다 갈렸어

벤치마크는 GSM8K, AQuA, MultiArith, SVAMP, MMLU, HumanEval 6개야. 기반 모델은 Qwen3-4B 하나야.

  • 정답률: GSM8K 88.36% → 88.76%, HumanEval 82.56% → 83.22%, MMLU 79.32% → 79.78%. 통계 검정에서 유의한 하락은 없었어.
  • AQuA: 3,914 토큰에서 2,633 토큰으로 33% 줄었어. 6개 중 폭이 가장 컸어.
  • HumanEval: 2,238에서 1,715로 23% 줄었어.
  • GSM8K: 4,546에서 3,863으로 15% 줄었어. 같은 방법인데 문제 종류에 따라 두 배 넘게 갈려.

따라 하기 전에 볼 것

  • 자체 보고 수치야: 측정도 보고도 저자가 했고 arXiv v1이라 동료 심사를 안 거쳤어. 제3자가 같은 폭을 다시 낸 기록도 아직 없어.
  • 모델 하나로만 쟀어: Qwen3-4B 단일 실험이야. 더 큰 모델이나 다른 계열에서 같은 폭이 나온다는 근거는 논문에 없어.
  • 토큰 수와 요금은 달라: 줄어든 건 토큰 수지 청구액이 아니야. 입력과 출력 단가가 다르니 실제 절감폭은 직접 계산해봐야 해.
  • 코드는 있는데 라이선스가 없어: 저장소는 Python으로 공개돼 있고 마지막 푸시가 8월 16일이야. 다만 라이선스 파일이 안 붙어 있어서 사내 코드로 가져다 쓰려면 저자에게 확인이 필요해.

멀티 에이전트를 이미 돌리고 있고 토큰 요금이 부담이라면, 모델을 바꾸기 전에 에이전트끼리 연결을 얼마나 촘촘하게 잡아뒀는지 먼저 볼 만해. 급할 건 없어.