사후학습을 더 돌려도 도구 호출은 안 올랐어
“도구 호출이 약한 모델은 RL을 더 돌려도 잘 안 올라가.”
Qwen3-4B-Base가 그래. 파인튜닝만 했을 때 BFCL v3가 39.73%였는데, RL까지 붙이니 39.51%로 내려갔어.
8B도 47.62%에서 45.79%로 떨어졌어. 사후학습을 더 얹는 것만으로는 안 되는 구간이 있다는 뜻이야.
사전학습과 사후학습 사이에 도구 코퍼스를 끼워 넣었어
arXiv에 8월 20일 올라온 MidTool은 학습 순서를 한 칸 앞으로 옮겼어. 사전학습이 끝난 모델에 도구 사용 데이터를 먼저 먹이고 나서 파인튜닝과 RL을 해.
MidTool-Mix라는 코퍼스는 11.22M 샘플에 20.3B 토큰이야. 웹이 4.4B(42%), 코드가 3.8B(26%), PDF가 2.6B(23%), 실제 에이전트 실행 기록이 1.8B(9%)로 섞여 있어.
코퍼스가 가르치는 절차는 네 가지야
- 도구 알아보기: 지금 상황에서 어떤 도구를 부를 수 있는지 판별하기
- 인자 채우기: 호출에 넣을 값을 앞 문맥에서 찾아 채우기
- 호출 이어 붙이기: 한 번으로 안 끝나는 작업을 여러 호출로 짜기
- 되돌아오기: 정보가 모자란 채로 호출했을 때 복구하기
실제 도구 API와 MCP 스킬 호출 기록, 문서 기반 작업 흐름에서 지도 신호를 합성했어.
4B가 8B의 기본선을 넘었어
중간 학습을 넣은 4B는 파인튜닝만으로 50.25%, RL까지 붙여 54.18%가 됐어. 중간 학습을 안 넣은 8B의 47.62%보다 높아. 다만 비교 대상은 8B의 최고 성적이 아니라 기본선이야.
도구를 여러 번 부르는 과제에서 폭이 더 컸어. tau2-Bench Pass@1이 4B에서 8.54% → 19.96%, 8B에서 10.43% → 21.31%야.
MCP 서버를 실제로 부르는 MCP-Universe는 4B가 13.20에서 23.80, 8B가 15.18에서 25.16이야. 백분율이 아니라 벤치마크 자체 점수고.
따라 하기 전에 볼 것
- 자체 보고 수치야: arXiv v1이라 동료 심사를 안 거쳤고, 제3자가 같은 점수를 다시 낸 기록도 아직 없어.
- 공개 범위는 갈려 있어: Hugging Face에 MidTool-Mix 데이터셋과 Arctic-MidTool 모델이 올라와 있는데, 모델 카드는 Apache-2.0인데 데이터셋 카드는 other야. 사내 재학습을 생각한다면 데이터 조건부터 확인해.
- RL이 쓸모없다는 얘기는 아니야: 중간 학습 뒤에는 RL이 4B를
50.25%에서54.18%로 더 올렸어. 순서 문제인 거지. - 가져갈 만한 관점: 작은 오픈 모델로 도구 호출 에이전트를 만들다 막혔다면, 파인튜닝 데이터를 더 모으기 전에 그 모델이 도구를 본 적 있는지 확인해볼 수 있어.
데이터셋 다운로드가 아직 두 자리도 안 돼서, 지금 쓰던 모델을 바꿀 근거로 보긴 일러. 그래도 다음에 베이스 모델 고를 때 확인할 항목이 하나 늘었어.