자기개선을 재려면 학습 알고리즘을 건드리게 해야 해
AI4AI-Bench는 에이전트가 기존 학습 코드를 직접 고쳐 성능을 높일 수 있는지 재는 벤치마크야. 데이터를 더 모으거나 하이퍼파라미터만 바꾸는 실행과 학습 알고리즘 자체를 바꾼 실행을 갈라서 본다는 게 핵심이고.
AI가 AI를 더 잘 만든다는 얘기는 자주 나와. 그런데 그걸 재는 평가는 데이터를 더 모으거나 하이퍼파라미터를 맞추는 것만으로도 이겨져 버렸어. 모델이 학습하는 방식을 바꾼 건지, 실행 조건만 손본 건지 갈라내지 못한 거야.
이 평가는 저장소 원래 알고리즘을 0.1, 과제 최적값을 1.0으로 놓은 눈금을 써. 가장 잘한 시스템의 점수는 0.250이었어.
4시간 안에 고쳐 쓰고, 12시간 돌려서 채점해
과제는 얼려 둔 연구 저장소 10개야. 다루는 학습 알고리즘 계열은 이래.
- 지도 파인튜닝(OpenR1), 멀티턴 에이전트 RL(RAGEN), 온폴리시 증류(OPD)
- 보상 모델(BTRM), 선호 최적화(DPO), 디퓨전 RL(DDPO), 언러닝(NPO)
- 이산 그래프 디퓨전(DiGress), 가중치 평균(Model Soup), 원샷 프루닝(OWL)
에이전트에게 주어지는 건 B300 한 장과 4시간이야. 그 안에 학습 알고리즘을 고쳐 쓰면, 그 코드를 처음부터 최대 12시간 다시 돌려서 채점해.
채점기는 고정돼 있고 에이전트에게 안 보여. 같은 절차로 저장소 원래 알고리즘과 붙여 비교하니까, 채점기를 맞춰 쓰는 요령으로는 점수를 못 올려.
대부분은 학습 방식을 안 건드렸어
시스템 6개를 추론 예산을 바꿔가며 29개 설정으로 돌렸어. 대상은 세 계열로 나뉘어.
- Claude 계열: Claude Opus 5, Claude Sonnet 5
- GPT-5 계열: GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna
- Kimi 계열: Kimi K3
전체 평균은 0.166, 가장 높은 시스템은 0.250이었어.
제출물을 뜯어보면 차이가 어디서 왔는지 보여. 모델이 학습하는 방식 자체를 바꾼 소수는 평균 0.226이었는데, 그러지 않은 제출물은 0.126이었거든.
추론 예산을 올리면 그 소수가 늘어나. 제출물의 8%에서 64%로 올라갔고, 평균 점수도 0.094에서 0.196이 됐어. 예산이 실력을 만든다기보다, 학습 방식을 건드려볼 마음을 먹게 만든 셈이야.
따라 하기 전에 볼 것
- 과제도 채점기도 저자들이 만들었어: arXiv v1이라 동료 심사를 안 거쳤고, 제3자가 같은 과제를 다시 채점한 기록도 아직 없어.
- 실패담으로만 읽으면 틀려:
0.1이 원래 알고리즘이니까 평균0.166은 원래보다 나아진 값이야. 다만 리더보드에는 고쳐 쓴 코드가 원래보다 나빴던 실행이124회 기록돼 있어. 전체290회 중에서야. - 조건이 빡빡해: B300 한 장에
4시간이야. 시간을 늘리면 어디까지 올라가는지는 공개 자료에 없어. - 재볼 수 있게 열어 뒀어: 과제 모음과 채점기, 채점된 제출물이 Apache-2.0으로 공개돼 있어. 모델이 바뀔 때마다 같은 측정을 다시 돌려볼 수 있다는 게 이 평가의 쓸모야.
에이전트가 스스로를 개선한다는 말을 들으면 세 가지부터 확인하면 돼. 원래 알고리즘보다 나아졌는지, 고정된 채점기로 비교했는지, 실행 조건이 아니라 학습 방식을 실제로 바꿨는지야. 이 셋이 빠지면 자기개선보다는 튜닝 결과에 가까워.