자기개선을 재려면 학습 알고리즘을 건드리게 해야 해

AI4AI-Bench는 에이전트가 기존 학습 코드를 직접 고쳐 성능을 높일 수 있는지 재는 벤치마크야. 데이터를 더 모으거나 하이퍼파라미터만 바꾸는 실행과 학습 알고리즘 자체를 바꾼 실행을 갈라서 본다는 게 핵심이고.

AI가 AI를 더 잘 만든다는 얘기는 자주 나와. 그런데 그걸 재는 평가는 데이터를 더 모으거나 하이퍼파라미터를 맞추는 것만으로도 이겨져 버렸어. 모델이 학습하는 방식을 바꾼 건지, 실행 조건만 손본 건지 갈라내지 못한 거야.

이 평가는 저장소 원래 알고리즘을 0.1, 과제 최적값을 1.0으로 놓은 눈금을 써. 가장 잘한 시스템의 점수는 0.250이었어.

4시간 안에 고쳐 쓰고, 12시간 돌려서 채점해

과제는 얼려 둔 연구 저장소 10개야. 다루는 학습 알고리즘 계열은 이래.

  • 지도 파인튜닝(OpenR1), 멀티턴 에이전트 RL(RAGEN), 온폴리시 증류(OPD)
  • 보상 모델(BTRM), 선호 최적화(DPO), 디퓨전 RL(DDPO), 언러닝(NPO)
  • 이산 그래프 디퓨전(DiGress), 가중치 평균(Model Soup), 원샷 프루닝(OWL)

에이전트에게 주어지는 건 B300 한 장과 4시간이야. 그 안에 학습 알고리즘을 고쳐 쓰면, 그 코드를 처음부터 최대 12시간 다시 돌려서 채점해.

채점기는 고정돼 있고 에이전트에게 안 보여. 같은 절차로 저장소 원래 알고리즘과 붙여 비교하니까, 채점기를 맞춰 쓰는 요령으로는 점수를 못 올려.

대부분은 학습 방식을 안 건드렸어

시스템 6개를 추론 예산을 바꿔가며 29개 설정으로 돌렸어. 대상은 세 계열로 나뉘어.

전체 평균은 0.166, 가장 높은 시스템은 0.250이었어.

제출물을 뜯어보면 차이가 어디서 왔는지 보여. 모델이 학습하는 방식 자체를 바꾼 소수는 평균 0.226이었는데, 그러지 않은 제출물은 0.126이었거든.

추론 예산을 올리면 그 소수가 늘어나. 제출물의 8%에서 64%로 올라갔고, 평균 점수도 0.094에서 0.196이 됐어. 예산이 실력을 만든다기보다, 학습 방식을 건드려볼 마음을 먹게 만든 셈이야.

따라 하기 전에 볼 것

  • 과제도 채점기도 저자들이 만들었어: arXiv v1이라 동료 심사를 안 거쳤고, 제3자가 같은 과제를 다시 채점한 기록도 아직 없어.
  • 실패담으로만 읽으면 틀려: 0.1이 원래 알고리즘이니까 평균 0.166은 원래보다 나아진 값이야. 다만 리더보드에는 고쳐 쓴 코드가 원래보다 나빴던 실행이 124회 기록돼 있어. 전체 290회 중에서야.
  • 조건이 빡빡해: B300 한 장에 4시간이야. 시간을 늘리면 어디까지 올라가는지는 공개 자료에 없어.
  • 재볼 수 있게 열어 뒀어: 과제 모음과 채점기, 채점된 제출물이 Apache-2.0으로 공개돼 있어. 모델이 바뀔 때마다 같은 측정을 다시 돌려볼 수 있다는 게 이 평가의 쓸모야.

에이전트가 스스로를 개선한다는 말을 들으면 세 가지부터 확인하면 돼. 원래 알고리즘보다 나아졌는지, 고정된 채점기로 비교했는지, 실행 조건이 아니라 학습 방식을 실제로 바꿨는지야. 이 셋이 빠지면 자기개선보다는 튜닝 결과에 가까워.