병렬 샘플링도 외부 검증기도 없이 한 궤적으로 풀었어

디퓨전 모델에서 타임스텝을 떼니 Sudoku-Extreme을 99.90% 풀었어. 9월 1일 arXiv에 올라온 논문인데, 디퓨전 모델이 노이즈를 걷어낼 때 지금 몇 번째 단계인지 알려주는 값(타임스텝)을 없애고, 대신 반복 사이에 정보를 넘겨주는 은닉 상태를 붙였어. 남는 건 몇 번이고 다시 돌릴 수 있는 갱신 규칙 하나야.

학습 때 본 반복 횟수를 한참 넘겨도 정확도가 올라가

  • 학습: 한 에피소드에서 노이즈 제거를 20~160번 사이로 무작위로 돌렸고, 역전파는 4스텝까지만 잘라서 했어.
  • 추론: Sudoku-Extreme 99.90%는 10,000번 돌렸을 때 나온 값이야. Maze-Unique 98.93%는 100번이면 됐고.
  • 비교: 같은 Sudoku-Extreme에서 TRM은 87.4%, HRM은 55%였어.

학습 때 본 깊이를 한참 넘겨서 돌려도 정확도가 계속 올라간 게 이 논문이 내세우는 결과야.

추론할 때는 노이즈를 점점 줄일 필요가 없었어

단서가 아닌 칸을 매 스텝마다 새 가우시안 노이즈로 통째로 덮어써서 오염도를 최대로 고정해도, 정확도가 거의 그대로였어. 궤적 하나가 답 공간을 훑다가 안정된 답에 눌러앉는 방식이거든. 그래서 병렬 롤아웃, 후보 선택, 외부 검증기 같은 장치를 안 붙여도 됐어.

정작 못 빼는 건 학습 때의 순서야

추론에서는 빼도 됐지만, 학습에서 노이즈를 순서대로 키우는 절차는 빼면 안 됐어. 그래서 저자들은 디퓨전이 이 해법에 준 게 추론할 때의 샘플링 절차가 아니라 학습 커리큘럼이라고 정리했어. Maze-Hard에서 여러 경로를 허용해 잰 값은 86.43%로 TRM의 85.3%와 비슷한 수준이고.

아직 남은 조건

  • 모델 크기: 초록과 본문에서 파라미터 수를 찾지 못했어. 작은 모델이라는 주장을 크기로 확인할 수는 없어.
  • 비교 조건: TRM 87.4%와 HRM 55%는 각자 논문에서 잰 값이야. 같은 조건에서 나란히 다시 잰 표는 이 논문에 없어.
  • 저자가 단 조건: 학습 방식마다 단서 개수와 마스크 모양이 달라서 답이 여러 개인 문제를 따로 떼어 보진 못했다고 적었고, 답이 눌러앉는 결과는 탐색적이라고 했어.

퍼즐 벤치마크 두 종류에서 나온 결과야. 지금 쓰는 추론 파이프라인에 병렬 샘플링과 검증기를 붙여둔 팀이라면, 그걸 떼는 실험보다 학습 커리큘럼을 먼저 손보는 순서를 검토해볼 만해.