데이터를 더 붓는 대신 증류 절차를 건드렸어
“실시간 영상 생성에서 색이 뜨고 디테일이 뭉개지는 문제, 실제 영상 데이터를 한 장도 더 안 넣고 줄였어.” 9월 8일 arXiv에 올라온 논문 얘기야. 양방향으로 학습한 큰 영상 생성 모델을 앞에서 뒤로만 만드는 작은 모델로 증류하면 실시간에 가깝게 뽑을 수 있는데, 그 대가로 결과물 색이 과하게 진해지고 디테일이 뭉개지는 게 알려진 문제였거든.
원인은 증류 목적함수가 모드를 좇는 성질이야
저자들은 DMD가 쓰는 reverse KL을 지목했어. 이 목적함수는 교사 모델이 만들 수 있는 여러 갈래 중 몇 개만 붙잡는 성질이 있어서, 학생 모델의 분포가 그 몇 갈래로 눌러앉는다는 거야. 색과 질감이 비슷비슷하게 나오는 게 그 결과고.
롤아웃 입력에 마스크로 덜 노이즈한 토큰을 섞어
Mask Forcing이 하는 일은 단순해. 학생이 자기 출력을 다시 입력으로 받는 롤아웃 과정에서, 공간 축과 시간 축에 랜덤 마스크를 씌워 덜 노이즈한 토큰을 함께 넣어주는 거야.
- 탐색 범위: 흔들린 입력을 받으니 학생 롤아웃이 교사 분포의 다른 영역까지 훑게 되고, DMD가 이미 덮은 모드 밖에서도 학습 신호를 받아.
- 오차 누적: 덜 노이즈한 토큰이 옆의 더 노이즈한 토큰을 이끄는 길잡이가 돼서 중간 예측이 좋아지고, 뒤로 갈수록 오차가 쌓이는 것도 덜해.
- 비용: 학습 한 번에 1.5k 스텝, GPU 8장으로 14시간이야. 마스크 비율은 0.2, 타임스텝 창은 250으로 뒀고.
수치는 올랐는데, 한 군데는 내려갔어
학생은 Wan2.1-T2V-1.3B, 교사는 Wan2.1-T2V-14B고, 생성 영상은 81프레임 832×480에 노이즈 제거 4스텝이야.
- Self Forcing 위에: 움직임이 많은 100개 프롬프트 세트에서 지시 준수가 38.50에서 45.03으로, 동적 정도가 70에서 82로 올랐어. VBench 표준 946개 프롬프트로 잰 총점은 81.89에서 82.61이고.
- LongLive 위에: 총점은 82.02에서 82.75로 올랐는데, 동적 정도는 76에서 69로 내려갔어.
- 사람 평가: Self Forcing·Causal Forcing·LongLive 대비 선호 득표율이 각각 80%, 79%, 83%였어. 저자들이 직접 돌린 평가야.
읽을 때 걸어둘 조건
논문이 밝힌 값은 Wan2.1 계열 1.3B 학생 하나에 얹어 잰 결과야. 다른 크기나 다른 계열에서 같은 폭이 나온다는 근거는 아직 없고, 제출 이틀째라 제3자 재현도 없어. LongLive 쪽 동적 정도가 내려간 걸 보면 기준선마다 결과가 갈릴 수도 있고.
그래도 쓸 만한 게 하나 있어. 실시간 영상 생성에서 품질이 아쉬울 때 보통 데이터를 더 모으거나 후처리 학습 단계를 더하는데, 이 논문은 그 둘 없이 증류 롤아웃 절차만 바꿔서 같은 방향으로 갔거든. 코드도 공개돼 있으니, 순서를 정할 때 증류 쪽을 먼저 볼지 한 번 재볼 만해.