보정 데이터 없이 반올림 방향을 정했어
“보정 데이터를 한 줄도 안 쓰고 정확도를 얻었는데, 대신 모델 하나마다 확산 모델을 따로 학습해야 해.”
양자화는 LLM 가중치를 촘촘한 실수에서 몇 단계 정수로 줄이는 작업이야. 제일 단순한 방법이 가장 가까운 단계로 반올림하는 RTN인데, 값이 두 단계 사이 한가운데에 놓이면 위로 갈지 아래로 갈지 근거가 없어.
ReRound는 그 구간에만 손을 대. 원본 가중치를 흉내 낸 연속값을 확산 모델로 미리 만들어 두고, 중간값 근처에 있는 가중치는 참고본이 위를 가리키면 위로, 아래를 가리키면 아래로 반올림해. 경계에 붙은 가중치는 그냥 RTN으로 둬.
개선 폭은 소수점 단위야
주 비교 대상은 작은 모델 5개고, 부록에서 4개를 더 확인했어. Gemma 2 2B를 4비트로 줄이면 평균 정확도가 67.4점인데, 보정 데이터를 쓰는 SignRound가 67.0점이야. 보정 없이 그걸 넘긴 거지. 다만 원본 16비트가 68.1점이라 아직 그 아래야.
Qwen3 1.7B의 WikiText-2 혼란도는 17.19에서 17.09로 내려갔어. OLMo 2 1B는 3비트에서 54.3점 → 55.1점으로 가장 크게 올랐고.
모델마다 확산 모델을 새로 학습해야 해
이득이 공짜는 아니야. 모델 하나를 양자화하려면 그 모델 전용 확산 모델을 따로 학습해야 하거든. 논문 기준으로 학습에 1.76~3.43시간(GPU 2장), 참고본을 뽑는 데 3.65~9.55시간(GPU 1장)이 들어.
대신 양자화 실행 자체는 42~124초로 끝나고, 추론할 때는 일반 RTN 모델과 똑같아. 계산이 전부 오프라인에서 끝나서 서비스에 올린 뒤에는 추가 비용이 안 붙어.