보정 데이터 없이 반올림 방향을 정했어

“보정 데이터를 한 줄도 안 쓰고 정확도를 얻었는데, 대신 모델 하나마다 확산 모델을 따로 학습해야 해.”

양자화는 LLM 가중치를 촘촘한 실수에서 몇 단계 정수로 줄이는 작업이야. 제일 단순한 방법이 가장 가까운 단계로 반올림하는 RTN인데, 값이 두 단계 사이 한가운데에 놓이면 위로 갈지 아래로 갈지 근거가 없어.

ReRound는 그 구간에만 손을 대. 원본 가중치를 흉내 낸 연속값을 확산 모델로 미리 만들어 두고, 중간값 근처에 있는 가중치는 참고본이 위를 가리키면 위로, 아래를 가리키면 아래로 반올림해. 경계에 붙은 가중치는 그냥 RTN으로 둬.

개선 폭은 소수점 단위야

주 비교 대상은 작은 모델 5개고, 부록에서 4개를 더 확인했어. Gemma 2 2B를 4비트로 줄이면 평균 정확도가 67.4점인데, 보정 데이터를 쓰는 SignRound가 67.0점이야. 보정 없이 그걸 넘긴 거지. 다만 원본 16비트가 68.1점이라 아직 그 아래야.

Qwen3 1.7B의 WikiText-2 혼란도는 17.19에서 17.09로 내려갔어. OLMo 2 1B는 3비트에서 54.3점 → 55.1점으로 가장 크게 올랐고.

모델마다 확산 모델을 새로 학습해야 해

이득이 공짜는 아니야. 모델 하나를 양자화하려면 그 모델 전용 확산 모델을 따로 학습해야 하거든. 논문 기준으로 학습에 1.76~3.43시간(GPU 2장), 참고본을 뽑는 데 3.65~9.55시간(GPU 1장)이 들어.

대신 양자화 실행 자체는 42~124초로 끝나고, 추론할 때는 일반 RTN 모델과 똑같아. 계산이 전부 오프라인에서 끝나서 서비스에 올린 뒤에는 추가 비용이 안 붙어.

지금 확인할 것

  • 항상 이기는 건 아니야: OLMo 2 1B를 4비트로 줄이면 HQQ가 60.4점, BNB FP4가 61.1점인데 ReRound는 59.4점이야. 쓰던 방법이 이미 잘 맞으면 굳이 바꿀 이유가 없어
  • 큰 모델 얘기가 아니야: 논문이 시험한 건 1B~2.7B 구간이야. 그보다 큰 모델에서 같은 효과가 나온다는 근거는 아직 없어
  • 재현은 각자 몫: 제출 이틀 뒤라 제3자가 같은 표를 다시 뽑은 기록이 없어. 코드는 공개돼 있으니 쓰는 모델로 직접 돌려보고 판단해도 늦지 않아