한 줄 정의

A4B NVFP4A4B MoE 구조의 모델NVFP4 포맷으로 양자화해 배포한다는 조합 표현이야. A4B는 매 토큰에서 실제로 켜지는 활성 파라미터 규모를 가리키는 신호에 가깝고, NVFP4NVIDIA Blackwell 경로에서 쓰는 4비트 부동소수점 양자화 포맷에 가까워.

둘을 붙여 쓰면 “계산량을 줄이는 MoE 구조”와 “가중치와 활성값을 작게 저장하는 정밀도 포맷”을 한 번에 말하는 셈이야. 그래서 Gemma 4 26B A4B NVFP4 같은 모델 이름을 볼 때는 모델 구조, 양자화 포맷, 런타임 조건을 따로 풀어 봐야 해.

어떻게 작동하나

A4B 쪽은 모델이 전체 파라미터를 모두 매번 계산하지 않는다는 신호야. 이름의 26B는 모델 라벨처럼 쓰이지만, Hugging FaceNVIDIA NVFP4 모델 카드 기준으로 실제 total parameters는 25.2B야. A4B도 정확히 4B를 뜻한다기보다 active parameters 3.8B를 반올림해 부르는 신호로 봐야 해. 같은 카드에는 30개 layer, 256K context length, 8 active / 128 total experts와 1 shared expert 구성도 함께 나와.

NVFP4 쪽은 값을 더 작은 정밀도로 담는 방식이야. NVIDIA TE 문서는 NVFP4 값을 E2M1, 즉 1 sign bit, 2 exponent bits, 1 mantissa bit 구성으로 설명해. NVIDIANVFP4 글은 여기에 16개 값마다 FP8 스케일을 붙이고, 텐서 전체에는 FP32 second-level scale을 둔다고 설명해. 이 구조 때문에 FP16이나 FP8보다 모델 메모리 footprint를 줄이면서도 정확도 손실을 제한하려는 목표를 가져.

실제 배포에서는 두 조건이 동시에 맞아야 해. A4B 구조라고 해서 자동으로 빠른 것도 아니고, NVFP4라고 해서 어떤 GPU와 런타임에서도 바로 도는 것도 아니야. 모델 카드가 vLLM추론 엔진으로 적고, 테스트 하드웨어로 B200을 적는다면 그 조합을 기준선으로 보고 자기 환경의 GPU, 드라이버, 컨테이너, backend를 다시 확인해야 해.

왜 중요한가

A4B NVFP4가 중요한 이유는 대형 멀티모달 모델을 로컬 또는 자체 인프라에서 돌릴 때 병목이 한 가지가 아니기 때문이야. MoE 구조는 매 토큰 계산되는 경로를 줄이고, NVFP4모델 footprint를 줄이는 쪽에 영향을 줘. 둘이 같이 있으면 inference 비용과 메모리 압박을 낮출 가능성이 생겨.

NVIDIAGemma 4 글은 26B A4B 변형을 데이터센터와 로컬 환경을 모두 겨냥한 모델군으로 소개하는 출처야. 반면 Hugging Face의 해당 모델 카드는 그 변형이 NVFP4 체크포인트로 배포된 사실, vLLM 추론 엔진, B200 테스트 하드웨어, 25.2B total과 3.8B active 수치를 확인하는 출처야. 두 출처를 섞지 않아야 “NVIDIAGemma 4를 소개했다”와 “이 체크포인트가 NVFP4로 배포됐다”를 분리해서 볼 수 있어.

다만 이 이름만 보고 “작고 빠른 모델”이라고 결론 내리면 위험해. KV cache, 긴 context window, 배치 크기, attention backend, MoE routing, 드라이버 버전이 체감 속도와 안정성을 바꿀 수 있어. A4B NVFP4는 도입 후보를 좁히는 신호이지, 운영 결과를 보장하는 문구가 아니야.

주의해서 볼 점

첫째, A4B와 NVFP4의 층위를 분리해야 해. A4B는 모델 구조와 계산 경로의 신호이고, NVFP4quantization과 정밀도 포맷의 신호야. 둘을 섞어 “4B짜리 FP4 모델”처럼 줄여 말하면 모델 파일 크기와 실제 계산량을 모두 잘못 이해할 수 있어.

둘째, Blackwell 조건을 확인해야 해. NVFP4FP4 이름이 붙어 있어도 일반적인 모든 GPU용 포맷처럼 다루기 어렵고, NVIDIA 문서에서는 Blackwell과 관련 소프트웨어 경로를 중심으로 설명해. 지원 런타임이 없으면 체크포인트를 받아도 기대한 속도나 안정성이 나오지 않을 수 있어.

셋째, 비교는 같은 프롬프트 묶음과 같은 런타임에서 해야 해. BF16, FP8, NVFP4를 비교할 때는 모델 버전, 컨텍스트 길이, batch, backend, 샘플링 설정을 맞춰야 해. 그래야 그 포맷 덕분에 좋아진 부분과 런타임 최적화 덕분에 좋아진 부분을 나눠 볼 수 있어.