로컬 실행 조건은 정밀도에서 갈려
Meta Superintelligence Labs가 8월 10일 Muse Glimmer를 공개했어. 이미지와 영상까지 읽고 도구를 호출하는 30B 멀티모달 모델이고, 가중치는 Apache 2.0 라이선스로 같이 나왔지. 허깅페이스 블로그는 Muse를 증류해 이 크기로 줄였다고 밝혔어.
실행 조건은 정밀도에 따라 달라져. 4비트로 줄이면 24GB나 32GB 그래픽카드 한 장에 들어가고, 원래 정밀도 그대로 돌리려면 80GB H100이 한 장은 있어야 해.
같은 모델인데 필요한 장비가 달라
- 4비트로 줄였을 때: 언어 모델 부분이
20GB아래로 내려가서 소비자용 그래픽카드 한 장에 올라가. 양자화 후에도 에이전트 작업 성능이 거의 떨어지지 않았다는 건 Meta가 자체 검증했다고 밝힌 내용이야 - 원래 정밀도로 돌릴 때: 허깅페이스 블로그가 적은 추론 최소 사양은
80GBH100 한 장. LoRA로 미세조정할 때도 같은 카드가 필요하고, 전체 미세조정에는8장이 들어가 - 속도: 추측 디코딩(작은 모델이 먼저 답을 뽑고 큰 모델이 검사하는 방식)을 적용하면 RTX 5090에서
3.1배, M5 Max에서1.8배, M4 Max에서1.5배빨라져. 세 수치 다 Meta 발표 글에 적힌 값이야
이미지와 영상까지 읽는데, 점수는 아직 Meta 측정값뿐
이미지와 영상을 입력으로 받고 도구 호출도 처리해. 영상은 소리 없이 화면만 읽어. 컨텍스트는 32,768 토큰, 출력은 최대 8,192 토큰이고, 학습 데이터에는 100개가 넘는 언어가 들어갔어.
- MCP Atlas:
75.5— 비교 대상 Gemma4 31B는54.2 - SWE-Bench Pro:
51.2— Gemma4 31B는36.9 - Charxiv Reasoning:
78.8 - AIME 2026:
94.7
비교 대상으로는 Gemma4 31B와 Qwen3.6 27B를 나란히 놓았어. 다만 이 점수는 전부 Meta가 직접 잰 결과라, 제3자가 가중치를 받아 재현한 기록은 아직 안 나왔어.
도입 전에 확인할 것
- 장비 목록부터 맞춰보기:
24GB그래픽카드가 있으면 4비트판으로 먼저 시작해 볼 만해 - 원래 정밀도로 평가할지: 발표된 수치를 그대로 재보려면
80GBH100을 빌려야 해. 예산이 안 되면 4비트판 결과로 판단하게 돼 - 성능 수치를 어디까지 믿을지: 공개된 값은 전부 Meta 자체 측정이야. 사내 작업으로 직접 재보기 전까지는 후보를 추리는 기준으로만 두면 돼