논문이던 게 내려받을 수 있는 가중치가 됐어
“지난주까지는 읽을 수만 있었는데, 이번엔 내려받아 돌릴 수 있어.”
Shieldstral-1.0-3B는 걸러낼 기준을 평문 문장으로 받아서 글과 이미지가 그 기준을 어겼는지 판정하는 3B 크기의 멀티모달 안전 분류기야. 글을 만들어 내는 모델이 아니라, 올라온 내용을 검사하는 판정기지.
Mistral이 8월 4일 이 가중치를 Apache 2.0으로 공개했어. Hugging Face에서 바로 내려받고, BF16으로 올리면 16GB VRAM 한 장에 들어가.
같은 모델의 arXiv 논문은 7월 30일에 나왔고, 그때 한 번 다뤘어. 그때는 방법과 점수뿐이었고, 이번엔 라이선스와 실행 조건이 붙었어.
정책을 평문으로 넣는 방식이야
기존 가드 모델은 위험 분류 체계가 학습 단계에서 굳어져. 회사 정책이 바뀌면 다시 학습시켜야 했거든.
Shieldstral은 판정할 정책을 평문 문장으로 같이 넣어. 모더레이션을 “이 내용이 이 정책을 어겼나”라는 예/아니오 한 문제로 바꿔서, 한 번의 forward pass로 보정된 안전 점수를 돌려줘. 텍스트만이 아니라 이미지, 그리고 텍스트와 이미지를 같이 받는 멀티모달 판정도 돼.
정책 문구만 고쳐도 판정 기준이 따라 움직인다는 게 여기서 나오는 차이야.
같은 크기대에서 어디까지 나왔나
- 프롬프트 안전 분류: HarmBench F1
99.4%, WildGuardTest88.1% - 멀티모달 안전: VLGuard
97.7%, UnsafeBench81.8% - 비교 대상: GPT-OSS-Safeguard-
20B, LlamaGuard-4-12B, ShieldGemma-9B, Qwen3Guard-8B
네 모델 모두 가중치가 공개된 안전 분류 전용 모델이야. 같은 자리에 놓고 재보려고 고른 비교군이고, 3B인 Shieldstral보다 전부 크다는 게 이 표의 조건이야.
Mistral은 자기 크기의 최대 7배까지 큰 오픈 가드 모델과 비슷하거나 더 나은 결과를 냈다고 적었어. 다만 이 표는 Mistral이 직접 돌린 자체 평가라는 건 감안하고 봐야 해. 제3자가 재현한 평가는 아직 안 보여.
모더레이션을 옮길지 보는 팀이 확인할 것
- 언어: 지원 목록에 한국어가 들어 있어. 영어, 프랑스어, 중국어를 포함해
12개언어야. 한국어만 따로 떼어 낸 점수는 문서에 없어. - 실행 스택: vLLM을 권장하고, llama.cpp와 Transformers로도 돌아가. 기존 추론 서버에 얹어 볼 수 있어.
- 정책 운영: 정책이 자주 바뀌는 서비스라면 재학습 대기 시간이 사라지는 게 실제 이득이야.
- 책임 경계: 라이선스가 열려 있어도 오탐과 미탐은 도입한 팀이 감당해. 사내 데이터로 한 번 재보고 판단해도 늦지 않아.