중앙값이 25인 표에서 50을 받았어

DeepSeek이 7월 31일에 올린 DeepSeek-V4-Flash-0731Artificial Analysis 지능 지수에서 50을 받았어. 같은 표에서 비교 대상 모델들의 중앙값이 25니까 딱 두 배 자리인데, 총 파라미터는 304B야.

Hugging Face 모델 카드를 보면 전문가 혼합(MoE) 구조에 추측 디코딩 모듈이 붙어 있어. 전문가 혼합은 파라미터를 전부 다 쓰는 대신 입력마다 일부만 깨우는 방식이고, 추측 디코딩은 다음 토큰을 미리 여러 개 뽑아 두고 맞는지 한 번에 확인하는 방식이야. 둘 다 같은 규모에서 처리 비용을 줄이려고 붙이는 구조야.

값이 잘 나온 건 에이전트 과제야

  • Terminal Bench 2.1: 82.7. 터미널에서 명령을 실행해 과제를 끝내는 능력을 재는 벤치마크야.
  • Cybergym: 76.7. 보안 과제를 다뤄.
  • DSBench-Hard: 59.6. 데이터 과학 과제 중 어려운 분할이야.
  • DeepSWE: 54.4, NL2Repo: 54.2. 이슈 해결과 저장소 단위 코드 생성은 절반 안팎이야.

높은 값만 보면 인상이 과해지니까 낮은 값도 같이 봐야 해. 터미널 작업은 82.7인데 저장소 단위 코드 생성은 54.2야. 같은 모델이라도 과제 성격에 따라 값이 크게 갈려. 그리고 이 표는 DeepSeek이 자기 에이전트 프레임워크로 직접 측정한 자체 값이야.

규모 비교는 인용까지만

Simon Willison은 총 304B인 이 모델428B짜리 MiniMax M3보다 Artificial Analysis 순위에서 앞선다고 적었어. 다만 그 맞대결 표기는 Artificial Analysis 모델 페이지를 직접 열었을 때 보이지 않았어. 확인된 순위가 아니라 인용된 관찰로 두는 게 맞아.

가격은 100만 토큰당 입력 0.14달러, 출력 0.28달러야. 가중치MIT 라이선스로 공개돼 있고, 컨텍스트100만 토큰까지 받아.

추론 강도는 low, high, max 세 단계야. OpenRouter로 돌려 본 관찰에서는 기본값보다 high로 올렸을 때 결과가 나아졌다고 해. 기본값 그대로 재고 “생각보다 별로네” 하고 접으면 이 모델은 손해야.

코딩 에이전트에 붙일 모델을 고르는 팀이 볼 것

  • 비교 축을 바꿔: 파라미터 수로 줄 세우는 대신 과제별 점수와 100만 토큰당 가격을 같이 놓는 게 이 모델을 판단하는 순서야.
  • 자체 값과 제3자 값을 갈라: 벤치마크 표는 DeepSeek이 낸 값이고, 지능 지수 50은 Artificial Analysis라는 별도 평가야. 성격이 다르니 같은 무게로 읽으면 안 돼.
  • 내려받을 수 있다와 돌릴 수 있다는 달라: MIT 라이선스라 제약은 거의 없지만 가중치167GB야. 사내 장비에 올릴 계획이면 저장 공간보다 메모리 구성부터 계산하는 게 순서야.

활성 파라미터 수가 카드에 없어서 실제 추론 비용 구조는 아직 가늠이 안 돼. 한국어 과제 값도 공개된 게 없어. 일단 API로 high 강도에서 며칠 써 보고 판단해도 늦지 않아.