무슨 일이 있었나

Google이 EmbeddingGemma 2를 내놨는데, 텍스트·코드·이미지·오디오·영상을 한 벡터 공간에 담는 임베딩 모델이야. 임베딩은 입력을 숫자 목록(벡터)으로 바꿔서 뜻이 비슷한 것끼리 가깝게 놓는 방식이거든. Google 블로그 발표에 따르면 이 입력들이 전부 같은 공간에 들어가. 텍스트 문장과 영상 한 장면을 같은 자로 비교할 수 있다는 얘기야.

크기와 라이선스

Google은 이 모델의 파라미터가 7억 4천만 개(740M)이고, Gemma 4 아키텍처 위에 만들었다고 밝혔어. 라이선스는 Apache 2.0이고, Hugging Face 모델 페이지에도 같은 라이선스가 적혀 있어. Google은 이 라이선스를 상업적 사용에도 허용 범위가 넓은 라이선스라고 설명해.

숫자로 보면

  • 코드 검색: Google이 직접 잰 MTEB Code 점수가 이전 버전의 68.76에서 78.68로 올랐다고 해. 모델 카드에 비교 표가 있어.
  • 벡터 길이 줄이기: 마트료시카 표현 학습(MRL, 벡터 앞부분만 잘라 써도 쓸 만하게 학습하는 방식)을 지원해서, 출력 768차원을 512, 256, 128차원으로 잘라 쓸 수 있어.

어떻게 보면 될까

점수는 전부 Google 자체 측정이라 독립 검증은 아직 없어. 그래도 코드 검색에 텍스트 전용 임베딩을 쓰던 팀이라면 같은 데이터로 한번 비교해 볼 만해. 벡터 저장 비용이 신경 쓰이면 차원을 줄여 보되, 짧게 자를수록 품질이 얼마나 떨어지는지는 자기 데이터로 먼저 재보는 게 안전해. 급할 거 없어.