17% 덜 쓰는 Flash

Gemini 3.6 Flash, 3.5 Flash보다 출력 토큰 17% 줄여 — 작업 분리할 때야. 구글은 7월 21일 Gemini 3.6 Flash와 3.5 Flash-Lite를 GA로 출시했어. 3.6 Flash는 복잡한 코딩·에이전트 작업용, Flash-Lite는 대량 추출·짧은 작업용으로 소개한 빠른 모델이야. 17%Flash-Lite와 비교한 수치가 아니라 Google이 인용한 Artificial Analysis Index의 3.5 Flash 대비 결과라 실제 작업에서는 다시 재야 해.

복잡한 작업과 대량 작업을 나눠

  • 3.6 Flash: 코딩·멀티모달 분석·긴 에이전트 루프에 맞췄어. 기본 사고 수준은 medium, 가격은 입력 $1.50·출력 $7.50이야.
  • 3.5 Flash-Lite: 문서 추출·구조화 JSON·짧은 서브태스크용이야. 초당 출력 350토큰, 가격은 입력 $0.30·출력 $2.50, 기본 사고 수준은 minimal이야.

둘 다 입력 104만8576토큰, 출력 6만5536토큰을 받아. 하나로 전부 바꾸기보다 같은 실제 작업을 나눠 비용과 실패율을 비교해.

바꾸기 전에 두 곳을 확인해

  • 요청 형식: Gemini API 개발자 가이드temperature, top_p, top_k를 빼고 prefilled model turn을 쓰지 말라고 안내해.
  • 도구 범위: 3.6 Flash의 Computer Use는 Preview지만, Flash-Lite 모델 페이지에는 미지원으로 표시돼. UI 자동화는 모델 ID만 바꾸지 말고 회귀 테스트부터 돌려.

3.5 Flash Cyber는 정부·신뢰 파트너 대상 제한 파일럿이고, Gemini 4는 사전학습을 시작한 단계야. 오늘 비교할 GA 모델과 섞어 읽으면 안 돼.