한 줄 정의
Cloud는 AI 모델과 에이전트를 개인 노트북이나 사내 서버 안에서 직접 실행하는 대신, 관리형 인프라에서 호출하고 배포하고 통제하는 계층이야. 이 페이지에서 말하는 Cloud는 저장공간 하나를 빌리는 얘기보다, Gemini 모델, Vertex AI 계열 기능, 보안 정책, 리전 선택이 한곳에서 돌아가는 AI 실행 환경에 가까워.
어떻게 작동하나
Cloud를 AI 스택에서 보면 세 층으로 나뉘어. 첫째는 모델을 고르는 층이야. Google Cloud models 문서는 Gemini Enterprise Agent Platform 안에서 여러 Gemini 모델을 나열해.
둘째는 모델을 실제 앱에서 호출하는 층이야. 2.5 Flash 문서는 모델 ID를 gemini-2.5-flash로 적고, 입력은 텍스트·코드·이미지·오디오·비디오, 출력은 텍스트라고 설명해. 입력 한도 1,048,576 토큰, 기본 출력 한도 65,535 토큰 같은 숫자는 앱 설계에 바로 영향을 줘. 긴 문서를 한 번에 보낼 수 있는지, 답변을 얼마나 길게 받을 수 있는지부터 달라지니까.
셋째는 운영 통제층이야. 같은 문서는 리전, 배포와 엔드포인트, 데이터 위치, 고객 관리 암호화키(CMEK), 서비스 경계(VPC-SC) 같은 보안 통제를 모델 페이지 안에서 다뤄. Google Blog가 소개한 Gemini Enterprise Agent Platform도 이 방향에 있어. 모델 빌드와 튜닝만이 아니라 에이전트 통합, 보안, DevOps를 한 개발자 플랫폼 안에 묶는다고 설명해.
왜 중요한가
Cloud를 알면 “모델을 하나 호출한다”와 “AI 기능을 운영한다”를 구분할 수 있어. 간단한 실험이면 Gemini API 호출 조건과 모델 한도만 봐도 충분할 때가 많아. 그런데 여러 직원이나 서비스가 같은 에이전트를 사용하고, 권한·로그·보안·리전·버전 교체를 같이 봐야 하면 이야기가 달라져.
예를 들어 2.5 Flash는 GA 모델로 2025년 6월 17일 release date가 있고, 문서에는 discontinuation date가 2026년 10월 16일 이전은 아니라고 적혀 있어. 클라우드에서 AI를 운영한다는 건 이런 날짜를 배포 계획에 넣는다는 뜻이야. 모델 이름만 기억하면 부족하고, 어떤 버전을 어느 리전에 어떤 보안 조건으로 쓰는지까지 같이 확인해야 해.
- Gemini Enterprise Agent Platform은 에이전트를 만들고 운영하는 Google Cloud 쪽 플랫폼 이름으로 보면 돼. agent-platform 관점은 단일 모델 호출이 아니라 권한, 배포, 보안, DevOps까지 한 운영면에서 묶어 보는 비교 기준이야.
- Gemini 2.5 Flash는 Gemini 2.5 계열의 Flash 모델 예시로 보면 돼. Cloud 판단에서는 입력·출력 한도와 중단 예정일을 배포 일정에 넣어야 하는지 보여주는 기준이야.
주의해서 볼 점
Cloud가 항상 더 낫다는 뜻은 아니야. 프롬프트를 빠르게 시험하거나 작은 자동화 하나를 만들 때는 AI Studio나 단일 API 호출로도 충분할 수 있어. 반대로 에이전트가 회사 데이터에 접근하고, 여러 팀이 같은 기능을 쓰고, 장애나 버전 교체가 업무에 영향을 주면 Cloud 쪽 질문이 먼저 와.
도입 전에 확인할 항목은 단순해.
- 모델 ID가 고정되어 있나.
- 입력과 출력 한도가 작업에 맞나.
- 쓰려는 리전에서 모델을 사용할 수 있나.
- 데이터 위치와 암호화 정책을 설정할 수 있나.
- 중단 예정일이 배포 일정과 충돌하지 않나.
이 다섯 가지를 못 맞추면 좋은 모델을 골라도 운영에서 막혀.