무슨 일이 있었나
2026년 7월 21일, 구글이 새 Gemini 모델 셋을 공개했습니다. Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber입니다. TechCrunch도 같은 날 이를 보도했습니다. 구글은 이 셋을 프로덕션 AI 에이전트 작업 중심으로 배치합니다. 낮은 지연, 더 안정적인 출력, 그리고 코딩·지식 업무와 텍스트·이미지 등을 한 모델에서 다루는 멀티모달 처리에서의 강점입니다.
구글은 3.6 Flash를 새로운 기본 주력 모델로 소개합니다. 이 모델이 Artificial Analysis Index에서 3.5 Flash보다 출력 토큰을 17% 적게 쓴다고 하며, 입력 100만 토큰당 1.50달러, 출력 100만 토큰당 7.50달러의 가격을 제시했습니다. 이 벤치마크·효율·가격 수치는 모두 구글 자체 자료이므로, 독립 측정이 아니라 업체 주장으로 읽는 편이 좋습니다.
Gemini 3.5 Flash-Lite는 구글의 3.5 계열에서 가장 빠르고 비용 효율이 높은 모델로, 대량·저지연 작업을 겨냥합니다. Gemini 3.5 Flash Cyber는 사이버 특화 모델로, 코드 취약점을 찾고 고치기 위해 구글이 CodeMender라 부르는 도구와 짝을 이룹니다. TechCrunch는 이 Cyber 모델의 접근이 정부와 신뢰할 수 있는 파트너를 위한 제한적 파일럿이라고 보도했으므로, 일반 이용은 불가능합니다.
구글은 Gemini 3.5 Pro는 내놓지 않았습니다. 3.5 Pro는 파트너와 테스트 중이며 준비되면 폭넓게 제공하겠다고 했고, Gemini 4의 사전 학습을 시작했다고 밝혔습니다. 날짜는 제시하지 않았습니다.
왜 중요한가
두 단어를 짚으면 이해가 쉽습니다. Flash와 Pro입니다. Gemini 이름 규칙에서 Flash는 더 작고 빠르고 저렴한, 대량과 속도를 위한 등급이고, Pro는 더 크며 가장 어려운 추론을 노리는 등급입니다. 채팅 응답, 요약, 추출 같은 대부분의 일상 앱 기능은 Flash 계열 모델로 충분합니다.
빌더에게 흥미로운 대목은 효율입니다. 3.6 Flash가 비슷한 품질에 정말로 더 적은 출력 토큰을 쓴다면, 에이전트나 API 기능의 운영 비용이 줄 수 있습니다. 대개 요금은 출력 토큰이 좌우하기 때문입니다. 다만 업체 지표 하나로 결론이 나지는 않습니다. 한 벤치마크에서의 적은 토큰이 내 작업과 다를 수 있고, 눈에 띄는 토큰당 가격은 내 작업이 실제로 쓰는 토큰 수를 담지 못합니다.
Cyber 모델은 일반 모델 곁에 특화 모델이 함께 등장하고 있음을 보여 줍니다. 구글은 이를 코드를 튼튼하게 하는 방어용으로 소개합니다. 제한적 파일럿은 오늘 당장 기댈 수 있는 제품이 아닙니다.
다음에 무엇을 하면 좋은가
- 표시 가격이 아니라 총 작업 비용을 비교하세요. 실제 입력·출력 토큰 수에 각 모델의 요율을 곱해 보세요. 토큰당 더 싼 모델이라도 답이 길면 더 비쌀 수 있습니다.
- 자기 예시로 품질을 시험하세요. 업체 벤치마크는 출발점 힌트일 뿐, 내 용도의 결론이 아닙니다.
- 지연과 가용성도 함께 따지세요. 빠르고 싼 모델도 내 지역과 등급에서 안정적으로 쓸 수 있어야 도움이 됩니다.
- 대부분의 기능은 Flash 계열에서 시작하고, 더 어려운 추론이 값을 한다고 측정될 때만 Pro로 올리세요.
- Cyber 모델이나 3.5 Pro가 내게 열려 있다고 가정하지 마세요. 이를 전제로 설계하기 전에 현재 접근 권한을 확인하고, 보안 도구는 방어 목적으로 쓰세요.
이 브리핑은 구글의 2026년 7월 21일 발표와 TechCrunch의 7월 21일 보도에 담긴 공개 진술을 요약합니다. 벤치마크·성능·가격·효율·안전 관련 주장은 구글 자체의 것이며 여기서 독립적으로 검증하지 않았습니다. 이는 모델 공개이며, 하루 전 보도된 별개의 Hugging Face 보안 사고에 대한 후속이 아닙니다.