Gemini 3.6 Flash 출시 — 3.5 Flash-Lite와 비교 가이드

Haram

@haram

Gemini 3.6 Flash 출시 — 3.5 Flash-Lite와 비교 가이드

Gemini 3.6 Flash 출시 — 3.5 Flash-Lite와 비교 가이드

구글이 실무용 AI 에이전트를 훨씬 가성비 있게 만들 수 있는 새로운 모델 라인업을 발표했습니다. 바로 대중적으로 쓸 수 있는 메인 엔진 Gemini 3.6 Flash와 극강의 속도 및 비용 효율을 자랑하는 Gemini 3.5 Flash-Lite, 그리고 보안용 특수 모델인 Gemini 3.5 Flash Cyber인데요. 내 업무나 개발 프로젝트에는 과연 어떤 가성비 엔진이 어울릴지, 핵심 스펙부터 쓰임새까지 쉽고 명확하게 비교해 드릴게요.

더 똑똑하고 알뜰해진 메인 엔진, Gemini 3.6 Flash

구글의 차세대 메인 워크호스로 자리 잡은 gemini-3.6-flash는 코딩과 복잡한 에이전트 추론 작업에 최적화된 새로운 범용 모델입니다. 현재 정식 출시되어 구글 AI 스튜디오와 버텍스 AI에서 즉시 활용할 수 있으며, 깃허브 코파일럿에도 순차적으로 탑재되고 있습니다. 정보 업데이트 기준점인 지식 컷오프는 2026년 3월까지입니다.

이 모델은 최대 약 104만 토큰의 거대한 입력 컨텍스트 창을 지원해 방대한 자료를 막힘없이 읽어 들입니다. 텍스트뿐만 아니라 이미지, 비디오, 오디오, PDF까지 한 번에 인식하는 멀티모달 설계에 최대 65,536 토큰의 넉넉한 출력 한도를 제공하여 긴 코드 작성이나 긴 글 생성도 무리 없이 처리합니다.

특히 실무 자동화를 돕는 강력한 도구들이 기본으로 내장되어 있습니다. 모델의 추론 수준을 직접 조절하는 생각하기 옵션을 시작으로 자주 쓰는 프롬프트의 비용을 아껴주는 프롬프트 캐싱, 실시간 검색과 지도 연동, 코드 실행 기능을 제공합니다. 여기에 미리보기 단계로 지원되는 컴퓨터 사용 기능까지 포함되어 마우스와 키보드로 직접 화면을 제어하는 고도화된 AI 에이전트를 만들 수 있습니다.

가장 매력적인 변화는 비용 부담이 크게 낮아졌다는 점입니다. API 유료 티어 기준 입력 토큰 100만 개당 1.5달러, 출력 토큰 100만 개당 7.5달러로 책정되었습니다. 이전 세대인 Gemini 3.5 Flash의 출력 토큰 단가였던 9.0달러와 비교해 가격이 한층 착해졌을 뿐만 아니라, 특정 에이전트 작업 실행 시 출력 토큰 소모량 자체를 대폭 줄여주기 때문에 실제 청구서에 찍히는 인프라 운영 비용을 효과적으로 줄일 수 있습니다.

극강의 가성비와 초고속 처리, Gemini 3.5 Flash-Lite

대량의 데이터를 실시간으로 처리해야 하거나 운영 비용이 가장 중요한 프로젝트라면 gemini-3.5-flash-lite가 아주 유용한 대안이 될 수 있습니다. 이 모델은 무려 초당 350개의 출력 토큰을 내뿜는 압도적인 속도를 자랑합니다. 단순히 속도만 빠른 것이 아니라 가격 면에서도 엄청난 메리트가 있습니다.

유료 API 기준 입력 토큰 100만 개당 0.3달러, 출력 토큰 100만 개당 2.5달러로 책정되었습니다. 이전 세대 모델인 3.1 Flash-Lite보다 요금이 아주 미세하게 조정되었지만, 성능 향상을 생각하면 여전히 대적할 모델이 없는 수준의 극강의 가성비를 보여줍니다. 입력 컨텍스트 창도 약 104만 토큰까지 넉넉하게 지원해 긴 문서를 한 번에 처리하기에 부족함이 없습니다.

특히 생각의 깊이를 설정할 수 있는 씽킹 레벨 옵션을 최소화로 설정하면, 불필요한 추론 과정을 생략하고 극도의 속도로 작업을 끝마칩니다. 텍스트뿐만 아니라 이미지, 비디오, 오디오, PDF까지 읽어낼 수 있어 대용량 문서 분류나 실시간 고객 응대 챗봇, 혹은 복잡한 시스템의 징검다리 역할을 하는 하위 보조 에이전트를 대량으로 실행할 때 가장 뛰어난 비용 효율을 발휘합니다.

일반 사용자는 접근할 수 없는 보안 모델, Gemini 3.5 Flash Cyber

마지막으로 구글은 일반 개발자나 사용자가 쓸 수 없는 베일에 싸인 특수 모델도 함께 공개했습니다. 바로 보안 전용 엔진인 Gemini 3.5 Flash Cyber입니다. 앞서 소개한 gemini-3.6-flashgemini-3.5-flash-lite와 달리, 일반 API로는 전혀 제공되지 않으며 구체적인 이용 요금 역시 공개되지 않았습니다.

이 특수 모델은 구글의 AI 보안 플랫폼인 코드멘더(CodeMender) 내부에서만 작동하는 전용 엔진입니다. 현재는 정부 기관이나 신뢰할 수 있는 소수의 파트너사에게만 파일럿 형태로 제한적으로 제공되는데요. 여러 개의 보안 서브에이전트가 최대 5단계에 걸쳐 병렬로 협업 분석을 진행하며 소프트웨어의 취약점을 자동으로 찾고 즉시 패치까지 만들어 줍니다.

실제로 구글 내부 테스트에서는 V8 엔진에서 55개의 고유한 취약점을 찾아냈으며(기존 3.5 Flash 47개, 경쟁 모델 Claude Opus 4.6 36개 대비 우수), 이 중 10개는 다른 모델이 전혀 발견하지 못한 것이었습니다. 별도의 실전 테스트에서는 구글 클라우드 취약점 연구팀이 공개 API의 원격 코드 실행 취약점과 프로덕션 서비스의 메모리 손상 버그를 단 2시간 만에 찾아내기도 했습니다.

나에게 맞는 모델 선택 가이드

이번 구글의 업데이트는 모델의 절대적인 성능 경쟁보다, 실제 서비스를 운영할 때 마주하는 비용 최적화와 대량 처리 효율에 초점을 맞추고 있습니다. 복잡한 추론과 코딩 능력이 뛰어나고 멀티모달 데이터 분석이 중요한 에이전트 개발에는 Gemini 3.6 Flash를 선택하는 것이 좋습니다. 반면, 실시간으로 쏟아지는 대량의 데이터를 초고속으로 처리하거나 간단한 요약과 분류 작업을 수행하는 서브 에이전트용으로는 Gemini 3.5 Flash-Lite가 훨씬 경제적입니다.

한눈에 비교하는 구글의 새로운 가성비 라인업 스펙은 다음과 같습니다.

모델 ID공개 여부입력 가격 (100만 토큰 기준)출력 가격 (100만 토큰 기준)특징
Gemini 3.6 Flash즉시 사용 가능 (정식 출시)$1.50$7.50에이전트 코딩 및 추론 최적화, 컴퓨터 사용 프리뷰
Gemini 3.5 Flash-Lite즉시 사용 가능 (정식 출시)$0.30$2.50초당 350토큰의 압도적인 출력 속도, 초경량 작업 특화
Gemini 3.5 Flash Cyber비공개 (정부 및 파트너 제한)미공개미공개코드멘더 보안 에이전트 전용 모델

자신의 프로젝트 목적과 예산에 맞춰 두 개의 공개 모델을 적절히 조합한다면, 운영 비용은 획기적으로 줄이면서도 만족스러운 성능을 내는 스마트한 에이전트 워크플로우를 만들 수 있습니다. 지금 구글 AI 스튜디오에서 여러분의 서비스에 알맞은 가성비 모델을 직접 테스트해 보세요.

(수정됨)

아직 댓글이 없습니다.