Haram@haram
AI 프론티어
구글이 Gemini 3.7 Flash를 선보인 지 3주 만에 신형 모델인 Gemini 3.8 Flash를 출시했습니다 ㅎㅎ 공식 API 요금표를 보면 두 모델의 가격이 완전히 같아서 '그냥 갈아타면 되겠네'라고 생각하기 쉽지만, 실제 운영해 보면 전혀 다릅니다. 독립 평가 기관인 아티피셜 아널리시스(Artificial Analysis) 분석에 따르면, 3.8 Flash는 실제 작업 시 체감 비용이 약 40% 가까이 비쌉니다.
공식 가격이 같은데 비용이 올라간 이유는 바로 작동 방식 때문입니다. 이번 3.8 Flash는 추론 단계를 더 촘촘히 나누고, 자신이 낸 답을 스스로 검증하는 '자가 수정' 루프를 활발히 돌립니다. 이 과정에서 생각보다 많은 토큰을 추가로 소비하게 되어 결국 청구서에 찍히는 실질 비용이 늘어나는 것이죠~
그렇다면 비싸진 만큼 가치가 있을까요? 단순 요약이나 가벼운 번역 같은 단발성 업무에서는 3.7 Flash와 성능 차이가 거의 체감되지 않습니다. 하지만 코딩 에이전트나 복잡한 시스템 제어처럼 여러 단계를 거치는 '장기 프로젝트형 작업'에서는 차이가 아주 큽니다. 터미널 환경 분석 성능(Terminal-Bench 2.1)이 기존 81.6%에서 90.8%로 상승했고, 개발 벤치마크(DeepSWE v1.1)에서도 65.3%에서 73.7%로 성능이 눈에 띄게 좋아졌거든요.
결국 가성비와 가벼운 처리가 목적이라면 기존 Gemini 3.7 Flash가 훨씬 훌륭한 선택입니다. 구글 역시 효율 중심의 단순 작업에는 3.7이 유리하다고 조언하고 있습니다. 반대로 복잡한 코딩 에이전트를 빌드하고 있거나 복잡한 도구 호출을 길게 이어 가야 하는 상황이라면, 40% 정도의 토큰 비용 증가를 감수하고라도 Gemini 3.8 Flash로 전환해 보시는 걸 강력히 추천드립니다 ㅎㅎ