아이라@aira
AI Frontier

Gemini 4 Argon 출시 — 100만 토큰 출력과 폐쇄형 보안 모델의 등장
구글 딥마인드가 기습적으로 공개한 새로운 AI 모델, '제미나이 4 아르곤(Gemini 4 Argon)'이 개발자 커뮤니티를 뜨겁게 달구고 있습니다. 무려 100만 토큰의 답변을 한 번에 출력할 수 있는 압도적인 능력을 갖췄기 때문인데요. 하지만 아쉽게도 이 강력한 모델을 지금 당장 누구나 써볼 수는 없습니다. 강력한 사이버 보안 및 해킹 악용 우려 때문에 구글이 꽁꽁 걸어 잠근 폐쇄적인 방식으로 배포를 시작했기 때문입니다.
스스로 취약점을 찾아내고 방어하는 철벽 보안
제미나이 4 아르곤이 가장 빛을 발하는 무대는 바로 사이버 보안입니다. 대규모 소프트웨어 개발 및 엔지니어링 능력을 평가하는 'DeepSWE v1.1' 테스트에서 아르곤은 77.9%라는 높은 점수를 기록했습니다. 이는 클로드 오푸스 5.5나 GPT-6 아스트라 같은 강력한 경쟁 모델들을 제치고 가장 앞서 나간 기록입니다.
단순히 시험만 잘 치는 것이 아닙니다. 구글이 보안 기업 위즈(Wiz)와 공동으로 진행한 프로젝트에서 아르곤은 시스템의 보안 취약점을 70.9%나 찾아냈습니다. 특히 놀라운 점은 발견한 취약점을 검증하기 위해 직접 모의 침투용 코드까지 생성했다는 사실입니다. 실제로 이 능력을 활용해 전 세계 병원에서 사용하는 의료 소프트웨어의 치명적인 제로데이 취약점을 해커보다 먼저 찾아내 구멍을 막는 성과를 거두기도 했습니다.
공격 코드를 잘 짜는 만큼 방어력도 강력합니다. 해커가 악성 명령을 숨겨 AI를 조작하는 '간접 프롬프트 주입(IPI)' 공격을 방어하는 그레이 스완(Gray Swan) 테스트에서 아르곤은 단 0.7%의 공격 성공률만을 허용했습니다. 경쟁 모델들의 피격률이 대다수 더 높았던 것과 비교하면, 그야말로 철벽 방어를 보여준 셈입니다.
가드레일이 풀린 AI, 그리고 굳게 닫힌 'Fairwind'의 문
이처럼 취약점을 찾아내고 공격 코드까지 직접 만들어내는 능력은 양날의 검입니다. 악의적인 해커의 손에 들어간다면 그야말로 치명적인 무기가 될 수 있으니까요. 이 때문에 구글은 아주 강력하면서도 독특한 통제망을 구축했습니다. 바로 신뢰할 수 있는 소수에게만 문을 열어주는 '페어윈드 프로그램(Fairwind Program)'입니다.
이 프로그램에는 전 세계에서 신원이 확실하게 검증된 정부 기관, 의료 제공자, 핵심 인프라 운영사 등 약 650개 단체만 참여할 수 있습니다. 흥미롭게도 이 파트너들에게는 사이버 가드레일이 완전히 해제된 특수 빌드가 제공됩니다. 가드레일이 없어야 실제 해킹 공격을 시뮬레이션하고 정밀한 역공학 분석을 할 수 있기 때문입니다. 이렇게 찾아낸 보안 허점은 자동 패치 에이전트인 '코드멘더(CodeMender)'가 실시간으로 치료합니다.
안전장치를 풀었다니 너무 위험하지 않냐는 걱정이 들 수 있습니다. 그래서 구글은 똑똑한 이중 감시 장치를 도입했습니다. AI가 답변을 적어 내려가는 동안 내부의 '생각의 흐름'을 실시간으로 감시하는 기술입니다. 분석 과정에서 위험한 방향으로 이탈할 조짐이 보이면, 시스템이 이를 감지하고 실행을 즉시 강제 종료시킵니다.
만능일까? 대화형 태스크에서 드러난 아쉬운 한계
Gemini 4 Argon이 장기적인 코드 분석이나 추론에는 압도적인 성능을 자랑하지만, 실시간으로 컴퓨터 환경을 조작하는 일에는 의외로 약한 모습을 보입니다. 화면을 보고 마우스를 움직이거나 터미널에서 실시간으로 명령어를 입력해 가며 문제를 해결하는 대화형 에이전트 영역에서는 경쟁 모델들에 비해 순발력이 다소 떨어지는 편입니다.
이러한 약점은 실제 성능 평가에서도 고스란히 드러납니다. 터미널 환경 분석 능력을 측정하는 벤치마크 테스트인 터미널벤치 4.0에서 Argon은 57.4%의 성공률에 그쳤습니다. 이는 최근 출시된 앤트로픽의 클로드 소넷 5.5가 기록한 70.6%나 클로드 오푸스 5.5의 66.4%와 비교하면 확실히 아쉬운 성적입니다.
운영체제를 직접 제어하는 능력을 평가하는 OS월드 2.0에서도 Argon은 69.2%를 기록하며 오픈AI의 최신 모델인 GPT-6 아스트라가 보여준 72.6%의 벽을 넘지 못했습니다. 복잡하고 긴 코드를 깊이 파헤치는 끈기는 훌륭하지만, 실시간으로 터미널 창을 열고 빠르게 대응해야 하는 민첩함은 아직 경쟁사들의 에이전트 수준에는 미치지 못하는 모습입니다.
개발자들의 아쉬움과 가격표 뒤에 숨은 흐름
눈앞에 두고도 써볼 수 없는 그림의 떡일까요? Gemini 4 Argon의 압도적인 스펙이 공개되자마자 해커 뉴스를 비롯한 글로벌 개발자 커뮤니티는 아쉬움 섞인 목소리로 가득 찼습니다. 100만 토큰을 출력하는 강력한 모델이 등장했지만, 정작 일반 개발자들은 써볼 기회조차 얻지 못하고 있기 때문입니다. 일각에서는 기술이 발전할수록 자본과 권력을 가진 대기업이나 정부 기관만 고성능 모델을 독점하는 구조가 고착화되는 것 아니냐는 깊은 우려를 표하고 있습니다.
이러한 제한적 배포 속에서도 구글은 향후 정식 출시 때 적용할 구체적인 API 가격표를 공개했습니다. 기본 서비스 요금은 100만 입력 토큰당 4달러, 출력 토큰당 20달러로 책정되었습니다. 다행히 출시 초기인 2026년 말까지는 프로모션 기간이 적용되어 입력 2달러, 출력 10달러라는 절반 가격에 제공됩니다. 여기에 자주 사용하는 데이터를 재사용하는 컨텍스트 캐싱 기능을 활용하면 입력 비용을 무려 95%까지 할인받을 수 있습니다.
하지만 아무리 조건이 매력적이어도 당장 쓸 수 없다면 무의미합니다. 현재 일반 API 고객은 물론이고, 매달 구독료를 지불하는 구글 AI 울트라 가입자들조차 여전히 기나긴 대기 명단에서 차례를 기다리는 상황입니다. 안전을 이유로 걸어 잠근 고성능 인공지능의 빗장이 과연 언제쯤 평범한 빌더들에게도 풀릴 수 있을지 아쉬움 섞인 시선이 쏠리고 있습니다.
걸어 잠그는 고성능 AI, 새로운 표준이 될까?
제미나이 4 아르곤의 배포 방식은 앞으로 고성능 AI 기술이 세상에 공개되는 방식을 보여주는 중요한 이정표가 될 수 있습니다. 악용 위험이 큰 기술을 무조건 모두에게 개방하기보다, 신원이 확실한 파트너에게만 제한적으로 통로를 열어주는 방식이 안전한 기술 공급의 현실적인 대안으로 자리 잡을 가능성이 크기 때문입니다.
100만 토큰 출력이라는 압도적인 기술을 갖춘 인공지능이 실제 보안 최전선에서 어떤 성과를 낼지, 그리고 이 굳게 닫힌 빗장이 언젠가 일반 개발자들을 위해 안전하게 풀릴 수 있을지 앞으로의 행보를 흥미롭게 지켜봐야겠습니다.