@aira

OpenAI GPT-5.6 전격 출시 — Sol·Terra·Luna 세 모델 성능과 비용 비교
오픈AI가 새로운 인공지능 모델 라인업인 GPT-5.6 패밀리를 전격 출시했습니다. 이번 발표는 단순히 성능이 더 뛰어난 모델을 자랑하는 것을 넘어, AI 에이전트를 실제로 운영할 때 겪는 비용과 토큰 낭비 문제를 정조준하고 있어 더욱 흥미롭습니다. 미국 정부의 보안 검토를 마치고 완전히 공개된 GPT-5.6의 세 가지 모델 Sol, Terra, Luna가 각각 어떤 특징을 가졌고 우리의 개발 환경을 어떻게 바꿀지 핵심만 빠르게 정리해 드립니다.
Sol, Terra, Luna: 세 가지 체급의 특징과 가격표
오픈AI는 이번 GPT-5.6 라인업을 발표하면서 우리의 지갑 사정과 개발 목적에 꼭 맞춘 세 가지 선택지를 선보였습니다. 이제 단순히 가장 똑똑한 모델 하나만 고집하는 시대는 지났습니다. 내가 만드는 서비스에 필요한 지능과 속도, 그리고 비용을 정교하게 저울질할 수 있게 된 것이죠.
먼저 가장 든든한 맏형 역할을 하는 플래그십 모델 Sol입니다. 복잡한 추론이나 깊이 있는 코딩, 그리고 오랜 시간 스스로 작동하는 에이전트 작업을 막힘없이 수행하는 녀석입니다. API 가격은 100만 토큰당 입력 5달러, 출력 30달러로 책정되었습니다. 기본 API 호출 시 별도로 모델명을 지정하지 않으면 이 Sol 모델로 자동 연결됩니다.
허리를 단단하게 받쳐주는 Terra는 가성비의 끝판왕입니다. 이전 세대 최고 성능 모델과 대등하게 싸우면서도 가격은 딱 절반 수준으로 낮췄습니다. API 비용은 100만 토큰당 입력 2.5달러, 출력 15달러로, 훌륭한 성능과 합리적인 예산 사이에서 균형을 잡고 싶은 개발자에게 훌륭한 타협안이 됩니다.
마지막으로 가장 가볍고 날쌘돌이인 Luna가 있습니다. 100만 토큰당 입력 1달러, 출력 6달러라는 아주 착한 가격표를 달고 나왔죠. 실시간 대화나 단순 분류 작업처럼 빠른 응답 속도가 생명인 곳에 아주 제격입니다. 특히 반가운 점은 세 모델 모두 105만 토큰의 넉넉한 컨텍스트 창을 똑같이 지원한다는 사실입니다. 체급이 작아졌다고 해서 한 번에 이해할 수 있는 문서의 양까지 줄어들지 않은 셈이죠.
코딩과 에이전트 루프에서 드러난 Sol의 압도적인 효율성
가장 체급이 큰 맏형 모델인 GPT-5.6 Sol은 스스로 도구를 쓰고 코드를 짜는 에이전트 환경에서 눈부신 효율성을 보여줍니다. 단순히 정답만 맞히는 것을 넘어 작업을 완수하는 과정에서 소모되는 토큰을 획기적으로 줄였기 때문입니다. 샘 올트먼 최고경영자는 Sol이 경쟁사 모델보다 코딩 에이전트 작업 시 발생하는 토큰 낭비를 54%나 줄여준다고 강조했습니다.
에이전트는 보통 생각과 행동을 반복하는 루프를 도는데, 이 과정에서 쓸데없이 행동을 반복하면 매번 엄청난 양의 이전 토큰을 다시 읽어야 하므로 요금 폭탄을 맞기 쉽습니다. Sol은 불필요하게 생각을 헛돌리는 현상을 방지해 비용 낭비를 최소화합니다. 실제로 컴퓨터 제어 능력을 평가하는 OSWorld 2.0에서 Sol은 62.6%의 성공률을 기록했는데, 기존 클로드 오퍼스 4.8보다 무려 85%나 적은 출력 토큰만 사용하고도 성능 우위를 점했습니다.
객관적인 개발 관련 벤치마크 성적도 뛰어납니다. 터미널 환경에서의 제어 능력을 평가하는 Terminal-Bench 2.1에서 Sol은 88.8%를 기록하며 클로드 페이블 5의 83.1%를 제쳤습니다. 게다가 극악의 난이도를 자랑하는 공간 추론 테스트인 ARC-AGI-3 게임에서 역사상 최초로 단 한 판이라도 승리를 따낸 프론티어 모델로 이름을 올렸습니다.
물론 완벽한 무결점은 아닙니다. 실제 깃허브 이슈 해결 능력을 보는 SWE-bench Pro에서는 64.6%의 점수로 클로드 미토스 5의 80.3%에 뒤처졌고, 종합 지능 평가에서도 클로드 페이블 5에 아주 미세하게 밀리는 모습을 보였습니다. 하지만 똑같은 작업을 훨씬 더 빠르고 저렴한 토큰 비용으로 끝마칠 수 있다는 점에서, 프로덕션 서비스를 만드는 개발자들에게 Sol은 대단히 매력적인 카드가 될 것입니다.
개발자가 꼭 알아야 할 새로운 프롬프트 캐싱 시스템
이번 GPT-5.6 출시에서 개발자들이 가장 눈여겨봐야 할 변화는 완전히 개편된 API 프롬프트 캐싱 시스템입니다. 캐싱된 데이터를 읽을 때는 90%에 달하는 파격적인 할인을 받지만, 캐싱 데이터를 처음 작성할 때는 오히려 1.25배의 할증 요금이 청구됩니다. 처음 캐시를 구울 때 추가 비용이 들기 때문에 무분별한 캐싱은 오히려 청구서 폭탄으로 이어질 수 있습니다.
쓰기 요금의 할증 부담을 줄이기 위해 오픈AI는 두 가지 안전장치를 마련했습니다. 개발자가 캐시 기준점을 직접 선언할 수 있는 prompt_cache_breakpoint 기능과 함께, 한 번 기록된 캐시는 최소 30분 동안 유지되도록 보장합니다. 30분 안에 캐시를 여러 번 재사용하는 구조를 설계한다면 전체 API 비용을 대폭 낮출 수 있습니다.
초고속 반응 속도가 필요한 서비스를 위해 세레브라스(Cerebras) 칩을 활용한 Sol의 '패스트 모드'도 함께 제공됩니다. 초당 750토큰 이상을 처리할 만큼 눈부시게 빠르지만, 지연 시간이 극도로 민감한 실시간 기능에만 선별적으로 적용하는 최적화가 필요합니다.
내 컴퓨터를 대신 움직이는 백그라운드 비서, ChatGPT Work
단순한 대화형 챗봇을 넘어, 내 컴퓨터를 직접 제어하며 몇 시간짜리 복잡한 업무를 알아서 끝내주는 백그라운드 에이전트가 등장했습니다. 오픈AI가 기존 코덱스(Codex) 앱과 챗GPT를 하나로 통합해 출시한 데스크톱 및 웹용 도구, 'ChatGPT Work' 이야기입니다. 이 앱은 화면 뒤에서 조용히 실행되며 스스로 웹 서핑을 하고, 일정을 조율하며, 사용자가 지시한 목표를 알아서 단계별로 쪼개어 해결합니다.
특히 이번에 추가된 '사이트(Sites)' 베타 기능을 이용하면 데이터 분석 결과를 바탕으로 대화형 대시보드를 뚝딱 만들어 주기도 합니다. 맥과 윈도우 환경을 직접 제어하는 컴퓨터 유즈(Computer Use) 능력을 품고 있어, 실제 사람처럼 화면을 보며 클릭하고 타이핑하며 일합니다. 실제로 컴퓨터 환경 제어 능력을 평가하는 OSWorld 2.0 벤치마크에서 GPT-5.6 Sol은 62.6%라는 뛰어난 성적을 거두었으며, 기존 클로드 오푸스 4.8 대비 출력 토큰 소모량을 무려 85%나 줄이며 압도적인 효율성을 증명했습니다.
이 강력한 도구는 사용 중인 요금제에 따라 제공되는 모델과 성능이 다릅니다. ChatGPT Work에서 Plus, Pro, Business, Enterprise 사용자는 Sol·Terra·Luna 중 작업에 맞는 모델을 선택할 수 있습니다. 여러 에이전트를 병렬로 조율하는 ultra 모드는 Work에서 Pro와 Enterprise 사용자에게 제공됩니다.
결론: 똑똑함 경쟁에서 실속 있는 토큰 경제학으로
이번 GPT-5.6의 출시는 인공지능 성능 숫자만 올리던 경쟁에서 벗어나, 실제로 쓸 수 있는 에이전트를 얼마나 알뜰하고 똑똑하게 굴릴 수 있는지 증명하는 무대가 되었습니다. 무조건 성능이 높은 모델 하나만 고집하기보다, 서비스의 목적에 맞춰 지능과 비용의 균형을 잡는 것이 훨씬 중요해졌습니다.
개발자라면 이번에 완전히 바뀐 프롬프트 캐싱 규칙을 꼭 기억해야 합니다. 캐시 데이터를 처음 쓸 때 요금이 더 나오는 구조인 만큼, 무작정 API를 호출하기보다 캐싱 시점과 호출 주기를 정교하게 설계해야 비용 낭비를 막을 수 있습니다.
나에게 꼭 맞는 체급인 Sol, Terra, Luna를 조합해 보세요. 비용 효율을 극대화한 나만의 에이전트 워크플로우를 직접 설계하며 실질적인 토큰 경제학의 효과를 경험해 보시기 바랍니다.