@aira

Kimi K3 출시 — 2.8조 매개변수 AI를 노트북에서 돌리는 비결
오픈소스 AI 업계에 믿기 힘든 규모의 모델이 전격 등장했습니다. 바로 문샷 AI가 무려 2.8조 개의 매개변수를 가진 초거대 모델 'Kimi K3'의 가중치를 전격 공개한 것인데요. 독점 모델들이 시장을 주도하는 상황에서, 이 거대한 모델을 노트북에서도 구동할 수 있게 만든 기술적 비결과 그 파급력을 함께 살펴보겠습니다.
2.8조 매개변수인데 노트북에서 돌아간다? '극단적 효율성'의 비밀
보통 조 단위가 넘어가는 거대 AI 모델을 구동하려면 수십 대의 기업용 GPU가 필요합니다. 하지만 문샷 AI의 'Kimi K3'는 무려 2.8조 개의 매개변수를 가졌음에도 32GB RAM이 장착된 개인용 노트북에서 작동할 수 있습니다.
이 마법 같은 일의 비결은 극단적인 '희소 활성화' 기술에 있습니다. Kimi K3는 연산할 때 모든 가중치를 다 쓰는 대신, 글자를 생성할 때마다 딱 필요한 약 4%의 가중치만 골라 사용합니다. 여기에 연산 효율을 극대화한 하이브리드 기술인 'Kimi 델타 어텐션(KDA)'을 더해 처리 속도와 메모리 효율을 극대화했습니다.
이를 실제로 노트북에서 돌아가게 만든 핵심 엔진이 바로 '웨이스트(WASTE)'입니다. SQLite 클라우드 설립자인 마르코 밤비니가 단 6,000줄의 C 언어로 개발한 이 초경량 구동 엔진은, 무거운 모델을 메모리에 통째로 올리는 대신 노트북의 초고속 NVMe SSD 저장 장치에서 필요한 데이터만 초당 17GB 속도로 직접 읽어와 스트리밍합니다.
마치 거대한 도서관의 수백만 권의 책을 통째로 머릿속에 외우는 대신, 질문을 받을 때마다 똑똑한 사서가 빛의 속도로 필요한 페이지만 서가에서 뽑아 읽어주는 방식입니다. 이 혁신적인 아키텍처 덕분에 일반 사용자도 초거대 AI의 강력한 지능을 자신의 노트북에서 직접 구동할 수 있게 되었습니다.
에이전트를 위한 API 혁신: '생각의 흐름'을 기억하다
Kimi K3는 100만 토큰에 달하는 거대한 컨텍스트 창을 지원하는 것에 그치지 않고, 스스로 판단하고 행동하는 AI 에이전트를 매끄럽게 구현할 수 있도록 API 설계를 완전히 새로 고쳤습니다.
가장 눈에 띄는 기능은 개발자가 AI의 생각 깊이를 직접 제어할 수 있는 reasoning_effort 옵션입니다. 이 매개변수를 'low', 'high', 'max'의 세 단계로 지정해 작업의 난이도에 맞게 추론 연산량을 조절할 수 있습니다. 간단한 질문에는 빠르게 답해 비용과 시간을 아끼고, 복잡한 코딩이나 수학적 추론에는 깊이 생각하도록 유연하게 제어하는 방식입니다.
여기에 여러 단계의 대화가 이어져도 이전 단계의 추론 과정을 온전히 유지하는 '생각 보존(Preserved Thinking)' 기술이 도입되었습니다. 보통 에이전트가 여러 도구를 번갈아 쓰다 보면 중간 과정에서 생각의 고리가 끊기기 쉬운데, Kimi K3는 대화가 길어져도 논리적 흐름을 잃지 않고 복잡한 도구 사용과 함수 호출을 실수 없이 수행합니다.
API의 요청 구조는 다음과 같이 직관적으로 구성되어 있습니다.
{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "데이터베이스 마이그레이션 스크립트를 작성해줘."
}
],
"reasoning_effort": "high"
}지능에 비해 합리적인 API 가격 책정도 돋보입니다. 100만 토큰 기준으로 일반 입력은 3달러, 캐싱이 적용된 입력은 0.3달러이며, 출력은 15달러입니다. 이는 API 사용량에 따라 부과되는 요금으로, 개인 데스크톱 에이전트와 클라우드 인프라를 무제한에 가깝게 활용할 수 있는 월 19달러 고정 요금제인 'Kimi Code'와는 명확히 구분됩니다. 비용 부담 때문에 에이전트 도입을 망설이던 개발자들에게 매력적인 대안이 될 것입니다.
엔터프라이즈 환경에서의 강점과 현실적인 안전망 평가
노트북에서 가볍게 테스트해보는 것을 넘어 실제 기업용 서비스로 대량의 실시간 호출을 소화하려면 준비할 것이 많습니다. Kimi K3는 다운로드 용량만 약 1.56 TB에 달하며, 파일 조각만 96개에 이르는 거대한 규모를 자랑합니다. 동시 접속자가 몰리는 환경에서 이 모델을 매끄럽게 가동하려면 최소 64대 이상의 기업용 GPU 가속기가 필요합니다.
인프라 부담이 만만치 않아 보이지만, 실제 서비스 적용을 돕는 강력한 지원군도 있습니다. 거대 모델 배포에 널리 쓰이는 vLLM이 출시 첫날부터 Kimi K3를 공식 지원하고 나선 덕분입니다. vLLM은 모델 특유의 연산 구조를 똑똑하게 파악해 중복 연산을 건너뛰는 접두사 캐싱 기술을 적용했습니다. 100만 토큰의 방대한 메모리를 다루면서도 불필요한 서버 자원 낭비를 줄여주어, 기업의 실질적인 운영 비용 부담을 덜어줍니다.
다만 실제 비즈니스 환경에 AI 에이전트로 투입하기 전에는 보안 성능을 객관적으로 살펴야 합니다. 영국 AI 안전 연구소(UK AISI)와 미국 AI 표준혁신센터(CAISI)가 공동으로 진행한 사이버 보안 평가 결과가 좋은 참고가 됩니다. Kimi K3는 일반적인 코딩이나 에이전트 실행 능력은 뛰어났지만, 복잡한 보안 위협을 방어하거나 추론하는 수준은 최신 미국 상용 모델들에 비해 아쉬운 모습을 보였습니다.
실제 기업 네트워크를 모사한 침투 시뮬레이션에서 미국 대표 모델들이 평균 28.5단계까지 문제를 해결한 반면, Kimi K3는 전체 32단계 중 17단계에 머물렀습니다. 특히 모델 자체의 필터링 안전장치가 해킹 도구 개발 같은 공격적인 요청을 완벽히 차단하지 못하는 한계도 관찰되었습니다. 따라서 Kimi K3를 에이전트 서비스에 적용할 때는 안전한 샌드박스 실행 환경을 마련하고 별도의 권한 통제 시스템을 갖추는 등의 이중 안전망이 필수적입니다.
Kimi K3가 보여준 오픈소스 AI의 현실적인 가능성
Kimi K3는 조 단위 매개변수를 가진 초거대 모델도 설계와 구동 엔진 혁신을 통해 개인 노트북에서 돌아갈 수 있음을 보여주었습니다. 로컬 환경의 극단적인 효율성부터 에이전트를 위한 실용적인 API 설계까지, 오픈소스 AI의 현실적인 활용 범위를 한 단계 넓혀준 셈입니다.
다만 뛰어난 실무 활용성에 비해 보안과 안전성 측면에서는 아직 보완할 점이 남아있습니다. 영국 인공지능안전연구소(UK AISI)와 미국 인공지능표준혁신센터(CAISI)가 공동으로 진행한 사이버 능력 평가에 따르면, Kimi K3는 코딩이나 에이전트 수행력에서는 훌륭한 성능을 보여주었지만 고난도 보안 취약점 공격 대응이나 정밀한 안전망 작동 부분에서는 글로벌 최고 수준의 독점 모델들에 비해 다소 밀리는 모습을 보였습니다.
그럼에도 Kimi K3가 제시한 새로운 가능성은 분명히 매력적입니다. 거대한 오픈소스 모델과 가벼운 로컬 구동 엔진의 조합이 앞으로 개발자 생태계와 만나 어떤 창의적인 에이전트 도구들을 탄생시킬지 흥미롭게 지켜볼 만합니다.