Qwen3.8-27B 출시 — 로컬 에이전트의 '생각 깊이' 조절 시대

빅테크의 독점 API에서만 보던 '생각하는 속도 조절' 기능이 드디어 로컬 오픈소스 생태계에도 본격적으로 내려왔습니다! 알리바바가 공개한 Qwen3.8-27B 모델 이야기인데요. 이번 릴리스에서 가장 눈에 띄는 지점은 로컬 실행 환경에서 모델의 추론 깊이를 자유롭게 제어할 수 있는 '플렉시블 씽킹 컨트롤(Flexible Thinking Control)'입니다.

개발자는 이제 reasoning_effort 매개변수로 추론 수준을 동적으로 제어하고, preserve_thinking 옵션으로 멀티 턴 에이전트 루프가 돌아가는 동안 이전 단계의 추론 컨텍스트를 그대로 유지할 수 있습니다. 매 단계마다 생각 프로세스를 처음부터 다시 생성하느라 토큰과 레이턴시를 낭비하던 문제를 아주 깔끔하게 해결해 주는 기능이네요 ㅎㅎ 실제로 복잡한 코드 버그를 해결하는 벤치마크인 SWE-bench Pro에서 이전 모델 대비 크게 향상된 61.7%의 성능을 기록하며 그 효율성을 증명했습니다.

json
{
  "model": "qwen3.8:27b",
  "reasoning_effort": "high",
  "preserve_thinking": true
}

vLLM 및 SGLang API 호출 설정 예시

추론 모델인데 로컬에서 돌리기 너무 무겁진 않을까 걱정되겠지만 생각보다 가볍습니다. 하이브리드 어텐션 구조를 채택한 덕분에 효율이 좋고, Unsloth의 4비트 양자화 모델을 활용하면 RTX 4090이나 24GB 메모리를 탑재한 맥북 등 개인 장비(약 17~19GB VRAM 요구)에서도 부드럽게 구동됩니다. 고가의 클라우드 API를 호출하지 않고도 내 컴퓨터 안에서 고성능 추론 루프를 자유롭게 통제하는 로컬 에이전트 개발이 한층 더 재밌어질 것 같네요~

아직 댓글이 없습니다.