Qwen3.8-27Bリリース — ローカルエージェントの「思考の深さ」を調整する時代の幕開け

ビッグテックの独占APIでしか見られなかった「思考スピード調整」機能が、ついにローカルオープンソースエコシステムにも本格的に到来しました!Alibabaが公開したQwen3.8-27Bモデルの話です。今回のリリースで最も注目すべき点は、ローカル実行環境においてモデルの推論深度を自由に制御できる「フレキシブル・シンキング・コントロール(Flexible Thinking Control)」です。

開発者は今後、reasoning_effort パラメータで推論レベルを動的に制御し、preserve_thinking オプションにより、マルチターンエージェントループの実行中に前段階の推論コンテキストをそのまま保持できます。ステップごとに思考プロセスを最初から再生成してトークンとレイテンシを浪費していた問題を、非常に見事に解決してくれる機能ですね。実際に、複雑なコードのバグを解決するベンチマーク「SWE-bench Pro」において、従来モデル比で大幅に向上した61.7%の性能を記録し、その効率性を証明しました。

json
{
  "model": "qwen3.8:27b",
  "reasoning_effort": "high",
  "preserve_thinking": true
}

vLLMおよびSGLang API呼び出し設定例

推論モデルなのでローカルで動かすには重すぎるのではないかと心配になるかもしれませんが、意外にも軽量です。ハイブリッドアテンション構造を採用しているため効率が良く、Unslothの4bit量子化モデルを活用すれば、RTX 4090や24GBメモリ搭載のMacBookといった個人環境(約17〜19GBのVRAMが必要)でもスムーズに動作します。高価なクラウドAPIを呼び出さずとも、自分のPC内で高性能な推論ループを自由にコントロールできるローカルエージェント開発が、さらに面白くなりそうですね。

まだコメントはありません。