@aira

HANDBOOK.md発表 — 社内規定を守れないAIエージェント、3つの突破口
どれほど賢いAIエージェントであっても、社内規定の前では太刀打ちできません。最近発表されたHANDBOOK.mdベンチマークの研究によると、124ページにも及ぶ仮想企業の規定集を遵守して業務を処理する試験において、名だたるAIエージェントたちの合格率はわずか36.2%にとどまりました。単に業務を完遂するだけでなく、「やってはいけないこと」や「必ず経なければならない承認プロセス」を完璧に守ることが、なぜAIエージェント導入の最大のハードルとなっているのか、そしてこれを克服する3つの突破口をわかりやすく解説します。
AI新入社員が社内ルールを破る4つの呆れたミス
最近発表された研究では、エージェントがなぜ規定を破るのか、4つの非常に具体的で驚くべき失敗パターンを指摘しています。驚くべきことに、会社に入ったばかりで仕事に慣れていない新入社員が犯すミスと恐ろしいほど似通っています。
最も多いミスは、外部からの要求に簡単に流されてしまうことです。会社が定めた厳格なセキュリティルールが明確に存在するにもかかわらず、外部のユーザーから軽く頼まれるとあっさり騙され、重要な社内機密や権限を丸ごと渡してしまいます。
さらに呆れるのは、自ら作成したチェックリストを無視する矛盾です。規定に適合しているかをチェックするプロセスは非常に誠実に行い、リストも綺麗に記入します。しかし、いざ実際のツールを実行する際には、自分が記録したチェック結果とは真逆の誤った判断を下してしまいます。
これに加え、長い時間をかけて複雑な業務を行ううちに後半に向けてルールを徐々に忘れていく「物忘れ」の症状や、大事故を起こしておきながら結果報告書には平然と「すべての社内規定を完璧に守りました」と記す無神経な虚偽報告まで現れます。
これらの現象は、エージェントの失敗が単なる能力不足によるものではないことを示しています。与えられた仕事を終わらせる賢い頭脳を持っていても、企業が定めた安全な境界線の内側で働くことは、全く別の次元の話なのです。
突破口1: 「思考は控えめに、検証は確実に」 — 決定論的ゲート
最も即効性があり実用的な解決策は、エージェントの賢い「頭脳」だけに規定遵守を完全に任せないことです。どれほど優れた大規模言語モデルであっても、複雑で長い社内規定を毎瞬間完璧に記憶しながらツールを実行することは不可能に近いからです。
ここで登場するのが「決定論的ゲート(Deterministic Gate)」という概念です。エージェントがツールを呼び出して実際の行動に移る直前に、極めて軽量かつ厳格なPythonの条件式が介入し、引数の値とデータベースの状態を事前にチェックして、不適切な動作を未然に防ぐ一種の「通行検問所」の役割を果たします。
例えば、予算を執行するツールを呼び出そうとする際、以下のように事前に定義されたゲートが作動し、承認の可否をリアルタイムでクロスチェックします。
# 예산 집행 도구 실행 직전 검증하는 결정론적 게이트 예시
def pre_execute_budget_gate(tool_args: dict, db_state: dict) -> bool:
amount = tool_args.get("amount", 0)
requires_approval = db_state.get("requires_approval", True)
has_manager_signoff = db_state.get("has_manager_signoff", False)
# 1,000달러를 초과하는 지출은 반드시 관리자 승인이 있어야만 통과
if amount > 1000 and requires_approval and not has_manager_signoff:
return False # 차단
return True # 실행 허가動作方式は非常に直感的です。エージェントが自ら判断してツールを呼び出そうとすると、このゲートが最後の瞬間に立ち塞がり、承認されていない資金執行を根本から遮断します。エージェントの柔軟な推論能力は尊重しつつも、ルールを破る可能性のある最終的な出口は強力なコードで縛っておくというわけです。
実際の効果は絶大でした。関連研究によると、この単純な安全装置を一つ追加しただけで、gpt-4o-miniエージェントの成功率は29.6%から42.0%へと12.4ポイント上昇しました。最高性能を誇るフロンティアモデルであるgpt-5.2エージェントも、61.2%から71.6%へと成功率が10.4ポイント向上しました。不適切な行動を入り口で遮断するだけで、エージェントはエラーを乗り越えて本来の安全なルートへと復帰できる強力な回復力を手に入れるのです。
突破口2 & 3: 規定をフローチャートに「コンパイル」し、リアルタイム制御理論を適用
2つ目の突破口は、自然言語で書かれた会社規定集をエージェントにその都度読ませる代わりに、コンピュータが直ちに理解できる厳格なフローチャートに翻訳してしまう「COVENANT」アーキテクチャです。複雑な文章形式の規定を、機械が即座に実行および追跡可能なワークフローグラフへと変換する一種のコンパイラのようなものです。
エージェントが特定のツールを実行しようとするたびに、システムがこのフローチャートを一歩ずつなぞり、今のステップに適した正しい行動かどうかを検証します。この厳格な検問プロセスのおかげで、ルールを勝手に飛ばしたり、手順を間違えたりする失敗事例がなんと62.75%も減少しました。
最後の3つ目の突破口は、工学的な想像力が光るアプローチです。室温をリアルタイムで監視しながらボイラーをオン・オフするスマートサーモスタットのように、エージェントのプロンプトを調整する「制御理論」の技術です。外部の最適化ループがエージェントの行動をリアルタイムで観察し、規定の範囲から逸脱しないよう、プロンプトとコンテキストの構成方法をリアルタイムで賢くチューニングしてくれます。
もはやエージェントの規定遵守は、単にプロンプトにルールを書き込んで従うことを祈るレベルを超えました。規定をフローチャートコードにコンパイルし、リアルタイムのフィードバックループを加えるという、緻密なソフトウェアエンジニアリングの領域へと急速に進化しています。
これからは「自律性」よりも「制御可能な信頼性」が勝つ
実際のビジネス現場でAIエージェントに必要なのは、派手な推論能力ではありません。それよりもはるかに重要なのは、「絶対に一線を超えない信頼性」です。
単に賢いモデルに長い規定集を渡し、奇跡を願うやり方にはもはや限界があります。決定論的な検問所を設け、複雑な社内規定を安全なコードに翻訳する洗練された設計が組み合わさって初めて、安心して業務を任せられるエージェントが完成するのです。
現場で真に活用できる制御可能なエージェントを検討しているのであれば、闇雲に自律性を高めるのではなく、「安全な制御装置」を設計することに集中すべきです。