1Password 연구 발표 — AI가 고친 보안 코드 74%가 실패하는 이유

1Password 연구 발표 — AI가 고친 보안 코드 74%가 실패하는 이유

1Password 연구 발표 — AI가 고친 보안 코드 74%가 실패하는 이유

최근 비트코인 레드팀이 501개 저장소를 대상으로 대규모 AI 보안 점검을 벌여 수천 개의 취약점을 찾아내며 화제가 되었습니다. AI 에이전트가 버그를 스스로 찾고 패치까지 적용하는 '자가 치유 코드베이스'는 모든 개발자가 꿈꾸는 기술입니다. 하지만 최근 보안 연구에 따르면, AI가 고친 보안 코드의 무려 74%에서 치명적인 오류가 발견되었습니다. 에이전트가 안전하게 코드를 고치게 하려면 무엇이 필요할까요?

수정만 하면 끝? AI 패치 74%가 실패하는 '터널 비전'

보안 기업 1Password 산하 Off-by-1 랩스가 최근 발표한 'FLAWED' 연구 결과는 우리에게 큰 경종을 울립니다. 연구진이 ChatGPT 5.5와 Claude Opus 4.8을 활용해 생성한 6,080개의 보안 패치 코드를 정밀 분석한 결과, 취약점을 완벽하게 해결한 패치는 단 26%에 불과했습니다.

그렇다면 나머지 74%는 어떻게 되었을까요? 무려 53.9%는 취약점을 고치는 데 완전히 실패했거나 오히려 새로운 보안 구멍을 만들어냈습니다. 그리고 20.1%는 보안 취약점은 어떻게든 막았지만, 정작 애플리케이션의 원래 기능까지 같이 망가뜨려 버렸죠.

연구진은 이러한 치명적인 실패 원인으로 AI의 '터널 비전' 현상을 지목합니다. 터널 비전이란 전체적인 코드 구조나 아키텍처를 고려하지 않고, 오직 눈앞에 닥친 특정 공격 코드만 임시방편으로 막으려다 다른 곳을 망가뜨리는 현상입니다.

비유하자면, 지붕에 비가 새는데 근본적인 누수 지점을 고치는 대신 물이 떨어지는 거실 바닥에 급하게 양동이만 받쳐두는 것과 같습니다. 당장 떨어지는 물은 받았을지 몰라도, 결국 지붕 내부가 썩어 들어가거나 다른 천장으로 물이 새는 더 큰 문제를 초래하게 됩니다. AI도 당장 해커의 공격 패턴만 차단하는 좁은 시야의 코드만 짜다 보니 전체 시스템을 망가뜨리고 마는 것입니다.

멀티 에이전트의 또 다른 함정: 길을 잃는 '추론 표류'

에이전트 한 개가 좁은 시야에 갇혀 실수한다면, 여러 에이전트를 팀으로 묶어 서로 감시하게 만들면 되지 않을까요? 얼핏 들으면 그럴듯한 해결책처럼 보이지만, 보안 패치처럼 극도로 정밀한 작업에서는 오히려 이 방식이 악재가 될 수 있습니다.

텍사스 A&M 대학교 연구진에 따르면, 멀티 에이전트 시스템을 구동할 경우 에이전트들이 도중에 길을 잃는 추론 표류 현상이 자주 발생합니다. 쉽게 말해 대학 조별 과제에서 열띤 토론을 하다가 삼천포로 빠져 결국 엉뚱한 발표 자료를 만드는 상황과 비슷합니다. 한 에이전트가 사소한 코드 실수를 던지면, 다른 검증 에이전트들이 그 실수를 분석하느라 정신이 팔려 정작 고치려던 핵심 취약점은 잊어버리고 전혀 다른 코드를 짜게 되는 식입니다.

실제 연구 결과에서도 복잡한 에이전트 협업 체계를 구축한 모델보다, 오히려 도구 인터페이스를 하나로 깔끔하게 통합한 범용 코드 에이전트가 더 일관성 있고 안정적인 패치 정확도를 보여주었습니다. 결국 에이전트의 머릿수만 늘리는 것은 비용만 더 쓰고 시스템의 혼란을 가중시키는 지름길이 될 수 있습니다.

안전하게 알아서 고치는 시스템을 만드는 두 가지 무기

그렇다면 이 한계를 극복하고 안전한 자율 복구 환경을 구축하려면 어떻게 해야 할까요? 핵심은 AI가 만든 코드를 맹신하지 않고, 개발 파이프라인 안에서 안전하게 실행해 보며 검증할 수 있는 환경을 만드는 것입니다. 업계는 이를 해결하기 위해 하드웨어 수준에서 격리된 안전한 테스트 공간과 상호 교차 검증 장치라는 두 가지 무기를 도입하고 있습니다.

첫 번째 무기는 하드웨어 가상화 기술 기반의 격리된 실행 환경인 샌드박스입니다. 대표적인 기술이 랭스미스 샌드박스(LangSmith Sandboxes)입니다. 1초도 안 되는 초고속 부팅이 가능한 마이크로 가상머신(microVM) 환경에서 AI가 만든 코드를 직접 실행해 유효성을 검증합니다. 혹시라도 AI가 취약점을 고치다 시스템을 망가뜨리거나 악성 코드를 실행하더라도, 하드웨어 수준에서 철저히 격리되어 있어 실제 시스템은 완벽히 보호됩니다.

두 번째 무기는 교차 검증을 위한 시냅스(Synapse) 패턴입니다. 코드를 수정하는 모델과 이를 비판적으로 검토하는 모델을 철저히 분리하는 '제안-검증' 이중 구조입니다. 하나의 모델이 패치 방안을 제시하면, 독립적인 성격의 검증 모델이 이를 다시 분석해 합의를 이끌어냅니다. 이를 통해 모델 한 개가 좁은 시야에 가두어지거나 추론 도중 길을 잃는 문제를 효과적으로 걸러낼 수 있습니다.

결국 개발 팀이 AI 보안 도입을 준비할 때 가장 먼저 집중해야 할 곳은 AI 모델 자체의 지능보다는, AI가 마음껏 안전하게 테스트해 볼 수 있는 격리된 검증 런타임을 구축하는 일입니다.

생성보다 '검증 환경'을 먼저 준비해야 하는 이유

AI가 스스로 코드를 고치는 자율 보안 시스템은 분명 매력적인 방향입니다. 하지만 AI의 완벽함을 기대하기 전에, 그가 만든 코드가 정말 안전한지 독립된 공간에서 돌려보고 교차 검증하는 시스템이 먼저 마련되어야 합니다.

앞으로 개발팀이 준비해야 할 가장 실질적인 과제도 더 똑똑한 AI 모델을 찾는 것이 아닙니다. AI가 제안한 패치를 안전하게 격리해 테스트하고 검증하는 에이전트 전용 실행 환경을 탄탄하게 구축하는 일입니다. 결국 자율 보안의 진짜 완성도는 얼마나 잘 쓰느냐가 아니라, 위험한 시도를 얼마나 확실하게 걸러내느냐에 달려 있습니다.