AI 요약
AI 코딩 에이전트의 명령을 승인하는 브라우저 게임의 40만 회 이상 실행 데이터를 분석한 결과, 인간 검토자가 위협 명령 3건 중 1건을 놓치는 것으로 나타났다. 평균 정확도는 66.3%에 불과했으며, 자격증명 탈취와 같은 실제 위협 명령은 파괴적 명령보다 3배 더 자주 놓쳤다. 특히 npm run analyze 명령은 64.7%의 승인율을 기록해 가장 많이 놓치는 명령으로 드러났다.
핵심 포인트
- 평균 플레이어는 위협 3건 중 1건을 놓침 (평균 정확도 66.3%)
- 세션의 32.9%는 부정적 점수로 종료 (위협 승인 및 안전 명령 차단으로 인한 패널티)
- 명백한 파괴적 명령(
rm -rf /)의 미스율은 11.7%지만, 자격증명 탈취 명령은 35.0% npm run analyze는 64.7% 승인율로 가장 많이 놓친 명령 — 에이전트 히스토리 로그에 악성 스크립트 내용이 표시됨에도 불구
향후 전망
- AI 에이전트의 권한 승인 과정에서 인간 검토의 한계가 입증됨에 따라, 자동화된 위협 탐지 시스템의 필요성이 더욱 부각될 전망
- 에이전트 명령 승인 UI에서 히스토리 로그의 가독성과 경고 표시를 개선하는 방향으로 도구 설계가 진화할 것으로 예상
출처:hackernews
