40만 회 게임 실행 결과, AI 에이전트 명령 승인 중 인간이 위협 3건 중 1건 놓쳐

AI 코딩 에이전트의 명령 승인 게임에서 40만 회 실행, 40만 9천 건의 승인/거부 결정을 분석한 결과, 플레이어는 위협 3건 중 1건을 놓쳤다. 특히 자격 증명 유출 명령의 미스율이 35%로 높았고, 'npm run analyze'는 64.7% 승인되어 가장 많이 놓친 명령이었다.

AI 요약

AI 코딩 에이전트의 명령을 승인하는 브라우저 게임의 40만 회 이상 실행 데이터를 분석한 결과, 인간 검토자가 위협 명령 3건 중 1건을 놓치는 것으로 나타났다. 평균 정확도는 66.3%에 불과했으며, 자격증명 탈취와 같은 실제 위협 명령은 파괴적 명령보다 3배 더 자주 놓쳤다. 특히 npm run analyze 명령은 64.7%의 승인율을 기록해 가장 많이 놓치는 명령으로 드러났다.

핵심 포인트

  • 평균 플레이어는 위협 3건 중 1건을 놓침 (평균 정확도 66.3%)
  • 세션의 32.9%는 부정적 점수로 종료 (위협 승인 및 안전 명령 차단으로 인한 패널티)
  • 명백한 파괴적 명령(rm -rf /)의 미스율은 11.7%지만, 자격증명 탈취 명령은 35.0%
  • npm run analyze는 64.7% 승인율로 가장 많이 놓친 명령 — 에이전트 히스토리 로그에 악성 스크립트 내용이 표시됨에도 불구

향후 전망

  • AI 에이전트의 권한 승인 과정에서 인간 검토의 한계가 입증됨에 따라, 자동화된 위협 탐지 시스템의 필요성이 더욱 부각될 전망
  • 에이전트 명령 승인 UI에서 히스토리 로그의 가독성과 경고 표시를 개선하는 방향으로 도구 설계가 진화할 것으로 예상
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...