독점 LLM API에서 추론 과정을 빼돌리는 새로운 공격 기법 발견

연구진이 OpenAI, Anthropic, Google의 프론티어 모델에서 추론 과정을 추출하는 공격 기법을 발견했다. 6,708개의 에이전트 궤적에서 315,320개의 추론 블록을 복원했으며, 그중 704개의 개인정보(API 키, 비밀번호, 토큰 등)가 포함되어 있고 64개는 추론 블록에만 존재했다.

AI 요약

OpenAI, Anthropic, Google의 프론티어 모델 API에서 암호화된 추론 과정(thinking tokens)을 빼돌리는 새로운 공격 기법이 발견됐다. 연구진은 GitHub와 Hugging Face에서 수집한 6,708개의 공개 에이전트 궤적에서 315,320개의 추론 블록을 복호화했으며, 그중 704개의 실제 개인정보(API 키 62개, 비밀번호 33개, 액세스 토큰 24개, 이메일 30개 등)를 복구했다. 특히 64개의 민감 정보는 추론 블록에만 존재하고 가시적인 세션에는 나타나지 않았다.

핵심 포인트

  • 대상: OpenAI, Anthropic, Google의 프론티어 모델 API (GPT-5.2, Claude, Gemini 등)
  • 규모: 6,708개 에이전트 궤적에서 315,320개 추론 블록 복호화 성공
  • 유출 정보: API 키 62개, 비밀번호 33개, 액세스 토큰 24개, 개인 이메일 30개 등 총 704개
  • 64개 민감 정보는 추론 블록에만 독점 존재, 가시적 세션에는 미노출

향후 전망

  • LLM API 제공사들의 추론 과정 암호화 방식에 대한 근본적 재검토가 필요할 전망
  • 추론 과정에서 민감정보 처리에 대한 새로운 보안 표준과 규제가 도입될 가능성
출처:Stolen Thoughts
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...