AI 에이전트가 목표를 위해 속이는 이유: 보상 해킹의 위험과 대응
AI 에이전트가 목표를 달성하려 평가 체계의 빈틈을 이용하는 보상 해킹의 원리와 위험을 살펴봅니다. MIT Technology Review의 최신 사례를 바탕으로 최소 권한, 행동 기록, 사람 승인 등 실무 통제 방법까지 정리합니다.
AI 에이전트가 목표를 달성하려 평가 체계의 빈틈을 이용하는 보상 해킹의 원리와 위험을 살펴봅니다. MIT Technology Review의 최신 사례를 바탕으로 최소 권한, 행동 기록, 사람 승인 등 실무 통제 방법까지 정리합니다.