AI 모델 보안
OpenAI가 모델 추론 추출 시도를 차단한 이유
OpenAI의 9월 30일 발표는 보호된 추론을 빼내려는 조직적 시도와 차단 조치를 설명합니다. Moonshot AI 연계는 회사의 판단이며 실제 성공 건수는 공개되지 않았습니다.
이 글에서 다룰 내용
보호된 추론 추출 방식, 시도 규모와 귀속의 한계, 추론 보호 조치
OpenAI가 발견한 것은 무엇인가요?
2026년 9월 30일, OpenAI는 자사 모델의 보호된 추론 추출을 노린 조직적 캠페인을 발견하고 차단했다고 발표했습니다. 여기서 보호된 추론은 모델이 답을 만들어 가는 내부 작업 기록을 뜻합니다.
이용자에게 보여 주는 최종 답변과는 다른 정보입니다. (OpenAI 공식 발표)
왜 이 기록을 노렸을까요? 추론 과정이 드러나면 최종 답변에 나타나지 않은 정보까지 볼 수 있고, 다른 모델이 비슷한 능력을 익히는 데 활용할 가능성이 있기 때문입니다.
OpenAI는 이처럼 다른 모델의 출력이나 추론을 허가 없이 체계적으로 이용해 모델을 훈련·복제·개선하려는 행위를 ‘적대적 증류’로 설명합니다. 흔히 말하는 OpenAI 모델 증류 논란도 바로 이 맥락에서 이해할 수 있습니다. (OpenAI 공식 발표)
암호를 깬 게 아니라, 대화 방식을 악용했습니다
이번 발표에서 가장 주의해서 볼 대목은 공격 방식입니다. OpenAI에 따르면 운영자들은 한 대화에서 얻은 암호화된 추론을 다른 대화에 복사한 뒤, 모델에 숨겨진 내용을 풀어 적어 달라고 요청했습니다.
이른바 암호화된 추론 재사용을 통해 원래 보이지 않아야 할 내용이 응답으로 나타나도록 시도한 것입니다. (OpenAI 공식 발표)
그렇다고 암호화 기술이 해독됐거나 데이터베이스가 침입당했다는 뜻은 아닙니다. OpenAI는 암호가 깨지지 않았고, 저장된 사용자 대화에 직접 접근한 일도 없었다고 명시했습니다.
문제의 핵심은 암호화된 정보를 대화 사이에서 다시 제시했을 때 모델이 어떻게 반응하느냐에 있었습니다. (OpenAI 공식 발표)
OpenAI가 관찰한 활동은 7월 1일 시작됐습니다. 7월 24~25일에는 4,000명이 넘는 사용자 계정에서 관련 추출 패턴을 보이는 요청 약 1만 6,000건이 몰렸고, 추가 조사에서는 1만 5,000명 넘는 사용자 계정이 포함된 연관 활동도 확인됐습니다.
다만 이 숫자는 추출 시도 규모이지 성공 건수나 실제 유출량이 아닙니다. OpenAI는 해당 활동을 7월 28일까지 차단했다고 밝혔습니다. (OpenAI 공식 발표)
Moonshot AI와 Kimi는 어떻게 언급됐나요?
OpenAI는 활동 전체가 하나의 주체에서 시작됐는지는 불분명하다고 선을 그었습니다. 그러면서도 핵심 활동 집단은 Kimi 개발사 Moonshot AI와 연관된 개인들의 것으로 판단한다고 밝혔습니다.
이는 OpenAI의 조사 결과에 따른 귀속 판단이며, Moonshot AI의 조직적 지시나 Kimi 모델의 실제 학습에 추출된 내용이 사용됐다는 사실까지 입증한 발표는 아닙니다. (OpenAI 공식 발표)
따라서 “Kimi가 OpenAI의 추론을 훔쳐 학습했다”처럼 확정적으로 표현하면 발표 범위를 넘어섭니다. 현재 공개된 내용으로 확인할 수 있는 것은 추출 시도의 양상, OpenAI의 연계 판단, 그리고 회사가 취한 차단 조치입니다. 시도와 성공, 개인의 연계와 회사의 책임은 구분해서 봐야 합니다. (openai.com)
AI 모델 보안은 어떻게 대응해야 할까요?
OpenAI는 관련 계정을 금지하거나 제한하고, 가입·인프라 통제와 연관 계정 감시를 강화했다고 설명했습니다. 다른 사용자의 암호화된 추론을 가진 사람이 이를 다시 입력해 내용을 복구할 수 있었던 경로도 차단했습니다.
추론이 출력으로 노출될 가능성을 탐지하는 점검 역시 추가했습니다. (OpenAI 공식 발표)
이번 사례가 보여 주는 AI 모델 보안의 과제는 단순히 데이터를 암호화하는 데서 끝나지 않습니다. 서비스가 대화·사용자·작업 공간 사이의 추론 정보를 어떻게 취급하는지, 수상한 요청이 대량으로 반복될 때 알아차릴 수 있는지도 중요합니다.
OpenAI는 관련 정보를 Frontier Model Forum과 공유하며 다른 개발사도 비슷한 활동을 살펴볼 수 있도록 했다고 밝혔습니다. (OpenAI 공식 발표)
결국 이번 발표는 ‘모델의 내부 추론을 보여 주지 않는다’는 원칙만으로 충분한지 되묻게 합니다. 확인된 사실을 차분히 구분하면서, 추론 정보가 다른 대화에서 재사용될 때도 보호되는지가 앞으로의 관건입니다.
한 줄 요약: OpenAI는 보호된 추론 추출 시도를 차단했고 Moonshot AI 연계 정황을 밝혔지만, 시도 규모를 실제 추출 성공이나 Kimi 학습의 증거로 혼동해서는 안 됩니다.
