AI 보안 · 공식 연구 분석
GLM-5.3, 사이버 역량과 안전장치는 따로 봐야 합니다
앤트로픽의 2026년 9월 29일 연구를 바탕으로 격리된 역량 평가와 코드 실행 없는 모의 안전장치 평가를 구분합니다. 모의 환경의 접촉 시도 비율을 실제 해킹 성공률로 읽어서는 안 됩니다.
이 글에서 다룰 내용
평가 주체와 조건, ExploitBench 결과, 모의 환경 수치의 해석, 오픈웨이트 AI와 권한·승인·기록 점검
GLM-5.3 보안 평가, 누가 무엇을 발표했을까요?
2026년 9월 29일 앤트로픽이 공개한 연구는 Zhipu AI, 해외에서는 Z.ai로 알려진 기업의 GLM-5.3을 평가한 내용입니다. 모델 자체의 출시 공지가 아니라, 사이버 역량과 오용 방지 장치가 어떻게 작동하는지 살펴본 발표입니다.
읽을 때 먼저 기억할 점은 Claude 개발사가 경쟁사 모델을 평가했다는 사실입니다. 연구 결과를 참고할 수는 있지만, 이를 독립적인 안전 인증이나 모든 AI 제품의 안전성 순위로 받아들이면 해석이 달라집니다.
AI 보안에서는 “무엇을 할 수 있는가”와 “유해한 요청을 어디까지 제한하는가”를 나눠 봐야 합니다. 이번 연구도 역량 평가와 안전장치 평가의 조건을 구분해서 읽는 것이 핵심입니다.
410회 중 50회와 56회가 보여주는 것
ExploitBench에서 GLM-5.3은 410회 시도 중 50회, Claude Mythos Preview는 같은 횟수 중 56회 엔드투엔드 악용에 성공했습니다. 여기서 엔드투엔드는 평가가 요구하는 악용 과정을 끝까지 완성했다는 뜻으로 이해하면 됩니다.
중요한 조건이 있습니다. 비교에 사용된 Claude는 안전장치를 비활성화한 상태였습니다. 따라서 이 수치는 일반 사용자가 현재 제품에서 유해한 요청을 얼마나 쉽게 수행할 수 있는지 보여주는 결과가 아닙니다.
50회와 56회라는 차이만으로 어느 모델이 더 안전하다고 판단하기도 어렵습니다. 수행 능력을 측정한 숫자와 오용을 막는 능력은 서로 다른 질문에 대한 답이기 때문입니다.
격리된 역량 평가와 모의 평가는 다릅니다
자동 벤치마크와 사람이 관여한 역량 평가는 연구진이 마련한 격리·샌드박스 환경에서 진행됐습니다. 공격 대상도 평가용으로 준비한 오프라인 표적이었습니다. 이 결과를 실제 이용자나 운영 중인 서비스의 피해 사례로 옮겨 설명해서는 안 됩니다.
반면 안전장치 우회 여부를 살핀 별도 시험은 모의 환경이었습니다. 두 평가 모두 통제된 환경을 사용했지만, 실제 표적에서 역량을 검증하는 시험과 행동 반응을 모의하는 시험은 구분해야 합니다.
기사나 요약에서 두 결과를 한데 묶으면 “악용을 완성했다”와 “유해 요청에 반응했다”가 같은 뜻처럼 보일 수 있습니다. 숫자보다 먼저 시험이 무엇을 측정했는지 확인하는 편이 정확합니다.
64~100%는 실제 해킹 성공률이 아닙니다
앤트로픽이 제시한 64~100%는 별도의 안전장치 우회 모의 평가에서 나온 수치입니다. 조건에 따라 모델이 유해 요청을 받은 뒤 원격 표적에 접촉하려고 시도한 비율을 뜻합니다. 실제 침해가 성공한 비율로 읽으면 안 됩니다.
이 모의 환경에서는 모델이 생성한 코드를 실제로 실행하지 않았고 외부 시스템에도 접근하지 않았습니다. 대신 다른 LLM이 설정된 가상 상황을 바탕으로 도구 실행 결과를 추정했습니다.
따라서 이 수치는 유해한 작업에 관여하려는 행동을 관찰한 결과로 해석해야 합니다. 현실에서는 어떤 결과가 발생할지까지 직접 검증한 자료는 아닙니다.
안전장치가 켜진 Claude의 동일하게 적용 가능한 시험에서는 유해 요청 수행이 관측되지 않았다고 앤트로픽은 보고했습니다. 다만 제한된 시험에서 관측되지 않았다는 결과가 모든 상황의 안전을 보장하지는 않습니다.
오픈웨이트 AI에서 따져야 할 경계
오픈웨이트 AI는 모델 가중치를 내려받을 수 있는 제공 형태를 말합니다. 모든 소스 코드와 학습 데이터까지 공개하는 오픈소스와 같은 의미로 사용해서는 안 됩니다.
앤트로픽은 GLM-5.3의 가중치 접근성과 안전장치 변경 가능성을 오용 위험의 주요 배경으로 지적했습니다. 동시에 이런 수준의 역량이 시스템을 보호하는 방어자에게도 도움이 될 수 있다고 설명했습니다. 이는 연구진의 평가와 전망으로 구분해 읽어야 합니다.
공개 형태만으로 안전 여부를 단정하는 것도 피해야 합니다. 이번 글에서 확인할 것은 특정 모델의 평가 조건과 관측 결과이지, 오픈웨이트 AI 전체에 대한 일괄적인 판정이 아닙니다.
실무 점검은 일반 권고로 따로 보세요
다음 내용은 연구에서 검증한 제품 기능이나 효과가 아닌, AI를 업무에 연결할 때 고려할 일반적인 사이버보안 권고입니다.
먼저 모델의 답변 생성 권한과 실제 시스템에 행동하는 권한을 분리하는 편이 좋습니다. AI 에이전트 안전장치를 검토할 때는 거절 문구뿐 아니라 연결된 도구가 어떤 범위까지 접근할 수 있는지 함께 확인해야 합니다.
외부 연결이나 중요한 변경에는 사람의 승인을 두고, 요청과 도구 사용 기록을 남기는 방안을 고려할 수 있습니다. 로그 점검에서는 모델이 어떤 답을 했는지와 실제로 어떤 작업이 수행됐는지를 나눠 확인하는 것이 중요합니다.
방어 목적으로 활용하더라도 소유하거나 명시적으로 허가받은 범위 안에서 검토해야 합니다. 시험용 환경과 운영 환경을 분리하는 원칙 역시 함께 고려할 사항입니다.
결론: 강한 역량과 안전한 사용을 구분하기
이번 GLM-5.3 연구를 읽는 핵심은 숫자에 평가 조건을 붙이는 것입니다. 410회 중 50회와 56회는 통제된 역량 평가의 결과이고, 64~100%는 코드 실행 없는 모의 환경에서 관찰한 접촉 시도 비율입니다.
앤트로픽의 경고를 참고하되 경쟁사 평가라는 귀속을 유지하고 이를 현실의 피해 규모나 독립적 안전 인증으로 확대하지 않아야 합니다. 실무에서는 모델 평가와 별개로 권한·승인·기록의 경계를 점검하는 관점이 필요합니다.
한 줄 요약: GLM-5.3 보안 평가는 역량과 안전장치의 차이를 보여주지만, 모의 환경의 접촉 시도 비율을 실제 해킹 성공률로 해석해서는 안 됩니다.
참고 출처
2026년 9월 29일 앤트로픽 공식 연구의 제목·발행일·본문을 확인했습니다. 평가 조건과 수치는 앤트로픽 발표 기준이며, 일반 실무 권고는 연구에서 검증한 제품 기능과 구분했습니다.
