AI 에이전트 평가
스킬은 설명이 아니라 반복 가능한 성능 향상으로 검증해야 합니다
NVIDIA가 공개한 SkillEvaluator는 같은 조건에서 스킬 적용 전후를 비교해 AI 에이전트 스킬의 효과를 점수 차이로 확인합니다.
이 글에서 다룰 내용
SkillEvaluator 평가 구조, Skill Lift 공식 수치와 주의점, 자체 평가 세트 만드는 법
NVIDIA SkillEvaluator는 무엇인가요?
AI 에이전트에 새로운 스킬을 추가하면 기능이 좋아진 것처럼 보이기 쉽습니다. 하지만 몇 번의 성공 사례만으로는 그 스킬이 실제 성능을 높였는지, 운 좋게 결과가 잘 나온 것인지 구분하기 어렵습니다.
NVIDIA SkillEvaluator는 정적 검사와 실제 과제 실행을 결합해 스킬의 효과를 측정하는 오픈소스 도구입니다. 같은 프롬프트·모델·과제·채점 기준에서 스킬을 설치한 실행과 설치하지 않은 실행을 분리해 비교하고, 점수 차이를 Skill Lift로 보고합니다.
공식 도구는 구조·보안·중복 지침을 확인하는 정적 평가와 격리된 샌드박스에서 수행하는 라이브 평가를 지원합니다. 라이브 비교에서는 같은 과제를 스킬 적용 전후로 실행해 정확성·발견성·효과성·효율성·보안 점수를 비교합니다.
이 글에서 다룰 내용
NVIDIA SkillEvaluator의 역할, AI 에이전트 스킬 평가 방법, Skill Lift 해석법, Codex와 Claude Code 비교 시 주의점, 실무 평가 체크리스트
왜 AI 에이전트 스킬 평가가 필요할까요?
에이전트 스킬은 프롬프트 모음일 수도 있고, 특정 도구의 사용법이나 반복 작업 절차를 정리한 지침일 수도 있습니다. 문제는 스킬이 추가됐다고 해서 에이전트가 항상 더 정확해지는 것은 아니라는 점입니다.
설명이 지나치게 길면 에이전트가 중요한 조건을 놓칠 수 있습니다. 특정 사례에만 맞춘 스킬은 다른 과제에서 오히려 판단을 방해할 수도 있습니다.
따라서 AI 에이전트 스킬 평가에서는 다음과 같은 질문을 확인해야 합니다.
- 스킬 적용 후 과제 성공률이 높아졌는가?
- 동일한 결과를 더 적은 단계로 얻었는가?
- 도구 호출 오류와 불필요한 재시도가 줄었는가?
- 새로운 과제에서도 개선 효과가 유지되는가?
- 성능 향상보다 실행 비용이 더 크게 증가하지 않았는가?
이 과정을 거치면 느낌이 아니라 데이터에 근거한 에이전트 성능 검증이 가능합니다. 특히 여러 사람이 스킬을 만들거나 공유하는 환경에서는 공통 평가 기준이 더욱 중요합니다.
Skill Lift는 어떻게 해석할까요?
Skill Lift는 스킬이 없을 때의 평가 점수와 스킬을 적용한 뒤의 평가 점수 차이입니다. 예를 들어 같은 채점 기준에서 50점이 70점으로 바뀌었다면 Skill Lift는 20점입니다. NVIDIA 공식 글도 이 수치를 성공 확률이나 전 작업 일반화 수치가 아니라 평가 점수의 차이로 설명합니다.
다만 숫자가 한 번 높게 나왔다고 바로 좋은 스킬로 판정하면 곤란합니다. 평가 문제 수가 너무 적거나 난이도가 한쪽으로 치우치면 결과가 쉽게 흔들릴 수 있기 때문입니다.
신뢰할 만한 Skill Lift를 얻으려면 동일한 모델, 동일한 도구, 동일한 실행 환경을 유지해야 합니다. 가능하면 각 과제를 여러 번 실행하고 평균뿐 아니라 실패 유형도 함께 살펴보는 것이 좋습니다.
또한 전체 점수만 확인하지 말고 과제 유형별 차이를 나눠 봐야 합니다. 코드 수정에서는 개선됐지만 문서 탐색에서는 성능이 떨어졌다면, 스킬의 적용 범위나 지침을 다시 조정할 필요가 있습니다.
Codex와 Claude Code를 비교할 때 주의할 점
Codex와 Claude Code처럼 서로 다른 코딩 에이전트를 비교할 때는 모델 이름만 보고 결론을 내리기 어렵습니다. 각 에이전트가 사용할 수 있는 도구, 작업 디렉터리 접근 범위, 명령 실행 권한이 다르면 공정한 비교가 되지 않습니다.
가장 좋은 방법은 공통 저장소를 준비하고 동일한 버그 수정, 테스트 작성, 문서 갱신 과제를 제공하는 것입니다. 이후 테스트 통과율, 수정 정확도, 작업 완료 시간, 도구 호출 횟수, 기존 기능 훼손 여부를 함께 기록합니다.
스킬 적용 전후 비교와 에이전트 간 비교도 구분해야 합니다. Codex에 특정 스킬을 적용한 결과와 스킬이 없는 Claude Code를 비교하면 모델 차이와 스킬 효과가 섞이기 때문입니다.
먼저 각 에이전트 내부에서 Skill Lift를 계산한 다음, 동일한 채점 기준으로 결과를 비교하는 편이 타당합니다. 이렇게 해야 AI 에이전트 벤치마크가 단순 순위 경쟁이 아니라 실제 업무 적합성을 확인하는 자료가 됩니다.
NVIDIA 공식 벤치마크에서 확인한 수치
NVIDIA는 30개가 넘는 제품의 검증된 스킬 300개 이상을 Codex와 Claude Code 두 하네스에서 비교했다고 밝혔습니다. 2026년 8월 12일 벤치마크 스냅샷 기준으로 전체 차원의 평균 Skill Lift는 31점, 보안 차원을 제외하면 39점이었습니다.
정확성은 평균 46점에서 87점으로 41점 올랐고, 효과성은 39점에서 78점으로 39점 올랐습니다. 이 수치는 NVIDIA가 공개한 특정 스킬·평가 과제·하네스의 평균이며, 모든 에이전트 업무에서 같은 향상을 보장하는 독립 실험 결과는 아닙니다.
공식 글은 공개된 스킬의 85%가 과제당 1회, 15%가 2회 실행됐고 신뢰구간을 보고하지 않았다고 명시합니다. 따라서 팀별 도입 전에는 자체 과제와 여러 번의 반복 실행으로 재현성·실패 유형·토큰·실행 시간을 함께 확인해야 합니다.
실무에서 평가 세트를 만드는 방법
처음부터 거대한 벤치마크를 만들 필요는 없습니다. 실제 업무에서 자주 발생하는 과제 10~20개를 모으고, 쉬운 문제와 까다로운 문제를 적절히 섞는 것부터 시작할 수 있습니다.
각 과제에는 입력 자료, 완료 조건, 허용 도구, 제한 시간, 채점 기준을 명확히 적어야 합니다. “코드를 잘 수정한다”보다 “기존 테스트를 유지하면서 신규 테스트 세 개를 통과한다”처럼 판정 가능한 조건이 좋습니다.
평가 결과에는 점수뿐 아니라 실패 원인도 남겨야 합니다. 지침 누락, 잘못된 도구 선택, 테스트 미실행, 과도한 파일 수정처럼 실패를 분류하면 다음 스킬 개선 방향이 선명해집니다.
마지막으로 평가에 사용한 문제를 스킬 작성 과정에서 과도하게 참고하지 않도록 주의해야 합니다. 평가 세트에만 맞춘 스킬은 높은 점수를 얻더라도 새로운 작업에서는 쉽게 무너질 수 있습니다.
좋은 스킬은 측정으로 확인해야 합니다
NVIDIA SkillEvaluator가 던지는 중요한 메시지는 간단합니다. 스킬의 가치는 설명의 길이나 복잡성이 아니라, 반복 가능한 조건에서 실제 성능을 얼마나 개선했는지로 판단해야 한다는 것입니다.
Codex와 Claude Code를 포함한 여러 에이전트를 운영한다면 작은 평가 세트부터 만들고, 변경할 때마다 스킬 적용 전후를 비교해 보세요. 성공률과 Skill Lift, 실패 유형을 함께 기록하면 감에 의존하지 않고 더 안정적인 에이전트 운영 기준을 세울 수 있습니다.
한 줄 요약: 좋은 AI 에이전트 스킬은 그럴듯한 설명이 아니라 반복 가능한 성능 향상으로 증명됩니다.
