AI 에이전트 벤치마크
모델만큼 중요한 것은 장기 실행 에이전트 하네스입니다
NVIDIA AVO가 Claude Opus 5와 결합해 ARC-AGI-3 공개 세트에서 100.00 RHAE를 기록했습니다. 공식 수치와 공개 세트 한계를 함께 살펴봅니다.
이 글에서 다룰 내용
ARC-AGI-3와 RHAE, Claude Opus 5와 AVO 구조, 100.00 점수의 의미와 한계
NVIDIA AVO의 100.00 RHAE, 무엇이 달라졌을까
NVIDIA AVO가 ARC-AGI-3 공개 세트에서 100.00 RHAE를 달성했다는 소식이 눈길을 끌고 있습니다. NVIDIA 공식 글 기준으로 공개 세트 25개 환경의 183개 레벨을 모두 완료했으며, 총 6,624회의 환경 행동을 사용했습니다.
단순히 문제 몇 개를 정확히 맞혔다는 이야기가 아니라, 변화하는 환경을 관찰하고 행동하며 규칙을 찾아내는 AI 에이전트의 능력을 보여준 결과이기 때문입니다.
ARC-AGI-3는 정답을 한 번에 출력하는 일반적인 질의응답 벤치마크와 성격이 다릅니다. 에이전트가 화면이나 상태의 변화를 살펴보고, 가능한 행동을 선택한 뒤, 그 결과를 바탕으로 다음 전략을 수정해야 합니다.
여기서 RHAE는 레벨 완료 여부와 행동 효율을 최초 수행 인간 기준과 비교해 집계하는 지표입니다. 이번 100.00은 NVIDIA가 공식 스코어카드로 측정한 공개 세트 결과이며, 비공개 경쟁 세트 성적을 뜻하지 않습니다.
이 글에서 다룰 내용
NVIDIA AVO의 역할, ARC-AGI-3의 특징, Claude Opus 5와 에이전트 하네스의 관계, 장기 실행 에이전트의 가능성, 점수를 해석할 때 주의할 부분
ARC-AGI-3가 어려운 이유
기존 AI 평가는 이미 학습한 지식을 얼마나 정확하게 꺼내는지 확인하는 경우가 많았습니다. 반면 ARC-AGI-3는 낯선 환경에서 규칙을 발견하고 목표를 달성하는 과정에 더 큰 비중을 둡니다.
AI 에이전트는 처음부터 완성된 설명서를 받지 않습니다. 어떤 행동이 가능한지 시험하고, 실패 결과를 기억하며, 이전과 다른 선택을 시도해야 합니다.
이 과정에서는 한두 번의 추론보다 상태 추적과 전략 수정이 중요합니다. 초반에 잘못 세운 가설을 계속 유지하면 행동 횟수와 비용이 늘어나고, 제한된 실행 기회를 낭비할 수 있습니다.
그래서 ARC-AGI-3는 모델의 지식량만 확인하는 시험이라기보다 관찰·행동·기억·계획을 결합하는 능력을 평가하는 무대에 가깝습니다.
Claude Opus 5만 잘하면 되는 걸까
이번 결과를 Claude Opus 5라는 기반 모델의 성능만으로 설명하면 핵심을 놓치기 쉽습니다. 강력한 모델은 중요한 출발점이지만, 실제 실행 과정에서는 모델을 둘러싼 운영 구조가 함께 작동합니다.
NVIDIA AVO는 Claude Opus 5가 환경을 관찰하고 다음 행동을 결정할 수 있도록 실행 흐름을 관리합니다. 이전 시도의 결과를 정리하고, 필요한 정보를 다시 제공하며, 실패 후 재시도할 수 있게 돕는 역할도 중요합니다.
이러한 구조를 에이전트 하네스라고 부릅니다. 모델이 두뇌라면 하네스는 기억 장치, 실행 관리자, 오류 복구 장치와 작업 기록을 연결하는 운영 시스템에 해당합니다.
같은 모델을 사용하더라도 하네스 설계에 따라 결과가 달라질 수 있습니다. 무엇을 기억할지, 언제 계획을 다시 세울지, 반복 행동을 어떻게 감지할지가 장기 과제의 성공률을 좌우하기 때문입니다.
NVIDIA는 같은 Claude Opus 5를 쓴 VISTA의 7,542회와 비교해 AVO가 약 12% 적은 환경 행동을 사용했다고 밝혔습니다. 다만 관찰 표현, 메모리, 컨텍스트 관리와 백엔드가 달라 통제된 일대일 성능 비교는 아닙니다.
장기 실행 에이전트가 중요한 이유
실제 업무는 한 번의 프롬프트로 끝나지 않습니다. 자료를 찾고, 결과를 비교하고, 오류를 수정한 뒤, 조건을 충족할 때까지 여러 단계를 이어가야 합니다.
장기 실행 에이전트는 이런 연속 작업을 안정적으로 수행하는 AI 에이전트를 뜻합니다. 실행 시간이 길어질수록 누적되는 실수와 맥락 손실을 줄이는 것이 핵심 과제가 됩니다.
예를 들어 코딩 업무에서는 파일을 분석한 뒤 수정하고 테스트를 실행해야 합니다. 테스트가 실패하면 원인을 찾아 다시 수정하고, 최종 결과가 요구사항을 충족하는지도 검증해야 합니다.
문서 조사나 데이터 분석도 마찬가지입니다. 출처 수집, 중복 제거, 사실 확인, 초안 작성과 검토가 연결되므로 단순한 문장 생성보다 실행 상태 관리가 더 중요해집니다.
NVIDIA AVO의 성과가 주목받는 이유도 여기에 있습니다. 제한된 시연을 잘하는 수준을 넘어, 여러 행동을 이어가며 목표에 접근하는 시스템 설계의 가능성을 보여주기 때문입니다.
100.00이라는 숫자를 해석할 때 주의할 점
가장 먼저 구분해야 할 것은 공개 세트 성과와 전체 벤치마크 해결은 동일하지 않다는 점입니다. NVIDIA도 이번 결과가 25개 환경의 공개 세트에 한정되며, 준비공개·완전 비공개 경쟁 세트 결과가 아니라고 명시했습니다.
점수와 함께 실행 비용도 살펴봐야 합니다. 목표를 달성했더라도 지나치게 많은 추론 호출, 행동 횟수 또는 긴 실행 시간이 필요했다면 실제 서비스에 적용할 때 부담이 커질 수 있습니다.
재현 가능성도 중요한 기준입니다. 동일한 설정으로 반복했을 때 비슷한 RHAE가 나오는지, 환경이 조금 달라져도 전략을 다시 찾는지 확인해야 진정한 일반화 능력을 판단할 수 있습니다.
따라서 이번 기록은 ARC-AGI-3가 완전히 정복됐다는 선언보다 AI 에이전트와 에이전트 하네스를 함께 최적화했을 때 어디까지 갈 수 있는지 보여준 이정표로 보는 편이 정확합니다.
앞으로 주목할 변화
다음 경쟁은 더 큰 모델 하나를 만드는 데서 끝나지 않을 가능성이 큽니다. Claude Opus 5와 같은 기반 모델에 어떤 기억 구조와 검증 절차를 연결하는지가 더욱 중요해질 것입니다.
특히 비공개 평가 성적, 반복 실행의 안정성, 작업당 비용과 실패 복구 능력을 함께 확인해야 합니다. 이 조건들이 충족돼야 장기 실행 에이전트가 연구 데모를 넘어 실제 업무 자동화에 안착할 수 있습니다.
NVIDIA AVO의 100.00 RHAE는 분명 인상적인 기록입니다. 다만 진짜 의미는 숫자 자체보다, 모델과 하네스가 협력해 낯선 환경을 탐색하고 장시간 목표를 추적했다는 데 있습니다.
한 줄 요약: NVIDIA AVO의 ARC-AGI-3 공개 세트 100.00 RHAE는 Claude Opus 5와 에이전트 하네스가 결합한 장기 실행 AI 에이전트의 가능성을 보여준 성과입니다.
