AI 뉴스 · 추론 벤치마크
Vera Rubin 첫 MLPerf 프리뷰: Qwen3-VL 처리량 최대 3.7배
NVIDIA 발표 기준으로 Vera Rubin NVL72가 Qwen3-VL 처리량에서 GB300 NVL72 대비 최대 3.7배를 기록했습니다. 모델별 비교 조건과 실제 운영 지표를 구분해 읽어야 하는 첫 프리뷰 결과입니다.
이 글에서 다룰 내용
첫 프리뷰의 범위, 모델별 처리량과 실행 조건, GB300 랙 확장과 소프트웨어 개선, 콘텐츠 자동화 운영 기준
첫 공개의 핵심은 ‘새 모델’이 아닌 추론 시스템입니다
이번 발표에서 눈여겨볼 부분은 AI가 얼마나 똑똑해졌느냐가 아니라, 시스템이 얼마나 많은 작업을 처리했느냐입니다. 엔비디아는 현지 시간 2026년 9월 16일, MLPerf Inference v6.1에 제출한 Vera Rubin NVL72의 첫 프리뷰 결과를 공개했습니다.
AI 추론은 학습된 모델이 입력을 받아 답변이나 결과물을 만드는 과정입니다. 블로그 초안을 생성하거나 이미지가 포함된 자료를 분석하는 작업도 여기에 해당합니다.
이번 결과는 이러한 추론을 수행하는 AI 인프라의 시스템 성능에 관한 발표입니다. 새로운 AI 모델이 출시됐거나, 모든 고객에게 해당 시스템의 정식 배치가 완료됐다는 의미로 읽으면 안 됩니다.
Qwen3-VL 처리량 최대 3.7배, 비교 조건이 중요합니다
엔비디아에 따르면 Vera Rubin NVL72는 Qwen3-VL 처리량에서 GB300 NVL72 대비 최대 3.7배를 기록했습니다. 사용한 소프트웨어는 vLLM과 엔비디아의 추론 프레임워크인 NVIDIA Dynamo입니다.
발표의 비교 범위에는 오프라인, 서버, 인터랙티브 시나리오가 포함됩니다. 여기서 ‘최대’는 조건별 결과 가운데 가장 큰 향상 폭을 뜻하므로, 모든 시나리오에서 똑같이 3.7배를 기록했다고 해석해서는 안 됩니다.
처리량은 일정 시간에 시스템이 처리하는 전체 작업량입니다. 식당에 비유하면 한 시간 동안 제공한 음식의 총량에 가깝고, 손님 한 명이 주문 후 기다린 시간과는 다른 지표입니다.
따라서 이 결과를 보고 “내 질문에도 무조건 3.7배 빨리 답한다”고 기대하기는 어렵습니다. 답변의 정답률이나 서비스 이용 가격 역시 이 수치만으로 판단할 수 없습니다.
DeepSeek-R1은 최대 2.5배, 실행 소프트웨어도 다릅니다
같은 발표에서 엔비디아는 Vera Rubin NVL72의 DeepSeek-R1 처리량이 GB300 NVL72 대비 최대 2.5배라고 설명했습니다. 이 비교에는 Qwen3-VL과 달리 NVIDIA TensorRT-LLM이 사용됐습니다.
두 모델의 숫자를 나란히 볼 때는 모델 이름뿐 아니라 실행 소프트웨어까지 함께 확인해야 합니다. 이번 결과는 하드웨어와 소프트웨어가 결합된 시스템 성능이지, 소프트웨어 조건을 떼어낸 반도체 단독 성능표가 아닙니다.
기술적 배경에는 하드웨어·소프트웨어 공동 설계, 프리필과 디코드를 분리하는 서빙 방식, 대규모 expert parallelism이 있습니다. 프리필은 입력 처리, 디코드는 출력 생성 단계입니다.
일반적으로 두 단계는 요구하는 자원의 특성이 달라 분리 운영을 통해 자원 배치를 조정할 수 있습니다. Expert parallelism은 모델 내부의 전문가 연산을 여러 GPU에 나누는 방식입니다.
다만 각각의 기술이 이번 향상 폭에 얼마나 기여했는지를 독립적으로 측정한 결과처럼 단정해서는 안 됩니다.
확장 효율 99%와 소프트웨어 개선 1.6배는 별개입니다
같은 발표에 등장하는 ‘99%’는 Vera Rubin이 아닌 GB300 NVL72의 랙 확장 결과입니다. 엔비디아는 DeepSeek-R1 오프라인 시험에서 GPU 72개로 구성된 1랙을 GPU 288개를 묶은 4랙으로 늘렸을 때 확장 효율 99%를 기록했다고 설명했습니다.
이는 장비 규모를 늘리는 데 따라 처리량도 거의 비례해서 증가했다는 뜻입니다. 전력 효율이 99%라거나, 답변 정확도가 99%라는 이야기가 아닙니다.
또 다른 숫자인 ‘최대 1.6배’는 GB300 NVL72의 Qwen3-VL 결과입니다. 엔비디아는 MLPerf v6.0 대비 v6.1에서 소프트웨어 최적화로 성능이 최대 1.6배 향상됐다고 밝혔습니다.
이 수치는 같은 GB300 플랫폼에서의 소프트웨어 개선을 보여줍니다. Vera Rubin의 Qwen3-VL 처리량 최대 3.7배와는 비교 기준이 다르므로, 두 배수를 더하거나 곱해 새로운 성능 수치를 만들어서는 안 됩니다.
콘텐츠 자동화 운영자는 무엇을 확인하면 될까요?
콘텐츠 자동화에서는 동시 요청 처리량과 개별 응답 지연을 나눠 보는 것이 좋습니다. 밤사이 초안을 일괄 생성하는 작업과, 사용자가 화면 앞에서 답변을 기다리는 서비스는 중요한 성능 기준이 다르기 때문입니다.
일괄 작업이라면 정해진 시간 안에 얼마나 많은 요청을 완료하는지가 중요합니다. 대화형 서비스라면 첫 응답이 나오기까지의 시간과 전체 답변이 완성되는 시간도 함께 살펴야 합니다.
자체 도입을 검토할 때는 모델, 입력·출력 길이, 동시 사용자 수, 하드웨어, 소프트웨어 버전을 맞춰 비교해야 합니다. 여기에 장비·서비스 가격과 전력 조건을 더해야 실제 운영에 가까운 판단이 가능합니다.
이번 발표의 핵심은 엔비디아가 Vera Rubin NVL72의 첫 MLPerf 프리뷰에서 Qwen3-VL 처리량을 GB300 NVL72 대비 최대 3.7배로 제시했다는 점입니다. 다만 벤더의 벤치마크 발표만으로 내 서비스의 비용 절감률이나 투자 수익까지 확정할 수는 없습니다.
한 줄 요약: 엔비디아가 발표한 Vera Rubin NVL72의 Qwen3-VL 처리량은 GB300 NVL72 대비 최대 3.7배이지만, 실제 운영에서는 응답 지연과 비용을 별도로 확인해야 합니다.
참고 출처
2026년 9월 16일 NVIDIA 공식 발표를 기준으로 정리했습니다. 성능 수치는 NVIDIA가 설명한 모델·실행 소프트웨어·벤치마크 조건의 결과입니다.
