초대형 오픈웨이트 AI
Qwen3.8 2.4조 파라미터, 추론 경쟁은 모델보다 시스템입니다
알리바바의 Qwen3.8-2.4T-A95B와 NVIDIA GB300 NVL72 공식 자료를 바탕으로 구조·성능 조건·실제 비용 판단법을 정리했습니다.
이 글에서 다룰 내용
Qwen3.8의 MoE 구조, GB300 NVL72 공식 성능 조건, 배포 경로와 추론 비용 판단법
Qwen3.8-2.4T-A95B가 주목받는 이유
이 글에서 다룰 내용
Qwen3.8의 구조와 의미, 엔비디아 GB300에서 기대할 수 있는 변화, AI 모델 추론 비용을 판단할 때 확인할 항목
알리바바 AI가 공개한 Qwen3.8-2.4T-A95B에서 가장 먼저 눈에 들어오는 숫자는 2.4T입니다. 2.4T는 전체 파라미터가 약 2조 4천억 개라는 의미이며, A95B는 토큰을 처리할 때 약 950억 개의 파라미터가 활성화된다는 뜻으로 해석할 수 있습니다.
전체 규모만 보면 매우 무거운 모델처럼 보이지만, 매번 모든 파라미터를 계산하는 구조는 아닙니다. 필요한 전문가 네트워크를 선택적으로 호출하는 MoE 구조를 사용하기 때문입니다.
Qwen3.8은 대규모 모델의 지식 용량을 확보하면서도 실제 연산량을 줄이려는 방향을 보여줍니다. 공식 기술 글에 따르면 최대 문맥 길이는 100만 토큰, 최대 출력 길이는 12만 8천 토큰이며, 요청별 추론 깊이는 low·high·xhigh로 조절할 수 있습니다.
2.4조 파라미터와 MoE는 어떻게 함께 작동할까
MoE는 Mixture of Experts의 줄임말입니다. 하나의 거대한 신경망을 항상 전부 사용하는 대신 여러 전문가 모듈을 준비하고, 입력 토큰에 적합한 일부 전문가만 선택해 계산합니다.
쉽게 비유하면 모든 과목의 전문가를 한 회의에 동시에 부르는 것이 아닙니다. 질문에 맞는 전문가 몇 명만 참여시키는 방식에 가깝습니다.
이 구조의 장점은 전체 파라미터 수와 실제 연산량을 분리할 수 있다는 점입니다. Qwen3.8-2.4T-A95B는 2.4조 개의 파라미터를 갖고 있어도 토큰마다 전체 파라미터를 모두 계산하지 않습니다.
그렇다고 950억 파라미터의 일반 모델과 운영 조건이 완전히 같아지는 것은 아닙니다. 전문가 가중치 전체를 저장해야 하고, 여러 GPU에 분산된 전문가 사이에서 데이터를 주고받는 통신 과정도 필요합니다.
따라서 MoE 모델은 단순한 연산 성능만으로 효율이 결정되지 않습니다. GPU 메모리 용량, 메모리 대역폭, GPU 간 연결 속도, 라우팅 최적화가 함께 맞아야 장점을 제대로 살릴 수 있습니다.
엔비디아 GB300에서 추론 성능이 달라지는 이유
엔비디아 GB300과 같은 차세대 AI 시스템이 중요한 이유는 단순히 GPU가 더 빠르기 때문만은 아닙니다. 초대형 모델을 여러 GPU에 배치하고 지속적으로 데이터를 이동시키는 환경에서는 메모리와 네트워크 구성이 전체 성능을 좌우합니다.
Qwen3.8처럼 규모가 큰 MoE 모델은 가중치를 어느 GPU에 배치할지, 토큰을 어떤 전문가에게 보낼지에 따라 처리량이 크게 달라질 수 있습니다. GPU 계산 장치가 쉬는 시간이 늘어나면 높은 이론 성능을 갖춘 장비도 충분히 활용하기 어렵습니다.
GB300 NVL72는 72개의 NVIDIA Blackwell Ultra GPU를 하나의 랙 규모 플랫폼으로 구성하며, NVIDIA 발표 기준 72-GPU NVLink 도메인은 초당 130TB의 통신 대역폭을 제공합니다. NVIDIA가 공개한 FP8 Day-0 측정에서는 GPU당 초당 4천 토큰 이상, 사용자당 초당 350토큰 이상을 기록했습니다.
다만 GB300을 사용하면 무조건 토큰당 비용이 내려간다고 단정할 수는 없습니다. 장비 가격과 전력 소비가 높아도 처리량이 더 큰 폭으로 증가하면 비용이 낮아질 수 있고, 반대로 사용률이 낮으면 비싼 시스템을 놀리는 결과가 될 수 있습니다.
AI 모델 추론 비용은 무엇으로 결정될까
AI 모델 추론 비용을 비교할 때는 GPU 한 대의 가격보다 실제 서비스 지표를 봐야 합니다. 대표적인 기준은 초당 생성 토큰 수, 첫 토큰이 나올 때까지 걸리는 시간, 요청당 지연시간, GPU 사용률입니다.
정밀도도 중요한 변수입니다. BF16, FP8, FP4처럼 더 낮은 정밀도를 적용하면 메모리 사용량과 연산 부담을 줄일 수 있지만, 모델 품질과 안정성이 유지되는지 별도로 검증해야 합니다.
배치 크기가 커지면 한 번에 많은 요청을 처리해 GPU 활용률을 높일 수 있습니다. 반면 실시간 챗봇처럼 응답 속도가 중요한 서비스에서는 배치를 무작정 키우기 어렵습니다.
입력 문맥의 길이와 출력 토큰 수도 비용에 직접 영향을 줍니다. 같은 Qwen3.8을 사용하더라도 짧은 질의응답과 장문 문서 분석은 필요한 메모리와 처리 시간이 전혀 다릅니다.
결국 비교해야 할 값은 장비의 최고 성능이 아니라 목표 품질을 충족한 유효 토큰 100만 개당 총비용입니다. 여기에는 서버 임대료, 전력, 네트워크, 운영 인력과 평균 GPU 사용률까지 포함해야 합니다.
오픈웨이트 AI 시장에 미칠 영향
Qwen3.8의 등장은 오픈웨이트 AI가 소형 모델 중심이라는 인식을 바꿀 수 있습니다. 조직이 모델 가중치를 직접 배포하고 최적화할 수 있다면 데이터 통제, 내부 시스템 연동, 산업별 미세조정 측면에서 선택지가 넓어집니다.
반면 2.4조 파라미터급 모델은 가중치가 공개됐다고 해서 누구나 간단히 운영할 수 있는 규모는 아닙니다. 저장 공간과 GPU 클러스터는 물론, 분산 추론과 MoE 라우팅을 다룰 엔지니어링 역량도 필요합니다.
현실적인 도입 방식은 모델 전체를 바로 구축하는 것보다 실제 업무 데이터로 품질을 먼저 평가하는 것입니다. NVIDIA 공식 기술 글은 SGLang·vLLM·NVIDIA Dynamo, 모델 프리 NVIDIA NIM, NeMo AutoModel을 배포·후속 학습 경로로 제시합니다. 이후 필요한 응답 속도와 동시 사용자 수를 정하고, 같은 정밀도와 문맥 길이 조건에서 비용을 계산해야 합니다.
결국 중요한 것은 실측 데이터입니다
Qwen3.8-2.4T-A95B는 알리바바 AI가 초대형 모델의 용량과 추론 효율을 함께 끌어올리려는 흐름을 보여주는 사례입니다. 엔비디아 GB300은 이런 모델을 운영할 때 발생하는 메모리와 GPU 간 통신 문제를 완화할 수 있지만, 최종 경제성은 실제 워크로드에서 결정됩니다.
공개된 최고 성능 수치만 비교하기보다 같은 정밀도, 문맥 길이, 배치 크기와 품질 조건에서 테스트해야 합니다. 그래야 Qwen3.8이 기존 모델보다 빠른지, 그리고 토큰당 비용까지 낮아지는지를 정확히 판단할 수 있습니다.
한 줄 요약: Qwen3.8의 2.4조 파라미터와 GB300의 조합은 강력하지만, 진짜 경쟁력은 MoE 최적화 이후의 실측 추론 비용으로 확인해야 합니다.
참고 출처
NVIDIA Developer 공식 글의 2026년 8월 12일 공개 내용과 Google News RSS의 NVIDIA Developer 출처명·정확 제목·발행일을 교차 확인했습니다. 성능 수치는 NVIDIA가 공개한 GB300 NVL72·FP8·Day-0 조건입니다.
