AI 에이전트 모델 라우팅
실행은 Lightning, 복잡한 판단은 알맞은 모델로 보냅니다
NVIDIA가 300억 매개변수 MoE 오픈 모델 Nemotron 3.5 Lightning과 오픈소스 라우팅 라이브러리 NeMo Switchyard를 함께 공개했습니다.
이 글에서 다룰 내용
Nemotron 3.5 Lightning의 공식 사양, NeMo Switchyard의 라우팅 구조, 비용·품질 트레이드오프, 실무 설계 기준
AI 에이전트가 비싼 진짜 이유
AI 에이전트는 한 번 질문하고 한 번 답변받는 일반적인 챗봇과 작동 방식이 다릅니다. 사용자의 요청을 이해하고, 계획을 세우고, 도구를 호출하고, 결과를 검토하는 과정에서 여러 차례 모델을 사용합니다.
겉으로는 단순한 업무처럼 보여도 내부에서는 수십 번의 추론이 일어날 수 있습니다. 모든 단계를 크고 비싼 모델에 맡기면 정확도는 높아질 수 있지만, 처리 시간과 API 비용도 함께 증가합니다.
예를 들어 문서 분류, 검색어 생성, 형식 변환처럼 비교적 쉬운 작업까지 최고 성능 모델이 담당할 필요는 없습니다. 반대로 복잡한 코딩이나 다단계 판단은 작은 모델만으로 처리하기 어렵습니다.
결국 중요한 것은 가장 강력한 모델 하나가 아니라 업무마다 적절한 모델을 배치하는 구조입니다. 엔비디아가 NVIDIA Nemotron 3.5 Lightning과 NeMo Switchyard를 함께 주목하게 만든 이유도 여기에 있습니다.
이 글에서 다룰 내용
NVIDIA Nemotron 3.5 Lightning의 의미, NeMo Switchyard의 역할, 모델 라우팅이 비용을 줄이는 방식, 로컬 AI와 클라우드 모델의 조합 방법
NVIDIA Nemotron 3.5 Lightning이 겨냥한 자리
NVIDIA 공식 기술 글에 따르면 Nemotron 3.5 Lightning은 총 300억 매개변수 중 토큰당 30억 매개변수를 활성화하는 MoE 오픈 모델입니다. 장시간 실행되는 AI 에이전트의 도구 호출, 결과 검증, 하위 에이전트 위임처럼 반복량이 많은 실행 계층을 겨냥합니다.
가중치·학습 데이터·레시피는 OpenMDW-1.1 아래 공개되며 BF16과 NVFP4 체크포인트가 제공됩니다. NVIDIA는 DGX Spark부터 데이터센터까지 배포할 수 있고, Jetson·GeForce RTX 5090·DGX Spark 같은 로컬 시스템도 지원한다고 밝혔습니다.
공식 글은 LM Studio, llama.cpp, Ollama, Unsloth 등에서의 실행 경로도 안내합니다. 다만 로컬 실행 가능성이 곧바로 비용 절감이나 보안 준수를 보장하는 것은 아니며, 하드웨어·권한·데이터 정책을 별도로 검증해야 합니다.
성능 수치도 조건을 붙여 봐야 합니다. NVIDIA 발표 기준으로 비슷한 크기 모델보다 출력 속도가 최대 4배 빠르며, PinchBench에서는 유사 정확도 조건의 Qwen3.6 35B보다 1만 개 작업을 30% 빠르게 완료했습니다. 이는 특정 평가와 시스템 조건의 결과이며 모든 업무에 일반화할 수 없습니다.
NeMo Switchyard가 하는 일
NeMo Switchyard는 여러 모델 가운데 현재 요청에 적합한 모델을 선택하도록 돕는 오픈소스 모델 라우팅 라이브러리입니다. 요청과 사용 가능한 맥락을 평가해 개발자가 구성한 오픈·상용 모델 풀 가운데 작업 요구, 제약, 정책에 맞는 대상을 고릅니다.
공식 기술 글은 LLM 분류기, 작업 단계 라우터, 에스컬레이션 라우터와 학습 가능한 프리필 라우터를 설명합니다. 계획과 고난도 판단은 상위 모델에, 반복 실행은 Nemotron 3.5 Lightning 같은 효율 모델에 맡기는 구성이 대표적입니다.
Switchyard는 OpenAI·Anthropic·Responses API 요청을 받을 수 있는 참조 서버도 제공하며 선택 모델, 판단 근거, 토큰 사용량, 지연 시간, 호출 결과를 기록합니다. 제공사나 모델을 바꿔도 라우팅 로직을 분리하기 위한 구조입니다.
비용 효과는 품질과 함께 읽어야 합니다. NVIDIA가 공개한 LangChain 평가에서는 Nemotron 3.5 Lightning과 Claude Opus 4.8을 에스컬레이션 라우터로 연결해 프런티어 모델 호출을 7%로 줄이고 비용을 74% 낮췄지만, 정확도는 약 6포인트 낮아졌습니다.
비용 구조는 어떻게 달라질까
기존에는 AI 서비스 비용을 모델의 입력·출력 토큰 단가로 계산하는 경우가 많았습니다. 하지만 AI 에이전트 환경에서는 호출 횟수, 도구 실행, 재시도, 검증 단계까지 포함한 업무 완료당 총비용이 더 중요한 지표가 됩니다.
NVIDIA Nemotron 3.5 Lightning을 반복적인 기본 작업에 활용하고, NeMo Switchyard를 통해 고난도 요청만 상위 모델로 보내면 평균 처리 비용을 낮출 여지가 생깁니다. 다만 실제 절감률은 라우팅 정책, 모델 가격, 오류 재시도, 목표 품질에 따라 달라집니다.
여기에 로컬 AI를 결합하면 비용 계산 방식이 한 번 더 달라집니다. API 호출량에 따라 지불하는 대신 GPU 운영비, 전력, 유지보수, 모델 관리 비용을 함께 비교해야 합니다.
요청량이 적다면 클라우드 API가 더 경제적일 수 있습니다. 반면 반복 업무가 많고 처리량이 일정하다면 자체 배포한 오픈 모델이 장기적으로 유리할 가능성이 있습니다.
실무에서는 이렇게 설계해야 합니다
첫 단계는 업무를 난도별로 나누는 것입니다. 분류, 요약, 정보 추출 같은 작업과 복잡한 추론, 최종 검수, 위험 판단을 같은 모델에 맡기지 않는 편이 좋습니다.
두 번째는 품질 기준을 수치화하는 것입니다. 정확도뿐 아니라 응답 시간, 재시도율, 사람의 수정 비율, 작업 완료율을 함께 기록해야 모델 라우팅 효과를 제대로 판단할 수 있습니다.
세 번째는 실패 경로를 준비하는 것입니다. 작은 모델이 확신하지 못하거나 결과 형식을 지키지 못하면 더 강한 모델로 자동 전환하고, 보안이 중요한 데이터는 로컬 AI 경로 안에서만 처리하도록 제한할 수 있습니다.
이러한 구조가 완성되면 에이전트 비용 최적화는 모델 교체가 아니라 운영 설계의 문제가 됩니다. 가장 저렴한 모델을 찾는 것이 아니라 목표 품질을 만족하면서 전체 작업 비용을 최소화하는 조합을 찾아야 합니다.
결국 중요한 것은 모델보다 배치 전략입니다
NVIDIA Nemotron 3.5 Lightning은 빠르고 효율적인 실행 모델의 선택지를 넓혀 줍니다. NeMo Switchyard는 여러 모델을 업무 특성에 따라 연결해 하나의 에이전트 시스템처럼 운영할 수 있게 돕습니다.
앞으로 AI 에이전트 경쟁력은 가장 큰 모델을 보유했는지가 아니라, 오픈 모델과 상용 모델, 로컬 AI와 클라우드를 얼마나 영리하게 조합했는지에 따라 달라질 가능성이 큽니다. 모델 라우팅을 중심에 둔 설계가 중요한 이유입니다.
한 줄 요약: AI 에이전트의 비용을 바꾸는 핵심은 더 싼 모델 하나가 아니라, 작업마다 알맞은 모델을 선택하는 지능형 라우팅입니다.
