Generative AI

NVIDIA Nemotron 3.5 Lightning, 장기 실행 에이전트를 위한 빠르고 정확한 특화 작업 실행 제공

Reading Time: 5 minutes

장기 실행 AI 에이전트는 대부분의 시간을 툴 호출, 결과 검증, 서브 에이전트 작업 위임과 같은 고빈도 실행 단계에 소모합니다. 모든 연산 과정에 프론티어 추론 모델을 사용하면 비용과 지연 시간이 대폭 증가합니다.

NVIDIA Nemotron 3.5 Lightning은 총 300억 개(30B)의 파라미터 중 토큰당 30억 개(3B)를 가동하는 오픈 혼합 전문가(MoE) 모델로, 상시 작동하는 에이전트의 실행 레이어를 처리하도록 설계되었습니다. OpenClaw 및 Hermes Agent 등의 하네스에 맞춰 제작되었으며, 오픈소스 보안 및 관리 스택인 NVIDIA NemoClaw 환경에서 동작을 지원합니다.

NVIDIA Nemotron 오픈 모델 제품군은 소프트웨어 라이브러리와 유사하게 버전이 업데이트될 때마다 정확도와 속도가 지속해서 향상됩니다. 이러한 모델의 발전과 더불어 모델 라우팅 및 오케스트레이션 기술도 신속하게 고도화되고 있습니다.

개발자들이 여러 모델을 결합하는 ‘모델 시스템(System of Models)‘ 방식을 애플리케이션에 적극 채택하는 이유가 여기에 있습니다. 전체적인 오케스트레이션과 복잡한 계획 수립은 Nemotron 3 Ultra와 같은 프론티어 추론 모델이 담당하고, 고빈도 실행 레이어는 더 작고 효율적인 모델에 위임하여 처리합니다.

본 글에서는 NVIDIA Nemotron 3.5 Lightning을 소개하고, 소형 MoE 구조가 자율 에이전트의 대용량·저지연 실행에 최적화된 방식을 설명합니다. 또한 이를 뒷받침하는 추론 및 학습 혁신 기술과 함께 각 작업을 적합한 모델로 라우팅하는 라이브러리인 NVIDIA NeMo Switchyard를 함께 살펴봅니다.

Nemotron 3.5 Lightning이 장기 실행 AI 에이전트에 이상적인 이유

Nemotron 3.5 Lightning은 30억 개의 활성 파라미터를 갖춘 커스터마이징 가능한 오픈 30B MoE 모델로, 자율 에이전트에 최적화된 고용량 실행을 제공합니다. MoE 모델은 라우터가 각 토큰을 소수의 전문가에게만 전달하여 토큰당 전체 파라미터 중 일부만 실행하므로 빠르고 효율적입니다. 이를 통해 소형 모델의 연산 비용으로 대형 밀집(dense) 모델의 용량을 제공합니다.

Nemotron 3.5 Lightning은 Nemotron 3 모델 패밀리 중 가장 소형이며, 다음을 포함해 패밀리 전반에서 검증된 많은 기법을 탑재하고 있습니다.

  • 투기적 디코딩(Speculative Decoding): Nemotron 3.5 Lightning 학습(Nemotron 3 Super 및 Ultra와 동일)에 다중 토큰 예측(MTP)이 포함되었습니다. 또한 DFlash와 DSpark를 탑재해 다양한 서빙 시나리오에 걸쳐 더욱 포괄적인 추론 최적화를 가능하게 합니다.
  • 하네스 최적화 학습: 인기 에이전트 하네스에 맞게 모델을 학습하여, 에이전트가 더 정확한 호출을 수행하면서 고용량 작업의 지연 시간을 줄입니다.

그 결과는 실행 중심의 고호출량과 저지연을 위해 구축된 모델로, NVIDIA DGX Spark부터 데이터 센터까지 어디서든 배포할 수 있는 크기입니다.

동영상 1. DGX Spark에서 NVIDIA Nemotron 3.5 Lightning을 배포하고 빠른 고용량 에이전틱 워크로드에 활용하는 방법

즉시 사용 가능한 Nemotron 3.5 Lightning 커스터마이징

모델은 특화 AI 에이전트 시스템에서 작업에 맞게 적응될 때 진가를 발휘합니다. 그리고 Lightning급 모델은 매우 높은 커스터마이징 가능성을 가집니다. 소형 모델은 대형 모델보다 훨씬 빠르고 저렴하며, 훨씬 더 소박한 하드웨어에서 파인튜닝됩니다.

워크로드에 맞게 Nemotron 3.5 Lightning을 즉시 커스터마이징할 수 있습니다. 모든 Nemotron 오픈 모델 출시와 마찬가지로, 가중치, 학습 데이터, 레시피는 OpenMDW-1.1 하에서 최대한 허용적으로 공개됩니다.

이번 릴리스에는 코딩 에이전트 역량 일부를 학습하는 데 사용된 오픈 에이전틱 강화 학습 데이터셋인 Nemotron-RL Agentic Terminal Pivot도 포함됩니다.

NeMo Switchyard로 적합한 모델에 작업 라우팅

프론티어 모델이 헤드라인을 장식할 수 있지만, Nemotron 3.5 Lightning 같은 모델은 현장에서 진가를 발휘합니다. git pull 같은 요청 처리, 툴 출력 검증, 결과 포맷 지정, 그리고 모든 장기 실행 에이전트의 토큰 예산을 지배하는 루틴 호출 실행을 담당합니다.

모델 라우팅과 오케스트레이션은 이러한 역할 분담을 더 쉽게 구현할 수 있게 합니다. 현재 NVIDIA NeMo Switchyard를 통해 사용할 수 있습니다. Switchyard는 Nemotron 3.5 Lightning을 오픈 모델과 클로즈드 모델과 나란히 라우팅 타깃으로 노출할 수 있어, 모든 요청이 처리할 수 있는 가장 유능하고 효율적인 모델로 전달됩니다. 계획 수립은 프론티어로, 실행은 Lightning으로 라우팅하여 토큰이 효율적이고 효과적으로 사용되도록 보장합니다.

Nemotron 3.5 Lightning의 정확도-속도 파레토 프론티어 성능

Nemotron 3.5 Lightning은 동급 최고의 출력 속도에서 선두 정확도를 제공하며, Artificial Analysis Intelligence Index의 정확도-속도 파레토 프론티어를 선도합니다. 이 인덱스는 9가지 평가를 결합하여 에이전틱 작업, 코딩, 과학적 추론, 일반 지능 전반에 걸쳐 모델 성능을 측정합니다.

Nemotron 3.5 Lightning은 뛰어난 지능과 유사한 크기 모델 대비 최대 4배의 출력 속도를 결합하여, 고용량 에이전트 워크로드의 정확도-속도 파레토 프론티어에 위치합니다.

에이전트 효율성은 궁극적으로 단순한 토큰 생성 속도가 아닌, 모델이 유용한 작업을 얼마나 빠르게 완료하는지에 달려 있습니다. PinchBench에서 Nemotron 3.5 Lightning은 유사한 정확도의 Qwen3.6 35B보다 10,000개 작업을 30% 빠르게 완료하면서 86% 정확도를 달성합니다.

더 높은 추론 처리량과 토큰 효율성은 Nemotron 3.5 Lightning을 효율성 프론티어에 위치시켜, 상시 작동 에이전트가 고용량 작업을 더 빠르게 완료할 수 있도록 지원합니다.

Nemotron 3.5 Lightning이 정확도를 저하하지 않고 속도를 제공하는 방법

Nemotron 3.5 Lightning은 투기적 디코딩과 양자화를 통해 정확도를 저하하지 않고 속도와 커스터마이징을 제공합니다.

투기적 디코딩

Nemotron 3.5 Lightning은 빠른 토큰 생성에 최적화되었으며, 투기적 디코딩을 통해 여러 토큰을 동시에 생성하는 능력을 갖추고 있습니다. 이는 모델(또는 드래프트 모델)이 일정 수의 토큰을 초안으로 생성하면 이를 효율적으로 검토하는 프로세스입니다. Nemotron 3.5 Lightning은 Nemotron 3 Super 및 Ultra와 마찬가지로 전용 사전 학습 단계를 통해 다중 토큰 예측(MTP)을 모델에 내재화했습니다. 학습 후에는 전용 MTP 향상 단계를 통해 MTP 정확도를 더욱 개선했습니다.

MTP 외에도 Nemotron 3.5 Lightning과 함께 두 가지 드래프트 모델이 제공됩니다. DSpark는 DGX Spark 추론 워크로드와 저동시성 데이터 센터 워크로드에 권장됩니다. MTP는 중간에서 높은 동시성에 가장 적합하며, 최적 드래프트 길이는 동시성이 증가함에 따라 감소합니다. NVIDIA는 또한 DFlash 드래프트 모델도 출시하며, 이는 다른 모델과 비교 측정하여 워크로드에 가장 적합한 것을 선택할 수 있습니다.

양자화

Nemotron 3.5 Lightning은 BF16과 함께 NVFP4 체크포인트를 제공하며, NVIDIA Blackwell, NVIDIA Hopper, NVIDIA Ampere GPU 전반에서 Nemotron 3 Ultra를 구동하는 동일한 특화 NVFP4 커널을 사용합니다. 동일한 파일이 데이터 센터에서와 마찬가지로 데스크톱 DGX Spark에서도 동일하게 작동합니다.

Nemotron 3.5 Lightning이 로컬 AI에 이상적인 이유

Nemotron 3.5 Lightning은 NVIDIA Jetson, GeForce RTX 5090, DGX Spark를 포함한 로컬 시스템에서 강력한 에이전틱 AI를 이용 가능하게 합니다.

NVIDIA는 EXO Labs를 포함한 여러 팀과 협력하여 DGX Spark에서 이 모델의 성능을 파악했습니다.

또한 LM Studio, llama.cpp, Ollama, Unsloth 등 업계 표준 툴 전반에서 Nemotron 3.5 Lightning을 실행할 수 있습니다.

파트너 생태계

Nemotron 3.5 Lightning은 하네스, 커스터마이징, 배포, 추론 분야의 성장하는 파트너 생태계의 지원을 받고 있습니다.

Nemotron 3.5 Lightning으로 개발 시작하기

Nemotron 3.5 Lightning은 가중치, 데이터, 레시피 모두 완전한 오픈 소스로, 워크플로에 맞게 적응하고 어디서든 배포할 수 있습니다. 시작하려면 build.nvidia.com 또는 OpenRouter에서 사용해 보십시오. Hugging FaceModelScope에서 가중치를 다운로드하실 수 있습니다.

NVIDIA 뉴스 구독 및 LinkedIn, X, Discord, YouTube에서 NVIDIA AI를 팔로우하여 NVIDIA Nemotron의 최신 소식을 받아보세요.

Nemotron 개발자 페이지를 방문해 시작에 필요한 리소스를 살펴보십시오. Hugging Face, ModelScope에서 오픈 Nemotron 모델 및 데이터셋을, build.nvidia.com에서 블루프린트(Blueprints)를 탐색하세요.

Nemotron 라이브스트림, 튜토리얼, NVIDIA 포럼Discord 개발자 커뮤니티에 참여해 보세요.

Discuss (0)

Tags