Data Center / Cloud

NVIDIA Vera Rubin·Blackwell, 와트당 에이전틱 AI 성능의 새로운 기준을 제시하다

NVIDIA Vera Rubin과 Blackwell은 실제 에이전틱 AI 워크로드에서 동일한 전력으로 더 높은 처리량과 비용 효율성을 구현하며 AI 팩토리의 에이전틱 추론 성능을 한 단계 끌어올립니다.

Reading Time: 6 minutes

AI 에이전트는 추론을 단일 턴 상호작용에서 여러 단계에 걸친 추론, 도구 호출, 하위 에이전트 조정, 턴 사이 다량의 컨텍스트 연결 등 다단계 워크플로우로 발전했습니다. 이러한 변화의 규모는 실제 소비량에서도 뚜렷하게 나타나는데요. 오픈라우터(OpenRouter)의 State of AI 보고서가 실제 사용 데이터 100조 토큰을 분석한 결과, 요청당 평균 프롬프트 토큰 수가 약 4배 증가했으며, 단일 에이전트 요청이 일반 채팅에 비해 15배 더 많은 토큰을 소비하는 것으로 나타났습니다.

이러한 워크로드에서 하드웨어 성능을 정확하게 평가하는 것은 새로운 과제를 제시합니다. 유용한 벤치마크는 현실적인 동시성 조건 하에서 긴 컨텍스트 프리필(prefill), KV 캐시 재사용, 인터랙티브 디코딩, 툴 호출 간격, 분산형 전문가 혼합(mixture of experts, MoE) 실행을 모두 반영해야 하죠. 또한 적절한 사용자 경험을 유지하면서 AI 팩토리의 전력 예산 중 얼마나 많은 부분이 유용한 에이전트 처리량으로 전환되는지도 보여줘야 합니다.

본 자료에서는 실제 운영 환경과 유사한 세션을 재현해 에이전틱 코딩 추론을 위한 AI 인프라를 평가하는 벤치마크인 세미애널리시스 에이전트X를 다룹니다. Vera Rubin NVL72의 프리뷰 결과에서는 GB300 NVL72 대비 메가와트당 AI 팩토리 처리량이 최대 30배 높은 성능을 보였습니다. 또한 Blackwell GB300 NVL72는 이전 세대 대비 메가와트당 처리량에서 압도적인 성능 우위를 동적 에이전틱 워크로드에서도 이어가는 것으로 나타났습니다.

에이전트X란 무엇인가?

에이전트X는 세미애널리시스의 오픈소스 벤치마크 모음인 인퍼런스X(InferenceX)에 포함된 에이전틱 코딩 벤치마크인데요. 이 벤치마크는 실제 코딩 에이전트가 생성하는 요청 패턴에 대해 가속기가 얼마나 효율적으로 대응하는지 측정합니다.

에이전트X 테스트 및 측정 방법론

에이전틱 세션은 길고, 상태를 유지하며, 가변적입니다. 아래 그림 1과 같이 고정된 프롬프트-응답 패턴을 따르는 대신 모델 호출과 도구 사용을 연속적으로 수행하고, 컨텍스트를 지속적으로 확장합니다. 따라서 에이전트X는 플랫폼이 재현된 에이전트 트래픽을 신속하게 처리하고, 이전에 처리된 컨텍스트를 재사용하며, 설비 전력 기준 메가와트당 에이전트 처리량을 극대화할 수 있는지를 측정합니다.

아래 그림 2는 딥시크-R1-0528(DeepSeek-R1-0528)을 대상으로 기존 인퍼런스X의 정적 8K/1K 시퀀스 길이에서 측정한 결과를 보여줍니다. GB300 NVL72는 H200 대비 메가와트당 토큰 처리량이 최대 40배 높은데요. 그러나 이 시나리오는 실제 운영 환경에서 에이전트가 생성하는 트래픽이 아닌, 통제된 고정 길이의 서빙 환경을 나타냅니다.

실제 에이전트 세션에서는 요청 길이가 턴마다 달라집니다. 작업이 진행되는 동안 컨텍스트가 누적되고, 이전에 처리된 토큰을 재사용할 수 있으며, 모델 호출은 도구 실행이나 위임된 작업으로 인해 중단되기도 하죠.

에이전틱 AI가 주요 워크로드로 자리 잡으면서 고정된 시퀀스 길이 시나리오는 실제 서빙 성능을 충분히 반영하기 어려웠으며, 이에 따라 인퍼런스X 제품군에서는 유지 관리 모드(maintenance mode)로 전환됐습니다.

에이전트X는 추론과 도구 사용이 교차하는 사전 녹화된 클로드 코드(Claude Code) 세션 전반의 서빙 성능을 측정함으로써 이러한 격차를 해소합니다. 에이전트X는 AIPerf 클라이언트를 사용해 각 세션을 턴 단위로 재현하죠. 모든 시스템에 동일하게 기록된 트래픽이 적용되므로, 측정된 성능 차이는 벤치마크에 특화된 튜닝이 아닌 서빙 스택 자체의 차이를 반영합니다. 아래 그림 3은 사전 녹화된 세션의 예시를 보여줍니다.

리플레이는 각 세션의 컨텍스트와 입출력 시퀀스 길이는 물론, 원래의 실행 과정에서 기록된 추론 시간과 도구 호출 지연 시간도 그대로 유지합니다. 이러한 시간 간격을 보존함으로써 원래 세션의 타이밍을 재현하며, 실제 환경을 반영하는 벤치마크에서 반드시 고려해야 하는 KV 캐시 용량에 대한 부하를 재현합니다.

에이전트X는 동시 실행 수준을 조정해 처리량과 인터랙티브 성능 간의 상충 관계를 측정합니다. 각 운영 지점에서 할당된 메가와트당 지속 처리량과 함께 각 스택이 반복되는 컨텍스트를 재사용하는 능력을 측정해 보고하죠.

에이전트X 결과 해석 방법

AI 팩토리에서 가장 중요한 에이전트X 지표는 메가와트당 토큰 수입니다. 이 벤치마크는 해당 지표를 E2E 정규화 인터랙티브 성능(E2E normalized interactivity), 표준 인터랙티브 성능(standard interactivity), E2E 지연 시간(E2E latency), 첫 토큰 생성 시간(time to first token, TTFT) 등 네 가지 사용자 경험 지표와 함께 제시합니다.

지표정의활용
E2E 정규화 인터랙티브 성능전체 요청에 대한 사용자당 평균 출력 토큰 속도. 총 출력 토큰 수를 요청 제출부터 최종 토큰 전달까지 걸린 시간으로 나눠 계산합니다.첫 토큰 생성 시간을 포함한 엔드투엔드 경험을 기준으로 플랫폼이 메가와트당 얼마나 많은 사용자 가시적 출력을 제공하는지 보여줍니다. 높을수록 좋습니다.
표준 인터랙티브 성능생성 단계에서의 사용자당 토큰 속도. 출력 토큰 수를 첫 번째 토큰부터 마지막 토큰까지 걸린 시간으로 나눠 계산합니다.첫 토큰 생성 시간을 제외하고, 생성이 시작된 후 플랫폼이 메가와트당 얼마나 많은 스트리밍 출력을 제공하는지 보여줍니다. 높을수록 좋습니다.
E2E 지연 시간단일 요청에 소요되는 총 시간. 요청 제출부터 최종 출력 토큰이 도착할 때까지 측정합니다.메가와트당 처리량 결과가 실제로 활용 가능한지를 평가합니다. 효율성이 높더라도 요청 완료에 지나치게 오래 걸린다면 의미가 없습니다. 낮을수록 좋습니다.
첫 토큰 생성 시간요청 제출부터 첫 번째 출력 토큰이 도착할 때까지 걸린 시간.전력 효율적인 처리량과 빠른 최초 응답이 함께 제공되는지를 보여줍니다. 에이전트가 긴 컨텍스트 턴을 반복적으로 시작하는 환경에서 특히 중요합니다. 낮을수록 좋습니다.

표 1. 에이전트X 주요 성능 지표

NVIDIA Vera Rubin NVL72 결과

다음 Vera Rubin NVL72 결과는 NVIDIA가 세미애널리시스 에이전트X 워크로드를 사용해 측정한 것으로, 현재 세미애널리시스의 검토 대기 중입니다. 아래 그림 4와 같이 에이전트X 딥시크 V4-프로(DeepSeek V4-Pro) 워크로드에서 사용자당 초당 160토큰을 기준으로 Vera Rubin NVL72는 GB300 NVL72 대비 메가와트당 AI 팩토리 처리량을 최대 30배 높입니다. 이는 동일한 응답성 수준을 유지하면서 에이전틱 추론 용량을 크게 향상시킬 수 있음을 보여줍니다.

NVIDIA Vera Rubin NVL72가 메가와트당 최대 성능을 제공하도록 어떻게 설계됐는지 자세히 알아보려면 NVIDIA Rubin GPU 아키텍처 살펴보기: 에이전틱 AI 시대를 위한 동력(Inside NVIDIA Rubin GPU Architecture: Powering the Era of Agentic AI)을 참조하면 됩니다.

NVIDIA GB300 NVL72 결과

에이전트X 워크로드에서 딥시크 V4 프로 1.6T(DeepSeek V4 Pro 1.6T)를 실행한 결과, GB300 NVL72는 H200 NVL8 대비 메가와트당 AI 팩토리 처리량을 최대 15배 높입니다. 즉, GB300 NVL72는 동일한 전력 예산 내에서 훨씬 더 높은 응답성을 유지하면서 더 많은 에이전틱 추론 처리량을 제공합니다.

이러한 처리량 우위는 단위 경제성으로 직결됩니다. GB300 NVL72는 H200 NVL8 대비 100만 토큰당 비용을 최대 10분의 1 수준으로 낮춥니다. 운영자 입장에서는 동일한 전력 및 인프라 예산으로 훨씬 더 많은 인터랙티브 에이전틱 AI 용량을 지원하거나, 동일한 용량을 훨씬 낮은 운영 비용으로 제공할 수 있음을 의미하죠.

모델 규모가 커질수록 GB300 NVL72의 이점은 더욱 두드러지는데요. 아래 그림 7은 에이전트X 워크로드에서 키미 K3 2.8T(Kimi K3 2.8T)의 메가와트당 처리량을 보여줍니다. 비슷한 수준의 인터랙티브 성능에서 GB300 NVL72는 H200 NVL8 대비 메가와트당 약 80배 높은 처리량을 제공합니다. 또한 사용자당 인터랙티브 성능을 초당 약 215토큰까지 확장해 H200 NVL8이 도달한 운영 범위를 크게 넘어섭니다.

이러한 GB300 NVL72 결과는 서빙 런타임, 모델 커널, 스케일업 패브릭 전반에 걸친 시스템 수준의 최적화를 반영합니다. 이러한 요소들이 함께 작동해 에이전트 세션에서 컨텍스트가 누적되고 동시 실행이 증가하며 디코딩 수요가 높아지는 상황에서도 대규모 MoE 모델이 높은 응답성을 유지하면서 처리량을 지속적으로 제공할 수 있도록 지원합니다.

  • MoE 서빙 런타임: SGLang, 텐서RT-LLM(TensorRT-LLM), vLLM 등의 프레임워크는 NVL72 도메인 전반에 전문가 실행을 분산할 수 있습니다. 와이드 엑스퍼트 패러렐리즘(Wide Expert Parallelism)과 DeepEP 등의 기술은 더 많은 GPU에 전문가 워크로드를 균형 있게 분산해 동시 에이전트 요청에 활용할 수 있는 유효 배치 크기를 늘립니다.
  • MoE 커널 및 통신 오버랩: DeepGEMM 기반 커널, MXFP4와 MXFP8 등의 혼합 정밀도 형식, 융합 MoE 실행 경로는 전문가 단계 간 데이터 이동에 소요되는 시간을 줄입니다. 전문가 병렬 통신과 텐서 코어(Tensor Core) 연산을 중첩함으로써 서빙 스택은 추론 및 코딩 워크로드의 토큰 처리량을 향상시킬 수 있습니다.
  • NVIDIA Dynamo: Dynamo는 프리필(prefill)과 디코드(decode)를 독립적으로 확장 가능한 워커 풀로 분리해 각 단계를 개별적인 성능 요구사항에 맞게 구성할 수 있도록 합니다. 또한 관련 모델 호출, 도구 실행 구간, 트레이스를 에이전트 실행 전반에서 연계하는 세션 ID를 통해 세션 인식형 서빙(session-aware serving)을 지원합니다. 이와 별도로 KV 캐시 인식 라우터는 캐시 중복도와 워커 부하를 기반으로 처리 대상을 선택해 불필요한 프리필 연산을 줄이고, 에이전트 세션에서 컨텍스트를 재사용할 때에도 멀티턴 서빙의 높은 응답성을 유지하도록 지원합니다.
  • NVIDIA NVLink 스케일업 패브릭: NVLink는 GB300 NVL72의 72개 GPU를 고대역폭 스케일업 도메인으로 연결합니다. 이를 통해 대규모 모델을 하나의 통합된 랙 스케일 시스템으로 서빙하는 데 필요한 컴퓨팅, 메모리, 전문가 병렬 통신, KV 캐시 이동을 지원합니다.

에이전틱 AI의 다음 단계

Vera Rubin NVL72는 랙 스케일 시스템을 에이전틱 추론의 긴 컨텍스트, 인터랙티브, 분산 실행 패턴에 맞게 최적화했을 때 구현할 수 있는 가능성을 보여줍니다. Vera Rubin 플랫폼은 이러한 접근 방식을 전체 워크플로우로 확장합니다. Rubin GPU는 대규모 컨텍스트 처리와 디코딩을 효율적으로 수행하고, Vera CPU는 도구 실행과 KV 캐시 오프로딩을 처리하며, Groq 3 LPX는 초고속 인터랙티브 성능을 구현하죠.

AI 팩토리 전반에서 NVLink 6, ConnectX-9, BlueField-4, Spectrum-X는 리소스 간 토큰, 컨텍스트, 도구 실행 결과의 이동을 지원합니다. 다이나모, 어텐션-FFN 분리(Attention-FFN Disaggregation), NVFP4, 텐서RT-LLM WideEP, 추측 디코딩은 가장 적합한 프로세서 전반에서 실행을 조율합니다. 이를 통해 재연산과 대기 시간을 줄이고, 에이전트 세션이 확장되는 환경에서도 인터랙티브 성능을 유지하며, 동일한 전력 예산으로 더 높은 에이전틱 AI 처리량을 구현할 수 있죠.

이번 결과를 뒷받침하는 기술과 벤치마크에 대한 자세한 내용은 아래 자료에서 확인할 수 있습니다.

Discuss (0)

Tags