단일 AI 모델 학습과 1:1 채팅 인터페이스로 시작했던 AI는 이제 대규모 인텔리전스를 끊임없이 생산해 내는 상시 가동형 AI 팩토리로 진화했습니다. 그리고 오늘날의 AI 팩토리는 단순 응답을 넘어 스스로 추론하고, 계획을 세우며, 툴을 활용하고, 중간 결과를 검증하면서 방대한 컨텍스트 기반의 복잡한 다단계 작업을 수행하는 에이전틱 워크플로우를 처리하고 있습니다.
에이전틱 워크로드는 단 한 번의 프롬프트와 답변으로 끝나지 않으며, 수많은 단계를 거치는 지속적인 추론 과정으로 작동합니다. 따라서 단계별 낮은 지연 시간은 물론, 높은 디코드 처리량, 긴 컨텍스트를 효율적으로 처리하는 어텐션 연산, 대용량 KV 캐시, 그리고 수많은 GPU를 하나의 도메인처럼 긴밀히 연결해 모델을 확장하는 능력이 필수적입니다. 데이터센터 전체가 단 하나의 거대한 컴퓨팅 단위로 재구성되어야 하는 이유이며, 이러한 비전을 현실로 만든 것이 바로 NVIDIA Vera Rubin 플랫폼입니다.
이 플랫폼의 핵심인 NVIDIA Rubin GPU는 이전 세대인 NVIDIA Blackwell 대비 전력 대비 에이전틱 처리량을 최대 10배까지 끌어올리도록 설계되었습니다 (그림 1). 정밀도 유연성이 확장된 향상된 텐서 코어와 새로운 HBM4 메모리 서브시스템, 그리고 최대 50 페타플롭스의 NVFP4 성능을 발휘하는 3세대 트랜스포머 엔진이 유기적으로 결합되어 에이전틱 워크로드를 획기적으로 가속합니다.

이 글에서는 NVIDIA Rubin GPU와 이에 맞춰 통합 설계된 스케일업 시스템이 에이전틱 추론의 전 과정에서 발생하는 병목 현상을 어떻게 해결하는지 살펴봅니다. 데이터 이동과 연산 효율성 문제부터 긴 컨텍스트 실행, 그리고 랙 단위 배포에 이르기까지 구체적인 해결책을 하나씩 짚어봅니다.
Rubin GPU 아키텍처는 에이전틱 워크로드를 어떻게 지원하는가?
Rubin GPU(그림 2)는 고밀도와 효율성을 달성하기 위해 레티클 한계(reticle limited) 컴퓨팅 다이로 구성됩니다. 이 두 다이는 NVIDIA 고대역폭 인터페이스(NV-HBI, NVIDIA High-Bandwidth Interface)라는 고속 다이 간 링크를 통해 단일 패키지 위에 통합됩니다.

이 아키텍처는 에이전틱 워크로드가 추론, 생성, 검색, 도구 사용 사이를 오갈 때 막대한 컴퓨팅 자원을 효율적으로 활용하는 과제에서 출발합니다. 3,360억 개의 트랜지스터, 224개의 스트리밍 멀티프로세서(SM, streaming multiprocessor), 896개의 텐서 코어는 원시 컴퓨팅 밀도를 제공하며, 3세대 트랜스포머 엔진은 수치 포맷에 따라 정밀도를 적응적으로 조정합니다. 이러한 유연성 덕분에 Rubin GPU는 정확도를 유지하면서 최대 50 페타플롭스의 NVFP4 추론 성능을 제공합니다.
그러나 성능은 텐서 코어 처리량만으로 결정되지 않습니다. Rubin GPU는 컴퓨팅 자원을 대형 중앙 L2 캐시를 갖춘 그래픽스 프로세서 클러스터(GPC, Graphics Processor Cluster)로 구성합니다. GigaThread 엔진은 작업을 조율하고, MIG 컨트롤은 여러 워크로드를 위해 GPU를 분할하며, NV-DEC는 디코딩을 가속합니다. 이러한 기능들이 함께 작동하여 대규모 에이전틱 시스템을 정의하는 다양하고 동적인 워크로드 전반에 걸쳐 Rubin GPU가 컴퓨팅 밀도를 지속적인 가동률로 전환할 수 있도록 합니다.
이 가동률은 또한 데이터가 컴퓨팅 코어에 얼마나 빠르게 도달하느냐에 달려 있습니다. Rubin은 전용 HBM 컨트롤러와 12-Hi 스택으로 구동되는 최대 288 GB의 HBM4 메모리를 통합하여 최대 22 TB/s의 최고 대역폭을 제공합니다. 향상된 텐서 메모리 가속기(TMA, Tensor Memory Accelerator)는 복잡한 데이터 레이아웃에 걸쳐 고효율 데이터 이동을 관리하고, NVIDIA NVLink 6는 전방위(all-to-all) GPU 간 통신을 위해 NVLink 스위치에 3,600 GB/s의 스케일업 대역폭을 제공합니다. NVLink-C2C는 일관성 있는 CPU-GPU 통신을 위해 1,800 GB/s를 제공하며, x16 PCIe Gen 6는 최대 256 GB/s의 호스트 연결성을 제공합니다.
마지막으로, 대규모 에이전틱 배포 환경은 데이터가 이 실행 도메인을 통과하는 동안 보안을 유지해야 합니다. TEE-I/O를 탑재한 기밀 컴퓨팅(Confidential Computing)은 AI 팩토리 전반에서 저장 중, 전송 중, 사용 중 데이터를 보호하도록 설계되었습니다. 이처럼 컴퓨팅, 메모리, 연결성, 보안 기능들이 함께 모여, 점점 커지는 모델과 스케일업 도메인에 걸쳐 효율적인 실행을 지속해야 하는 에이전틱 워크로드를 위한 GPU 수준의 기반을 형성합니다.
Rubin GPU는 핵심 추론 경로를 어떻게 가속하는가?
최고 컴퓨팅 성능만으로는 에이전틱 추론을 가속하기에 충분하지 않습니다. 실제 성능은 GPU가 데이터를 얼마나 효율적으로 이동하고, 행렬 연산을 실행하며, 장문 컨텍스트 어텐션을 처리하고, 종속 커널 간에 전환하느냐에 달려 있습니다. 이 섹션에서는 이러한 핵심 실행 경로의 오버헤드를 줄이도록 설계된 Rubin GPU 기능들을 살펴봅니다.
랙 규모 MoE 가중치 및 토큰 이동 가속
혼합 전문가(MoE, Mixture-of-Experts) 모델은 여러 전문가 네트워크에 걸쳐 토큰을 동적으로 라우팅합니다. 전문가 수가 늘어날수록 전문가 가중치를 효율적으로 찾고 이동하는 것이 추론 성능에 점점 더 중요해집니다.
Rubin GPU는 전문가 수가 많은 모델의 데이터 이동 오버헤드를 줄이기 위해 텐서 메모리 가속기를 향상시켰습니다. 개선된 디스크립터 처리 방식은 소프트웨어가 동일한 레이아웃을 공유하지만 메모리의 서로 다른 위치에 존재하는 텐서를 보다 효율적으로 다룰 수 있게 합니다.
Rubin은 TMA를 위한 인라인 디스크립터 업데이트 지원으로 이를 개선합니다(그림 3). 메모리의 디스크립터를 수정하는 대신, 커널은 동일한 레이아웃을 공유하는 텐서를 위한 하나의 통합 디스크립터를 유지하고, 런타임에 TMA 명령어에서 직접 메모리 포인터와 스트라이드 같은 필드를 재정의할 수 있습니다.

이를 통해 MoE 모델이 전문가 수 증가에 따라 더욱 효율적으로 확장될 수 있습니다. 메타데이터 관리와 데이터 이동 오버헤드를 줄임으로써 Rubin은 더 많은 GPU 시간을 유용한 추론 연산에 할애할 수 있게 하며, 대규모 MoE 모델에 의존하는 에이전틱 워크로드의 처리량을 향상시킵니다.
랙 규모 행렬 연산 효율을 두 배로
Rubin은 K 차원을 따라 처리할 수 있는 데이터의 양을 두 배로 늘려 클록당 텐서 코어 처리량을 두 배로 향상시킵니다. 이 최적화는 처리량에 바운드된 커널뿐 아니라 메모리 및 지연 시간에 바운드된 커널에도 도움이 됩니다.
모델 실행이 여러 GPU에 분산될수록 각 GPU는 출력 작업의 더 작은 조각을 받지만, 축소(reduction) 차원은 여전히 크게 유지됩니다.
더 큰 K 차원의 이점은 K 루프 반복 횟수가 줄어드는 것입니다. 그림 4에서 Blackwell에서 네 번의 K 반복이 필요한 GEMM은 Rubin에서 두 번만에 완료될 수 있습니다. 반복 횟수가 줄어들면 루프 오버헤드가 감소하고, 텐서 코어 가동률이 향상되며, 높은 텐서 병렬 규모에서 컨텍스트 및 디코드 GEMM 모두 더 효율적으로 실행될 수 있습니다.

더욱 압축된 가중치 표현이 필요한 모델을 위해 Rubin 트랜스포머 엔진은 행렬 B에 대한 3비트 룩업 테이블(LUT, Lookup-Table) 포맷도 지원합니다. 각 가중치를 직접 저장하는 대신, 이 포맷은 대표 값들로 구성된 작은 테이블에 대한 3비트 인덱스를 저장하며, Rubin 텐서 코어는 이 인덱스를 인라인으로 해석하여 가중치 저장 공간과 데이터 이동을 줄입니다. LUT 기반 표현은 MXFP8 수준의 정확도를 유지할 수 있어 Rubin 추론 도구함에 또 하나의 정밀도 옵션을 추가합니다.
에이전틱 AI를 위한 장문 컨텍스트 처리의 핵심 과제 해결
장문 컨텍스트 및 에이전틱 AI 워크로드는 어텐션에 더 많은 부담을 줍니다. 컨텍스트 윈도우가 커질수록 모델은 더 많은 토큰을 비교하고, 더 큰 어텐션 점수 행렬을 정규화하며, 다음 레이어의 출력을 생성하는 데 사용되는 값(value) 데이터에 해당 점수를 적용해야 합니다. 이로 인해 어텐션은 사용자당 초당 토큰 수 향상을 위한 가장 중요한 성능 경로 중 하나가 됩니다.
Rubin은 활성화 희소성(activation sparsity)과 적응형 압축, 향상된 소프트맥스(softmax) 처리량을 결합하여 어텐션을 가속합니다. Rubin의 새로운 희소성 기능을 어텐션에 활용하는 간단하고 안전하며 효과적인 방법은 다음과 같습니다. 어텐션 파이프라인은 중간 어텐션 점수를 생성하기 위한 밀집(dense) QKᵀ 연산으로 시작합니다. 그런 다음 Rubin은 해당 중간 데이터를 텐서 메모리에서 2:4 희소 압축 형태로 로드하여, 비(非)제로 값과 이를 효율적으로 활용하는 데 필요한 메타데이터를 생성하는 동시에 점수의 쓰기 비용과 저장 요구 사항을 줄입니다. 이를 통해 이후 어텐션 단계는 모델 나머지 부분이 기대하는 밀집 출력 포맷을 유지하면서 더 적은 데이터를 처리할 수 있습니다.

이 압축된 중간 표현은 소프트맥스와 두 번째 어텐션 GEMM, 두 핵심 지점에서의 작업량을 줄입니다. 소프트맥스는 비제로 어텐션 값에 대해 작동할 수 있으며, 그 다음 밀집 V 행렬과의 곱셈에서는 소프트맥스의 비제로 값과 원래 압축 단계의 메타데이터를 사용하는 희소 MMA를 활용할 수 있습니다. 결과적으로 주변 모델 파이프라인의 인터페이스를 변경하지 않고도 장문 컨텍스트 어텐션의 가장 부담이 큰 부분에서 컴퓨팅과 데이터 이동이 줄어들어 토큰/와트 효율이 향상됩니다.
Rubin은 또한 소프트맥스 처리량을 개선합니다. 텐서 코어 처리량이 증가함에 따라 소프트맥스는 지수 연산과 어텐션 행에 걸친 축소에 의존하기 때문에 병목 현상이 발생할 수 있습니다. Rubin은 Blackwell 기준 대비 FP32 지수 처리량 2배, BF16/FP16 지수 처리량 4배를 포함하여 지수 처리량을 높여 소프트맥스가 더 빠른 행렬 연산을 따라잡을 수 있도록 합니다.
| NVIDIA GPU 플랫폼 | FP32 지수 처리량(클록당, SM당) | BF16/FP16 지수 처리량(클록당, SM당) |
|---|---|---|
| Blackwell | 1x | 1x |
| Blackwell Ultra | 2x | 2x |
| Rubin | 2x | 4x |
표 1. Blackwell에서 Rubin으로 세대가 바뀌면서 향상되는 지수 처리량
이러한 기능들이 합쳐져 Rubin 어텐션 가속은 단일 커널 개선 이상의 효과를 발휘합니다. 활성화 희소성은 중간 어텐션 작업량을 줄이고, 더 빠른 지수 연산은 소프트맥스 병목 현상을 줄입니다.
커널 실행 효율성 개선
추론이 더 큰 모델과 더 많은 GPU에 걸쳐 확장될수록 원시 텐서 코어 처리량은 성능 이야기의 일부에 불과합니다. GPU는 또한 한 커널에서 다음 커널로 효율적으로 이동해야 합니다. 추론에서 활성화 값이 종종 임계 경로(critical path)에 놓이기 때문에 이 점은 특히 중요합니다. 하나의 프로듀서(producer) 커널이 활성화 데이터를 생성하고 메모리에 쓰면, 다음 컨슈머(consumer) 커널이 해당 데이터를 소비하여 다음 토큰 생성을 이어갑니다.
전통적인 프로듀서-컨슈머 실행 방식은 GPU 타임라인에 버블(bubble)을 만들 수 있습니다. 프로듀서 커널은 일부 타일이나 스레드 블록의 작업을 일찍 완료할 수 있지만, 컨슈머는 더 넓은 종속성이 해결될 때까지 유용한 작업을 시작하지 못할 수 있습니다. Blackwell의 프로그래매틱 종속 실행(programmatic dependent launch)은 컨슈머 커널이 더 일찍 진행할 수 있게 함으로써 이를 개선했지만, 종속 작업은 여전히 필요한 활성화 데이터가 제공될 때까지 대기할 수 있습니다.

Rubin은 종속 커널 간의 더 세밀한 조율을 가능하게 합니다. 이를 통해 더 큰 프로듀서 작업 세트가 완료될 때까지 기다리는 대신, 필요한 입력 데이터가 사용 가능해지는 즉시 컨슈머 작업이 더 일찍 시작될 수 있습니다.
그 결과 GPU 타임라인이 더 촘촘하게 채워지고, 유휴 간격이 줄어들며, 종속 커널 간의 오버랩이 개선됩니다. 이는 활성화가 모델을 순차적으로 통과하고 커널 간 지연이 사용자당 초당 토큰 수에 직접적인 영향을 미치는 에이전틱 추론에서 특히 중요한 가치를 발휘합니다.
Rubin의 메모리와 통신은 어떻게 고처리량 추론을 지속하는가?
모델, 컨텍스트 윈도우, GPU 도메인이 커질수록 데이터 이동은 연산만큼이나 중요해집니다. Rubin은 GPU 내부와 스케일업 시스템 전반에 걸쳐 가중치, 활성화, KV 캐시 데이터, 통신 트래픽의 흐름을 개선하도록 설계되었습니다. 다음 섹션에서는 고처리량 추론을 지속하는 데 도움을 주는 메모리 및 통신 혁신을 살펴봅니다.
스케일업 통신 가속
추론이 단일 GPU에서 전체 랙 규모 시스템으로 확장될수록 통신은 핵심 성능 경로의 일부가 됩니다. GPU 커널 내부에 통신이 직접 융합되면 커널은 멈추거나 CPU에 제어권을 반환하지 않고, 연산이 여전히 실행되는 중에 NVLink를 통해 다른 GPU에 직접 데이터를 쓰거나 축소 연산을 수행합니다.
기존의 GPU 간 통신은 페이로드 데이터 이동 외에도 조율 및 동기화 작업이 필요합니다. 이러한 단계들은 특히 분산 추론 워크로드에서 통신이 자주 발생할 때 지연 시간을 추가하고 인터커넥트 대역폭을 소비할 수 있습니다.
Rubin은 디바이스 개시(device-initiated) NVLink 통신을 위한 카운티드 라이트(counted writes)를 도입합니다. 이 기능은 수신 GPU가 전송 완료를 보다 효율적으로 추적할 수 있게 함으로써 GPU 간 데이터 전송의 동기화를 간소화합니다.

카운티드 라이트를 활용한 NVLink 융합 통신은 GPU 간 데이터 이동 조율을 위한 저지연 메커니즘을 제공하여, 동기화 연산을 기다리는 대신 연산이 계속 진행될 수 있도록 합니다.
최대 전력 및 컴퓨팅 효율을 위한 메모리 서브시스템 공동 설계
추론의 디코드(decode), 즉 생성(generation) 단계는 근본적으로 메모리 서브시스템에 바운드됩니다. 이는 최고 대역폭 스펙이 아니라 각 커널이 전체 메모리 서브시스템을 얼마나 효율적으로 활용하느냐의 문제입니다. 현대의 추론 및 에이전틱 워크로드는 디코드에서 더 많은 종단 간 런타임을 소비하기 때문에 이 제약을 증폭시킵니다. 장문 컨텍스트, 대용량 KV 캐시, 대화형 토큰 생성은 달성된 메모리 대역폭을 핵심 성능 레버로 만듭니다.

Rubin은 고효율 로컬 메모리 서브시스템과 결합된 HBM4로 이를 해결합니다. HBM4는 HBM3e 대비 인터페이스 폭을 두 배로 늘렸습니다. 새로운 메모리 컨트롤러, 메모리 에코시스템과의 심층 공동 엔지니어링, 더 긴밀한 컴퓨팅-메모리 통합과 결합하여 이 서브시스템은 최대 22 TB/s의 메모리 대역폭을 제공합니다. 이는 Blackwell 및 Blackwell Ultra 대비 2.8배 증가한 수치입니다.
Rubin은 또한 GPU당 최대 288 GB의 HBM4를 제공하여 Blackwell 대비 패키지 내 가용 용량을 늘렸습니다. 용량과 대역폭은 서로 다르지만 상호 보완적인 역할을 합니다.
- 용량: 불필요한 KV 캐시 오프로드 없이 모델 상주, 더 큰 컨텍스트 윈도우, 더 큰 KV 캐시, 더 높은 동시성을 지원합니다.
- 대역폭: 모델 가중치와 KV 상태가 컴퓨팅 엔진을 효율적으로 유지할 만큼 빠르게 이동해야 하는 토큰 단위 생성 단계를 지원합니다.
- 메모리 서브시스템: TMA와 메모리 지역성 전략은 소프트웨어가 메모리 서브시스템을 효율적으로 활용하여 복잡한 데이터 레이아웃에서 높은 달성 대역폭을 지원하도록 돕습니다.
고용량, 고대역폭 HBM4는 수조 개의 파라미터를 가진 모델을 호스팅하고, KV 캐시 오프로드 없이 컨텍스트 길이를 확장하며, 고동시성 장기 호라이즌(long-horizon) 추론 워크로드를 지원하는 데 핵심적입니다.
NVIDIA는 효율성, 확장성, 안정성을 어떻게 설계하는가?
에이전틱 AI 인프라는 개별 GPU 이상을 최적화해야 합니다. 전체 AI 팩토리에 걸쳐 전력, 냉각, 네트워킹, 랙 수준 자원을 효과적으로 활용해야 합니다. NVIDIA Vera Rubin NVL72는 GPU 아키텍처를 통합되고 탄력적인 랙 규모 실행 도메인으로 확장합니다. 이 섹션에서는 NVIDIA가 전력 효율성, 운영 확장성, 시스템 수준 안정성에 어떻게 접근하는지 살펴봅니다.
동일한 전력 예산 내에서 GPU 수 늘리기
에이전틱 AI는 에너지 효율성을 단순한 GPU 전력 문제가 아닌 AI 팩토리 문제로 만들었습니다. 랙 규모에서 Vera Rubin NVL72는 고정된 전력 범위 내에서 유용한 토큰 출력을 극대화하도록 설계된 단일 실행 도메인으로 컴퓨팅, 네트워킹, 액체 냉각, 전력 스티어링, 에너지 저장을 활용한 지능형 전력 스무딩(Intelligent Power Smoothing)을 통합합니다.

AI 워크로드 중 전력 수요는 급격히 변동하여 순간 최고치를 만들고, 이로 인해 가용 용량이 낭비되고 팩토리 수준의 처리량이 줄어듭니다. Vera Rubin 전원 공급 장치는 SoC(State-of-Charge) 지능형 전력 스무딩을 사용하여 이러한 변동을 흡수하고, 이전 세대 전력 스무딩 기법 대비 평균 전력 소비를 약 10% 줄이며, 50ms 최고 전력을 약 20% 낮춥니다. 더 안정적인 전력 프로파일을 제공함으로써 시스템은 지속 최대 전력 요구 사항을 줄이고, 지원 전력 인프라와 전력망에 이점을 주며, 동일한 AI 팩토리 전력 예산 내에서 더 많은 컴퓨팅을 가능하게 합니다.
AI 팩토리 수준에서 NVIDIA DSX MaxLPS는 GPU, 랙, 45°C 액체 냉각, 워크로드에 걸쳐 이 접근 방식을 확장하는 반면, DSX OS는 스케줄링, 라이프사이클 관리, 상태 자동화를 위한 운영 계층을 제공합니다. 함께 작동하여 낭비되는 전력을 회수하고 고정된 메가와트 범위 내에서 유용한 컴퓨팅을 늘리도록 설계되었습니다. DSX MaxLPS는 워크로드 성능에 최소한의 영향을 주면서 에너지 효율적인 동작점에서 동일한 전력 예산 내에 최대 40% 더 많은 GPU를 프로비저닝(그림 10)할 수 있게 합니다.

탄력성과 데이터 센터 확장성을 위한 랙 설계
Vera Rubin NVL72는 수조 개의 파라미터를 가진 모델과 다중 랙 에이전틱 워크로드를 위해 Rubin GPU를 랙 규모 실행 도메인으로 확장합니다. 3세대 MGX 랙 아키텍처는 케이블 없는 컴퓨팅 및 스위치 트레이, 45°C 액체 냉각, 동적 랙 규모 전력 스티어링, 지능형 전력 스무딩을 결합하여 컴퓨팅, 네트워킹, 냉각, 전력이 하나의 시스템으로 작동하게 합니다. 핫 스왑 가능한 NVLink 스위치 트레이와 향상된 RAS(Reliability, Availability, Serviceability) 기능이 대규모에서의 탄력적인 운영을 추가로 지원합니다.
이 랙 설계는 NVLink와 NVIDIA Spectrum-X 이더넷(Ethernet)에 걸친 개방적이고 유연한 연결성을 갖춘 팟(pod) 규모 다중 랙 에이전틱 시스템의 기반이 됩니다.
더 알아보기
NVIDIA Rubin GPU는 장문 컨텍스트 추론, 다단계 생성, 분산 MoE 디코드, 저지연 상호 작용이 대규모로 지속적으로 운영되어야 하는 에이전틱 AI의 실행 패턴을 위해 설계되었습니다. 컴퓨팅, 메모리, 네트워킹, 랙 규모, 전력, 냉각, 소프트웨어 계층이 AI 팩토리가 데이터, 통신, 전력 제약을 기다리는 대신 유용한 작업을 수행하는 시간을 극대화하도록 신중하게 공동 설계되었습니다. 그 결과는 와트당 에이전틱 성능을 극대화하도록 구축된 아키텍처, 즉 고정된 전력 범위 내에서 더 많은 유용한 토큰과 완성된 AI 작업을 생산하는 아키텍처입니다.
랙 아키텍처와 더 광범위한 NVIDIA Vera Rubin 플랫폼에 대한 심층 분석은 NVIDIA Vera Rubin 플랫폼 내부: 6개의 새 칩, 하나의 AI 슈퍼컴퓨터를 참조하십시오. NVIDIA Vera Rubin POD에 대한 자세한 내용은 NVIDIA Vera Rubin POD: 7개의 칩, 5개의 랙 규모 시스템, 하나의 AI 슈퍼컴퓨터를 참조하십시오.
감사의 말
이 작업은 Jeff Pool, Ran Zilberstein, Ronny Krashinksky, Sailaja Madduri, Shivam Raj, Xiaowei Wang, Manas Mandal, Bita Darvish, Raj Dash를 비롯한 수많은 뛰어난 NVIDIA 엔지니어들의 전문 지식과 공헌으로 이루어졌습니다.