최첨단 프론티어 모델의 사전 학습 방식이 혼합 전문가(MoE, Mixture of Experts) 구조로 모이면서, 대규모 AI 학습의 병목 요인도 근본적으로 바뀌고 있습니다. 토큰당 연산 비용이 낮아질수록, 수천 개의 GPU를 아우르는 확장 성능을 결정짓는 핵심 열쇠는 바로 ‘통신 효율성’이 되고 있기 때문입니다. NVIDIA GB300 NVL72는 DeepSeek-V3 671B 사전 학습 과정에서 GPU당 1,648 TFLOPs라는 세계 기록을 달성하며, 반도체부터 네트워킹, 소프트웨어에 이르는 풀스택 AI 플랫폼의 진화가 학습 성능을 어떻게 극대화하는지 확실히 증명해 보였습니다. 이처럼 사전 학습 효율이 향상되면, 연구자들은 동일한 NVIDIA 인프라에서도 더 큰 모델을 학습시키고, 다양한 실험을 신속하게 거쳐 최첨단 성능에 훨씬 빠르게 도달할 수 있게 됩니다.
업계가 MoE 아키텍처로 빠르게 전환하는 이유는 엄청난 연산 효율성 때문입니다. 모든 토큰이 전체 파라미터를 활성화하여 토큰당 컴퓨팅 비용이 모델 크기만큼 비례해 늘어나는 기존 덴스(Dense) 모델과 달리, MoE 모델은 각 토큰에 대해 일부 파라미터만 선별적으로 활성화합니다. 일례로 DeepSeek-V3는 총 6,710억 개의 파라미터를 갖고 있지만, 토큰당 약 370억 개만 활성화하여 훨씬 작은 모델 수준의 연산 비용만으로 최첨단 프론티어급 성능을 구현해 냅니다.
하지만 이러한 효율성 뒤에는 ‘통신 트레이드오프’라는 과제가 존재합니다. 전문가(Expert) 파라미터들이 여러 GPU에 나뉘어 분산되어 있기 때문에, 모든 MoE 레이어는 순전파(Forward pass)와 역전파(Backward pass) 과정에서 토큰을 적절한 전문가에게 할당하고 올투올(All-to-All) 통신으로 그 결과를 수집해야 합니다. 이 집합 연산이 전체 처리의 병목 구간(Critical path)에 위치하기 때문에, 결국 전체 처리량은 연산력 못지않게 통신 속도에 크게 좌우됩니다. 이 통신이 매 학습 단계의 모든 레이어마다 반복되다 보니, 작은 지연만 누적되어도 통신 시간을 연산 시간 뒤로 숨기기(Overlapping)가 불가능해지고 GPU를 늘려도 처리량이 더 이상 늘어나지 않는 한계에 부딪히게 됩니다.

이것이 바로 사전 학습에 긴밀하게 연결된 스케일업 도메인이 필요한 이유입니다. 이 도메인에서는 모든 GPU가 비차단(non-blocking) 패브릭을 통해 다른 모든 GPU와 통신할 수 있어야 하며, 도메인이 커져도 높고 균일한 대역폭, 낮은 지연 시간, 완전한 이분 대역폭(bisection bandwidth)을 유지해야 합니다. 이 크기의 모델을 학습하려면 단일 도메인이 수용할 수 있는 것보다 더 많은 GPU가 필요하므로 여러 도메인을 함께 연결해야 합니다. 이 스케일아웃 트래픽은 더 가볍고 덜 빈번하지만, 컴퓨팅 윈도우 내에서 완료되어야 하며 예측 가능성이 유지되어야 합니다. 단 하나의 느린 링크가 전체 단계를 지배해서는 안 됩니다. 이 과제는 두 계층으로 이루어져 있으며, 성공은 최고 FLOPs가 아닌 실제 전달된 FLOPs로 측정됩니다.
NVIDIA GB300 NVL72: 긴밀하게 연결된 AI 사전 학습을 위해 설계됨
두 계층의 통신 과제는 단순히 더 빠른 칩이 아니라 그에 맞게 설계된 시스템을 필요로 합니다. 컴퓨팅, 스케일업 인터커넥트, 스케일아웃 네트워킹, 인프라 처리, 소프트웨어가 각각 부담의 일부를 담당합니다. 어느 하나라도 부족하면 전체가 제한됩니다. GB300 NVL72는 이러한 과제들을 함께 해결합니다. 이 랙 규모 시스템은 극도의 공동 설계를 통해 구축되었으며, 실리콘, 인터커넥트, 네트워킹, 소프트웨어가 부품을 조립하는 방식이 아니라 하나의 플랫폼으로 설계되었습니다.
핵심에는 72개의 NVIDIA Blackwell Ultra GPU를 하나로 작동하게 하는 스케일업 패브릭인 NVIDIA NVLink가 있습니다. 5세대 NVLink는 각 GPU에 1.8 TB/s의 대역폭을 제공하고, 랙 전체에 걸쳐 130 TB/s의 비차단 전방위 대역폭을 지원하여 모든 GPU가 단 한 번의 홉(hop)으로 다른 모든 GPU에 도달할 수 있습니다.
대역폭은 절반에 불과하며, 나머지 절반은 경로입니다. NVLink는 메모리 시맨틱(memory-semantic) 방식으로 동작합니다. GPU는 손실 없는 흐름 제어 패브릭을 통해 네이티브 로드 및 스토어 연산으로 피어의 HBM을 직접 읽고 씁니다. 전송은 소프트웨어 송신이 아닌 하드웨어 메모리 연산이므로 데이터 경로에 지연을 추가하는 요소가 없으며, 리덕션은 데이터가 스위치를 통과하는 동안 스위치 내부에서 실행될 수 있습니다.
이것이 바로 레이어별 트래픽이 요구하는 바입니다. 텐서 병렬(tensor-parallel) 전체 리덕션(all-reduce)과 MoE 전방위 통신은 완전한 대역폭과 낮은 지연 시간으로 랙 내부에서 처리됩니다. 랙 너머로는 GPU당 800 Gbps의 NVIDIA ConnectX-8 SuperNIC를 통해, 그리고 NVIDIA Quantum-X800 InfiniBand 또는 NVIDIA Spectrum-X 이더넷(Ethernet)을 통해 플랫폼이 스케일아웃되어 그래디언트 트래픽이 컴퓨팅 뒤에 숨겨질 수 있도록 합니다.

공동 설계는 학습 패브릭을 넘어 인프라 서비스와 소프트웨어까지 확장됩니다. 프로덕션 AI 팩토리에서 NVIDIA BlueField 데이터 처리 장치(DPU, Data Processing Unit)는 가상 네트워킹, 스토리지 접근, 보안, 원격 측정, 라이프사이클 관리를 위한 격리된 인프라 처리 도메인을 제공하여 대규모 학습 작업에서 호스트 CPU 오버헤드를 줄입니다.
학습 소프트웨어는 에코시스템의 양 측면을 지원합니다. NVIDIA Megatron Core는 이러한 GPU에 맞게 구축되고 튜닝되었습니다. NVIDIA는 또한 TorchTitan과 JAX가 GB300 NVL72 시스템에서 최고 속도로 실행될 수 있도록 오픈 소스 프레임워크에 적극적으로 기여하고 있습니다.
Megatron Core를 활용한 탁월한 사전 학습 성능
256개 GPU를 사용한 DeepSeek-V3 671B 모델에서 Megatron Core는 GB300 NVL72에서 GPU당 1,648 TFLOPs에 도달했습니다. 이는 이전 GB200 NVL72 결과의 GPU당 606 TFLOPs 대비 단 한 세대 만에 GPU당 실제 처리량이 약 3배 향상된 수치입니다.

NVIDIA는 전체 플랫폼에서 더 나은 성능을 끌어내기 위해 소프트웨어를 지속적으로 최적화하고 있습니다. DeepSeek-v3 671B 규모의 사전 학습 워크로드에서 이러한 향상은 복리처럼 쌓입니다. 동일한 GB300 NVL72 랙 규모 시스템에서 소프트웨어 개선만으로 6개월 만에 성능이 1.5배 향상되었습니다. 이는 실리콘이 출하된 후에도 원시 성능과 학습 처리량이 계속 개선된다는 것을 보여줍니다.

NVIDIA가 가속하는 선도적인 사전 학습 프레임워크
NVIDIA 엔지니어들은 AI 커뮤니티가 의존하는 오픈 프레임워크에 직접 기여하며, NVIDIA GPU에서 더 빠르게 실행될 수 있도록 최적화를 추가합니다. PyTorch 및 JAX 커뮤니티와 협력하여 개발된 이러한 기여는 지속적으로 반영되며 시간이 지남에 따라 성능을 향상시킵니다.
TorchTitan은 PyTorch의 네이티브 학습 스택으로, NVIDIA의 기여가 GB300 NVL72에서의 성능을 꾸준히 향상시키고 있습니다. DeepSeek-V3 671B에서 이러한 최적화가 누적되어 동일한 인프라에서 약 6배 높은 실제 성능을 달성했습니다.

JAX도 동일한 궤적을 따릅니다. 6개월에 걸쳐 NVIDIA JAX 최적화는 256개 GPU 규모에서 DeepSeek-V3 671B의 성능을 거의 10배 향상시켰으며, 이 모두가 소프트웨어 최적화에서 비롯된 것입니다. 최신 소프트웨어 버전은 1,025 TFLOPS/GPU라는 뛰어난 처리량에 도달했으며, 소프트웨어 최적화는 계속해서 발전하고 있습니다.

DeepSeek-V3 671B 사전 학습을 256개에서 1,024개 GPU로 확장할 때 Megatron Core는 GPU당 성능의 98.5%를 유지하고, TorchTitan과 JAX는 각각 97%를 유지합니다. 이는 추가된 인프라 거의 전부가 시스템 수준의 초당 토큰(tokens per second) 처리량 향상으로 이어진다는 것을 의미합니다. 이 효율성은 GPU당 800 Gb/s 네트워킹으로 랙을 스케일아웃할 때 스케일아웃 패브릭이 제 역할을 다하는 덕분입니다. 그래디언트 트래픽은 컴퓨팅 뒤에 숨겨진 채로 유지되어, GPU를 추가할수록 통신 오버헤드로 네트워크를 혼잡하게 만드는 대신 전체 시스템 처리량이 순수하게 증가합니다.

세계 기록 수립
256개 GPU로 DeepSeek-v3 671B를 사전 학습하여 GB300 NVL72에서 GPU당 1,648 TFLOPs라는 세계 기록을 달성했습니다. 이를 통해 동일한 학습 작업이 이전 세대 대비 훨씬 적은 하드웨어로 동일한 성능에 도달할 수 있게 되었습니다.
오픈 프레임워크도 같은 이야기를 전합니다. 소프트웨어가 발전함에 따라 동일한 플랫폼에서 성능이 계속 향상됩니다. 이러한 결과는 천장이 아닙니다. 하드웨어, 인터커넥트, 소프트웨어가 함께 설계되고 지속적으로 최적화되는 플랫폼에서 나온 것입니다. 오늘의 기록적인 성능은 내일 더 높은 성능을 위한 토대에 불과합니다.
NVIDIA AI 인프라에서 최전선 모델 학습 시작하기
- 랙 규모 아키텍처 탐색: GB300 NVL72를 살펴보세요.
- 워크로드 확장: 최전선 모델 학습을 위한 Megatron-Core로 시작하세요.
- 성능 최적화: NVIDIA CuteDSL 퓨전 커널 블로그 포스트를 통해 CUDA 그래프를 활용한 성능 향상 방법을 읽어보세요.
감사의 말
DeepSeek-V3 모델을 사전 학습하여 NVIDIA GB300 NVL72 플랫폼에서 세계 기록을 수립한 것은 회사 전반에 걸쳐 수많은 뛰어난 엔지니어들의 노력이 있었기에 가능했습니다. 다음 분들의 기여에 감사드립니다(성 알파벳순 정렬):
Aidyn Aitzhan, Michael Andersch, Jan Bernloehr, Santosh Bhavani, Ben Cashman, Carlo del Mundo, Ashraf Eassa, Fabio Paes Leme Ferriani, Matt Frank, Abhinav Goel, Vivek Goel, Elfie Guo, Eric Harper, Munira Hussain, Tomasz Jakubek, Masaki Kozuki, George Kurian, Himangshu Lahkar, Guihong Li, Kibibi Moseley, Nitin Nitin, Devin O’Kelly, Christian M. Sarofeen, Priya Sethuraman, Tejash Shah, Franciszek Szarwacki, John Tran, Qiyu Wan, Cliff Woolley.