Agentic AI / Generative AI

NVIDIA Vera CPU: 에이전틱 AI 최고의 싱글스레드 성능을 위해 설계된 Olympus 코어

Reading Time: 8 minutes

에이전틱 AI는 실행 과정의 더 많은 비중을 CPU에 의존하게 만듭니다. 에이전트가 샌드박스 환경에서 코드를 직접 실행하고, 툴을 호출하며, 컨텍스트를 검색하고, 데이터베이스와 상호작용하면서 모델에 전달할 결과를 분석해야 하기 때문입니다. 이러한 작업 루프가 AI 팩토리 전반에서 동시에 실행됨에 따라, CPU의 성능은 개별 에이전트의 응답성은 물론 전체 AI 팩토리의 처리량을 결정짓는 핵심 요소로 자리 잡았습니다

이에 따라 CPU의 설계 방향도 새로워지고 있습니다. 에이전트 워크로드는 다음과 같은 특성을 요구합니다.

  • 모든 소켓에 부하가 걸린 상태에서도 유지되는 강력한 싱글스레드 성능
  • 수많은 활성 실행 컨텍스트에 데이터를 원활히 공급할 수 있는 코어당 메모리 대역폭
  • 동시 요청이 몰려도 에이전트의 작업 단계가 일정하게 마무리되는 예측 가능한 지연 시간
  • 복잡한 제어 흐름과 긴 의존성 체인, 포인터 중심의 데이터 구조를 처리하는 뛰어난 효율성

이러한 요구사항은 균일한 워크로드를 바탕으로 코어 밀도와 단순 처리량에 집중하던 기존 클라우드 CPU의 설계 방식과는 크게 다릅니다. 에이전틱 AI는 각 에이전트 루프 내부처럼 순차적이고 분기가 많으며 지연 시간에 민감한 소프트웨어 구간에서, 스레드별로 막힘없이 작업을 이어 나가는 능력을 훨씬 중요하게 여깁니다

NVIDIA Vera CPU는 바로 이러한 워크로드를 처리하기 위해 설계되었으며, 그 중심에는 Olympus 코어가 있습니다. 이 글에서는 AI 팩토리 규모에서 뛰어난 싱글스레드 성능을 제공하는 Olympus 코어 아키텍처부터 멀티스레딩 방식, 코히어런시 패브릭, 메모리 서브시스템, 그리고 안전한 스케일업 연결성까지 차례로 살펴봅니다. 더욱 자세한 기술적 내용은 함께 제공되는 NVIDIA Vera CPU 백서에서 확인하실 수 있습니다.

최고의 싱글스레드 에이전틱 성능을 위한 코어 설계

Olympus는 Vera Rubin 플랫폼 전반에 걸쳐 CPU, GPU, 네트워킹, 스토리지, 메모리 시스템, 소프트웨어를 아우르는 극도의 공동 설계를 통해 개발되었습니다. 이 시스템 수준의 접근 방식은 NVIDIA가 CPU를 개별적으로가 아니라 AI 팩토리 전체를 최적화할 수 있게 했습니다. 에이전틱 AI와 강화 학습(RL, Reinforcement Learning)이 CPU 측 실행에 더 많은 부담을 가할수록, Olympus는 종단 간 성능을 점점 더 좌우하는 불규칙하고 분기가 많으며 지연 시간에 민감한 소프트웨어 경로를 가속하도록 구축되었습니다.

Olympus 코어는 NVIDIA Vera CPU의 컴퓨팅 엔진으로, 고도로 동시적인 AI 인프라 워크로드의 사이클당 명령어 수(IPC, Instructions Per Cycle)를 극대화하기 위해 처음부터 새로 설계되었습니다. 높은 싱글스레드 성능, 광범위한 명령어 처리량, 깊은 비순서(out-of-order) 실행, 고급 메모리 가속 기술을 결합하여 에이전틱 AI, 강화 학습, 데이터 분석, 대규모 소프트웨어 워크로드를 효율적으로 실행합니다.

Olympus는 그림 1과 같이 다음 블록들로 구성됩니다.

  • 프런트 엔드(Front end): 최적화된 분기 예측기
  • 미드 코어(Mid core): 임계 경로 가속
  • 실행 엔진(Execution engine): 복잡한 벡터 최적화
  • 캐시 서브시스템(Cache subsystem): 지연 시간 최적화된 명령어 및 데이터 경로

프런트 엔드

Olympus 프런트 엔드는 크고 분기가 많은 소프트웨어 스택 전반에 걸쳐 코어에 유용한 명령어를 지속적으로 공급하도록 구축되었습니다. 에이전트 런타임, 인터프리터, 컴파일러, 그래프 분석, 데이터 처리 프레임워크와 같은 워크로드는 종종 대규모 명령어 풋프린트(footprint)와 빈번한 제어 흐름 변화를 결합하여 실행 자원이 충분히 활용되지 못할 수 있습니다. Olympus는 고급 분기 예측, 고대역폭 명령어 페치(fetch), 그리고 매 사이클마다 더 많은 명령어를 코어에 전달하는 10-wide 디코드 엔진으로 이러한 과제를 해결합니다.

이 접근 방식의 핵심은 Olympus 분기 예측 서브시스템으로, 어렵고 통계적으로 편향된 분기 패턴에서 정확도를 향상시키도록 설계된 뉴럴 분기 예측기(neural branch predictor)를 포함합니다. 잘못된 경로 실행을 줄이고 사이클당 최대 두 개의 실행된 분기를 지원함으로써, 소프트웨어 동작이 불규칙할 때 제어 흐름 처리량을 유지하는 데 도움이 됩니다. 광범위한 디코드 경로와 결합하여 이러한 기능들은 Olympus가 복잡한 제어 흐름의 효율적인 처리가 가장 중요한 에이전틱 AI 및 강화 학습 애플리케이션을 포함한 지연 시간에 민감한 워크로드에서 더 강력한 프런트 엔드 처리량을 유지할 수 있게 합니다.

미드 코어

에이전틱 워크로드는 종종 코드 해석, 객체 순회, 런타임 상태 관리, 도구 출력 처리, 그래프 형태의 데이터 구조 탐색 등 긴 종속 작업 체인을 따릅니다. 이러한 경로에서 성능은 명령어 페치뿐 아니라 이전 명령어가 분기, 메모리 또는 의존성 해결을 기다리는 동안 코어가 독립적인 작업을 발견하는 능력에도 달려 있습니다.

Olympus 미드 코어는 이 숨겨진 병렬성을 드러내고 가속하도록 설계되었습니다. 광범위한 이름 변경(rename) 및 할당 엔진이 디코딩된 명령어를 물리적 자원에 매핑하고, 대형 재정렬 버퍼(reorder buffer)와 광범위한 물리 레지스터 용량이 더 깊은 비순서 실행을 위해 더 많은 명령어를 진행 중인 상태로 유지합니다. 메모리 이름 변경, 값 예측, 임계 경로 가속을 포함한 의존성 차단 기능은 포인터 집약적 코드, 직렬화된 메모리 연산, 긴 의존성 체인으로 인한 스톨(stall)을 줄이는 데 도움이 됩니다.

이러한 기능들이 함께 작동하여 실행 엔진의 생산성을 유지하고, IPC를 향상시키며, 에이전트, RL 환경, 현대 AI 인프라에서 일반적인 불규칙한 소프트웨어 경로 전반에 걸쳐 싱글스레드 성능을 강화합니다.

실행 엔진

에이전틱 워크로드는 광범위한 프런트 엔드 이상을 요구합니다. 명령어가 코어에 진입하면 CPU는 새로운 병목 현상을 만들지 않으면서 정수 연산, 분기, 벡터 작업, 메모리 접근이 변화하는 혼합을 효율적으로 실행해야 합니다. 기존 x86 서버 CPU는 종종 더 높은 클록 주파수에 의존하여 싱글스레드 응답성을 높이지만, 에이전틱 워크로드는 불규칙한 제어 흐름, 긴 의존성 체인, 메모리 지연에 의해 자주 제약을 받습니다. 이러한 과제는 주파수만이 아닌 더 높은 IPC를 요구합니다.

Olympus 실행 엔진은 광범위한 명령어 공급을 생산적인 실행으로 전환합니다. 광범위한 백엔드와 깊은 비순서 실행의 지원을 받아 정수, 분기, 벡터, 부동소수점, 암호화, 로드, 스토어 자원으로 구성된 넓은 세트에 걸쳐 동적으로 연산을 스케줄링합니다. 이 균형 잡힌 설계는 Olympus가 분기가 많은 소프트웨어, 벡터화된 데이터 처리, AI 전처리, 암호화, 압축, 분석 및 기타 메모리 집약적 워크로드를 효율적으로 처리할 수 있도록 합니다.

캐시 서브시스템

에이전트는 런타임 객체, 검색 인덱스, 도구 상태, 그래프 구조, 희소 데이터, 데이터베이스, 환경 메모리 등 캐시에 깔끔하게 들어맞지 않는 데이터 구조를 자주 다룹니다. 기존의 캐시 및 프리페치(prefetch) 설계는 규칙적인 스트리밍 액세스 패턴에 잘 동작하지만, 포인터 집약적이고 그래프 형태의 에이전트 워크플로에서 일반적인 것처럼 각 주소가 이전 메모리 조회의 결과에 의존할 때는 효과가 떨어집니다.

Olympus 캐시 서브시스템은 이러한 스톨을 줄이고 실행 엔진에 명령어와 데이터를 지속적으로 공급하도록 설계되었습니다. 깊은 캐시 계층, 메모리 모호성 제거(memory disambiguation), 다중 하드웨어 프리페치 엔진을 결합합니다. Olympus는 또한 데이터 집약적인 그래프 및 분석 워크로드의 성능을 향상시키도록 설계된 그래프 프리페처를 포함합니다.

이러한 기능들이 함께 작동하여 효과적인 메모리 지연을 줄이고 메모리 수준 병렬성을 높여, 에이전트, 그래프 분석, 데이터 처리 워크로드가 불규칙한 메모리 액세스를 기다리는 시간을 줄이고 유용한 작업을 수행하는 시간을 늘릴 수 있게 합니다.

도구 호출 및 강화 학습을 위해 설계된 멀티스레딩 혁신

멀티스레딩은 종종 버스티(bursty)하고 이벤트 기반이며 백그라운드 시스템 활동과 혼재되는 에이전트 워크로드에 중요합니다. 일반적인 샌드박스는 비동기 I/O, 타이머, 런타임 서비스, 네트워킹, 로깅, 메모리 관리, 도구 오케스트레이션을 처리하면서 기본 실행 경로를 실행할 수 있습니다. 두 번째 하드웨어 스레드는 CPU가 이러한 지원 작업을 로컬에서 흡수할 수 있게 하여, 기본 에이전트 스레드가 양보하거나 마이그레이션하거나 대기해야 하는 빈도를 줄이면서 활용도와 응답성을 향상시킵니다.

기존의 동시 멀티스레딩(SMT, Simultaneous Multithreading)은 두 개의 하드웨어 스레드가 코어를 공유할 수 있게 함으로써 활용도를 높이지만, 이 공유는 경쟁을 유발할 수 있습니다. 밀집된 스레드 샌드박스 환경에서는 스레드들이 분기 예측, 디코드 대역폭, 실행 자원, 로드/스토어 용량, 캐시, 메모리 대역폭을 두고 경쟁할 수 있습니다. 이는 코어 내에서 노이지 네이버(noisy-neighbor) 효과를 만들어, 한 스레드의 활동이 다른 스레드의 성능을 저하시킬 수 있습니다. 에이전틱 AI, RL 환경, 클라우드 서비스에서는 꼬리 지연(tail latency)이 처리량과 서비스 품질에 직접적인 영향을 미칠 수 있으므로 이러한 가변성이 중요합니다.

Vera CPU는 NVIDIA 공간 멀티스레딩(SMT, Spatial Multithreading)으로 다른 접근 방식을 취합니다. 단순히 기회적 자원 공유에만 의존하는 대신, 광범위한 Olympus 코어는 두 개의 하드웨어 스레드에 걸쳐 자원을 보다 효과적으로 분할하도록 설계되었습니다. 이를 통해 Olympus는 형제 스레드(sibling thread)가 관리 활동을 처리하는 동안 최대 스레드별 성능이 필요할 때는 고처리량 싱글스레드 코어로, 더 높은 스레드 밀도가 필요할 때는 두 개의 더 격리된 실행 컨텍스트로 작동할 수 있습니다.

그 결과 강력한 스레드별 성능, 향상된 활용도, 부하 하에서 더 예측 가능한 동작이 가능합니다. 88개의 Olympus 코어와 176개의 SMT 스레드를 통해 Vera CPU는 스레드 간 간섭을 줄이고 더 일관된 지연 시간과 처리량을 제공하면서 많은 수의 동시 에이전트 작업을 지원할 수 있습니다.

코히어런트 패브릭과 고대역폭 메모리로 에이전틱 AI 성능 유지

고 IPC 코어는 프로세서의 나머지 부분이 지속적으로 공급할 수 있을 때만 완전한 가치를 발휘합니다. 에이전틱 AI, 강화 학습, 그래프 분석, 데이터 처리 워크로드는 종종 대규모 작업 세트와 불규칙한 액세스 패턴에 의존하므로, 패브릭 대역폭, 캐시 액세스, 메모리 대역폭, 지연 시간이 실행 폭만큼 중요합니다.

Vera CPU는 AI 팩토리 규모에서 고처리량 CPU 실행을 위한 더 균형 잡힌 플랫폼을 만들기 위해 Olympus 코어를 NVIDIA 확장형 코히어런시 패브릭(SCF, Scalable Coherency Fabric)과 SOCAMM2(소형 압축 장착 메모리 모듈, Small Outline Compression Attached Memory Module) LPDDR5X 메모리와 결합합니다.

NVIDIA 확장형 코히어런시 패브릭

NVIDIA 확장형 코히어런시 패브릭(SCF)은 Vera CPU의 통신 백본으로, 코히어런트 고대역폭 온다이(on-die) 패브릭을 통해 Olympus 코어, 공유 캐시, 메모리 컨트롤러, I/O, NVLink-C2C 인터페이스를 연결합니다. 최대 3.4 TB/s의 이분 대역폭(bisectional bandwidth)을 제공하고 모든 코어에 걸쳐 164 MB 통합 L3 캐시를 통합합니다. 캐시와 패브릭 자원을 단일형(monolithic) 컴퓨팅 다이에 배치함으로써 Vera CPU는 분산된 칩렛(chiplet) 설계에서 흔한 다이 간 홉 지연과 가변성을 피하고, 프로세서 전반에 걸쳐 공유 데이터에 대한 더 예측 가능한 접근을 지원합니다.

이는 상태를 자주 교환하고, 공유 데이터 구조를 순회하며, 런타임, 검색, 분석, 오케스트레이션 코드 사이를 이동하는 에이전트 워크로드에 특히 중요합니다. SCF는 경쟁을 줄이고, 캐시 공유를 개선하며, CPU 자원 전반에 걸쳐 코히어런트 접근을 유지하는 동시에 GPU 및 스케일업 플랫폼에 대한 NVLink-C2C 연결의 통합 지점 역할을 합니다.

SOCAMM2 LPDDR5X 메모리

Vera CPU는 AI 인프라에 필요한 대역폭, 효율성, 용량을 제공하기 위해 SOCAMM2 LPDDR5X 메모리를 사용합니다. 메모리 서브시스템은 최대 1.2 TB/s의 집계 대역폭, 즉 코어당 최대 14 GB/s를 제공하여 각 Olympus 코어가 높은 동시성 하에서도 유용한 작업을 지속할 수 있게 합니다. 기존 DDR5 및 MRDIMM 기반 서버 설계와 비교하여 SOCAMM2 LPDDR5X는 이 대역폭을 실질적으로 낮은 메모리 전력으로 제공하여, 대역폭 집약적인 AI, 분석, 그래프, RL 워크로드 전반에 걸쳐 코어에 공급을 유지하면서 플랫폼 전력을 절감합니다.

SOCAMM2는 또한 LPDDR 메모리에 엔터프라이즈 수준의 서비스 가용성을 제공합니다. 납땜 방식의 LPDDR을 사용하는 대신, Vera CPU는 고속 LPDDR5X에 필요한 짧은 전기적 경로를 유지하면서 데이터 센터 배포 모델을 지원하는 모듈형 현장 교체 가능 메모리 모듈을 사용합니다. 결과는 높은 대역폭, 강력한 전력 효율성, 광범위한 신뢰성·가용성·서비스 가용성(RAS, Reliability, Availability, and Serviceability) 기능을 결합한 메모리 아키텍처로, AI 팩토리 전반에 걸쳐 CPU 성능을 확장하는 데 필수적입니다.

에이전틱 AI 데이터를 더 빠르고, 더 안전하게, 대규모로 이동

고성능 CPU는 명령어를 빠르게 실행하는 것 이상을 수행해야 합니다. AI 팩토리 전반에 걸쳐 데이터를 안전하고 효율적으로 이동시켜야 합니다. 현대 AI 시스템은 CPU가 가속기, 메모리, 스토리지, 네트워킹, 기타 프로세서를 조율하는 것에 의존하므로, 스케일업 연결성과 I/O 대역폭이 전체 시스템 성능의 핵심입니다.

Vera CPU는 코히어런트 NVIDIA NVLink-C2C, 듀얼 소켓 확장, PCIe 6.4, CXL 3.1, 컨피덴셜 컴퓨팅(Confidential Computing)을 균형 잡힌 플랫폼 아키텍처로 통합합니다. 이러한 기능들은 차세대 AI 인프라 전반에 걸쳐 안전하고 고대역폭 데이터 이동을 지원합니다.

듀얼 소켓 확장

Vera CPU는 고대역폭 소켓 간 연결을 위한 2세대 NVLink-C2C를 사용하여 단일 소켓 배포에서 코히어런트 듀얼 소켓 플랫폼으로 확장됩니다. 이를 통해 두 CPU가 코히어런트 데이터 공유와 예측 가능한 스케일업 성능으로 통합된 시스템으로 작동하면서, AI 팩토리, HPC, 엔터프라이즈 컴퓨팅 전반의 대규모 CPU 워크로드를 위한 더 단순한 소프트웨어 모델을 유지합니다.

기존 x86 서버 CPU는 종종 각 소켓 내에 여러 NUMA 도메인을 노출할 수 있는 칩렛 기반 설계를 사용합니다. 대규모 듀얼 소켓 시스템에서는 소프트웨어가 원격 액세스, 추가 다이 홉, 불균등한 지연을 피하기 위해 스레드, 메모리, I/O 트래픽을 신중하게 배치해야 하는 분산된 메모리 토폴로지가 생성될 수 있습니다.

Vera CPU는 소프트웨어 우선(software-first) 접근 방식을 취합니다. 각 소켓은 단일 NUMA 도메인으로 표시되어, 듀얼 소켓 시스템에서 깔끔한 2 NUMA 노드 토폴로지를 만듭니다. 단일형 컴퓨팅 다이, 통합 시스템 수준 캐시, 코히어런트 패브릭을 중심으로 구축되어 토폴로지 기반 가변성을 줄이고 여러 다이를 넘나드는 것과 관련된 오버헤드를 피합니다. 그 결과는 프로그래밍과 튜닝이 더 쉽고, 에이전틱 AI, RL, 분석, 엔터프라이즈 워크로드에서 더 예측 가능한 확장이 가능한 듀얼 소켓 플랫폼입니다.

IO 연결성

차세대 네트워킹, 스토리지, 가속기, 주변 장치에 대한 고대역폭 유연 연결을 위한 PCIe 6.4를 포함합니다. 듀얼 소켓 구성은 176개의 PCIe 레인을 제공하여 다양한 플랫폼 설계를 지원합니다. Vera CPU는 또한 더 큰 메모리 풋프린트의 이점을 활용하는 워크로드를 위한 코히어런트 메모리 확장, 메모리 풀링, 컴포저블 인프라를 지원하는 CXL 3.1을 지원합니다.

컨피덴셜 컴퓨팅

Vera Rubin NVL72는 불필요한 데이터 복사나 바운스 버퍼 없이 CPU, 코히어런트 GPU, 인터커넥트 전반에 걸쳐 사용 중인 데이터를 보호하며, 스케일업 AI 인프라 전반에 걸쳐 컨피덴셜 컴퓨팅을 확장합니다. VM별 암호화 키를 사용하는 Arm CCA/RME를 기반으로 구축된 Vera CPU는 컨피덴셜 VM 격리를 제공하고, TDISP 지원 코히어런트 디바이스의 보안 할당을 지원하며, 코히어런트 링크 전반에 걸쳐 데이터를 보호하기 위해 인증된 C2C 암호화를 사용합니다. 이러한 기능들이 함께 서버에서 랙 규모까지 보안 AI 워크로드를 위한 통합 신뢰 도메인(trust domain)을 구축합니다.

선도적인 에이전틱 워크로드 성능 제공

Olympus 코어와 패브릭, SOCAMM2 LPDDR5X 메모리, 듀얼 소켓 스케일업 아키텍처를 갖추고, 다음 질문은 이러한 설계 선택이 에이전틱 워크로드 성능으로 어떻게 이어지는가입니다. 에이전틱 시스템은 Python 실행, 코드 컴파일, 정적 분석, 도구 기반 소프트웨어 워크플로에 상당한 CPU 시간을 소비합니다. 이러한 소프트웨어 경로는 대규모 명령어 풋프린트, 분기가 많은 제어 흐름, 동적 런타임 동작, 긴 의존성 체인에 부담을 줍니다.

핵심 지표는 모든 소켓에 부하가 가득 찬 상태에서의 싱글스레드 성능입니다. 에이전틱 AI와 강화학습 환경에서는 수많은 샌드박스와 툴, 실행 환경이 동시에 동작합니다. 개별 에이전트 단계는 각 스레드의 강력한 처리 능력에 의존하지만, CPU 전체가 소켓 수준의 전력, 캐시, 메모리 대역폭, 패브릭 자원을 공유하는 과부하 상황에서도 이러한 처리 능력이 흔들림 없이 유지되어야 합니다. 따라서 시스템 부하가 높을 때의 싱글스레드 성능이야말로 AI 팩토리 규모에서 에이전트의 처리량과 응답성, 그리고 CPU 단의 효율성을 판단할 수 있는 가장 실질적이고 정확한 측정 지표가 됩니다.

NVIDIA Vera CPU 아키텍처와 성능에 대해 더 자세히 알아보려면 NVIDIA Vera CPU 백서를 참조하세요.

SPEC CPU® 2026 결과는 2026년 7월 내부적으로 측정되었습니다. 성능 측정 및 구성에 대한 자세한 내용은 NVIDIA Vera CPU 백서를 참조하세요.

SPEC®, SPEC CPU®, SPECrate®는 표준 성능 평가 협회(SPEC, Standard Performance Evaluation Corporation)(www.spec.org)의 등록 상표입니다.

Discuss (0)

Tags