Agentic AI / Generative AI

NVIDIA Vera Storage 벤치마크: AI 네이티브 스토리지를 위한 더 빠른 암호화, 압축, 무결성 검사 및 복구

Reading Time: 8 minutes

스토리지는 에이전틱 AI 워크플로우의 핵심 요소로 동작합니다. 에이전트가 기업 지식을 검색하고, 영구 메모리에 접근하며, KV 캐시 데이터를 재사용하고, 툴을 실행하여 새로운 결과를 생성할 때 스토리지는 에이전트 추론 루프를 지탱하는 데이터를 끊임없이 공급하고 보존해야 합니다.

에이전트의 개별 단계마다 여러 스토리지 작업이 발생할 수 있으며, 더 커진 컨텍스트 윈도우를 사용하는 수천 개의 동시 실행 에이전트 전반에서 이러한 작업이 반복됩니다. 이 데이터를 제대로 공급하고 보존하려면 단순한 읽기/쓰기 이상의 기능이 필요합니다. AI 추론은 GPU에서 실행되지만, 에이전트 프로세스, 툴 호출, 데이터 관리 작업, 그리고 이를 지원하는 스토리지 서비스는 CPU에서 실행됩니다.

쓰기 작업 중 스토리지는 데이터를 압축 및 암호화하고, 체크섬을 계산하며, 중복성을 산출할 수 있습니다. 읽기 작업 중에는 애플리케이션에 데이터를 반환하기 전에 검증, 복호화, 압축 해제, 복원 작업을 수행할 수 있습니다. 이러한 기능은 AI 시스템의 보안과 복원력에 필수적이지만, 데이터가 스토리지 경로를 통과할 때 추가적인 CPU 연산을 소모합니다.

에이전트의 동시성과 컨텍스트 용량이 늘어남에 따라, 스토리지는 애플리케이션 응답성이나 토큰 생성 속도를 저하시키지 않으면서 이러한 작업을 더 많이 처리해야 합니다. 즉, 가속 컴퓨팅 요구 수준에 맞춰 데이터를 공급할 수 있어야 합니다.

이러한 기능 대부분은 데이터 경로에 직접 포함되어 있어, 단 하나의 작업만 지연되어도 전체 데이터 흐름이 느려질 수 있습니다. 일반적인 CPU로 이를 확장하려면 더 많은 코어, 전력, 냉각 시스템이 필요해 인프라 비용이 증가하며, 그럼에도 성능은 가장 느린 단계에 종속됩니다. 데이터를 보호하고 준비하는 프로세서가 속도를 맞추지 못한다면, 더 빠른 SSD와 네트워크를 도입하더라도 그 잠재력을 완전히 발휘할 수 없습니다.

스토리지 처리 성능 격차 해소

AI 네이티브 데이터 플랫폼을 위한 NVIDIA STX 파운데이션의 핵심 요소인 NVIDIA Vera BlueField-4 STX 스토리지 프로세서NVIDIA Vera CPU의 성능을 스토리지 데이터 경로에 직접 접목합니다. NVIDIA Rubin GPU에 데이터를 원활하게 공급하도록 설계된 동일한 Vera CPU 아키텍처가 CPU 측 스토리지 처리 속도 역시 가속합니다.

벤치마크 결과는 Vera가 암호화·복호화, 복구, 무결성 검사, 압축·압축 해제, 그리고 다단계 스토리지 파이프라인 전반에서 x86 CPU를 능가함을 보여줍니다. 이러한 성능 향상은 스토리지 플랫폼이 CPU 및 전력 오버헤드를 줄이면서 더 많은 데이터를 처리하고 필수 엔터프라이즈 서비스를 적용할 수 있게 하며, 더 높은 압축 처리량은 스토리지 용량과 대역폭 요구를 줄이는 데 기여합니다.

이 글에서는 BlueField-4 STX의 Vera CPU가 에이전틱 AI에 필요한 스토리지 처리를 어떻게 가속하는지 설명합니다. 이를 통해 AI 네이티브 스토리지 플랫폼이 더 많은 데이터를 보호·검증·압축하면서 스토리지 처리 처리량과 효율성을 높이는 방법을 살펴봅니다.

Vera CPU 아키텍처: 스토리지가 요구하는 두 가지 핵심 가치의 충족

Vera CPU는 Armv9.2 명령어 세트와 완전히 호환되는 NVIDIA 설계의 Olympus CPU 코어 88개를 포함합니다. 이 CPU는 176개의 NVIDIA Spatial Multithreading 스레드를 지원합니다. 또한 강력한 단일 스레드 성능과 AI 팩토리 규모의 고처리량 CPU 실행을 지원하기 위해 NVIDIA Scalable Coherency Fabric(SCF), Small Outline Compression Attached Memory Module(SOCAMM2) LPDDR5X 메모리와 결합됩니다.

SCF는 코어, 공유 캐시, 메모리 컨트롤러, I/O 전반에 걸쳐 코히어런트한 온다이 데이터 경로를 제공하며, 최대 3.4 TB/s의 이분 대역폭과 164 MB의 통합 L3 캐시를 갖추고 있습니다. 이를 통해 워크로드가 프로세서 전체로 확장될 때 활성 코어가 공유 데이터에 고대역폭으로 예측 가능하게 접근할 수 있습니다. SOCAMM2 LPDDR5X 메모리 서브시스템은 최대 1.2 TB/s의 집계 메모리 대역폭, 즉 코어당 최대 14 GB/s를 제공하여 대역폭 집약적이고 고동시성 워크로드에서 NVIDIA Olympus 코어를 원활하게 공급합니다. 모듈식 현장 교체 가능 메모리는 LPDDR5X의 전력 효율성과 데이터센터 인프라에 필요한 서비스 가능성 및 신뢰성을 결합합니다.

스토리지 프리미티브는 CPU에 두 가지 서로 다른 요구를 부여합니다. 첫째, 각 데이터 스트림 내에서 암호화, 무결성 검사, 복구, 압축, 압축 해제는 후속 스토리지 처리가 진행되기 전에 빠르게 완료되어야 하므로 지속적인 코어당 성능이 중요합니다. 둘째, 시스템 전체에서 이러한 작업들은 수많은 동시 스트림에 걸쳐 실행되고 반복적으로 캐시와 메모리를 통해 데이터를 이동시키므로, 대역폭과 예측 가능한 레이턴시가 똑같이 중요합니다.

Vera는 이 두 가지 요구를 모두 충족합니다. Olympus 코어는 광범위한 명령어 처리량, 고급 분기 예측, 깊은 비순차 실행, 벡터 및 암호화 리소스를 결합하여 제어 집약적 및 데이터 처리 코드 전반에서 각 코어가 명령어 처리량을 유지할 수 있도록 합니다.

NVIDIA Spatial Multithreading, 모놀리식 컴퓨팅 다이, SCF, 통합 L3 캐시, 고대역폭 SOCAMM2 메모리는 스레드 간 간섭을 줄이고 부하 하에서 더 예측 가능한 데이터 접근을 지원하면서 활성 코어에 데이터를 원활하게 공급하는 데 기여합니다. 이러한 기능들이 함께 작동하여 암호화, 무결성 검사, 패리티 계산, 압축, 다단계 스토리지 파이프라인에서 측정된 성능 향상을 설명합니다.

이를 통해 BlueField-4 STX Storage Processor는 CPU 리소스, 전력, 냉각의 비례적 증가 없이 동시 데이터 스트림 전반에서 더 많은 CPU 측 스토리지 처리를 유지할 수 있습니다.

기초 스토리지 성능 측정

스토리지 작업은 읽기, 쓰기, 복구 경로 전반에 걸쳐 반복적으로 실행됩니다. 이러한 작업의 처리량과 효율성은 CPU 측 처리가 SSD 및 네트워크 속도를 따라갈 수 있는지, 아니면 데이터 경로의 병목으로 작용하는지를 결정짓는 핵심 요인입니다. 본 게시글의 스토리지 프리미티브 마이크로벤치마크는 이러한 기능들을 격리하여 프로세서만의 순수한 기여도를 측정합니다. 이를 통해 더 높은 처리량과 뛰어난 효율성의 스토리지 서비스를 구축하는 데 필요한 Vera의 CPU 성능과 여유 자원(Headroom)을 보여줍니다.

각 테스트는 이미 메모리에 보관된 데이터를 사용하는 단일 프로세스 내에서 실행됩니다. 별도로 명시된 경우를 제외하고, 테스트는 파일 I/O, 디스크 성능, 네트워킹, 명령 시작, 외부 장치 병목 현상을 제외합니다. 벤치마크 세트는 OpenSSL, Zstandard, LZ4를 포함한 일반적인 라이브러리와 Arm 및 x86 프로세서에서 사용 가능한 네이티브 명령어를 사용하도록 최적화된 비교 가능한 구현을 사용합니다.

전용 테스트 프레임워크가 각 워크로드를 일관되게 실행하며 버퍼 크기, 스레드 수, CPU 배치, 타이밍, 정확성 검증, 결과 수집을 제어합니다. 알고리즘과 많은 소프트웨어 구현은 널리 채택되어 있습니다. 테스트 프레임워크는 Vera와 x86 전반에 동일한 워크로드 정의와 제어를 적용하여 일관된 프로세서 비교를 가능하게 합니다. 결과는 소스 코드, 스크립트, 고정된 소프트웨어 버전, 구성 및 결과 파일을 사용하여 재현할 수 있지만, 완전한 벤치마크 세트는 기성 공개 벤치마크가 아닙니다.

이러한 측정 결과는 안전한 데이터 이동, 복원력, 용량 효율성, 서비스 밀도에 영향을 미치는 스토리지 핵심요소들에 대한 Vera의 성능 기준을 제시합니다. 실제 프로덕션 스토리지 경로는 동일한 데이터에 이러한 연산들을 복합적으로 적용하므로 CPU 연산 요구량이 누적되는 특성을 보입니다.

프로덕션 스토리지 소프트웨어에 통합될 경우, 이러한 개별 연산의 성능은 전체 처리량과 CPU 효율성에 직결됩니다. 개별 프리미티브 및 다단계 파이트라인 전반에 걸친 높은 처리량은 스토리지 소프트웨어에 충분한 CPU 여유 자원을 제공하여 SSD와 네트워크의 속도를 유지하고, 동시 데이터 흐름을 지원하며, 필수적인 데이터 서비스를 효율적으로 실행할 수 있도록 돕습니다. 다만 전체 스토리지 시스템이나 GPU 성능에 미치는 최종 영향을 수치화하려면 엔드투엔드(End-to-End) 테스트가 별도로 요구됩니다.

더 빠른 암호화로 한층 안전해진 AI 데이터 보호

AI 팩토리는 모델 자산, 기업 지식, 에이전트 컨텍스트, 프롬프트, 출력 결과, 고객 데이터 등 중요한 민감 정보를 처리합니다. AES-128은 저장 데이터(Data-at-rest) 및 전송 중 데이터(Data-in-flight) 암호화에 폭넓게 쓰이는 방식입니다. 암호화는 쓰기 경로에 직접 위치하므로, 해당 처리량이 암호화 병목 현상 발생 전 플랫폼이 초당 처리할 수 있는 보안 데이터의 양을 좌우합니다. Vera는 비교 대상인 x86 CPU 대비 최대 1.43배 더 높은 AES-128 암호화 처리량을 제공합니다.

복호화는 읽기 경로에서 이에 대응하는 작업을 수행하며, Vera는 비교에 사용된 x86 CPU 대비 AES-128 복호화 처리량을 최대 1.29배 향상시킵니다.

더 높은 암호화 처리량은 스토리지 시스템이 쓰기를 제한하지 않고 더 많은 데이터를 보호할 수 있게 하며, 더 빠른 복호화는 보호된 데이터를 에이전트, 애플리케이션 또는 가속기에 반환하는 데 필요한 시간을 줄입니다. 이를 통해 스토리지 시스템이 증가하는 AI 데이터 볼륨을 보호하고 반환하면서 스토리지 성능 예산의 증가하는 비중을 소비하지 않아도 됩니다.

더 빠른 AI 데이터 보호 및 복구

스토리지 플랫폼은 드라이브, 노드 또는 데이터 조각을 사용할 수 없게 될 때 데이터를 보호하기 위해 이레이저 코딩(Erasure Coding)을 사용합니다. 리드-솔로몬(Reed-Solomon) 인코딩은 중복성(Redundancy)을 생성하고, 복구 작업은 이 중복성을 활용하여 누락되거나 손상된 데이터를 복원합니다. 인코딩은 주로 쓰기 경로에서 발생하며, 복구는 재구축, 복구 작업 또는 성능이 저하된 상태의 읽기(Degraded Read) 중에 수행됩니다. 두 작업은 서로 다른 연산 및 메모리 접근 패턴을 사용하므로 성능 결과가 다르게 나타날 수 있습니다.

Vera는 복구 워크로드에서 x86 CPU 대비 최대 3.26배 더 높은 리드-솔로몬 처리량을 제공합니다.

더 높은 Reed-Solomon 처리량은 스토리지 시스템이 보호된 데이터를 쓰고 누락된 데이터를 더 빠르게 재구성할 수 있게 합니다. 선택된 효율성 측정에서 Vera는 또한 사용 가능한 CPU 전력 범위 내에서 더 많은 보호 작업을 완료하여 재구축을 단축하고 일반 데이터 서비스와의 경합을 줄이는 데 도움이 됩니다.

더 높은 처리량으로 데이터 무결성 검증

데이터가 이동, 저장 및 검색되는 과정에서 정확성이 유지되어야 합니다. 순환 중복 검사(CRC)는 스토리지 시스템이 우발적인 데이터 손상을 감지하는 데 사용하는 체크섬을 생성합니다.

CRC와 리드-솔로몬(Reed-Solomon)은 상호 보완적인 역할을 수행합니다. CRC가 데이터가 예상 결과와 더 이상 일치하지 않음을 감지하면, 리드-솔로몬은 누락되거나 손상된 정보를 재구성하는 데 필요한 중복성을 제공합니다.

스토리지 시스템은 버퍼 간에 데이터를 복사하는 과정을 포함해 쓰기 및 읽기 경로 모두에서 CRC를 계산할 수 있습니다. 데이터 용량이 늘어남에 따라 이러한 검사는 CPU 자원의 상당 부분을 소모하게 됩니다.

Vera는 x86 CPU 대비 최대 3.67배 더 높은 CRC32C 처리량을 제공합니다.

더 높은 CRC32C 처리량은 스토리지 시스템이 무결성 검사로 인해 읽기나 쓰기가 제한되지 않고 더 많은 데이터를 검증할 수 있게 합니다. 에이전틱 워크로드의 경우, 이는 CPU 측 처리 지연을 줄이면서 신뢰할 수 있는 컨텍스트, 영구 메모리, 엔터프라이즈 데이터를 반환하는 데 도움이 됩니다.

더 빠른 압축 및 압축 해제로 데이터 공간 차지 축소

에이전틱 AI는 점점 더 많은 컨텍스트, 로그, 체크포인트, 검색 데이터, 중간 출력, 영구 메모리를 생성합니다. 압축은 이 데이터에 필요한 스토리지 용량과 이동에 필요한 대역폭을 줄입니다. 압축 해제는 데이터를 읽을 때 복원합니다. 스토리지 아키텍처에 따라 압축은 데이터가 쓰여진 후 인라인으로 또는 후처리로 실행될 수 있으며, 압축 해제는 일반적으로 압축된 데이터를 읽을 때 필요합니다. 압축 처리량은 데이터가 얼마나 빠르게 줄어들 수 있는지에 영향을 미치며, 압축 해제 처리량은 스토리지 시스템이 에이전틱 AI 애플리케이션에 데이터를 얼마나 빠르게 반환할 수 있는지에 영향을 줄 수 있습니다. 다음 벤치마크는 이러한 작업을 독립적으로 측정합니다.

Vera는 측정된 스레드 수 전반에서 우위를 유지하며 x86 CPU 대비 압축 처리량을 최대 3.29배 향상시킵니다.

압축 해제 벤치마크는 압축된 데이터를 읽을 때의 이에 대응하는 작업을 측정합니다. Vera는 동시성 하에서 x86 CPU 대비 압축 해제 처리량을 최대 1.72배 향상시키며, 더 많은 워커 스레드가 병렬로 실행될수록 우위가 커집니다.

압축 성능은 알고리즘, 데이터 특성, 압축 수준, 버퍼 크기, 스레드 수에 따라 달라지므로, 이러한 결과는 측정된 워크로드에 특정적으로 적용됩니다. 더 높은 압축 처리량은 스토리지 시스템이 CPU 측 처리 성능을 유지하면서 쓰여지고 저장되고 전송되는 데이터의 양을 줄일 수 있게 합니다.

더 높은 압축 해제 처리량은 스토리지 시스템이 에이전트와 애플리케이션에 압축 해제된 데이터를 더 빠르게 반환하는 데 도움이 됩니다. 이러한 기능들이 함께 작동하여 에이전틱 AI 워크로드가 증가함에 따라 각 프로세서가 더 많은 데이터를 압축 및 압축 해제할 수 있도록 하면서 스토리지 용량 및 대역폭에 대한 압박을 낮춥니다.

다단계 스토리지 쓰기 경로 가속화

스토리지 시스템은 데이터 서비스를 독립적으로 실행하는 경우가 거의 없습니다. 안전한 쓰기 경로는 데이터의 풋프린트를 줄이기 위해 압축한 다음 쓰여지기 전에 암호화할 수 있습니다. 벤치마크 세트에는 각 데이터 버퍼에 압축에 이어 암호화를 적용하는 메모리 상주 파이프라인이 포함됩니다. 개별 작업을 측정하는 이전 벤치마크와 달리, 이 테스트는 두 가지 CPU 집약적 스토리지 기능이 순차적으로 실행될 때의 총 파이프라인 처리량을 측정합니다.

Vera는 압축 및 암호화 2단계 파이프라인에서 벤치마크에 사용된 x86 CPU 대비 파이프라인 처리량을 최대 3.21배 향상시킵니다.

이 결과는 Vera의 성능 우위가 앞서 측정된 개별 작업을 넘어 데이터를 압축하고 보호하는 스토리지 쓰기 경로를 대표하는 다단계 순서로 확장됨을 보여줍니다. 더 높은 다단계 파이프라인 성능은 스토리지 시스템이 프로세서당 더 많은 데이터를 처리할 수 있게 하여 에이전틱 AI 데이터 볼륨이 증가함에 따라 쓰기 처리량을 유지하는 데 도움이 됩니다.

Vera를 활용한 에이전트 실행 및 스토리지 확장

에이전틱 AI는 CPU 실행과 스토리지 처리를 동일한 AI 팩토리 데이터 경로의 일부로 만듭니다.

CPU는 모델 호출 사이에 도구, 코드, 검색, 분석, 데이터 처리 단계를 실행합니다. 스토리지 시스템은 이러한 단계에 필요한 데이터를 보호, 검증, 압축하고 반환합니다. 두 가지 모두 AI 팩토리 전반에 걸쳐 사용 가능한 유한한 CPU, 전력, 냉각 리소스 내에서 확장되어야 합니다.

Vera는 에이전틱 AI 시대를 위한 CPU 의존적 작업을 가속하도록 설계되었습니다. NVIDIA Vera Rubin에서는 NVIDIA GPU의 호스트 CPU 역할을 하며 에이전트 실행을 지원합니다. 독립형 Vera는 에이전틱 도구에서 코어당 최대 1.8배 높은 성능을 제공합니다. BlueField-4 STX에서 Vera는 AI 네이티브 스토리지 플랫폼에서 사용하는 CPU 측 처리를 구동합니다.

벤치마크 결과는 Vera가 안전한 데이터 접근을 위한 암호화 및 복호화, 스토리지 재구축 및 복구 중 누락되거나 손상된 데이터의 더 빠른 재구성을 위한 Reed-Solomon 복구, 고처리량 무결성 검증을 위한 CRC32C, 그리고 용량 및 대역폭 요구를 줄이고 데이터 검색을 가속하기 위한 압축 및 압축 해제를 가속함을 보여줍니다.

이러한 기능들을 개별적으로 그리고 다단계 쓰기 경로 내에서 유지함으로써, Vera는 AI 네이티브 스토리지 플랫폼이 CPU 측 지연을 줄이면서 안전하고 신뢰할 수 있는 데이터를 처리하고 반환하는 데 도움이 됩니다. 또한 CPU 리소스, 전력, 냉각의 비례적 증가 없이 더 많은 동시 데이터 흐름과 더 높은 서비스 밀도를 지원합니다. 선택된 워크로드에서 Vera는 또한 와트당 더 높은 측정 성능을 제공하여 사용 가능한 프로세서 전력 예산 내에서 더 많은 CPU 측 스토리지 처리를 가능하게 합니다.

컴퓨팅과 스토리지 전반에 걸친 공통 Vera CPU 아키텍처와 소프트웨어 툴체인은 에이전트 실행과 지원 데이터 인프라 모두를 확장하기 위한 일관된 기반을 제공합니다.

Vera CPU 및 BlueField-4 STX에 대해 자세히 알아보기

Discuss (0)

Tags