NVIDIA Groq 3 LPX는 NVIDIA Vera Rubin 플랫폼을 위한 인터랙티브 AI 추론 가속기입니다. 이 플랫폼의 핵심인 NVIDIA Vera Rubin NVL72는 소형부터 대형까지, 오픈 소스부터 클로즈드 모델까지 폭넓은 AI 워크로드에서 높은 처리량과 뛰어난 인터랙티비티를 제공하는 역대 가장 다재다능한 머신입니다. Groq 3 LPX는 Vera Rubin NVL72와 결합해 최고 수준의 인터랙티비티가 요구되는 서빙 티어까지 플랫폼의 처리 범위를 넓히고, AI 팩토리 환경에서 사용자 경험을 뒷받침하는 Vera Rubin의 역량을 한층 강화합니다.
이 포스트에서는 Groq 3 LPX 시스템의 첫 번째 제3자 벤치마크 결과를 소개합니다. Artificial Analysis는 Groq 3 LPX에서 Gemma 4 31B 모델을 대상으로 100K 컨텍스트 벤치마크를 진행했으며, 초당 3,431개의 출력 토큰을 기록해 세계 최고 수준의 인터랙티비티를 확인했습니다. 이러한 성능을 뒷받침하는 기술을 바탕으로 Groq 3 LPX와 Vera Rubin NVL72를 결합하면, Vera Rubin 플랫폼은 높은 인터랙티비티와 긴 컨텍스트를 요구하는 2조 개 이상 파라미터 규모의 멀티에이전트 시스템까지 서빙할 수 있습니다.
높은 인터랙티비티에서 긴 컨텍스트가 중요한 이유
에이전틱 세션은 멀티턴 추론을 특징으로 합니다. 각 턴이 끝날 때마다 에이전트의 출력이 지속적으로 증가하는 컨텍스트에 추가되어 이후의 모든 턴에 입력됩니다.

그림 1에서 볼 수 있듯이 에이전틱 세션이 이어질수록 컨텍스트는 수십만 토큰까지 늘어날 수 있으며, 특히 수백 턴이 넘는 세션에서 그 증가 폭이 커집니다. 즉, 작업이 진행될수록 에이전트는 지금까지 축적된 정보를 반복해서 처리해야 합니다.
긴 컨텍스트를 지원하지 않으면 에이전트는 이전 정보의 일부만 고려할 수밖에 없습니다. 기반 모델이 아무리 빠르고 뛰어나더라도 컨텍스트가 제한되면 에이전틱 역량도 제한됩니다. 가장 유능한 에이전트는 빠른 속도뿐 아니라, 세션이 길어져도 충분한 컨텍스트를 유지할 수 있어야 합니다.
긴 컨텍스트에서 초고속 인터랙티비티로 모델을 서빙하는 것이 어려운 이유
100K 입력 토큰을 위한 KV 캐시를 관리하면서 사용자당 초당 3,000개 이상의 토큰으로 모델을 서빙하는 것은 독특한 시스템 과제를 야기합니다. 추론 시스템에서 텐서 병렬화(TP, Tensor Parallelism)와 같은 분할 정복(divide-and-conquer) 기법은 시스템이 필요한 조정(집합 연산)을 효율적으로 관리할 수 있다면 수십 배의 속도 향상을 제공할 수 있습니다. 그러나 최고 수준의 인터랙티비티를 위해서는 매우 작은 배치 크기가 필요하며, 이 경우 고정 조정 비용이 텐서 병렬화(TP)로 절약하는 시간을 초과할 수 있습니다.
텐서 병렬화(TP)는 두 가지 요소로 구성됩니다. 여러 칩에 분산하여 일련의 계산을 병렬로 수행하는 부분과 결과를 합산하는 부분입니다. 높은 인터랙티비티 추론에 필요한 매우 작은 배치 크기에서 텐서 병렬화(TP)를 효과적으로 만들기 위해서는 긴밀한 조정이 필요합니다. 많은 소형 텐서가 컴퓨팅 유닛 사이를 이동해야 하며, 각 텐서는 필요한 위치에 필요한 시간에 정확히 도착해야 합니다. 통신과 결과 합산에 소요되는 시간은 계산을 분산함으로써 절약하는 시간과 비슷하거나 그보다 더 많아질 수 있습니다.

어떤 시스템에서든 프로세서 간 네트워크가 이러한 일련의 전송을 조정해야 합니다. 그림 2에서 볼 수 있듯이 각 개별 전송에 소요되는 총 시간에는 두 가지 구성 요소가 있습니다.
- 첫 비트 지연(First bit latency): 전송에 사용할 특정 통신 링크를 결정하고, 송수신 링크 엔드포인트를 동기화하고, 충돌(예: 두 칩이 동시에 단일 링크를 통해 데이터를 전송하려는 경우)을 중재하는 데 소요되는 시간입니다.
- 전송 시간(Transfer time): 네트워크를 통해 데이터를 이동하는 데 실제로 걸리는 시간으로, 전송되는 데이터 양과 네트워크 대역폭의 함수입니다.
텐서 병렬화(TP)가 제공할 수 있는 수십 배의 속도 향상을 실현하려면 첫 비트 지연을 절대 최솟값으로 줄여야 합니다. 전체 포워드 패스에 걸쳐 모델 가중치와 긴 컨텍스트 KV 캐시 모두에 병렬화를 적용하면서 이를 달성하려면, 낮은 지연과 긴 컨텍스트를 모두 염두에 두고 설계된 접근 방식이 필요합니다.
Groq 3 LPX가 긴 컨텍스트에서 초고속 인터랙티비티로 모델을 서빙하는 방법
NVIDIA Groq 3 LPX는 컴파일러 스케줄링된 워크로드 계획을 사용하여 긴 컨텍스트에서 초고속 인터랙티비티로 모델을 서빙합니다. 여기에는 칩 간(C2C, Chip-to-Chip) 랙 내부 네트워킹과 프로세서 간 통신과 컴퓨팅을 대폭 중첩하는 능력이 포함됩니다.
긴밀하게 스케줄링된 칩 간 통신
Groq 3 LPX는 결정론적(deterministic) 실행 모델을 사용합니다. 이는 컴파일러가 다음에 대한 가시성을 가짐을 의미합니다.
- 256개의 LP30 로컬 프로세싱 유닛(LPU, Local Processing Unit)의 각 개별 컴퓨팅 유닛
- 해당 칩들이 집합적으로 보유한 128GB의 총 SRAM 기반 메모리
- 칩당 112Gbps로 작동하는 96개의 C2C 링크
이 정보를 활용하여 워크로드 실행 전에 클록 사이클 단위까지 워크로드가 어떻게 실행될지에 대한 스케줄을 정확히 생성할 수 있습니다.
이는 많은 장점을 제공합니다. 높은 인터랙티비티와 가장 관련이 있는 것은, 워크로드가 시작되기 전에 각 데이터 조각이 각 C2C 링크를 통해 언제 이동할지 계획할 수 있어 실시간 전송 중재(arbitration)가 필요 없어진다는 점입니다. 그림 3과 같이 데이터 전송 스케줄을 미리 생성합니다.

또한 이 사전 워크로드 스케줄링은 데이터 전송 방식의 근본적인 변화를 가능하게 합니다. 많은 시스템에서 소량의 데이터에도 각 전송에 여러 단계가 있습니다.
- 하나의 칩이 데이터 전송을 요청할 수 있습니다.
- 다른 칩이 데이터 전송 가능 여부를 확인하고 위치를 파악할 수 있습니다.
- 데이터가 동시에 전송 중인 다른 데이터와 경쟁해야 할 수 있습니다.
반면, 컴파일러가 생성한 스케줄 덕분에 LPU는 데이터가 준비되는 클록 사이클에 데이터를 전송하고, 그림 4에서 볼 수 있듯이 도착하는 클록 사이클에 데이터를 수신할 수 있습니다.

링크는 LPU 쌍 간의 지점 간(point-to-point) 방식이며, 각 LPU는 프로세서 역할뿐만 아니라 라우터 역할도 할 수 있으므로, 필요한 경우 다른 LPU를 경유하여 데이터를 라우팅할 수 있습니다.
이 네트워킹 설계 덕분에 LPX는 그림 2의 첫 비트 지연을 절대 최솟값으로 줄일 수 있습니다. 대형 배치에서는 이 첫 비트 지연 시간이 실제로 바이트를 전송하는 시간에 비해 미미하지만, 파레토(Pareto)의 높은 인터랙티비티 영역에서는 고정된 전송 초기화 시간을 최소화하는 것이 매우 중요해집니다.
세밀한 컴퓨팅-통신 중첩
LPX 컴파일러는 소형 배치 추론에 필요한 많은 소형 C2C 전송을 사전 스케줄링하는 것 외에도, 이러한 전송과 컴퓨팅을 매우 세밀한 단위로 중첩할 수 있습니다.
컴퓨팅과 통신의 중첩은 어떤 추론 시스템에서도 최적의 성능을 이끌어내기 위해 필수적입니다. LPX는 이를 한 단계 더 발전시킬 수 있습니다. 컴파일러는 320바이트 벡터 수준에서 컴퓨팅 및 통신 유닛의 워크로드를 스케줄링합니다. 그림 5에서 볼 수 있듯이 행렬 곱셈을 일련의 내적(dot product) 연산으로 표현할 수 있다는 사실을 활용하여, 컴파일러는 개별 LPU가 출력 행렬의 320열을 계산하고 계산 직후 C2C 링크를 통해 전송하도록 스케줄링할 수 있습니다.

이를 통해 Groq 3 LPX는 전체 행렬 연산이 완료되길 기다리는 대신, 320바이트 벡터를 채울 만큼의 결과가 준비되는 즉시 데이터 전송을 시작할 수 있습니다. 이는 특히 소형 텐서에서 컴퓨팅과 통신의 중첩을 높여줍니다(그림 6).

이러한 기술들을 결합함으로써 긴 컨텍스트 추론에서 가장 계산 집약적인 어텐션 연산에서 수십 배의 속도 향상을 실현합니다. Groq 3 LPX는 칩 간 계산과 통신의 긴밀하게 조정된 스케줄을 가능하게 함으로써 텐서 병렬화(TP)의 분할 정복 접근 방식을 활용하여 소형 배치, 높은 인터랙티비티 파레토 구간에서도 속도 향상을 제공할 수 있습니다.
Groq 3 LPX, Artificial Analysis 벤치마크에서 100K 컨텍스트의 선도적인 인터랙티비티 달성
Artificial Analysis는 서로 다른 추론 제공업체의 모델에 대해 10K 및 100K 입력 컨텍스트 길이 모두에서 서빙 속도를 테스트하는 표준 벤치마킹 스위트를 보유하고 있습니다. 이 스위트를 사용하여 Artificial Analysis는 2026년 4월에 출시된 310억 개의 파라미터를 가진 밀집형(dense) 모델인 Gemma 4를 100K 벤치마크에서 평가하였습니다. NVIDIA가 자체 데이터센터에 구축한 NVIDIA Groq 3 LPX 시스템은 초당 3,431개의 출력 토큰으로 답변을 생성하였습니다(그림 7).

100K 입력 컨텍스트 길이 샘플에서 중앙값 속도는 초당 3,431토큰이었습니다. 모든 모델과 제공업체에서 동일한 “o200K_basetokens” 토크나이저가 사용되었습니다.
랙 전체에 걸쳐 SRAM에 대한 낮은 지연 액세스를 통해, 이 속도를 수십만 토큰의 컨텍스트에서도 유지할 수 있을 것으로 기대합니다. 에이전틱 코딩 작업에서 에이전트는 100K 컨텍스트 토큰을 초과하는 수백 개의 파일을 쉽게 읽을 수 있으며, 5,000개의 추론 및 출력 토큰을 생성할 때 해당 컨텍스트를 통합할 수 있습니다. 이는 사용자가 혜택을 받는 컨텍스트일 뿐만 아니라, 사용자 경험을 근본적으로 변화시키는 속도이기도 합니다. 이 속도에서 5,000토큰을 디코딩하는 데는 초당 100토큰일 때의 50초에 비해 약 1.5초가 걸립니다. 오늘날 가장 인기 있는 에이전틱 도구들이 초당 약 60토큰에 가깝게 실행된다는 점을 고려하면 이 비교조차도 보수적인 것입니다.

Artificial Analysis는 또한 LPX가 10K 컨텍스트 길이에서도 유사한 성능을 달성할 수 있는지 확인하기 위해 동일한 시스템을 10K 컨텍스트 길이에서 벤치마킹하였습니다. 결과적으로 Groq 3 LPX는 초당 3,382개의 출력 토큰의 중앙값 속도로 응답하였습니다. LPU의 결정론적 아키텍처와 높은 텐서 병렬화의 결합은 컨텍스트 길이에 따른 지연과 출력 토큰/초의 최소한의 변동을 이끌어냅니다.

10K 입력 컨텍스트 길이 샘플에서 중앙값 속도는 초당 3,382토큰이었습니다. 동일한 “o200K_basetokens” 토크나이저가 사용되었습니다.
Artificial Analysis와 NVIDIA의 테스트는 이 두 벤치마크에 대한 NVIDIA 구성에서 출력 결과의 정밀도 또는 모델 품질 손실이 없음을 확인하였습니다. Artificial Analysis 테스트 방법론에 대해 자세히 알아보세요.
코딩 특화 보완 측정으로서, 원시 생성 속도가 에이전틱 코딩 워크플로에서 특히 중요하기 때문에 오픈소스 SPEED-Bench 벤치마크를 실행하였습니다. 동일한 Gemma 4 모델을 사용하여 NVIDIA Groq 3 LPX 시스템은 이러한 코딩 질문에 대한 답변을 초당 4,767개의 출력 토큰의 중앙값 속도와 5,520개의 출력 토큰의 P80 속도로 생성하였습니다. 이는 이 데이터셋에서 작업의 20%가 초당 5,500개 이상의 토큰 속도로 완료되었음을 의미합니다.

중앙값 출력 토큰 속도는 초당 4,767토큰이었으며, 문제의 20% 이상이 초당 5,500토큰 이상의 속도로 솔루션이 생성되었습니다.
NVIDIA Groq 3 LPX가 Vera Rubin NVL72와 함께 긴 컨텍스트 에이전틱 AI 워크로드를 가속화하는 방법
이 새로운 낮은 지연, 결정론적 실행 기능의 Groq 3 LPX와 Vera Rubin NVL72 랙을 결합하면 다음을 포함한 여러 서빙 구성이 가능합니다.
- 표준 프리필-디코드 분리(Standard prefill-decode disaggregation): Vera Rubin NVL72가 프리필(prefill)을 처리하고 턴당 한 번씩 KV 캐시를 전달합니다. Groq 3 LPX는 이 KV 캐시와 SRAM에 보관된 가중치를 사용하여 전체 디코드(decode) 단계를 수행합니다.
- 어텐션-FFN 분리(Attention-FFN disaggregation): Vera Rubin NVL72가 어텐션(attention)을 계산하고 KV 캐시를 DRAM에 보관하는 동안, Groq 3 LPX는 FFN(피드포워드 네트워크, Feed-Forward Network) 레이어를 실행합니다. 전체 어텐션 레이어당 한 번씩 랙 사이에서 중간 토큰만 전송됩니다.
- 외부 드래프터 추측 디코딩(External-drafter speculative decoding): Groq 3 LPX가 Vera Rubin NVL72의 대형 타겟 모델보다 앞서 소형 드래프트 모델을 실행하고, 이를 통해 토큰을 검증하고 확정하며 다음 청크를 위해 거부된 위치를 반환합니다. 각 랙은 자체 모델의 KV 캐시를 보관하며 드래프트 토큰만 링크를 통해 교환됩니다.
이 모든 구성을 통해 각 랙은 가장 잘 실행할 수 있는 워크로드의 부분에 집중할 수 있습니다. 이 완전히 공동 설계된 솔루션으로 LPX는 Vera Rubin 플랫폼을 높은 인터랙티비티와 낮은 지연의 새로운 수준으로 끌어올릴 수 있습니다. 그림 11은 Vera Rubin NVL72와 Groq 3 LPX에서 실행 중인 2조 개의 파라미터로 확장된 GPT-OSS 모델의 추정치를 보여줍니다.

더 알아보기
NVIDIA Groq 3 LPX의 속도는 이제 제3자 벤치마크를 통해 측정되었으며, 에이전틱 워크로드에 중요한 컨텍스트 길이에서 선도적인 인터랙티비티를 제공함을 확인하였습니다. NVIDIA는 또한 코딩 작업의 오픈소스 벤치마크에서 더욱 극단적인 성능을 측정하였습니다.
Groq 3 LPX에 대해 자세히 알아보려면 Inside NVIDIA Groq 3 LPX: The Low-Latency Inference Accelerator for the NVIDIA Vera Rubin Platform을 참조하세요.