Agentic AI / Generative AI

웨이퍼 출하부터 첫 토큰까지: Nemotron과 Palantir Foundry를 통한 공급망 전문성 코드화

Reading Time: 8 minutes

NVIDIA는 세계에서 가장 크고 복잡한 공급망 네트워크 중 하나를 보유하고 있으며, 그 성능은 웨이퍼 출하(Wafer-out)부터 첫 토큰 생성까지의 과정으로 측정됩니다. 이 구간은 크게 두 부분으로 나뉩니다. 랙 설치까지의 시간(Time-to-rack)은 실리콘이 팹(Fab)을 떠나 조립된 시스템이 데이터센터 현장에 도착할 때까지를 의미합니다. 토큰 생성까지의 시간은 그 이후의 모든 과정, 즉 전력, 냉각, 네트워킹 및 인프라가 첫날부터 생산성을 발휘하도록 만드는 소프트웨어 스택을 포괄합니다.

NVIDIA Grace Blackwell NVL72 플랫폼은 전 세계에 분산된 수백만 개의 부품과 수천 개의 공급업체를 기반으로 하며, 최종 시스템은 수십 개의 OEM 및 ODM에 의해 구축됩니다. 단 하나의 컴퓨트 트레이(단일 랙에 들어가는 18개 트레이 중 하나)에도 2개의 NVIDIA Grace CPU, 4개의 NVIDIA Blackwell GPU, 32개의 HBM3e 스택이 필요합니다. Vera Rubin을 위해 구축한 공급망은 Grace Blackwell보다 두 배나 큽니다. CPU, GPU, 메모리는 모두 핵심 부품이며 주 단위로 가용성이 변하므로, 특정 주에 조립을 지연시키던 부품이 다음 주에는 원활하게 공급될 수 있습니다. 각 부품은 자체 자재명세서(BOM), 공급업체, 리드 타임을 가집니다. 이를 랙 내부의 모든 서브 어셈블리에 적용하면, 이는 단순한 공급망을 넘어 거대한 조합론적 문제에 가까워집니다.

위탁 생산 업체는 NVIDIA 직접 공급 부품, NVIDIA 사급 자재, 공급업체 직접 공급 부품이라는 세 가지 풀 중 하나에서 모든 부품이도착할 때까지 조립을 시작할 수 없습니다. 이상적으로는 모든 부품이 동시에 도착해야 하지만, 그렇지 못할 경우 조기 도착한 자재는 지연된 부품이 올 때까지 대기해야 합니다. NVIDIA는 제조 현장에 자재가 수령되는 순간부터 서브 어셈블리 또는 완제품 형태로 출하되는 순간까지의 시간을 측정하며, 이 지표를 소유 시간(Time of Ownership, TOO)이라 부릅니다.

가용성이 매우 유동적인 상황에서 NVIDIA는 각 제조 현장에 어떤 자재를 얼마나 할당할지 결정해야 합니다. 이를 자재 할당 문제라 하며, 매주 수작업으로 재조정됩니다. 자재 할당은 현재 분기와 다음 분기까지 적용되며 직전 주차 항목은 이미 확정되어 있으므로, 매주 새로 수집되는 데이터는 주로 먼 미래의 일정에 영향을 미칩니다.

본 게시물은 주로 랙 설치까지의 시간을 단축하는 데 주안점을 두고 있으며, 이를 위해서는 다음 네 가지 요소가 요구됩니다:

  • 임의의 시점에 발생하는 치명적인 운영 병목 현상을 정확히 파악할 수 있는 실시간 가시성
  • 단일 실패 지점이 전체 생산을 중단시키지 않도록 하는 리던던시 구축
  • 상류 생산 확정 일정이 준수되도록 보장하는 신뢰성
  • 복잡한 자재 할당 의사결정 뒤에 숨은 판단을 지속 가능한 지식으로 전환하여 축적하는 인간 전문성의 코드화

앞선 세 가지 요구사항이 필수적인 운영 베이스라인을 구축한다면, 가장 커다란 혁신은 바로 인간의 전문성을 코드화하는 과정에서 완성됩니다.

Palantir Foundry 내 공급망 커맨드 센터 구축

NVIDIA 공급망 운영 팀은 Palantir와 협력하여 자재 할당 의사결정에 필요한 모든 입력 데이터를 단일 화면에서 조회할 수 있는 환경을 구축했습니다. NVIDIA는 이를 ‘디지털 공급망 지능(Digital Supply Chain Intelligence)’ 커맨드 센터로 명명하고, 분산된 데이터 소스에 파묻혀 있던 리스크와 병목 요인 등 다양한 신호를 가시화하여 의사결정에 적극 반영하고 있습니다.

비디오 1. 컴퓨트 공급망을 위한 소버린 AI

내부적으로는 Palantir Foundry가 운영 맥락을 제공합니다. 온톨로지(Ontology)는 자재, 제조 현장, 확정 일정, 용량, 할당량, 생산 출력, 그리고 비구조화된 정성적 신호들을 하나의 통제된 데이터 레이어로 연결합니다. 행과 테이블이 아닌 객체와 링크로 구성된 이 아키텍처는 운영 현실에 대한 완전한 표현 체계를 형성합니다.

이러한 표현 체계 덕분에 할당 계획 담당자는 수많은 시나리오를 시뮬레이션하고 분석하여 의사결정 공간에 더욱 넓게 접근할 수 있으며, 시간이 지남에 따라 새로운 지식을 축적하고 성능을 개선하는 AI 플라이휠의 기반을 마련할 수 있습니다.

NVIDIA cuOpt를 활용한 정량적 문제 해결

여러 제조 현장에 자재를 할당하는 작업은 정량적 연산에서 출발하며, 의사결정 변수를 정의하는 것부터 정형화됩니다. 즉, ‘제한된 자재를 향후 지정된 기간 동안 어느 현장에, 얼마큼, 언제 배분할 것인가?’의 문제입니다. 그 주위로는 해답을 제한하는 다양한 조건들이 배치됩니다. 특정 Blackwell 서브 어셈블리를 조립할 수 있는 모든 위탁 생산 업체와 자재 입고 시 각 현장이 수용 가능한 처리량이 이에 해당합니다. 또한 필요 부품의 전체 의존성 그래프가 상류 공급망 방향으로 역매핑되어 있어, 솔버(Solver)는 컴퓨트 트레이 조립을 막아서는 원인이 평균적인 자재 공급 수준이 아닌 가장 수급이 어려운 희소 부품이라는 점을 명확히 인식합니다. 이러한 제약 조건(Binding constraint)은 고정된 것이 아니라 다음과 같이 계속해서 변합니다.

  • 주 단위로 변하는 GPU, CPU, 메모리 가용성
  • 세 가지 공급 경로 전체에 걸친 입고 타이밍
  • 고객과 이미 맺은 약정으로, 특정 현장의 공급 부족이 실제로 발생시키는 비용 결정
  • 수천 개의 변수와 제약 조건이 해소되어 단일 주간 할당안으로 도출

GPU 가속 의사결정 최적화를 위한 오픈 소스 라이브러리인 NVIDIA cuOpt가 이 문제를 해결할 수 있습니다. cuOpt는 온톨로지로부터 입력값을 가져와 그 결과를 할당 결정 형태로 다시 기록합니다. 자재 할당은 혼합 정수 선형 계획법(MILP)으로 정립되며, 목표 함수는 소유 시간(TOO)을 최소화하는 방향으로 설정됩니다. cuOpt는 할당 결과 그 이상을 반환합니다. 어떤 제약 조건이 구속 요소로 작용했는지도 함께 보고하므로, 계획 담당자는 이번 주의 출하 수량을 제한한 원인이 메모리 공급 부족이 아니라 대만의 제조 용량 제한이었음을 명확히 확인할 수 있습니다.

연산 속도가 빠르기 때문에 계획 담당자는 도출된 해답 주변의 조건들을 자유롭게 탐색할 수 있습니다. 이번 기간 동안 메모리 공급이 10% 감소하면 어떻게 되는가? 새로운 제조 현장이 가동되면 어떻게 되는가? 계획 담당자는 솔버에게 단일 해답을 요구하는 대신, 각 조건 간의 트레이드오프가 무엇인지 질의하기 시작합니다.

수학적 모델링의 한계

정량적 최적화만으로는 전체 상황을 모두 설명할 수 없습니다. NVIDIA와 Palantir가 과거의 할당 결정 데이터를 실제 발생했던 결과와 비교하여 백테스팅한 결과, cuOpt가 포착하지 못하던 인간적 요소가 드러났습니다.

계획 담당자들은 솔버가 접근할 수 없는 정보, 즉 그주에 파트너사와 주고받은 이메일, 주요 지역의 기상 악화 예보나 진행 중인 지정학적 이벤트, 최근 공급업체 디브리핑 통화 녹취록, 그리고 수년간 축적된 인적 전문성을 바탕으로 작업하고 있었습니다. 이러한 입력값들은 향후 기간의 자재 할당 방식에 대한 직관을 형성하며, 수학적 모델보다 인간 전문가가 더 뛰어난 판단을 내리게 만드는 원동력이 됩니다.

이를 염두에 두고 NVIDIA와 Palantir는 해당 인간 전문가들을 중심으로 이 워크플로우를 구축했습니다. 워크플로우는 할당 결정, 그 뒤에 숨은 근거, 예상 결과, 그리고 실제 도출된 결과까지 모두 캡처합니다. 이를 통해 조직 내부의 지식은 검토 가능한 명시적 의사결정 로직으로 전환되며, 해당 데이터가 온톨로지 내에 상주하므로 전문가의 판단력을 바탕으로 대형 언어 모델(LLM)을 학습시키는 기초 자료로 활용됩니다.

의사결정 지능의 코드화

그 후 NVIDIA는 동일한 추론 과정을 적용하고 추천안을 제시할 수 있도록 오픈 웨이트 LLM을 사후 학습시켰습니다. NVIDIA Nemotron 오픈 모델들을 평가한 끝에, 에이전틱 워크플로우의 실행 레이어에 특화된 Nemotron 3.5 Lightning을 최종 선택했습니다. 이 모델은 조율 및 일반 작업을 담당하는 대형 변종 모델들과 함께 시스템의 일부로서 특화된 작업을 수행합니다.

이 모델의 전문가 혼합(MoE) 아키텍처는 매우 효율적인 추론을 가능하게 합니다. 전체 300억 개(30B) 파라미터 중 순전파(Forward pass)당 약 30억 개만 활성화되는 경량 모델임에도 불구하고, 집중된 정책을 학습하기에 충분한 규모를 갖추고 있습니다. 이러한 가벼운 구조 덕분에 사후 학습 루프를 실용적으로 운영할 수 있으며, 소형 모델은 대형 모델에 비해 데이터 학습이 빠르고 학습 및 배포에 필요한 연산 자원도 훨씬 적습니다.

Nemotron은 오픈 모델이므로 자체 컴퓨팅 경계 내부에서 사후 학습을 진행할 수 있습니다. 어떤 조직이든 운용 데이터를 외부로 노출하지 않고 자체 운영 데이터에 동일한 플라이휠을 적용할 수 있습니다. 모델은 계획 담당자가 실제 사용하는 신호, 즉 제조 현장에 제공된 제한 자재의 양, 제조 업체가 생산하기로 약정한 수량, 최종적으로 생산된 수량, 의사결정 시점에 확인 가능했던 정성적 운영 증거 등을 통해 학습합니다.

이 과정의 목표는 생산 리스크를 평가하고, 할당 범위를 추천하며, 해당 추천 뒤에 있는 요인들을 식별하고, 공급망 팀에게 그 추론 근거를 설명할 수 있는 자재 할당 정책을 코드화하는 것입니다.

동일한 기록은 평가 하네스 역할도 겸합니다. 해당 날짜에 알 수 있었던 정보만을 사용하여 각 의사결정을 재현하고, 최종 결과를 숨긴 채 모델의 추천안을 계획 담당자의 실제 판단 및 실제 발생 결과와 비교합니다. 이 평가가 답변하고자 하는 핵심 질문은 다음과 같습니다: “이 모델이 지난달에 가동 중이었다면, 올바른 할당 판단을 내렸을 것인가?”

온톨로지 데이터에서 특화 모델로

학습 프로세스는 Palantir 온톨로지에 저장된 운영 기록에서 출발합니다:

  • 익명화: NeMo Anonymizer가 학습 전 개인식별정보를 제거하고 민감한 필드를 마스킹 처리합니다.
  • 합성 데이터 생성: NeMo Data Designer가 예시 데이터를 확장하고 균형을 맞춰, 모델이 일상적인 주차 데이터뿐만 아니라 할당량 증가, 용량 제약, 공급망 중단 시나리오까지 학습할 수 있도록 합니다.
  • 감독 파인튜닝: NeMo AutoModel이 베이스 가중치는 동결한 채 소규모 LoRA 어댑터 파라미터만 학습시켜 학습 시간, 메모리 요구량, 체크포인트 크기를 대폭 줄입니다.
  • 평가: 시점 기준 백테스트(Point-in-time backtest)가 동일한 과거 의사결정을 베이스 모델과 파인튜닝된 모델 모두에 재현 실행하여 사후 학습이 추가한 효과를 격리 분석합니다.

Palantir Autopilot은 온톨로지 데이터로부터 각 작업을 개시하고, 배포된 맞춤형 Nemotron 모델을 모니터링하며, 데이터부터 모델 버전, 추천안에 이르는 계보(Lineage)를 온전히 유지하면서 라이프사이클을 엔드투엔드로 관리합니다.

배포가 완료되면 모델은 현재의 운영 맥락을 읽어 들여 관련 리스크 및 추론 근거와 함께 추천안을 반환합니다. 계획 담당자는 이를 검토하고 최종 판단을 내립니다.

피드백 루프 완성하기

모든 수락, 수정, 재정의 및 생산 결과는 온톨로지(Ontology)에 다시 기록되며, 또 다른 통제된 학습 실행을 정당화할 만큼 충분한 대표 데이터가 쌓일 때까지 누적됩니다.

향후 이러한 피드백은 강화학습에 활용될 예정입니다. 수락되거나 재정의된 추천안은 할당 정확성, 정책 준수성, 증거 접지성(Grounding)을 아우르는 보상 지표와 함께 선호도 쌍(Preference pair)을 형성합니다. 모델이 프로덕션 환경에서 스스로 재학습을 수행하지는 않습니다.

이러한 결과는 두 가지 방식으로 복리 효과를 창출합니다. 계획 담당자는 반복적인 결정 프로세스를 재구성하는 데 드는 시간을 줄여 더 많은 현장과 제품을 관리할 수 있게 되며, 자재 할당 전문성이 조직의 지식으로 축적되어 신규 인력 온보딩 기간을 단축하고 핵심 노하우를 조직 전반으로 확산시킵니다.

사후 학습이 가져온 성과

NVIDIA 공급망 운영 팀은 Palantir와 협력하여 모델이 전달받는 정보, 모델이 추천할 수 있는 항목, 그리고 이러한 추천안을 평가하는 방식을 명확히 정의했습니다. 이 워크플로우는 애플리케이션인 동시에 자재 할당 의사결정 지능의 벤치마크가 되었습니다.

동일한 작업과 동일한 평가 데이터를 바탕으로 세 가지 모델을 비교했습니다:

  • 베이스 Nemotron 3.5 Lightning (BF16)
  • Nemotron 3 Ultra (NVFP4)
  • 사후 학습된 Nemotron 3.5 Lightning (BF16)

개발 벤치마크에서 사후 학습된 Lightning 모델은 86.7%의 할당 결정 정확도를 기록했습니다. Ultra 모델은 55.5%, 베이스 Lightning 모델은 17.5%에 그쳤습니다. 이는 사후 학습된 모델이 Ultra 대비 31.2%p, 자체 베이스 모델 대비 69.2%p 앞선 성과를 보여줍니다.

사후 학습된 모델은 예시의 개수보다 의사결정 유형에 동일한 가중치를 부여하는 두 가지 지표에서도 우위를 점했습니다. 균형 정확도(Balanced accuracy)는 클래스별 재현율(Recall)을 평균화하여 드물게 발생하는 호출 항목도 자주 발생하는 항목만큼 비중 있게 다룹니다:

Ultra의 42.0% 대비 58.6%를 기록했습니다. 매크로 F1(Macro-F1)은 클래스별 F1을 평균화하고 정밀도(Precision)를 합산하여, 모델이 희귀 클래스를 과잉 예측함으로써 재현율을 인위적으로 부풀리는 현상을 방지합니다: Ultra의 39.5% 대비 57.5%를 기록했습니다. 자재 공급이 제한된 상황에서는 계획 담당자가 할당량을 늘리는 경우보다 줄이는 경우가 훨씬 많으므로, 두 지표 모두 단순 정확도 평가가 다수 클래스 예측 모델에 유리하게 작용하는 오류를 막아주는 중요한 지표입니다.

이 결과가 주는 교훈은 명확하면서도 중요합니다:

제한된 자재 할당 작업에서는 사후 학습된 300억 개(30B) 파라미터 규모의 특화 모델이 한 자릿수 이상 더 큰 범용 모델보다 뛰어난 성능을 발휘할 수 있습니다.

이것이 소형 모델이 전반적으로 더 뛰어난 역량을 가졌음을 의미하지는 않습니다. 성과는 사후 학습을 진행한 특정 도메인에 집중되어 나타납니다. 파인튜닝에도 불구하고 향후 프로덕션 리스크를 예측하는 작업은 여전히 까다로운 과제로 남았습니다. 모델의 특화는 의사결정 작업의 성능을 향상시켰지만, 이에 수반되는 모든 예측 문제를 완전히 해결하지는 못했습니다.

LoRA 학습은 단 2대의 NVIDIA B200 GPU에서 수 분 만에 완료되어, 피드백이 누적됨에 따라 주기적으로 반복 실행하기에 매우 부담 없는 규모입니다. 이것이 바로 현장에 구현된 소버린 AI(Sovereign AI)의 실체입니다. 독자적인 공급망 데이터와 모델 가중치, 추론 프로세스 전체가 단일 통제 환경 내에 안전하게 보존됩니다. 이 AI 스택은 온프레미스는 물론 클라우드 환경에도 배포가 가능하여, 데이터 규제와 시스템, 운영 요구사항에 맞춰 원하는 곳 어디서나 AI를 직접 운용할 수 있습니다.

스스로 학습하는 공급망

본 게시물에서 다룬 공급망 워크플로우는 반도체 분야에만 국한되지 않습니다. 파편화된 신호를 바탕으로 숙련된 인력이 핵심 자원을 할당해야 하는 모든 운영 환경에서 동일한 플라이휠을 도입하고 새로운 도메인에 맞춰 최적화할 수 있습니다.

이를 위해서는 다음 세 가지 핵심 요소가 필수적입니다:

  • 통제된 운영 데이터 레이어
  • 의사결정 근거와 결과를 모두 수집하는 캐처 프로세스
  • 자체 보안 컴퓨팅 경계 내부에서 사후 학습이 가능한 오픈 모델

운영 데이터가 모델을 학습시키고, 학습된 모델은 의사결정의 정확도를 끌어올리며, 그 의사결정은 다음 라운드의 학습을 위한 새로운 운영 데이터가 됩니다. NVIDIA와 Palantir는 이러한 방식을 통해 웨이퍼 출하부터 첫 토큰 생성까지의 시간을 단축하고, 세계에서 가장 신뢰할 수 있는 AI 인프라 공급망을 양적 성장보다 한발 앞서 고도화하고 있습니다.

자체 에이전틱 워크플로우에 맞춰 고효율 오픈 웨이트 모델을 직접 맞춤화해 보세요.

NVIDIA 뉴스를 구독하고 LinkedInXYouTube, 및 DiscordNemotron 채널에서 NVIDIA AI를 팔로우하여 최신 NVIDIA Nemotron 소식을 확인하세요.

Hugging Face에서 공개된 Nemotron 모델에 접근할 수 있으며, build.nvidia.com에서 NIM 마이크로서비스 컬렉션과 개발자 예제를 확인할 수 있습니다.

Discuss (0)

Tags