Agentic AI / Generative AI

에이전트 스킬로 NVIDIA Cosmos 3를 하루 만에 사후 훈련하는 방법

NVIDIA Cosmos 3 Nano를 TAO 에이전트 스킬과 코딩 에이전트로 하루 만에 사후 훈련하는 방법을 소개합니다. LoRA로 정확도 54.41%에서 87.14%로, AutoML 스윕으로 93.35%까지 끌어올린 과정을 확인하세요.

Reading Time: 8 minutes

자율 코딩 AI 에이전트가 거의 수작업 없이 비전 추론 모델의 정확도를 90% 이상으로 끌어올릴 수 있다면 어떨까요? 비전 추론 모델을 프로덕션 비디오 작업에 맞게 조정할 때, 개발자는 사후 훈련(post-training)이 실제로 정확도를 높이는지 확인하기도 전에 데이터 포맷팅, 컨테이너 설정, 훈련 스크립트 작성, 베이스라인 평가, 하이퍼파라미터 스윕에 며칠을 소모하기 마련입니다.

오픈 피지컬 AI 월드 파운데이션 모델인 NVIDIA Cosmos 3NVIDIA TAO 에이전트 스킬을 결합하면 이 문제를 해결할 수 있습니다. Cosmos 3는 하나의 공유 옴니모달 월드 모델을 통해 이해, 생성, 시뮬레이션, 행동을 연결하며, MoT(mixture-of-transformers) 아키텍처 아래 텍스트, 이미지, 비디오, 환경음, 행동 추적을 통합합니다. 이 모델은 별도 조정 없이도 뛰어난 비전 추론 성능을 발휘하지만, 실제 배포 환경에서는 고유한 카메라 각도와 엣지 케이스, 환경을 처리하기 위한 도메인 특화가 반드시 필요하죠. 바로 이 지점에서 사후 훈련이 중요해집니다.

이 포스트에서는 코딩 에이전트와 NVIDIA TAO의 비전 모델 에이전틱 파인튜닝 스킬 라이브러리를 활용해 NVIDIA Cosmos 3 Nano 모델을 비디오 질의응답 작업에 맞게 손쉽게 사후 훈련하는 방법을 소개합니다.

NVIDIA 실험 결과, LoRA(Low-Rank Adaptation)를 적용한 워크플로는 모델을 효율적으로 적응시켜 단 한 번의 실행으로 제로샷 베이스라인의 정확 일치(exact-match) 정확도 54.41%(4지선다 기준)를 87.14%까지 끌어올렸습니다. 나아가 TAO AutoML로 구성을 체계적으로 스윕해 감에 의존하던 과정을 없애자 최고 정확도는 93.35%까지 올라갔죠. 며칠이 걸리던 엔지니어링 작업을 몇 개의 자연어 프롬프트만으로 하루 만의 자동 실행으로 압축한 셈입니다.

동영상 1. 설정부터 AutoML 스윕과 최종 리포트까지, NVIDIA TAO 에이전트 스킬로 Cosmos 3 Nano를 사후 훈련하는 과정을 단계별로 살펴봅니다

Cosmos 3 MoT 아키텍처의 장점은 무엇인가?

NVIDIA Cosmos 3의 MoT 아키텍처는 견고한 추론과 계획을 담당하는 자기회귀(autoregressive) 트랜스포머와, 미래의 월드 상태와 행동을 정확히 예측하는 디퓨전 트랜스포머를 짝지어 사용합니다. Super 64BNano 16B 등 여러 크기로 제공되는 Cosmos 3는 다음과 같은 벤치마크에서 오픈 모델 가운데 꾸준히 1위를 기록하고 있습니다.

그림 1은 자기회귀 추론 경로와 반복적 디퓨전 생성 경로로 나뉘는 통합 듀얼 타워 설계를 보여줍니다. 모달리티별 입력은 토큰화된 뒤 별도의 LayerNorm과 MLP 블록을 거쳐 처리되는데요, 두 경로는 크로스 스트림 연결을 통해 상호작용하며 이때 키-값 상태(KAR, VAR)가 텍스트·시각 컨텍스트를 위한 생성 측 풀 어텐션 블록으로 전달됩니다.

NVIDIA Cosmos 3의 듀얼 타워 Mixture-of-Transformers 구조를 보여주는 기술 블록 다이어그램. 왼쪽의 텍스트, 이미지, 비디오, 오디오, 행동 입력이 토큰화되어 중앙 블록으로 전달되고, 중앙 블록은 자기회귀 타워와 디퓨전 타워로 나뉜다. 자기회귀 타워의 Causal Self Attention에서 K_AR, V_AR가 디퓨전 타워의 Full Attention으로 전달되며, 오른쪽의 출력 토큰은 다시 텍스트, 이미지, 비디오, 오디오, 행동으로 디코딩된다.
그림 1. NVIDIA Cosmos 3 MoT 레이어의 상세 아키텍처

Cosmos 3 Nano에 최적인 사후 훈련 방법은 무엇인가?

Cosmos 3 같은 파운데이션 모델은 방대하고 다양한 데이터셋에서 일반화된 패턴을 학습합니다. 그렇기 때문에 특정 도메인의 작업과 어휘, 고유한 카메라 시점을 모델이 더 잘 이해하게 하려면 사후 훈련이 꼭 필요하죠.

Cosmos 3 Nano처럼 비전 언어 추론 모델을 사후 훈련할 때, 개발자는 보통 다음 두 가지 방법 가운데 하나를 선택합니다.

  • 전체 파라미터 지도 파인튜닝(SFT): 도메인 변화가 매우 크거나 작업상 모델 구조 변경이 필요할 때 가장 적합합니다. 다만 SFT는 모델의 모든 가중치를 업데이트하므로 막대한 컴퓨팅 자원이 필요하고, 일반 지식이 퇴행(regression)할 수 있습니다.
  • LoRA(Low-Rank Adaptation): 빠른 반복 실험에 이상적입니다. LoRA는 기본 모델 가중치를 고정한 채 훈련 가능한 저랭크 분해 행렬을 주입합니다.

이 포스트에서 다루는 예제의 경우, Cosmos 3 Nano의 LoRA 사후 훈련에는 전체 파라미터 SFT 대비 약 7분의 1의 GPU 시간만 소요됐습니다. 덕분에 엔지니어링 팀은 하루 안에 사후 훈련을 마칠 수 있게 됐죠.

Cosmos 3 Nano를 사후 훈련하는 방법에는 어떤 선택지가 있는가?

Cosmos 3 Nano를 사후 훈련하는 방법은 두 가지입니다.

  • 오픈 프레임워크: 완전히 공개된 Cosmos 3 사후 훈련 프레임워크는 훈련 레시피, 데이터셋 포맷, 구성 파일을 직접 노출하므로 사후 훈련 파이프라인의 모든 단계를 직접 구축하고 소유할 수 있습니다. 맞춤형 훈련 로직이 필요하거나 기존 인프라와 통합하려는 경우에 적합합니다.
  • TAO 에이전트 스킬: 같은 기능을 기반으로 이를 자동화하는 스킬입니다. 코딩 에이전트가 워크플로를 스스로 추론하고, 데이터 문제를 패치하며, 훈련 컨테이너를 실행하고, 하이퍼파라미터를 스윕해 줍니다. 이 자동화가 바로 며칠이 걸리던 설정 작업을, 뒤에서 설명할 프롬프트 두 개로 하루 만에 끝나는 경험으로 압축하는 핵심입니다.
코딩 에이전트가 사용자 프롬프트를 처리해 TAO 에이전트 스킬로 사후 훈련 루틴을 오케스트레이션하는 시스템 다이어그램. 실제 데이터가 자동 라벨링, 마이닝, Cosmos 합성 데이터 생성, 갭 분석 모듈을 포함한 데이터 강화 파인튜닝(DEFT) 루프로 연결되고, 이 루프는 AutoML 하이퍼파라미터 스윕 박스로 이어진다.
그림 2. NVIDIA TAO 에이전틱 사후 훈련 인프라

NVIDIA TAO는 코딩 에이전트가 지원 모델 패밀리의 비전 모델 사후 훈련 워크플로를 실행할 수 있도록 돕는 에이전트 스킬을 도입했습니다. 이 스킬에는 프레임워크 세부 사항, 런처 동작, 구성 구조, 데이터 로딩, 평가 워크플로 등 모델을 훈련·평가·최적화·서빙하는 데 필요한 작업별 지식이 패키징되어 있죠.

모든 커맨드와 구성 파일을 손으로 조립하는 대신, TAO 스킬을 활용하면 코딩 에이전트가 워크플로를 추론해 올바른 단계를 스스로 생성합니다.

Cosmos 3 아키텍처는 기능을 Reasoner 타워(멀티모달 이해와 논리를 담당하는 비전 언어 모델)와 Generator 타워(비디오·행동 생성 담당)로 분리합니다. TAO 에이전트 스킬을 사용하면 워크플로가 이 가중치 분리를 자동으로 처리하므로, 사후 훈련이 다운스트림 작업에 맞춰 Reasoner 가중치만 정확히 겨냥해 최적화합니다.

코딩 에이전트용 TAO 스킬 설치 방법

TAO 스킬 세트는 어떤 코딩 에이전트에서도 사용할 수 있도록 설치할 수 있습니다. 이 예제에서는 Codex를 사용하며, Claude용 설정 방법도 NVIDIA-TAO/tao-skill-bank GitHub 리포지토리에서 확인할 수 있습니다. 가장 빠른 설정 방법은 TAO 스킬 뱅크 리포지토리의 자동 설치 스크립트를 실행하는 방식입니다.

curl -fsSL https://raw.githubusercontent.com/NVIDIA-TAO/tao-skills-bank/main/scripts/install-codex-agents.sh | bash

각 단계를 직접 진행하고 싶다면, 리포지토리에 스크립트를 단계별로 분해한 안내도 마련되어 있습니다.

실험을 시작하기 전에 터미널 환경에 필요한 키를 설정해 두세요.

export HUGGINGFACE_TOKEN="your_hf_token" #To pull missing models
export NGC_API_KEY="your_ngc_key" #For TAO Docker containers
export AUTOML_LLM_API_KEY="your_llm_key" #Required for LLM-guided hyperparameter sweeps in AutoML

데이터셋

이 예제에서는 Toyota의 Woven Traffic Safety(WTS) 데이터셋으로 Cosmos 3 Nano를 사후 훈련하는 방법을 보여줍니다. 실험은 8,000개 이상의 훈련·검증 샘플로 구성된 4지선다형 비디오 질의응답 작업에 초점을 맞춥니다.

교통 안전은 실제 장면을 세밀하게 이해해야 하는 분야이므로, 이 데이터셋은 Cosmos 3 사후 훈련을 시연하기에 적합합니다. 모델은 비디오에서 복잡한 도로 구조와 신호, 차량, 보행자, 사건 맥락을 추론해야 하죠(그림 3). 물론 같은 워크플로는 창고 모니터링, 자율주행차 인식, 로봇 워크셀 등 어떤 다운스트림 시각 추론 작업에도 그대로 적용할 수 있습니다.

데이터셋 예시

질문: 도로의 형태는 무엇인가?

  • A: 단일 도로(우측 커브)
  • B: 단일 도로(직선)
  • C: 교차로(신호 없음)
  • D: 교차로(신호 있음)

기대 답변: D

Woven Traffic Safety(WTS) 검증 데이터셋의 시각적 개요. 모델의 공간 추론을 테스트하는 데 사용된 도심 및 주거지역 도로 구조를 여러 시점에서 보여준다.
그림 3. Woven Traffic Safety(WTS) 데이터셋의 시각적 개요

프롬프트 하나로 LoRA 사후 훈련을 실행하는 방법

앞서 API 키를 설정한 동일한 환경에서, Codex 프롬프트 하나로 전체 엔드투엔드 파이프라인을 시작할 수 있습니다.

Perform LoRA post-training of the Cosmos 3 model on the Woven Traffic Safety dataset.
Training data: /home/…/WTS_dataset/wts_data_train
Validation data: /home/…/WTS_dataset/wts_data_val
Base model on Hugging Face: nvidia/Cosmos3-Nano
Also perform a baseline evaluation first, to compare with the post-trained model.
번호가 매겨진 단계로 프로세스를 보여주는 기능 흐름도. 1단계에서 TAO 스킬을 설정하고, 2단계에서 코딩 에이전트에 프롬프트 하나를 입력해 LoRA 파인튜닝과 평가를 실행하며, 3단계에서 또 다른 프롬프트로 AutoML 실험 스윕을 시작한 뒤 최종 리포트를 생성한다.
그림 4. LoRA 에이전틱 파인튜닝의 단계별 파이프라인 실행 순서

그러면 Codex는 내부적으로 TAO 라이브러리를 조회해 Cosmos-reason 전용 스킬을 선택합니다. 에이전트는 하위 프레임워크와 데이터 로더를 자율적으로 처리하며 다음 작업을 순서대로 실행하죠.

  1. 자동 오류 패치: 에이전트가 데이터셋 어노테이션을 스캔해 누락된 비디오 FPS 파라미터를 찾아내고, 즉시 구성 패치를 적용합니다.
  2. 모델 캐싱: Hugging Face 토큰을 사용해 Cosmos 3 가중치를 안전하게 가져옵니다.
  3. 베이스라인 평가: 가중치를 변경하기 전에 제로샷 베이스라인 평가를 실행합니다. 기본 Cosmos 3 모델의 초기 정확도는 54.41%입니다.
  4. LoRA 파이프라인 실행: 에이전트가 최적화된 LoRA 훈련 구성을 생성하고 TAO 훈련 컨테이너를 실행합니다.

사후 훈련이 완료되면 에이전트는 LoRA로 적응된 모델을 평가하고 그 결과를 베이스라인과 비교합니다.

NVIDIA A100 Tensor Core GPU 8개에서 약 30분의 훈련 시간, 단 한 번의 실행만으로 모델 정확도는 87.14%로 뛰어올랐습니다. 32퍼센트포인트라는 큰 폭의 개선을 사람 손을 전혀 거치지 않고 이뤄낸 것이죠.

TAO AutoML로 비전 모델을 최적화하는 방법

LoRA는 강력한 첫 결과를 제공하지만, 사후 훈련 성능은 어떤 구성을 선택하느냐에 크게 좌우됩니다. 학습률, LoRA 랭크, 드롭아웃, 배치 크기, 스케줄러 설정 등 다양한 하이퍼파라미터가 최종 정확도에 영향을 미치기 때문입니다.

구성을 하나씩 수동으로 시험하는 대신, TAO AutoML을 사용하면 에이전트가 중요한 사후 훈련 파라미터 전반에 걸쳐 체계적인 스윕을 실행할 수 있습니다.

TAO AutoML은 다음을 포함해 다양한 파라미터 탐색 전략을 지원합니다.

  • 베이지안 최적화
  • Hyperband
  • 베이지안 최적화 + Hyperband(BOHB)
  • 배치 우선 베이지안 최적화(BFOB)
  • LLM 기반 탐색: LLM 브레인(NVIDIA NIM, OpenAI 또는 OpenAI 호환 엔드포인트)을 사용해 하이퍼파라미터를 제안합니다. NVIDIA_API_KEY 또는 AUTOML_LLM_API_KEY가 필요하며, 이 실험에서는 Gemini API 엔드포인트를 사용했습니다.

각 알고리즘에 대한 간단한 설명은 TAO AutoML 알고리즘 문서를 참조하세요.

같은 코딩 에이전트 채팅에서 프롬프트를 하나 더 입력하면 에이전트에게 AutoML 스윕을 실행하도록 요청할 수 있습니다.

Run an AutoML sweep to improve the LoRA result. Let TAO choose suitable search strategies 
and tune the important training hyperparameters. Optimize validation accuracy and summarize 
the best models.

에이전트는 여러 전략으로 후보 트라이얼을 생성하고, 각 실험을 실행하며, 하이퍼파라미터를 추적하고, 결과를 평가한 뒤 최적 구성을 기록합니다.

LoRA와 AutoML은 정확도를 얼마나 개선했는가?

TAO 에이전트 스킬의 자동화와 TAO AutoML의 최적화 성능을 결합한 결과, 모델은 제로샷 베이스라인 대비 놀라운 정확도 향상을 달성했습니다. 전체 실험은 단 두 개의 프롬프트만으로 도메인에 맞춰지지 않은 기본 모델을 고도로 특화된 교통 안전 전문가 모델로 발전시켰죠.

모델 변형전략검증 정확도베이스라인 대비 개선
Cosmos 3 Nano(기본)제로샷 베이스라인54.41%기준
Cosmos 3 Nano + LoRA단일 프롬프트 베이스라인 LoRA87.14%+32.73퍼센트포인트
Cosmos 3 Nano + AutoML베이지안 최적화93.35%+38.94퍼센트포인트
표 1. 사후 훈련 전략별 Cosmos 3 Nano 검증 정확도 개선

어떤 하드웨어와 실행 시간을 예상해야 하는가?

TAO 스킬의 다중 구성 실험 스윕은 클라우드 기반 NVIDIA 하드웨어에서 테스트했습니다. Cosmos 3 MoT 아키텍처의 효율성 덕분에 NVIDIA A100(80GB) GPU 노드 한 대에서 LoRA 사후 훈련 1 에포크는 약 30분이 소요되는데요, 다시 말해 한 시간이 채 걸리지 않아 87.14% 정확도의 고정밀 모델을 빠르게 확보할 수 있다는 뜻입니다.

다만 한 가지 분명히 해 둘 점이 있습니다. 이 수준을 넘어 정확도를 더 끌어올리려면 TAO AutoML 하이퍼파라미터 스윕으로 최적 구성을 찾아야 합니다. 이번 실험 환경에서는 5개의 병렬 노드(탐색 전략별로 8x A100 GPU 노드 1대 할당)에서 43개의 병렬 트라이얼을 동시에 처리하는 데 19.5시간이 걸렸죠. TAO는 스윕을 베이지안(10 트라이얼), BFBO(10 트라이얼), BOHB(3 트라이얼), LLM-베이지안 하이브리드(10 트라이얼), LLM-BFBO 하이브리드(10 트라이얼)라는 5가지 탐색 전략에 자동으로 분산 실행했습니다.

비교를 위해 덧붙이면, 전체 파라미터 SFT 실행은 NVIDIA H100 GPU 8개에서 3시간 34분이 소요됐습니다.

사후 훈련의 정성적 결과는 어떠한가?

수치는 이야기의 일부만 보여줍니다. 도메인 특화의 진정한 가치는 복잡하고 모호한 실제 엣지 케이스를 평가할 때 드러나죠. 그림 5와 그림 6은 모델 사후 훈련 전후의 정성적 비교를 보여줍니다.

횡단보도가 있는 교차로를 위에서 내려다본 비디오 재생 프레임. 왼쪽 끝의 작고 멀리 있는 교통 신호를 빨간 바운딩 박스로 강조했는데, 베이스라인 모델은 이를 놓쳤지만 사후 훈련된 모델은 이를 올바르게 활용해 장면을 신호가 있는 교차로로 식별했다.
그림 5. 모델 사후 훈련 전후 도로 형태 추론의 정성적 비교
횡단보도 표시, 녹지 중앙분리대, 멀리 있는 저층 건물이 보이는 넓은 교차로의 비디오 재생 프레임. 기본 모델은 이를 주차장으로 잘못 식별했지만 사후 훈련된 모델은 주거지역 도로로 정확히 라벨링했다.
그림 6. 베이스라인 모델과 최적화 모델 간 도로 유형 분류의 정성적 비교

사후 훈련된 Cosmos 3 LoRA 어댑터를 배포하는 방법

Cosmos 3 Reasoner NIM은 프로덕션급 OpenAI 호환 Reasoner 엔드포인트를 구축하는 가장 빠른 경로입니다. 효율적인 온디바이스 추론을 위해 독립적으로 분리해 최적화한 자기회귀 Reasoner를 제공하는데요, NIM 마이크로서비스는 사전 빌드된 최적화 컨테이너로 배포되므로 vLLM 의존성을 수동으로 관리하거나 CUDA 버전을 맞추는 설정을 건너뛸 수 있고, 텍스트·이미지·비디오 입력으로부터 텍스트 출력을 서빙합니다.

배포 역시 코딩 에이전트에게 요청할 수 있습니다.

Locally deploy Cosmos 3 Nano Reasoner NIM using the post-trained checkpoint in <checkpoints path>. 
Run NVIDIA/Docker preflight, use a LoRA-capable profile when available or the fused merged checkpoint otherwise.

Llama 스타일 VLM NIM과의 중요한 아키텍처 차이는 어댑터를 로드하는 방식에 있습니다. Llama NIM은 기본 모델과 별도의 LoRA 어댑터 디렉터리를 함께 서빙할 수 있는 반면, Cosmos 3 Reasoner NIM은 어댑터 단독이 아닌 병합 체크포인트(기본 가중치와 LoRA 어댑터를 융합한 것)가 필요합니다.

TAO 스킬과 함께 코딩 에이전트를 사용하고 있다면, 에이전트가 가중치 융합을 내부적으로 자동 처리해 컨테이너가 로드할 수 있는 단일 체크포인트를 제공합니다.

직접 배포하려면 에이전트에서 병합 체크포인트를 받은 뒤, NIM으로 Cosmos 3 모델을 서빙하는 단계별 안내를 담은 비디오 튜토리얼 How to Run NVIDIA Cosmos 3 Reasoner NIM for Video Reasoning을 참고하세요.

Cosmos 3 사후 훈련 시작하기

범용 AI에서 고도로 특화된 피지컬 AI로 넘어가기 위해 더는 인프라와 씨름할 필요가 없습니다. NVIDIA Cosmos 3 Reasoner 타워의 구조적 추론 능력과 NVIDIA TAO 에이전트 스킬의 자동화를 결합하면, 원시 비디오 데이터에서 배포 준비가 끝난 특화 비전 언어 모델까지 하루 만에 도달할 수 있죠.

자연어 프롬프트 두 개만으로 코딩 에이전트가 프레임워크의 복잡성을 처리하고, 데이터 버그를 패치하며, 베이스라인 벤치마크를 실행하고, TAO AutoML로 고급 하이퍼파라미터 튜닝까지 사람 손 없이 수행합니다. 덕분에 엔지니어링 팀은 핵심적인 피지컬 AI와 로보틱스 과제 해결에 집중할 수 있습니다.

직접 비전 추론 모델을 사후 훈련할 준비가 되셨나요? 로컬 개발 환경에서 이 워크플로를 구현하려면 다음 리소스를 확인하세요.

Discuss (0)

Tags