프론티어 언어 모델은 AI 에이전트를 구성하는 요소 중 하나일 뿐입니다. 흔히 하네스라 불리는 주변 에이전트 시스템은 모델이 컨텍스트를 받는 방식부터 도구 사용, 상태 유지, 피드백 대응, 장애 복구, 장시간 작업의 진행 관리까지 좌우합니다. 핵심 과제는 길고 복잡한 다단계 작업에서도 프론티어 언어 모델이 안정적으로 작동할 수 있는 에이전트 아키텍처를 구축하는 것입니다.
NVIDIA의 연구 프로젝트 에이전틱 변이 연산자 AVO는 이러한 범용 에이전트 아키텍처 구축 과제를 해결하기 위해 개발됐습니다. AVO는 까다로운 소프트웨어 엔지니어링과 GPU 커널 최적화 작업에서 처음 시연됐습니다. 이와 같은 작업을 성공적으로 수행하려면 한 번의 응답으로 코드를 생성하는 것만으로는 부족합니다. 에이전트는 기존 구현을 검토하고, 가설을 세우고, 변경을 적용한 뒤 하드웨어 기반 테스트를 실행해야 합니다. 또한 피드백을 해석하고 접근 방식을 반복적으로 수정해야 합니다.
이 포스트에서는 AVO 아키텍처와 장시간 자율 작업을 지속할 수 있도록 지원하는 시스템 수준의 메커니즘을 소개합니다. 먼저 GPU 커널 최적화에 적용한 사례를 살펴본 뒤, 동일한 아키텍처를 ARC-AGI-3 벤치마크에 적용한 방식과 공개 세트 성능, 효율성, 주요 교훈을 설명합니다.
AVO란 무엇인가
AVO는 NVIDIA가 개발한 범용 코딩 에이전트 시스템입니다. 다른 최신 코딩 에이전트와 마찬가지로 코드를 살펴보고 수정하며, 명령을 실행하고, 문서를 참조하고, 실행 결과를 통해 작업을 검증할 수 있습니다. AVO의 차별점은 장기 작업에서도 자율적으로 운영을 이어가는 데 있습니다.
GPU 커널 최적화 작업에서 AVO는 기존 진화 검색 시스템의 사전 정의된 변이 단계를 자율 에이전트로 대체해, 다음 후보를 생성하는 방식을 결정합니다. 무엇을 검토하고, 무엇을 변경하며, 무엇을 테스트하고, 무엇을 확정할지 스스로 판단하는 방식입니다. ARC-AGI-3에서는 동일한 범용 에이전트를 다른 작업 인터페이스에 연결했습니다. 기반 에이전트는 같고, 환경에 따라 도구와 평가 방식만 달라집니다.

자율 GPU 커널 최적화를 통한 성능 향상
GPU 커널 최적화는 이 아키텍처의 초기 까다로운 시험장이었습니다.
검색 공간이 방대하고, 성능 지형을 직접 추론하기 어려우며, 작은 구현 변경이 실행 없이는 예측하기 어려운 방식으로 정확도, 메모리 동작, 스케줄링, 처리량에 영향을 미칩니다.
어텐션 커널 연구에서 AVO는 7일간 지속적으로 운영되어 500개 이상의 최적화 방향을 탐색하고 40개의 확정된 커널 버전을 생성하였습니다.
NVIDIA DGX B200 시스템에서 도출된 멀티헤드 어텐션(multihead attention) 커널은 평가된 구성에 따라 cuDNN 대비 최대 3.5%, FlashAttention-4 대비 최대 10.5% 높은 성능을 기록하였습니다. 이후 에이전트는 약 30분의 추가 자율 작업을 통해 진화된 커널을 그룹드 쿼리 어텐션(grouped-query attention)에 맞게 적용하였습니다.
최종 커널 성능 외에도, 이 실험은 AVO가 각 단계를 수동으로 규정하지 않고도 수많은 반복 작업에 걸쳐 생산적인 엔지니어링 루프를 유지할 수 있음을 보여줍니다. 더 넓은 관점에서, AVO는 에이전트 설계에 대한 시스템 수준의 관점을 강화합니다. 신뢰할 수 있는 에이전트 스택을 구축하려면 성능, 신뢰성, 보안이 전체 시스템에 걸쳐 설계되어야 하며, 모델만의 속성으로 처리해서는 안 됩니다. 이 동일한 원칙은 AI 에이전트 스택 보안에 대한 사고 방식에도 적용됩니다.
장기 에이전틱 작업의 지속
AVO는 단일 모델 컨텍스트를 넘어 진행 상황을 보존하도록 설계되어 있습니다. 특히 두 가지 메커니즘이 중요합니다. 바로 지속 메모리(persistent memory)와 슈퍼비전(supervision)입니다.
지속 메모리는 이전 구현, 평가 결과, 컴파일러 및 프로파일러 출력, 누적된 추론 결과를 보존하여 에이전트가 검색을 반복적으로 재구성하는 대신 현재 상태에서 재개할 수 있도록 합니다.
슈퍼바이저는 더 넓은 진행 경로에서 정체 또는 반복적인 비생산적 사이클을 모니터링하고, 검색이 정체될 때 메인 에이전트를 대안 전략으로 방향을 전환할 수 있습니다. 7일간의 어텐션 커널 실행 중에 메인 에이전트는 무엇을 검사하고, 변경하고, 테스트하고, 평가할지를 결정하는 역할을 담당했으며, 슈퍼바이저는 검색이 정체되었을 때 전진 진행을 유지하는 데 도움을 주었습니다.
고성능 엔지니어링에서 범용 추론으로의 진화
NVIDIA 팀은 최근 동일한 기반 AVO 아키텍처를 매우 다른 과제인 인터랙티브 추론 벤치마크 ARC-AGI-3에 적용하였습니다. 이 벤치마크에서 에이전트는 지침, 명시된 규칙, 명시된 목표 없이 낯선 환경에 진입합니다.
AVO는 ARC-AGI-3 공개 세트의 25개 환경 전체에서 100.00 RHAE 점수를 달성하여 183개 레벨을 모두 완료하였습니다. 이 결과는 더 넓은 관점을 시사합니다. 모델 평가와 에이전트 평가는 다릅니다. 모델 능력은 매우 중요하지만, 그 능력을 지속적인 자율 진행으로 얼마나 효과적으로 전환할 수 있는지는 주변 시스템이 결정합니다.
GPU 커널 최적화와 ARC-AGI-3 벤치마크는 표면적으로는 매우 달라 보입니다.
하나는 소스 코드, 컴파일러, 프로파일러, 처리량을 다루고, 다른 하나는 에이전트가 사용 가능한 액션의 효과를 추론하고, 목표를 발견하고, 진행할 만큼 충분히 효율적으로 행동해야 하는 낯선 인터랙티브 환경을 다룹니다.
하지만 기반 계산 패턴은 유사합니다. 두 환경 모두에서 에이전트는 다음을 수행해야 합니다.
- 불완전한 증거에서 가설 수립
- 외부 인터페이스를 통한 행동 수행
- 결과 관찰
- 유용한 상태 보존
- 문제 모델 수정
- 잘못된 가정에서 회복
- 장기 수평에 걸쳐 진행 지속
도메인이 달라집니다. 피드백 채널이 달라집니다. 하지만 핵심 에이전트 루프는 달라지지 않습니다.
전이되는 것은 도메인 지식이 아니라 지속적인 자율 진행을 위한 메커니즘입니다.
이러한 이유로 ARC-AGI-3는 AVO 아키텍처가 근본적으로 소프트웨어 엔지니어링에 국한된 것인지, 아니면 더 일반적인 무언가를 포착하는지를 시험하는 유용한 테스트였습니다.

ARC-AGI-3에서의 AVO 평가
ARC-AGI-3는 인터랙티브 추론 벤치마크입니다. 에이전트는 지침, 명시적 규칙, 명시된 목표 없이 낯선 게임과 같은 환경에 진입합니다. 상호작용을 통해 탐색하고, 환경의 역학과 목표를 추론하며, 점점 더 어려워지는 레벨에 걸쳐 효율적으로 행동을 계획해야 합니다.
이 벤치마크는 상대적 인간 행동 효율성(RHAE, Relative Human Action Efficiency)을 사용하는데, 이는 작업 완료와 첫 번째 시도 인간 기준선 대비 레벨별 행동 효율성을 결합한 지표입니다. 성능은 레벨과 환경 전반에 걸쳐 집계됩니다.
이 지표는 ARC-AGI-3를 까다로운 장기 에이전트 작업으로 만듭니다. 성공을 위해서는 고립된 상태를 해결하는 것 이상이 필요합니다. 에이전트는 유용한 지식을 보존하고, 이전 상호작용에서 학습하고, 실수에서 회복하고, 환경 행동을 효율적으로 사용해야 합니다.
Tycho가 탐구한 것처럼 명시적 프로그래밍 방식의 월드 모델 구축을 중심으로 ARC-AGI-3 시스템을 구성하는 대신, VISTA가 설명하는 직접 상호작용 설계 원칙을 채택하고 작업 인터페이스를 독립적으로 재구현하였습니다. 이는 ARC 특화 월드 모델 레이어를 도입하는 것보다 AVO를 범용 에이전트로 평가한다는 목표에 더 잘 부합하였습니다.
작업 인터페이스의 여러 요소는 VISTA를 참고하였지만, 에이전트 백엔드는 근본적으로 달랐습니다. VISTA는 Claude Code를 통해 Claude Opus 5를 사용하거나 Codex를 통해 GPT-5.6 Sol을 사용하는 반면, 저희 시스템은 지속 메모리, 슈퍼비전, 자체 실행 루프를 갖춘 NVIDIA 장기 에이전트 아키텍처인 AVO를 사용합니다.
관찰 인터페이스도 다릅니다. VISTA의 기본 구성은 렌더링된 512×512 PNG를 사용하면서 텍스트 그리드 표현도 탐구하는 반면, AVO 구성에서 LLM은 텍스트 전용 모달리티로 운영되었습니다. 각 관찰은 정확한 64×64 텍스트 그리드로 제공되었으며, 이미지나 이미지 토큰은 모델에 전송되지 않았습니다. 직접 상호작용 설정에 따라 에이전트는 게임의 규칙이나 목표 설명 없이 사용 가능한 액션만 제공받아 상호작용을 통해 그 효과를 스스로 추론해야 했습니다.
ARC-AGI-3 벤치마크에서의 AVO 성능 결과
최근의 ARC-AGI-3 시스템들은 Tycho와 같은 명시적 실행 가능 월드 모델부터 VISTA와 같은 직접 상호작용 하네스에 이르기까지 실질적으로 다른 에이전트 아키텍처를 탐구해 왔습니다. 이러한 결과들은 벤치마크 성능이 기반 모델뿐만 아니라 완전한 에이전트 시스템을 반영한다는 점을 강조합니다.
Claude Opus 5를 사용하여 AVO는 6,624번의 환경 행동으로 25개 환경 공개 세트를 완전히 완료하여 183개 레벨을 모두 해결하고 100.00 RHAE 점수를 달성하였습니다. 참고로 VISTA는 동일한 183개 공개 세트 레벨을 완료하면서 Claude Opus 5로 7,542번의 환경 행동을 보고합니다. 따라서 AVO는 이 교차 시스템 비교에서 약 12% 적은 행동을 사용하였습니다.
이를 통제된 비교 실험으로 해석해서는 안 됩니다. 두 시스템은 에이전트 백엔드, 관찰 표현, 메모리, 컨텍스트 관리 및 기타 구현 세부 사항이 다릅니다. 장기 수평에서 중요할 수 있는 한 가지 아키텍처 차이점은 AVO 메모리 시스템으로, 유용한 이해를 앞으로 전달하고 반복 탐색을 줄이도록 설계되었지만, 이 실험은 그 개별 기여를 분리하지는 않습니다.
ARC Prize는 High 추론 노력 설정에서 Claude Opus 5의 약 30%를 별도로 보고합니다. 저희 실행은 동일한 모델 패밀리를 다른 추론 설정과 상당히 다른 에이전트 시스템 및 평가 설정 하에 사용하였습니다. 따라서 이 수치들은 AVO의 성능 기여에 대한 직접적인 측정으로 해석되어서는 안 되며, 오히려 모델 수준의 평가만으로는 완전한 에이전트의 성능을 특성화할 수 없음을 보여줍니다.
AVO는 또한 여러 프론티어 모델에서 운영되도록 설계되었습니다. 전체 공개 세트 결과에는 Claude Opus 5를 사용하였지만, 어려운 게임의 일부 서브셋에서는 AVO와 GPT-5.6 Sol을 함께 사용하였습니다. 이 제한적인 실험에서 Sol은 여러 경우에 매칭된 레벨에 더 빠른 벽시계 시간(wall-clock time)으로 도달한 반면, Opus는 매칭된 레벨 비교에서 더 적은 환경 행동을 사용하였습니다. 이 예비 결과는 모델 간 상호 보완적인 운영 프로파일을 시사하며, 더 광범위한 체계적 비교는 향후 연구에 남겨둡니다.
이 결과들은 공식 스코어카드와 RHAE 지표를 사용하여 25개 환경 ARC-AGI-3 공개 세트를 대상으로 합니다. 반공개 또는 완전 비공개 경쟁 세트에 대한 결과가 아닙니다.
ARC-AGI-3에서 AVO 벤치마킹을 통해 얻은 교훈
가장 중요한 결과는 단순히 100.00 점수가 아니라, 동일한 에이전트 아키텍처가 고도로 특화된 GPU 커널 최적화에서 매우 다른 인터랙티브 추론 작업으로 전이되었다는 점입니다.
GPU 최적화에서는 피드백이 컴파일러, 테스트, 프로파일러, 성능 벤치마크에서 나옵니다. ARC-AGI-3에서는 피드백이 환경 전환과 행동 결과에서 나옵니다. 인터페이스는 다르지만 루프는 동일합니다. 가설을 형성하고, 행동하고, 증거를 관찰하고, 상태를 업데이트하고, 계속합니다.
이는 범용성이 도메인 지식뿐만 아니라, 추론과 피드백이 시간이 지남에 따라 누적될 수 있도록 하는 메커니즘에서도 비롯될 수 있음을 시사합니다.
더 넓은 관점에서, 장기 수평 능력은 전체 시스템의 속성입니다. 메모리는 무엇이 살아남는지를 결정하고, 도구는 가능한 행동을 결정하며, 피드백은 진행에 근거를 부여하고, 회복은 단일 모델 호출을 넘어 작업을 지속할 수 있게 합니다.
앞으로의 방향
NVIDIA AVO 연구는 자율 소프트웨어 엔지니어링 및 고성능 GPU 커널 최적화에서 시작되었습니다. ARC-AGI-3는 동일한 기반 아키텍처가 매우 다른 추론 환경으로 전이될 수 있음을 보여줍니다.
더 큰 기회는 지속 상태, 도구 사용, 근거 있는 피드백, 회복, 장기 컨텍스트 관리를 중심으로 범용 에이전트 시스템을 구축하는 것입니다. 이는 점점 더 다양한 작업에 걸쳐 증거를 누적하고 진행을 지속할 수 있는 시스템입니다.
모델이 중요합니다. 하지만 모델이 전체 에이전트는 아닙니다.
자세히 알아보려면 다음 자료를 참조하세요.
- 논문 읽기: AVO: Agentic Variation Operators for Autonomous Evolutionary Search
- 탐색하기: ARC-AGI-3 벤치마크
- 검토하기: ARC-AGI-3 채점 방법론
- 관련 연구 살펴보기: VISTA: A Visual Harness For Reasoning in an Interactive World
- Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3
편집자 주: ARC-AGI-3 공개 세트와 반공개 및 완전 비공개 경쟁 세트를 보다 정확하게 구분하기 위해 문구를 업데이트하였습니다.