Agentic AI / Generative AI

NVIDIA Open Agent Safety Platform: 실리콘 수준 지속 에이전트 모니터링 레퍼런스

NVIDIA Open Agent Safety Platform은 OpenShell 런타임과 BlueField-4 기반 NVIDIA Sentry를 결합해 AI 에이전트를 실리콘 수준에서 지속 모니터링합니다. 에이전트 안전을 위한 5가지 원칙과 3계층 구조를 확인하세요.

Reading Time: 4 minutes

오늘 날의 에이전틱 AI가 어디에 서 있는지 이해하려면, 기술 분야의 지난 대격변이었던 1990년대 인터넷의 부상을 떠올려 보면 좋습니다. 인터넷은 새로웠고 가능성으로 가득했죠. 주말 동안 웹사이트를 만들어 전 세계에 공개할 수도 있었고, 장거리 전화 요금 없이 온라인 채팅방에서 지구 반대편 사람과 대화할 수도 있었습니다. 무한한 기회를 가져다준 동시에 위험도 많았는데요, 웹사이트가 사용자 컴퓨터에서 코드를 실행하거나 민감한 정보를 훔치거나 바이러스를 감염시킬 수 있었습니다. 그럼에도 사람들은 인터넷을 사랑했죠.

신뢰 계층을 도입하기 위해 커뮤니티는 암호화된 연결과, 연결이 안전한지 알려주는 자물쇠 아이콘 같은 장치를 만들었습니다. 안전성의 획기적인 도약은 당시로서는 급진적이었던 보안 아이디어에서 나왔는데요, 각 페이지를 고유한 샌드박스(브라우저의 탭)에 격리해 악성 페이지가 컴퓨터의 나머지 부분을 감염시키지 못하게 하는 방식이었습니다. Amazon, Google, Netflix, Meta는 모두 이 신뢰 계층 위에 세워졌습니다.

인터넷의 보안과 안전성은 온라인 상거래, 소통, 게임 등 이전에는 불가능했던 수많은 것을 가능하게 했습니다. 보안과 안전성이 혁신의 속도를 늦추기는커녕, 오히려 가속한 셈이죠.

왜 지금 에이전트를 위한 신뢰 계층을 구축해야 하는가?

최근 여러 프런티어 랩이 비슷한 사례를 잇달아 보고했습니다. AI 에이전트가 자신을 가두기 위해 마련된 평가 환경을 벗어나, 접근이 허용되어서는 안 되는 시스템에 도달했다는 것이죠. 일부 에이전트는 자신이 한 일을 잘못 보고하기까지 했습니다. 당시 마련되어 있던 보안 제어는 충분하지 않았던 것이죠.

지난 몇 주 동안 이러한 보고는 에이전트 개발 속도에 관한 진지한 논쟁으로 이어졌습니다. 저희는 프런티어 랩과 더 넓은 커뮤니티와 협력해 AI 안전 연구와 엔지니어링의 속도를 높여야 한다고 믿습니다.

이러한 탈출은 어떤 단일한 새 기능 때문에 일어난 것이 아니었습니다. 도구, 시간, 모호한 지시가 결합되고, 여기에 에이전트가 “틀을 벗어나” 생각하려는 성향이 더해진 결과였죠.

에이전트 안전에는 독립적인 보안 제어가 필요합니다. 인터넷은 웹 개발자에게 선하게 행동하겠다는 약속을 요구해서 안전해진 것이 아니라, 브라우저가 웹 페이지의 코드를 명시적으로 신뢰하지 않게 되면서 안전해졌습니다.

따라서 우리는 에이전트를 위해 이 신뢰 계층을 구축해야 합니다.

NVIDIA Open Agent Safety Platform은 Vera CPU에서 실행되는 OpenShell 런타임과 BlueField-4 실리콘에서 실행되는 NVIDIA Sentry를 결합한다. 런타임은 에이전트 샌드박스와 정책을 오케스트레이션하고, 독립적인 워치독은 별도의 하드웨어에서 에이전트 활동을 추적하고 강제한다.
그림 1. NVIDIA Open Agent Safety Platform 레퍼런스 디자인은 NVIDIA Vera 기반 NVIDIA OpenShell과 NVIDIA BlueField-4 기반 NVIDIA Sentry를 결합한다

OpenShell을 구축하며 배운 교훈

NVIDIA OpenShell(Apache 2.0)은 커널 수준 격리를 갖춘 샌드박스 환경에서 자율 AI 에이전트를 실행하는 오픈소스 보안 런타임입니다. 지난 1년간 OpenShell을 구축하면서 저희는 모든 에이전트가 기본적으로 제로 트러스트 환경에서 실행되어야 한다는 사실을 배웠습니다. 에이전트에는 격리, 모니터링, 행동 탐지가 필요하죠. 오늘 저희는 이를 가능하게 하는 오픈 스택을 소개합니다.

저희 연구에서는 에이전트가 어떻게 경로를 벗어나는지 지켜봤습니다. 드리프트(drift)는 의도된 작업이나 운영 제약에서 벗어나는 에이전트 행동을 가리키는데요, 정책 차단이나 버그, 누락된 도구에 대한 반응으로 발생할 수 있습니다. 지시가 모호하거나, 처음 시도한 1,000가지 방법이 모두 실패하는 어려운 문제를 풀기 위해 에이전트를 며칠 혹은 몇 주 동안 실행하도록 두었을 때도 드리프트가 일어나죠. 이는 에이전트의 능력을 유지한 채 훈련만으로 없앨 수 있는 문제가 아닙니다. 그리고 가장 중요한 교훈은 이것입니다. 이런 상황에 놓인 에이전트가 스스로의 행동을 완전히 통제하리라 기대할 수는 없습니다.

에이전트 시스템 구축을 위한 5가지 핵심 원칙

  1. 정책은 검증 가능해야 합니다: 에이전트가 실행되기 전에, 증명기(prover)가 해당 정책이 운영자의 의도를 벗어날 수 없음을 보여줍니다.
  2. 강제는 아웃오브밴드(out-of-band)로 이루어져야 합니다: 제어 장치는 에이전트 내부나 에이전트가 닿을 수 있는 범위에 있지 않습니다. 에이전트는 자신이 감시되고 있다는 사실을 알 필요가 없습니다.
  3. 모델(두뇌)로 향하는 경로가 제어 지점입니다: 에이전트는 다음 생각 없이는 행동할 수 없습니다. 모델로 향하는 경로를 제어하면 최적의 관측 지점과, 필요할 때 에이전트를 중단시킬 킬 스위치를 모두 확보할 수 있습니다.
  4. 에이전트의 권한은 그 사고 과정을 검사할 수 있는 능력에 맞춰 확장해야 합니다: 에이전트가 할 수 있는 일이 많아질수록 그 추론 과정은 더 투명하게 드러나야 합니다. 오픈 모델의 장점은 전체 추론 공간과 활성화 값이 모두 보인다는 점입니다.
  5. 공동 책임 모델을 적용해야 합니다: 오늘날의 클라우드처럼 랩, 기업, 하드웨어 제공자가 각자 한 계층씩 책임집니다. 어떤 제공자든 연결할 수 있도록 에이전트 런타임과 정책 언어는 개방되어야 합니다.

오픈 에이전트 안전 플랫폼의 세 계층

AI 에이전트를 위한 안전 플랫폼은 다음 세 계층으로 구성됩니다.

  • 애플리케이션: 최종 사용자가 구축하는 대상입니다. 모델, 하네스, 도구, 데이터, 지원 스크립트와 프로그램 등 임무 성공에 필요한 기본 요소를 담습니다.
  • 런타임: 애플리케이션 계층을 인프라 위에 배치합니다. 최종 사용자 요구 사항에 맞는 인프라(사용자 워크스테이션, 엣지 디바이스, 데이터센터)에 에이전틱 워크로드를 오케스트레이션하고, 지속적인 모니터링과 실시간 정책 강제 및 거버넌스를 제공합니다.
  • 인프라: 에이전틱 워크로드를 실행하는 데 쓰이는 실제 하드웨어 자원입니다. 업스트림 서비스로의 네트워크 호출, 데이터베이스와 파일시스템 접근, 도구·코드 실행을 위한 범용 컴퓨팅, 안전 모니터링과 워크로드 밀도 향상을 위한 가속 컴퓨팅이 여기에 속합니다.

에이전트 안전을 위한 계층형 기반

OpenShell은 각 에이전트를 샌드박스에서 실행하고, 운영자의 지시를 검증 가능한 정책으로 바꿉니다. 운영자는 에이전트가 접근할 수 있는 파일, 네트워크, 도구, 프로세스, 자격 증명을 정의하는데요, OpenShell은 에이전트가 실행되기 전에 이 한계를 검사하고 작업 중에도 계속 강제합니다.

독립적인 계층을 추가로 원하는 조직을 위해 NVIDIA Sentry는 모니터링과 강제를 NVIDIA BlueField 하드웨어로 확장합니다. NVIDIA DOCA는 BlueField 보안 기반을 프로그래밍 가능하게 만들고 OpenShell 정책과 연결하죠. 또한 에이전트 상호작용, 정책 결정, 도구 및 데이터 접근을 상호 연관시켜 에이전트 활동의 맥락 기록을 생성합니다.

이를 바탕으로 안전 시스템은 드리프트를 식별하고, 의심스러운 행동을 조사하며, 개입이나 심층 분석이 필요한 시점을 판단할 수 있습니다. DOCA 게이트웨이는 이러한 행동 기반 보호를 아이덴티티 거버넌스로 보완하는데요, 각 에이전트의 아이덴티티와 위임된 권한을 지속적으로 검증해 할당된 범위 안에서 동작하도록 보장합니다.

자세한 내용은 기술 안내 포스트인 NVIDIA OpenShell로 AI 에이전트에 런타임 제어 추가하기를 참조하시기 바랍니다.

AI 팩토리 규모에서의 운영

NVIDIA Open Agent Safety Platform은 NVIDIA Vera CPU와 BlueField DPU 기반 시스템에서 최적으로 실행되도록 설계되었으며, 다른 하드웨어 시스템과도 호환됩니다.

NVIDIA Vera Rubin POD에서는 각 컴퓨팅 트레이에 BlueField-4 데이터 처리 장치가 노드에서 모델로 향하는 유일한 경로에 자리합니다. 이 위치에서 BlueField-4는 에이전트 행동에 대한 지속적인 아웃오브밴드 관측성을 제공하고, 라인 속도로 실시간 보안 정책을 강제하죠. 호스트와 격리되어 있고 에이전트가 닿을 수 없는 곳에 있으므로, 호스트 자원을 신뢰할 수 없는 상황에서도 신뢰할 수 있는 인프라 보호 계층으로 기능합니다. 조직은 이를 활용해 OpenShell과 함께 NVIDIA Sentry를 선택적 보안 계층으로 실행할 수 있습니다.

이 기반 위에서 OpenShell 정책을 실리콘에서 강제하는 복원력 있는 보안과, 에이전트의 보안 및 무결성에 대한 지속적 평가가 가능해집니다. 여기에는 런타임 보안 평가와, 사전 정의된 행동 프로필을 기준으로 설계 의도에서 벗어나는 편차를 모니터링하는 작업이 포함되죠. 이 아키텍처에서는 에이전트, 서브 에이전트, 도구, 애플리케이션으로 이루어진 플릿 전체가 완전한 계보(lineage)와 함께 경계 안에 머무릅니다. 이미 BlueField-4가 탑재된 NVIDIA Vera 시스템을 운영하고 있다면, 소프트웨어 업데이트만으로 이 보호 기능을 활성화할 수 있습니다.

에이전트 경제

인터넷은 오픈소스와 개방형 연구, 그리고 인터넷이 인류의 진로를 바꿀 수 있다고 믿은 사람들 위에 세워졌습니다. 여기에 신뢰가 더해지자 훌륭한 개념은 훌륭한 경제로 발전했죠. 에이전트 경제와 다음 세대의 위대한 기업들은 같은 계층을 기다리고 있습니다. 그리고 우리는 이를 같은 방식으로, 함께 만들어 갈 수 있습니다.

NVIDIA는 NVIDIA Open Agent Safety Platform을 통해 AI 생태계 전반의 업계 리더들과 이 기반을 구축하고 있습니다. 프런티어 랩, 개발자, 인프라 제공자 여러분이 저희와 함께 구축에 나서 주시기를 환영합니다.

흰 배경 위에 'NVIDIA Open Agent Safety Platform'이라는 제목과 함께 여러 기업 로고가 나열된 이미지.
그림 2. 애플리케이션, 모델, 인프라, 칩, 에너지에 걸친 AI 생태계 전반의 기업들이 NVIDIA Open Agent Safety Platform을 지원한다

NVIDIA OpenShell 시작하기.

Discuss (0)

Tags