Meta가 다시 오픈소스 생태계에 뛰어들었습니다. 이번에 선보인 Muse Glimmer는 12만 자가 넘는 긴 맥락(120K 컨텍스트 윈도우)을 한 번에 다루는 300억 매개변수(30B) 규모의 밀집형 오픈 모델로, PC나 온프레미스 환경에서 직접 구동하는 로컬 AI 에이전트 작업에 맞춰 개발되었습니다.
NVIDIA의 엣지, 데스크톱, 워크스테이션 AI 플랫폼에 최적화된 Muse Glimmer는 GPU 단 1대로도 초당 2만 개에 달하는 토큰을 쏟아냅니다. 덕분에 24시간 끊임없이 돌아가는 AI 에이전트가 외부 유출 걱정 없이 모든 데이터를 기기 내부에서 처리하며, 여러 단계를 거치는 복잡한 작업도 막힘없이 처리할 수 있습니다.
단순 대화가 아닌 장기 실행 에이전트를 위해 설계
대부분의 거대 언어 모델(LLM)은 일문일답식 대화나 빠른 첫 응답 속도(TTFT)가 중요한 일반 채팅 환경에 맞춰져 있습니다. 하지만 AI 에이전트가 이끄는 워크로드는 판이하게 다릅니다. 소프트웨어 뼈대를 잡거나, 문서를 고치고, 지식 베이스를 관리하는 에이전트는 한 번의 세션 안에서 수많은 툴을 연달아 호출합니다. 이 과정에서는 기존 대화형 모델이 제공하지 못하는 높은 수준의 신뢰성과 일관성, 긴 맥락을 놓치지 않는 집중력, 그리고 흔들림 없는 처리 속도가 필수적입니다.
Muse Glimmer는 토큰을 하나씩 처리할 때마다 모든 파라미터를 100% 가동하는 밀집(Dense) 구조를 채택했습니다. 데이터를 특정 전문가 노드로 분산하거나 경로를 따로 배정하지 않는 방식입니다. 덕분에 지연 시간이 일정하게 유지되고 연산 오류 가능성이 줄어들어, 복잡한 지시를 오차 없이 수행하고 긴 맥락 속에서도 매끄럽게 흐름을 이어가야 하는 에이전트 작업에 매우 뛰어난 성능을 보여줍니다.

로컬 하드웨어 전반의 프라이버시 바이 디자인
개인 파일, 통신, 자격 증명, 독점 문서를 포함하는 에이전틱 워크플로는 추론이 기기 밖으로 나가지 않아야 합니다. Muse Glimmer는 최적의 균형점을 제공합니다. 복잡한 다단계 추론을 수행하기에 충분히 크면서도, 단일 NVIDIA GPU의 VRAM에 적재될 만큼 소형이어서 모델 샤딩(sharding), CPU 오프로딩(offloading), 또는 외부 엔드포인트 사용이 필요하지 않습니다.
NVIDIA 텐서 코어 아키텍처는 바로 이러한 컴퓨팅 패턴을 가속화하여, 전체 컨텍스트 길이에서 완전히 온디바이스로 실시간 에이전틱 추론을 가능하게 합니다.
- NVIDIA GeForce RTX 5090은 32GB VRAM과 5세대 텐서 코어를 결합해 Muse Glimmer를 로컬 개발자 기기에서 구동하고, 독점 코드를 온디바이스로 유지하며, 토큰당 추론 비용을 없앱니다.
- NVIDIA DGX Spark는 워크스테이션급 성능과 엔터프라이즈 에이전틱 파이프라인을 소형 시스템에 구현합니다. NVIDIA NVLink가 메모리에 대한 고속 접근을 제공하며, NVIDIA NIM 컨테이너를 통해 로컬 Muse Glimmer 배포를 단 하나의 명령어로 수행할 수 있습니다.
- NVIDIA DGX Station은 에어 갭(air-gap) 요건이나 클라우드 추론이 불가능한 컴플라이언스 프레임워크에서 운영되는 팀을 위해 랙 규모의 Blackwell Ultra 컴퓨팅 성능을 온프레미스(on-prem) 엔터프라이즈 환경에 제공합니다.
- NVIDIA Jetson은 네트워크 격리가 필수이고 모든 추론 결정이 행동 시점에 이루어져야 하는 로보틱스, 산업 자동화, 임베디드 시스템 분야까지 로컬 Muse Glimmer 추론의 범위를 엣지로 확장합니다.
NVIDIA Blackwell Ultra에서의 최적화된 Muse Glimmer 성능
NVIDIA Blackwell Ultra에서 Muse Glimmer는 BF16/NVF4 정밀도로 GPU당 초당 20K 토큰 이상을 처리하며, 처리량-응답성 곡선은 30B 밀집 아키텍처가 MoE 모델의 라우팅 오버헤드 없이 높은 동시성을 유지함을 보여줍니다.
단일 Blackwell Ultra는 KV 캐시 버퍼를 위한 여유 공간과 함께 VRAM 내에서 전체 모델을 처리하므로, 개발자가 로컬 인프라에서 상시 작동 에이전트를 실행하는 데 필요한 높은 처리량과 낮은 지연 시간을 갖추기에 적합합니다.

에이전틱 활용 사례 구축 및 파인튜닝
보안이 적용된 OpenShell 환경에서 NVIDIA NemoClaw를 실행하면 코드 생성, 개인 비서, 자율 지원 등의 작업을 위한 장기 실행 개인 비서를 구축할 수 있습니다.

개발자는 NVIDIA NeMo AutoModel을 사용해 모델을 추가로 사후 학습(post-train)할 수 있습니다. 이는 모델 변환 없이 네이티브 Hugging Face 체크포인트를 지원하는 고처리량 효율의 파인튜닝 라이브러리입니다.
NeMo AutoModel은 NVIDIA GPU(DGX Spark 포함)에서 신속한 실험에 최적화되어 있으며, SFT(지도 파인튜닝)와 LoRA(저랭크 적응) 파인튜닝을 즉시 사용 가능하게 지원합니다. 또한 샘플 레시피와 레퍼런스 정확도 검증 곡선을 포함한 NeMo RL을 통한 강화 학습도 수행할 수 있습니다.
Muse Glimmer를 위한 확장 가능한 배포 경로
NVIDIA는 다양한 개발자 요구를 충족하기 위해 여러 추론 스택을 지원합니다.
SGLang과 vLLM은 NVIDIA 가속 플랫폼에서 성능을 보다 세밀하게 제어하고자 하는 개발자를 위한 오픈 소스 추론 레시피를 제공합니다.
또한 런타임 구성과 서빙 설정을 자동으로 선택하는 사전 구축 최적화 추론 컨테이너인 다운로드 가능한 NVIDIA NIM으로도 제공되어, 팀이 에이전트 구축과 확장에 집중할 수 있습니다.
Muse Glimmer와 로컬 AI 에이전트 시작하기
시작하려면 HuggingFace에서 Muse Glimmer 가중치를 다운로드하고 위의 추론 레시피를 사용해 배포하거나, 모든 NVIDIA GPU 가속 플랫폼에서 프로덕션 준비 완료 컨테이너를 위한 다운로드 가능한 NIM을 사용하십시오. 호스팅된 엔드포인트를 즉시 호출하려면 build.nvidia.com에서 사용해 보십시오. Jetson의 지 배포는 Jetson AI Lab을 참고하십시오.