長時間稼働する AI エージェントは、その処理時間の大半を、ツール呼び出し、結果の検証、サブエージェントへのタスク委任といった、大量の実行処理に費やしています。 全ての実行ステップでフロンティア推論モデルを使用すると、コストと遅延が増加します。
NVIDIA Nemotron 3.5 Lightning は、常時稼働するエージェントのこうした実行レイヤー向けに構築されたオープンな 300 億パラメーターの mixture-of-experts (MoE) モデルで、30 億 のアクティブ パラメーターを備えています。OpenClaw や Hermes Agentのようなエージェント ハーネスでの利用を想定して設計されており、これらはいずれも、常時稼働する AI エージェント向けのオープン ソースのセキュリティおよび管理スタックである NVIDIA NemoClaw でサポートされています。
NVIDIA Nemotron オープン モデル ファミリは、ソフトウェア ライブラリのようなものであり、リリースごとに精度と速度を継続的に向上させています。 これらのモデルが進化するにつれて、モデル ルーティングとオーケストレーションの技術も急速に成熟しつつあります。
開発者が複数モデルで構成されるシステム (System of Models) を活用してアプリケーションを構築するケースが増えているため、これは重要な意味を持ちます。Nemotron 3 Ultra のようなフロンティア推論モデルは、オーケストレーションや複雑なプランニング担う一方で、より小型で効率的なモデルが大量の処理をこなす実行レイヤーを担当します。
本ブログでは、NVIDIA Nemotron 3.5 Lightning を紹介し、その小規模 MoE 設計が、自律型エージェントにおける大量かつ低遅延の実行に向けてどのように最適化されているかを説明します。また、それを支える推論とトレーニングのイノベーションについても詳しく説明します。 さらに、各タスクをジョブに最適なモデルにインテリジェントにルーティングするライブラリである NVIDIA NeMo Switchyard も紹介しています。
Nemotron 3.5 Lightning が長時間稼働する AI エージェントに最適な理由
Nemotron 3.5 Lightning は、30B パラメーターのカスタマイズ可能なオープン MoE モデルで、実際に稼働するアクティブ パラメーターは 3B です。自律型エージェントによる大量の処理を効率よく実行できるよう設計されています。MoE が高速かつ効率的なのは、ルーターが各トークンを多数のエキスパートのうち一部にだけ振り分けられ、トークンごとに実行されるのはモデル全体のパラメータの一部に限られるためです。そのため、小規模モデル並みの計算コストで、より大規模な Dense モデルに相当するキャパシティを実現できます。
Nemotron 3.5 Lightning は、Nemotron 3 モデル ファミリの最小サイズであり、ファミリ全体で実績のある同じ技術の多くを採用しています。
- Speculative Decoding (投機的デコーディング): Nemotron 3.5 Lightning の学習中に (Nemotron 3 Super や Nemotron 3 Ultra と同様に) マルチトークン予測が組み込まれています。Nemotron 3.5 Lightning は DFlash と DSpark も搭載しており、幅広いサービング環境でより包括的な推論最適化を可能にします。
- エージェント ハーネスに最適化されたトレーニング: 一般的なエージェント ハーネス向けに学習されており、エージェントがより正確な呼び出しを行えるようにすると同時に、大量のタスクにおける遅延を低減します。
その結果、Nemotron 3.5 Lightning は、実行性能を重視した大量の呼び出しと低レイテンシに適したモデルとなっています。さらに、そのコンパクトなサイズによりNVIDIA DGX Spark からデータセンターまで、幅広い環境に導入できます。
Nemotron 3.5 Lightning をすぐにカスタマイズ
モデルが特化型 AI エージェント システムで真価を発揮は用途に合わせた適応が重要です。 また、Lightning クラスのモデルは高いカスタマイズ性を備えています。小規模モデルは、大規模モデルと比較して、より高速かつ低コストでファインチューニングでき、必要なハードウェアもはるかに小規模です。
Nemotron 3.5 Lightning は、ワークロードに合わせてそのままカスタマイズできます。Nemotron のすべてのオープン モデルと同様に、モデルの重み、学習データ、レシピは OpenMDW-1.1 の下で可能な限り制約の少ない形で公開されています。そのため、以下のことが可能です。
- NeMo Automodel と NeMo Megatron Bridge を使用した LoRA またはフルの SFT によるファインチューニング
- NeMo RL と NeMo Gym で強化学習と環境ベースの評価、ロールアウトの実行
今回リリースには、コーディング エージェントの一部の機能を学習するために使用されるオープン エージェント型強化学習データセットである Nemotron-RL Agentic Terminal Pivot が含まれています。
NeMo Switchyard で処理を最適なモデルにルーティング
最先端のフロンティア モデルが注目を集める一方で、Nemotron 3.5 Lightning のようなモデルは、エージェントの実運用を支える日常的な処理で力を発揮します。たとえば、git pull のようなコマンドの実行、ツール出力の検証、結果のフォーマットなど、長時間稼働するエージェントのトークン消費の大部分を占める定型的な処理を担います。
モデル ルーティングとオーケストレーションは、この分業をより利用しやすくするのに役立ちます。これらは現在、NVIDIA NeMo Switchyard を通じて利用できるようになりました。Switchyard では、オープン モデルおよびクローズド モデルと並んで Nemotron 3.5 Lightning をルーティング先として設定できるため、それぞれのリクエストを、処理可能な最も高性能で効率的なモデルに振り分けられます。計画 (プランニング) はフロンティア モデルに、実行は Lightning に振り分けることで、トークンを効率的かつ効果的に活用できます。
Nemotron 3.5 Lightning の精度と速度のパレート フロンティアにおける性能
Nemotron 3.5 Lightning は、クラス最高水準の出力速度で業界トップクラスの精度を実現し、Artificial Analysis Intelligence Index において、精度と速度のパレート フロンティアを制覇しています。この指標は 9 つの評価を組み合わせ、エージェント型タスク、コーディング、科学的推論、一般的なインテリジェンスにおけるモデル性能を測定するものです。
Nemotron 3.5 Lightning は、強力なインテリジェンスと同等サイズのモデルと比較して最大 4 倍の出力速度を実現します。これにより、大量の処理を伴うエージェントワークロードにおいて、精度と速度を高い水準で両立するモデルとなっています。

エージェントの効率を最終的に左右するのは、単純なトークン生成速度ではなく、有用なタスクをどれだけ速くに完了できるかです。PinchBench では、Nemotron 3.5 Lightning が 86% の精度に達し、同等の精度を持つ Qwen3.6 35B と比較して 30% 高速に 10,000 件のタスクを完了します。
より高い推論スループットとより優れたトークン効率により、Nemotron 3.5 Lightning は効率のフロンティアに位置し、常時稼働するエージェントが大量のタスクをより短時間で処理できるよう支援します。

Nemotron 3.5 Lightning は、精度を損なうことなくどのようにスピードを実現しますか?
Nemotron 3.5 Lightning は、投機的デコーディングや量子化を通じて精度を損なうことなく、高速性とカスタマイズ性を実現しています。
投機的デコーディング
Nemotron 3.5 Lightning は、トークンを高速に生成できるよう設計されており、投機的デコーディングによって複数のトークンをまとめて生成できます。これは、モデルまたはドラフト モデルが複数のトークン候補を先行して生成し、それらを効率的に検証する手法です。Nemotron 3.5 Lightning は、Nemotron 3 Super および Ultra と同様に、マルチトークン予測 (MTP) をモデルに組み込むために専用の事前学習段階を設けました。さらに、学習後、専用の MTP ブースト フェーズにより、MTP の精度がさらに向上しました。
MTP に加えて、Nemotron 3.5 Lightning には 2 つのドラフト モデルが用意されています。その 1 つである DSpark は、DGX Spark での推論ワークロードや同時実行数が少ないデータ センターのワークロードに推奨されます。MTP に加えて、Nemotron 3.5 Lightningでは 2 つのドラフト モデルが提供されます。DSpark は、DGX Spark での推論ワークロードや、同時実行数が少ないデータ センター ワークロードに推奨されます。一方、MTP は中~高程度の同時実行数に適しており、同時実行数が増えるほど最適なドラフト長は短くなります。MTP は中~高レベルの同時実行に最適であり、同時実行数が増えるにつれて最適なドラフト長は短くなります。NVIDIA はさらに、DFlash ドラフト モデルもリリースしています。このモデルは、他のモデルと比較して測定でき、ワークロードに最適なパフォーマンスを発揮します。
量子化
Nemotron 3.5 Lightning は、BF16 に加えて NVFP4 チェックポイントも提供されています。NVIDIA Blackwell、NVIDIA Hopper、NVIDIA Ampere GPU 上で Nemotron 3 Ultra を支えるものと同じ、専用の NVFP4 カーネルを使用しています。同じモデル ファイルは、デスクトップの DGX Spark 上と同様に、データ センターでも遜色なく機能します。
Nemotron 3.5 Lightning がローカル AI に最適な理由
Nemotron 3.5 Lightning により、NVIDIA Jetson、GeForce RTX 5090、DGX Spark などのローカル システムで高性能なエージェント型 AI を利用できるようになります。
NVIDIA は、EXO Labs を含む多くのチームと協力して、このモデルが DGX Spark 上でどのようなパフォーマンスを発揮するかを検証しています。

さらに、Nemotron 3.5 Lightning は LM Studio、llama.cpp、Ollama、Unsloth などの業界標準のツール セットと組み合わせて実行することができます。
パートナー エコシステム
Nemotron 3.5 Lightning は、以下を含む、ハーネス、カスタマイズ、デプロイ、推論など、成長するパートナーのエコシステムによってサポートされています。
- 事後学習: AgileRL、Applied Compute、Deep Cogito、distil labs、Fastino Labs、Locai Labs、Prime Intellect、Reasonable、Thinking Machines Lab、Thoughtworks、Trajectory、Uniphore
- 推論ソフトウェア: Ollama、Exo、Canonical、LM Studio、Unsloth
- ハーネスとエージェント フレームワーク: Aible、Cline、Factory AI、Hermes Agent、Kilo Code、LangChain、LM Studio Bionic、OpenClaw、OpenCode、OpenHands、Pi
- クラウド サービス プロバイダー プラットフォーム: Amazon SageMaker JumpStart、Google Cloud Gemini Enterprise Agent Platform、MSFT Foundry、OCI Enterprise AI
- GSI: Accenture、Tata Consultancy Services、Tech Mahindra、Wipro
- AI ネイティブ: Arcos Labs、CodeRabbit、Dream、Harvey
- ホスティング型推論サービス プロバイダー: Baseten、BlackBox AI、CoreWeave、Crusoe、DeepInfra、Fireworks AI、FriendliAI、GMI Cloud、Modal、Nebius、Together AI
Nemotron 3.5 Lightning で構築を始める
Nemotron 3.5 Lightning は、重み、データ、レシピの各点で完全にオープンであるため、ワークフローに適応し、どこにでもデプロイできます。 始めたい場合は、build.nvidia.com または OpenRouter よりお試しください。 Hugging Face と ModelScope から重みをダウンロードします。 詳細情報を知りたいですか?
- Nemotron 3.5 Lightning クックブックを読む
- vLLM、SGLang、TensorRT-LLM デプロイ ガイドを使用してデプロイ
- Switchyard ドキュメントを利用してルーティングを構築する
NVIDIA Nemotron の最新情報を入手するには、NVIDIA ニュースを購読し、LinkedIn、X、Discord、YouTube で NVIDIA AI をフォローしてください。
開発を始めるためのリソースについては、Nemotron 開発者ページをご覧ください。Hugging Face や ModelScope で公開されている Nemotron モデルとデータセット、および build.nvidia.com の Blueprints をぜひご覧ください。
Nemotron のライブストリーム、チュートリアル、NVIDIA フォーラムの開発者コミュニティや Discord で交流しましょう。
翻訳に関する免責事項
この記事は、「NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents」の抄訳で、お客様の利便性のために機械翻訳によって翻訳されたものです。NVIDIA では、翻訳の正確さを期すために注意を払っておりますが、翻訳の正確性については保証いたしません。翻訳された記事の内容の正確性に関して疑問が生じた場合は、原典である英語の記事を参照してください。