今日のデータ主導の世界において、組織は重要な情報を収集するために動画への依存度をますます高めています。しかし、大量の映像から有意義なリアルタイムのインサイトを抽出することは、依然として課題です。映像検索/要約 (VSS) 向けの NVIDIA Metropolis Blueprint は、数百万のライブ ビデオ ストリームや数時間におよぶ録画ビデオを、即座に検索可能で実用的なインテリジェンスに変換することで、この課題を克服します。
VSS は、大量のライブ ビデオ ストリームと録画データに対して、リアルタイムで認識、推論、対応する動画分析 AI エージェントを構築するためのリファレンス アーキテクチャを提供します。このソリューションは、高速化されたビジョンベースのマイクロサービス、ビジョン言語モデル (VLM)、大規模言語モデル (LLM)、およびリトリーバーを使用し、リアルタイム ビデオ インテリジェンス、エージェント型検索、自動レポート作成を実現します。VSS は、企業が業務を監視し、傾向を検出し、これまで以上に迅速に情報に基づいた意思決定を行うのを支援します。VSS の最新バージョンでは、新しいモジュール設計、高度な融合型検索機能、自律型エージェントと容易に統合できる一連のスキルを提供します。
この記事では、コーディング エージェントで新しい VSS スキルを活用して、VSS のデプロイとカスタム アプリケーションへの統合を自動化する方法を学び、その後、VSS 3 の基盤となるテクノロジーを詳しく説明します。この記事を読み、自律型の動画分析 AI エージェントを構築するために、コーディング エージェントで VSS スキルを活用する方法を学びましょう。
また、録画を視聴して、VSS スキルを用いた動画分析 AI エージェントの構築方法を学ぶこともできます。

VSS スキルとコーディング エージェントを活用した、動画 AI エージェントの構築
これまで、開発者は、ビデオ分析アプリケーションを構築するために、動画管理、検索、要約などに VSS が提供する豊富なマイクロサービス セットを手動で設定、デプロイ、統合しなければなりませんでした。現在では、VSS スキルで拡張されたコーディング エージェントを活用して、シンプルなエージェント型チャット インターフェイスを通じて、VSS のデプロイ、使用、統合をすべて自動化できます。
VSS スキルは、VSS GitHub リポジトリにホストされ、エージェント スキルの仕様に準拠しているため、さまざまなエージェントで使用できます。これらのスキルを活用するための前提条件は、VSS を実行できるように設定されたシステムと、Codex、Claude Code、OpenClaw、NemoClaw などのスキルと互換性のあるエージェントを備えていることです。
まず、Codex に VSS のスキルを追加し、それを利用して VSS 検索プロファイルをデプロイする方法の例を示します。次に、OpenClaw に VSS スキルを追加する方法について説明します。これにより、ほぼすべてのチャット インターフェイスを通じて VSS デプロイと対話し、大量の映像を検索して分析できるようになります。
これらのスキルは、VSS プロファイルのデプロイ、動画のアップロードとインデックス作成、検索と要約ワークフローの実行、アラート検証の設定、VSS 出力のカスタム アプリケーションへの統合など、一般的な開発タスクに役立つように設計されています。
VSS を既存のコンピューター ビジョン パイプラインと統合する開発者については、CV トリガーのビデオ クリップを VSS に接続して VLM ベースのレビュー、アラート、Q&A を行うイベント レビュアー ワークフローについて、「コンピューター ビジョン パイプラインを生成 AI および推論と統合する方法」を参照してください。
VSS の前提条件の設定
最初のステップは、VSS を実行するシステムを準備することです。これを行う最も簡単な方法は、NVIDIA Brev Launchable for VSS を使用することです。VSS Launchable のドキュメント ページに移動し、[Launch Blueprint] ボタンをクリックしてから、[Deploy Launchable] をクリックします。
チュートリアルを視聴します。セットアップ手順に進む前に、NVIDIA Launchable を使用して VSS Blueprint をデプロイする方法を学びましょう。
デプロイしたら、[Open Notebook] ボタンをクリックし、/video-search-and-summarization/scripts/deploy_vss_launchable.ipynb ノートブックに移動します。NGC から取得した NGC_CLI_API_KEY を最初のセルに貼り付け、ティアダウン セクションを含むノートブック全体を実行してください。これにより、VSS 向けにシステム設定が完全に完了します。その後、デプロイ スキルを活用して、コーディング エージェントから VSS デプロイを管理できるようになります。
ノートブックの実行が完了したら、ホスト システムに Brev CLI をインストールし、VSCode を起動して、以下の図 2 に示すように、Launchable ページの「Using Brev CLI (SSH) (Brev CLI (SSH) の使用)」セクションの手順に従って Brev インスタンスにリモート接続します。

リモート アクセスの設定が完了したら、VSCode 拡張機能を介して Codex をインストールし、コーディング エージェントとして使用できます。
Codex を使用した VSS のデプロイ
VSCode では、[extensions] タブを使用して Codex を検索し、インストールします。インストールが完了したら、VSS スキルをインストールする必要があります。これを行うには、Codex に、次のプロンプトに示すように VSS スキルの自動インストールを指示し、VSS GitHub リポジトリの場所を指定します。
Read ~/video-search-and-summarization/skills/README.md and every SKILL.md file under ~/video-search-and-summarization/skills/. For each skill in the catalog, install it for this host so I can invoke it from a shell or chat session. Use the host's standard skills directory:
Claude Code: ~/.claude/skills/<name>/
Codex: ~/.codex/skills/<name>/
Hosts that follow the agentskills.io universal path: ~/.agents/skills/<name>/
Symlink each skill folder rather than copying it so a git pull here keeps every install up to date. Skip skills that are already installed and pointing at this checkout. When you're done, list the skills you registered and which directory you used.
以下の図 3 は、エージェントがどのように応答するかを示しており、VSS スキルにアクセスできることを確認しています。

エージェントに VSS スキルが読み込まれたら、それを活用して、さまざまな VSS コンポーネントとプロファイルをデプロイできます。その後、Codex を活用して、以下の図 4 に示すように、新しい VSS 検索プロファイルをデプロイできます。

Codex は、その後、デプロイ計画を策定し、必要な環境変数を構成したうえで、VSS 検索機能を有効にするために必要なすべてのコンテナをデプロイします。ここから、Codex を継続して活用し、VSS と連携して動画を検索することも、次のセクションに進んで、VSS スキルで OpenClaw を使用する方法を確認することもできます。
VSS と OpenClaw による動画の検索
検索プロファイルが実行されている状態で、 OpenClaw をインストールして設定し、VSS を使用して動画を分析する自律型エージェントとして機能させることができます。
Brev システム上で OpenClaw をセットアップする方法を説明し、この強力な自律型エージェントで、どのようなことができるかを確認します。Brev インスタンスに接続された VSCode ターミナルから、標準の OpenClaw インストール手順に従い、推奨されるインストーラー スクリプトを使用します。
初期設定を実行したら、以下の図 5 に示すエージェントを起動し、VSS を使用して動画分析アプリケーションを構築するためのエージェントであるというコンテキストをエージェントに与えることができます。

初期セットアップの後、OpenClaw に VSS スキルを指定する必要があります。これを実現する最も簡単な方法は、スキルを手動で OpenClaw ワークスペースにコピーすることです。
mkdir ~/.openclaw/workspace/skills
cp -r ~/video-search-and-summarization/skills/* ~/.openclaw/workspace/skills
これでターミナルで openclaw dashboard コマンドを実行して、OpenClaw UI を開きます。これにより、OpenClaw UI にアクセスするためのクリック可能なリンクが表示されます。UI が開いたら、OpenClaw が VSS スキルにアクセスできることを確認できます。

これで、OpenClaw に、前のセクションでデプロイした VSS 検索プロファイルを使用して、大量の映像データの分析を開始させることができます。この例では、倉庫で撮影された 10 分間の動画 3 本へのパスを提供します。これらの動画では、安全なはしごの使用について分析する必要があります。OpenClaw の検索機能を使用して、動画内のはしごの使用事例をすべて検出し、作業員がヘルメットと安全ベストを着用していることを確認します。このために、次のプロンプトを使用します。
I have a set of warehouse videos located at ~/warehouse_videos. I need to find any instances of a worker climbing a ladder and verify they are wearing a hardhat and safety vest. Can you do this with the VSS Search profile that is deployed?
プロンプトが表示されると、OpenClaw はバックグラウンドで動作を開始し、タスクを完了するために必要なスキルと、実行する必要がある関連ツールの呼び出しを判断します。
OpenClaw は、VSS スキルを活用して動画ファイルを VIOS にアップロードし、埋め込みマイクロサービスを通じて動画を取り込んで検索可能なインデックスを生成します。次に、VSS の融合検索機能を使用して、ヘルメットと安全ベストを着用した作業員がはしごを登っている動画クリップを検索します。

完了すると、OpenClaw は、動画全体で確認されたはしごの使用状況に関する簡潔なレポートと、動画のスクリーンショットを返します。
このセクションでは、VSS スキルを活用して、Codex をデプロイし、OpenClaw を動画分析に活用する簡単な例を 1 つだけ説明しました。VSS スキルでエージェントを拡張することで、動画データから貴重なインサイトを得たり、VSS を使用して新しいアプリケーションを構築したりする無限の可能性が広がります。
今度は、VSS 3 の豊富な動画分析機能を支えるテクノロジーについて、さらに深く掘り下げます。
よりスマートな動画: アラートから検索に至るまで
大規模な動画検索は、現代の情報検索において、依然として最も困難な課題の 1 つです。 ユーザーのクエリは本質的に複雑で曖昧です。特にオブジェクトやイベントが、単純なベクトル表現では対応できない多層的な属性を持つ場合には、単一の視覚的な埋め込みだけで意味的な意図を完全に捉えることは根本的に不十分です。
膨大な規模では、数百万時間に及ぶ映像の中から特定の瞬間を見つけることは、まさに「干し草の山の中から針を探す」ような問題となります。このような場合、単一の埋め込み空間における最近傍検索では、精度と再現率の両面が急速に低下してしまいます。
これらの制限に対処するには、次の 2 つの中核的な機能に基づいた、より高度な検索アーキテクチャが必要です。
- マルチタイプの埋め込み抽出と検索、および関連性フィルタリングと意味的重複排除の組み合わせ。
- エージェント型推論に基づく検索オーケストレーション。複雑なクエリを扱いやすいサブクエリに分解し、各ステップで推論ベースの検索戦略を適用し、反復的な検証とリフレクション ループを実行して、結果を段階的に洗練させる。
この検索アーキテクチャは、まず RTVI-CV を、埋め込みおよび RTVI- 埋め込みマイクロサービスとともに使用し、動画を取り込み、特徴量を抽出します。次に、VSS エージェントは、この特徴量データとビジョン認識ツールを活用して、動画に関する詳細で反復的な検索を実行し、計画を作成して結果を取得することで、動画のタイムライン内の特定のオブジェクトやイベントを特定します。

モジュール型アーキテクチャにより、高い柔軟性とパフォーマンスを実現
VSS は、docker-compose ベースのモジュール型開発者プロファイル システムを中核として設計されています。基本エージェントは 5 分以内にデプロイされ、必要に応じて追加のワークフローが階層化されます。
| ワークフロー | プロファイル | コア機能 |
| 基本情報 / Q&A | ベース | VLM ベースの Q&A と短い動画クリップによるレポート生成 |
| アラートの検証 | アラート (検証) | CV パイプライン + 行動分析 + VLM 検証 |
| リアルタイム VLM アラート | アラート (VLM) | ライブ ストリームでの継続的な VLM 異常検出 |
| 検索 | 検索 | 動画アーカイブ全体でのエージェント型マルチ埋め込み検索 |
| 動画の要約 | lvs | 拡張録画のチャンク化された要約 |
各ワークフローは、ハードウェアとパフォーマンスのニーズを満たすために、さまざまな構成のいくつかのタイプの GPU でサポートされています。
さまざまなワークフローと構成におけるベンチマークを見てみましょう。
エージェント型検索ワークフローは、最大同時入力ストリーム数、受信ストリームの取り込みにかかる時間、検索結果を受け取るまでの取得の遅延によって特徴付けられます。以下の表 2 では、H100 および NVIDIA RTX PRO 6000 のシングル GPU 構成における、これらの指標を示しています。
| GPU | 最大同時ストリーム数 | 最大取り込み遅延 (秒) | 取得の遅延 (秒) |
| H100 x 1 | 33 | 0.079 | 2.24 |
| RTX PRO 6000 x 1 | 51 | 0.101 | 1.87 |
アラート検証ワークフローの場合、同時実行可能なストリームの最大数と、検証に要する遅延が測定されます。以下の表 3 では、RT-DETR を検出器として、Cosmos Reason 2 を、平均 1 分間に 1 回のアラート イベントが発生するストリーム上で動作する VLM 検証ツールとして使用して測定された各指標を示しています。
| GPU | 最大同時ストリーム数 | 検証の遅延 (秒) |
| DGX Spark x 1 AGX Thor x 1 | 14 | 0.89 |
| H100 x 1 | 147 | 1.01 |
| RTX PRO 6000 x 1 | 87 | 0.82 |
長尺動画要約マイクロサービスは、何時間にもわたるビデオ映像の要約を迅速に生成します。以下の図は、特定の GPU 構成が 1 時間の動画を要約するのにかかる時間を示しています。LVS マイクロサービスを複数の GPU に拡張することで、要約にかかる時間を大幅に短縮できます。

VSS スキルを使ってみる
VSS スキルを利用すると、開発者は自然言語を使用して、ビデオを検索可能で意味のあるデータに変換できます。これにより、インサイトの発見、要約の生成、よりスマートなアプリケーションの構築が容易になります。
VSS を詳しく知りたい場合は、ドキュメントをご覧ください。 VSS スキルを使用して動画分析 AI エージェントを構築するライブ配信を視聴し、GitHub ですべての VSS スキルを確認してください。
技術的な質問については、フォーラムをご覧ください。
NVIDIA Metropolis は、高品質なデータの生成から、エッジとクラウド全体でのモデルの適応とデプロイに至るまで、ビジョン AI エージェントのライフサイクル全体をサポートします。VSS に加えて、開発者は TAO スキルを使用して効率的にモデルのファインチューニングを実行し、動画データ拡張スキルを用いて合成データを生成し、限られたデータセットを拡張してモデルの精度を向上させることができます。
翻訳に関する免責事項
この記事は、「Transform Video Into Instantly Searchable, Actionable Intelligence with AI Agents and Skills」の抄訳で、お客様の利便性のために機械翻訳によって翻訳されたものです。NVIDIA では、翻訳の正確さを期すために注意を払っておりますが、翻訳の正確性については保証いたしません。翻訳された記事の内容の正確性に関して疑問が生じた場合は、原典である英語の記事を参照してください。