Generative AI

コンテキストに応じた動画 AI エージェントのエンタープライズ ワークフローへの統合

Reading Time: 4 minutes

膨大な量の映像に基づいて認識、推論し、行動を行うことができるビデオ解析 AI エージェントは、有用なものとするために、既存のワークフローやアプリケーションと統合する必要があります。これらには、コンテンツ管理システム、メッセージング プラットフォーム、データベース、チケット キュー、およびエスカレーション パスが含まれます。

動画システム、エンタープライズ ナレッジベース、および運用ツールは通常、サイロ化されているため、この統合は困難です。開発者は、ユーザーの意図を把握し、正しい組織的な文脈を取得し、構造化されたレポートを生成し、その結果をダウンストリームのシステムに転送する必要があります。

前回の投稿では、NVIDIA Blueprint を使用してドキュメントの知見を動画分析に活用する方法について説明しました。本記事では、そのトピックの続きを説明し、NVIDIA NemoClaw を導入することで、単なる動画分析だけでなく、それらの分析に基づいてプログラマティックにアクションを実行する方法について説明します。

学習内容:

  • VSS を拡張し、ガイド付きのコンテキストに基づいた動画分析を実現する
  • NVIDIA NemoClaw を使用して、VSS と RAG ブループリントを、コンポーザブル サービスとしてオーケストレーションする
  • 組織の知識やリファレンスの知識を活用して、構造化されたレポートを生成する
  • 動画分析を他のビジネス プロセスにフィードするマルチステップ ワークフローを構築する
  • エンタープライズ環境全体でこのソリューションをデプロイおよび拡張する

このアプローチは、コンテキスト認識型の動画 AI エージェントにおける次のステップであり、「この動画は何を示しているか」という問いから、「この動画で示されている内容に対して何をすべきか、そして、その対応を大規模に、どう調整すべきか」という問いへと移行するものです。

NVIDIA NemoClaw と NVIDIA Blueprint とは?

NVIDIA NemoClaw は、自律型エージェントを構築するためのオープン ブループリントのコレクションです。 これにより、エコシステムは、デジタル ワークフローおよびフィジカル ワークフロー全体にわたって、より安全で高速に動作し、コスト効率の高い、ドメインに特化した常時稼働のエージェントを構築できます。

NVIDIA Blueprint は、エンタープライズ規模でエージェント型 AI パイプラインを構築するためのカスタマイズ可能なリファレンス ワークフローです。 これらは、専用マイクロサービス、最適化されたモデル、コンポーザブル API を組み合わせることで、モジュール性を維持しながら、価値創出までの時間を短縮します。NemoClaw に加えて、このブログで使用している主なブループリントは次のとおりです。

  • 動画検索と要約 (VSS) 向け NVIDIA Metropolis Blueprint は、ストリーミング動画やアーカイブ動画を取り込み、キャプションや視覚的なメタデータを生成するとともに、セマンティック検索、対話型 Q&A、イベント要約をサポートします。
  • 検索拡張生成 (RAG) 向け NVIDIA AI Blueprint は、企業独自のドキュメント (マニュアル、ポリシー、規制、SOP、リファレンス データなど) を GPU で高速化されたベクトル ストアに取り込んでインデックスを作成し、高速なセマンティック検索を実現します。

VSS は、どのようにして意図を捉え、知識を検索し、動画からレポートを生成するのか?

VSS は、エージェントに組み込まれた一連のツールを通じて、ガイド付きのコンテキスト対応型の動画分析を提供します。ヒューマンインザループ (HITL) のプロンプトは、処理が開始される前に、ユーザーが求める内容を捉えます。 エージェントは、関連する組織知識を検索し、タイムスタンプが入った構造化されたレポートを生成します。

自律型エージェントを構築するための NVIDIA NemoClaw ブループリントと組み合わせることで、このシステムは、単なる動画分析の枠組みを超えて、それらの分析に基づいてプログラム的に実行できるようになります。 これにより、チケットの生成、複数ソース間のパターンの比較、手順書の改訂案の作成、異常のエスカレーション、およびダウンストリームのワークフローへの結果の反映といった機能が利用可能になります。

これを実現するために、3 つのエージェント ツールが連携します。

  • 長編動画の要約 (LVS) 動画理解ツール: 必須の HITL パラメーターの収集を行い、長編動画の要約を実行します。 ユーザーは、シナリオ (動画の内容)、関心のあるイベント (検出対象)、注目している対象 (追跡対象)、およびオプションの知識検索クエリを対話形式で指定します。
  • ナレッジ検索 (frag) ツール: RAG Blueprint を呼び出して、ドキュメント、ポリシー、リファレンス データ、およびナレッジベースから組織固有のコンテキストを取得します。RAG Blueprint は、埋め込み、再ランキング、およびベクトル検索を内部で処理します。
  • レポート生成ツール: 動画分析と取得されたコンテキストを組み合わせ、タイムスタンプ、ナラティブ分析、引用情報を盛り込んだ構造化レポートを生成します。HITL を活用して、レポートが生成される前に、ユーザーがプロンプトを確認または編集できるようにできます。

これらのツールを組み合わせることで、HITL を使用してユーザーのインテントを収集し、RAG ブループリントにコンテキスト情報を求めてクエリを行い、そのコンテキストを使用して動画を処理し、レポート生成ツールに引き渡してフォーマットされた出力を生成します。

動画から評価と推奨のアクションを生成する

このプロセスを実証するために、食事動画を分析してユーザーの食習慣を評価し、具体的で追跡可能な、実行可能な次のステップを返す「健康的な食生活コーチ」を作成します。このプロセスについては、以下のセクションで詳しく説明します。

ユーザーが動画をアップロードし、分析対象を指定する

まず、ユーザーは VSS インターフェイスを介して食事準備ビデオをアップロードします (図 1)。

それから NemoClaw がワークフローを開始します。 vss-generate-video-report-rag スキル定義 (SKILL.md) を読み込み、分析に必要なパラメーターを把握し、そのリクエストを VSS エージェントに渡します。VSS エージェントは、ターミナル上で一連の短い HITL プロンプトを通じてユーザーを案内します (図 2)。

プロンプトでは、分析対象、シナリオ、関心のあるイベント、追跡対象、および栄養ガイドラインや規制ガイドラインなどの参照知識を取得するためのオプションの RAG Blueprint クエリについて尋ねられます。この意図をあらかじめ把握することで、動画を処理する前に、ユーザーが実際に関心を持っている内容まで分析の範囲を絞り込むことができます。自動バッチ実行の場合、これらの回答は、インタラクティブな方法ではなく、プログラムによって提供できます。

NemoClaw が、VSS と RAG Blueprint を統合管理する

次に、パラメーターが確認された状態で、NemoClaw がパイプラインを調整します。LVS 動画理解ツールは、まず RAG Blueprint から関連する栄養ガイドラインを検索し、RAG Blueprint が、マッチングした参照ドキュメントを返却し、ベクトル検索を内部で処理します。

その後、それらのパラメーター、動画、および取得したコンテキストを LVS サービスに渡します。LVS サービスは、動画の階層的な要約を行い、リファレンス知識をその分析結果に組み込みます。レポート生成ツールは、その結果を構造化されたタイムスタンプ付きのレポートにまとめます。このレポートには、タイムスタンプを伴う検出イベント、リファレンス資料に基づいたナラティブ分析、関連するソースドキュメントの引用、および具体的な推奨アクションが含まれます。

図 3 は、NemoClaw ターミナルにおけるこのオーケストレーションを示しており、エージェントの推論とツール呼び出しを含みます。

NemoClaw が Jira チケットを作成する

NemoClaw は、完成したレポートを読み取り、調整されたアクションへと変換します。 ここでは、Markdown および PDF レポートや動画再生へのリンクとともに、完了した分析結果、その食事がなぜ健康的であるかの要約、および推奨される次の手順が表示されます (図 4)。その後、アクション項目が完了するまで追跡されるように、適切な優先順位と割り当てを伴う、調査結果と推奨される食事の調整を要約した Jira チケットが自動的に作成されます (図 5)。

このダウンストリームのステップは、Jira の枠を超えて一般化されます。 レポートの内容に応じて、NemoClaw は以下を行うこともできます。

  • 検出事項に対して、適切な優先順位と割り当てを指定するチケットを作成します。
  • 複数の実行時に出現するパターンをエスカレーションまたは要約します。
  • レビューやコンプライアンスのための証拠をバンドルします。
  • 適切なフォローアップ ワークフローにギャップをルーティングします。

この時点で、レポートはもはや静的なドキュメントではありません。 これは、チームがすでに使用しているシステム全体で、協調的なアクションを行うためのトリガーとなります。

図 6 は、4 つのレイヤーに分かれたアーキテクチャを示しています。

  • オーケストレーション: NemoClaw エージェント、vss-generate-video-report-rag スキル、および HITL プロンプト
  • VSS エージェント: ツールには、動画 I/O、検索、理解、LVS、知識検索、およびレポート生成が含まれます。 知識検索は、エージェントの一部であり、個別の拡張機能ではありません
  • RAG Blueprint: NVIDIA RAG API、Milvus ベクトル データベース、NVIDIA Nemotron のリランキング NIM、およびインデックス付きのリファレンス ドキュメントや組織ドキュメント
  •  LLM フュージョン: RAG Blueprint を通じて取得したコンテキストを使用して、VSS が提供する要約を強化する

データはシステム内を上位から下位へ流れ、エージェントのツールが LVS サービスと RAG Blueprint への呼び出しをオーケストレーションし、その両方が最終出力のためにレポート生成ツールに供給されます。

知識検索を伴う VSS エージェントをデプロイする方法

自社独自のワークフロー向けにソリューションを実装するには、以下の手順に従います。

前提条件

  • 少なくとも 24 GB の VRAM を搭載した NVIDIA GPU
  • Docker Engine と Docker Compose v2
  • NGC API キー (ngc.nvidia.com)
  • NVIDIA Build API キー (build.nvidia.com)
  • RAG Blueprint がデプロイされ、エージェントからアクセス可能である (サーバー URL にアクセス可能)、およびそのコレクション名
  • NemoClaw がインストールされた (プログラマティック アクセス向け)

ステップ 1: VSS リポジトリをクローンし、NGC で認証を行う

git clone https://github.com/NVIDIA-AI-Blueprints/video-search-and-summarization.git ~/vss-public
cd ~/vss-public
echo "$NGC_CLI_API_KEY" | docker login nvcr.io --username '$oauthtoken' --password-stdin

ステップ 2: 環境を構成する

LVS プロファイル .env ファイル、deploy/docker/developer-profiles/dev-profile-lvs/.env を編集します。RAG_ values を除く、すべての変数はそのファイル内に存在します。この値はエージェントの RAG 構成によって読み取られ、お客様自身が追加します。

# Deployment selection
MODE=2d
BP_PROFILE=bp_developer_lvs
HARDWARE_PROFILE=H100         # H100, L40S, RTXPRO4500BW, RTXPRO6000BW, DGX-SPARK, IGX-THOR, AGX-THOR, or OTHER
  
# LLM / VLM placement
LLM_MODE=local_shared         # local_shared runs LLM and VLM on one GPU; use 'local' for separate GPUs
VLM_MODE=local_shared
LLM_DEVICE_ID='0'
VLM_DEVICE_ID='0'
  
# Paths (you MUST set these)
VSS_APPS_DIR="<PATH>/vss-public/deploy/docker"
VSS_DATA_DIR="<PATH>/vss-apps-data"
HOST_IP='<YOUR_IP>'
  
# Agent image + config
VSS_AGENT_VERSION=3.2.0
# Enable knowledge retrieval (frag): point at config_rag.yml (default config.yml has it off)
VSS_AGENT_CONFIG_FILE=./deploy/docker/developer-profiles/dev-profile-lvs/vss-agent/configs/config_rag.yml
  
# Credentials
NGC_CLI_API_KEY='nvapi-...'
NVIDIA_API_KEY='nvapi-...'
  
# RAG Blueprint connection (read by config_rag.yml)
RAG_SERVER_URL='http://<RAG_SERVER>:8081/v1'
RAG_API_KEY='<YOUR_RAG_API_KEY>'
KNOWLEDGE_COLLECTION='<YOUR_COLLECTION>'

VSS_AGENT_CONFIG_FILEconfig_rag.yml に設定すると、frag 知識検索ツールが有効になります。これら 3 つの RAG_ 値は、エージェントが必要とする唯一の RAG 設定です。エージェントが RAG サーバーの検索エンドポイントを呼び出すと、RAG Blueprint が内部で埋め込み、リランキング、ベクトル検索を処理します。RAG Blueprint のデプロイ自体のドキュメントに従って、そのデプロイ上でベクトル データベース、埋め込み、およびリランカーを構成します。

ステップ 3: VSS スタックをデプロイ

バインド マウントに必要なデータ ディレクトリを作成してから、スタックを起動します。 コンポーズ プロファイルは、.env ファイル内の COMPOSE_PROFILES から自動的に選択されます。

export VSS_DATA_DIR=<PATH>/vss-apps-data
mkdir -p "$VSS_DATA_DIR"/data_log/{elastic/data,elastic/logs,kafka,redis/data,redis/log}
chmod -R 777 "$VSS_DATA_DIR/data_log"
  
cd ~/vss-public/deploy/docker
docker compose \
  --env-file developer-profiles/dev-profile-lvs/.env \
  -f compose.yml \
  up -d

コンポーズ スタックは、RAG 対応の構成を使用して、すべてのインフラ (VST、Redis、Elasticsearch、LVS、NIM) とエージェントを起動します。 開発者プロファイル ヘルパー ./deploy/docker/scripts/dev-profile.sh up --profile lvs --hardware-profile H100 も、同じ処理を行い、データ ディレクトリを作成します。

ステップ 4: サービスが正常であることを確認する

NIM の読み込みには 5 分から 15 分かかる場合があります。

docker ps --format 'table {{.Names}}\t{{.Status}}\t{{.Ports}}'
curl -sS http://localhost:8000/health       # VSS agent
curl -f http://127.0.0.1:38111/v1/ready         # LVS backend
curl -f http://127.0.0.1:8018/v1/health/ready   # RT-VLM
curl -f http://127.0.0.1:30081/v1/health/ready  # LLM NIM

NemoClaw のセットアップ

NemoClaw は、オーケストレーション レイヤーとして機能し、ワークフロー全体を制御できるように、サンドボックス、ネットワーク ポリシー、およびスキルを構成します。

ステップ 1: NemoClaw インストーラーを実行する

リポジトリのルートから: NEMOCLAW_PROVIDER が必要です。NVIDIA がホストするモデル向けに build を使用します。

NEMOCLAW_PROVIDER=build \
NVIDIA_API_KEY="$NVIDIA_API_KEY" \
  bash deploy/docker/scripts/nemoclaw/init_nemoclaw.sh demo

この 1 つのコマンドで、フルセットアップが処理されます。NemoClaw のオンボード処理を行い、モデル プロバイダーを構成し、VSS サンドボックス ポリシーを適用 (これにより、ポート 8000 上の VSS エージェントへのサンドボックス アクセスを許可します) し、vss-generate-video-report-rag を含むリポジトリ スキルを OpenClaw プラグインとしてサンドボックスにインストールし、OpenClaw UI URL を表示します。

代わりに、独自の OpenAI 互換エンドポイント (ローカル vLLM など) を使用するには:

NEMOCLAW_PROVIDER=custom with NEMOCLAW_ENDPOINT_URL and COMPATIBLE_API_KEY

ステップ 2: エンドツーエンドのワークフローをテストする

nemoclaw SANDBOX_NAME connect
openclaw tui

OpenClaw UI が開いています。次の 2 つのアクションは、シェル内ではなく UI 内で実行されます。

  1. /new と入力し、Enter キーを押して、新規のセッションを開始します。
  2. リクエストをメッセージとして入力し、Enter キーを押します。例: <VIDEO_NAME> の動画要約レポートを生成したいです。

エージェントは、HITL プロンプトを通じて分析パラメーターを収集し、LVS と RAG Blueprint を使用してレポートを生成します。そして、Jira チケットを作成するか、その結果に基づいて通知を送信できます。

エンドツーエンド パイプラインの遅延とパフォーマンス

NemoClaw のオーケストレーションと HITL パラメーターの収集を追加することで、遅延のオーバーヘッドを最小限に抑えます。 HITL フェーズは非同期です。つまり、システムの待機状態中は NemoClaw と人間のユーザーとのやり取りが行われるため、パラメーターが確認されたら、動画処理を続行します。

業界や NVIDIA パートナーは、NemoClaw、VSS 3、RAG Blueprint をどのように活用しているのか?

動画理解、知識検索、エージェント型オーケストレーションの組み合わせにより、あらゆる業界の新機能が可能になります。 パートナーがこのソリューションをどのようにデプロイしているかをご覧ください。

  • Computacenter は、予知保全のために Run:AI クラスター上に DETECT → REASON → ACT の完全なパイプラインをデプロイしました。VSS 3 を使用してドローン、ボアスコープ、サーマル検査の映像を分析し、OEM のコンテキスト向けの RAG Blueprint、および NemoClaw を活用して Maximo の作業オーダーを自動作成することで、4 つのアセット クラスにおいて映像の分析から作業指示書の作成までの時間を 30 ~ 45 分から約 19 秒へと短縮しました。
  • VAST Data は、NemoClaw を活用して VAST DataEngine 上でリアルタイムの VSS パイプラインをオーケストレーションし、VastDB およびベクトル上の VAST RAG を用いてライブ ゲーム ストリームを処理します。cosmos-reason2 と Nemotron を用いた NVIDIA ブループリントを基盤に構築されており、NVIDIA DSX AIR 上でエンドツーエンドで実行されます。

実用的な動画 AI の利点とは?

VSS 3、RAG Blueprint、NemoClaw の統合は、企業の動画分析へのアプローチ方法に根本的な変化をもたらすものです。 通常、動画分析では、静的レポートが生成されます。 動画で何が起こっているかを理解するには、手動での解釈と手動でのアクションの開始が必要でした。

この統合ソリューションにより、動画の理解がその出発点となります。 エージェント型オーケストレーションは、その理解を、チケットの作成、チームへのアラート送信、パターンの比較、異常のエスカレーション、ダウンストリームのワークフローへの結果の反映といった、調整されたアクションへと変換します。

その影響は重大です。

  • スピード: 応答時間は、数時間から数日から数分に短縮されます。
  • 拡張性: 複数のソースにまたがる数千もの動画を分析し、全社規模のパターンを浮上させます。
  • 一貫性: 参照知識 (ポリシー、手続き、規制、ガイドライン) が一貫して適用されます。
  • アカウンタビリティ: あらゆる意思決定は、動画証拠やソースドキュメントにまで遡って追跡されます。
  • 自動化: 日常的なワークフロー(アラート生成、チケット作成、ドキュメント作成)は、手動の介入なしで実行されます。

これがエンタープライズ グレードの動画 AI の特徴です。専用分析エンジン (VSS と RAG Blueprint) を、あらゆる意思決定に組織的インテリジェンスを組み込む汎用的なエージェント型ワークフロー (NemoClaw) に組み込んでいます。

実用的なエンタープライズ グレードの動画 AI を始めましょう

VSS、RAG Blueprint、NemoClaw は、より広範なアーキテクチャ上の原則を表しています。あらゆる問題に最適な 1 つのモデルやサービスは存在しませんが、クリーンで定義された API を通じて構成された専門システムは、各部分の合計を超える機能を提供できます。 これは、エンタープライズデプロイに必要なモジュール性、拡張性、およびガバナンスを犠牲にすることなく実現できます。

この結果は、映像分析の目的を再構築します。 人間の解釈を待つような静的なレポートで終わるのではなく、動画の理解が、オーケストレーションされたワークフローのエントリ ポイントとなります。このワークフローは、関連する組織的知識を検索し、あらゆる結論を証拠 (エビデンス) に基づかせ、ダウンストリームのアクションを自動的に実行します。

企業は、動画インサイトの生成と同じくらい迅速に、一貫して大規模に、そのインサイトに基づいた対応を行うことができます。映像は、すでに撮影されています。 次のチャンスは、これを調整された責任ある行動へと変えることであり、そのためのブループリントが現在入手可能です。 今すぐ始めてみませんか? この投稿に記載されている手順を使用し、独自の動画ソースとリファレンス知識 (OEM マニュアルと組み合わせた検査映像、マーチャンダイジング ポリシーと組み合わせた小売店フロア カメラ、ルールブックと組み合わせたライブ放送など) を入れ替えてみてください。

VSS リポジトリをクローンし、知識検索 (frag) を有効にした VSS エージェントをデプロイし、RAG ブループリントを自社ドキュメントに関連付けて、Jira、Slack、データベース、チケット キューなど、チームがすでに使用しているシステムに NemoClaw を接続します。まず、動画から意思決定、そしてアクションへと至る 1 つの反復ループから始め、それをエンドツーエンドで試験運用し、そこから拡大してみてください。

翻訳に関する免責事項

この記事は、「Integrating Context-Aware Video AI Agents Into Enterprise Workflows」の抄訳で、お客様の利便性のために機械翻訳によって翻訳されたものです。NVIDIA では、翻訳の正確さを期すために注意を払っておりますが、翻訳の正確性については保証いたしません。翻訳された記事の内容の正確性に関して疑問が生じた場合は、原典である英語の記事を参照してください。

Tags