日本語

モデル発表エヌビディアRT-DETR Hand Detection

NVIDIA、リアルタイムの手のローカリゼーションに向けた RT-DETR 手検出 v1.0 をリリース

この記事は翻訳です。 原文を読む

NVIDIAは、Real-Time Detection Transformer (RT-DETR) アーキテクチャを適応させ、RGB画像内で直接手を検出・ローカリゼーションするモデルである RT-DETR 手検出 v1.0 をリリースしました。このモデルは、畳み込みバックボーン、効率的なハイブリッドエンコーダー、および TransformerDecoder ヘッドを組み合わせることで、単一のエンドツーエンドのプロセスで 2D 手のバウンディングボックスとクラス信頼度スコアを予測します。

RT-DETRv2-S の一部として開発されたこのモデルは、約 20 百万のパラメータを備えています。リアルタイムのヒューマン・コンピュータ・インタラクション (HCI) および一人称視点(エゴセントリック)のコンピュータビジョン・パイプライン向けに設計されています。出力される 2D 手のバウンディングボックスは、EgoHand などのダウンストリームモデルが 3D 手のキーポイントやメッシュを予測するための、正確な関心領域 (ROI) として機能します。

このモデルは、合成データと実世界の詳細な手の動きの画像およびビデオデータの混合セットを用いてトレーニングされています。NVIDIA Lovelace マイクロアーキテクチャなどのハードウェアを活用することで、NVIDIA GPU アクセラレーションを備えたシステムでの実行に最適化されており、CPUのみのソリューションと比較して、より高速なトレーニングと 推論 倍の速度を実現します。

NVIDIA は、このモデルはデモンストレーション目的であり、商用利用を意図したものではないと述べています。本モデルは NVIDIA Software and Model Evaluation License の下でリリースされます。

出典

  1. nvidia/RT-DETR-Hand-Detector-v1 (HF: NVIDIA, 2026-09-15)
  2. NVIDIA Software and Model Evaluation License