日本語

モデル発表FoundationPose

FoundationPose: 6-DoFオブジェクトの姿勢推定とトラッキングのためのTransformerベースのモデル

この記事は翻訳です。 原文を読む

FoundationPoseは、6-DoF (Degrees of Freedom) オブジェクトの姿勢推定とトラッキングのために設計された基盤モデルです。このモデルは、対象のCADモデルが利用可能であれば、テスト時に未知のオブジェクトへ即座に適用することができ、ファインチューニングの必要性を排除しています。

アーキテクチャはTransformerベースであり、リファインメント・ネット(refinement net)とスコア・ネット(score net)という2つの独立したネットワークで構成されています。リファインメント・ネットワークは、共有CNNエンコーダを使用して2つのRGBD入力ブランチから特集マップを抽出し、平行移動と回転の更新を予測します。スコア・ネットは、比較のために画像全体のコンテキストを利用するポーズ・ランキング・エンコーダを採用しています。

このモデルは、ObjaverseやGoogle Scanned Objects (GSO) を含む大規模な3Dデータベースで学習されています。FoundationPoseは、NVIDIA Jetsonデバイスを含むNVIDIAハードウェアと互換性があり、TensorRTに最適化されています。エッジデバイスへのデプロイ向けに設計されており、効率的なAIアプリケーション・パイプラインのためにNVIDIA Triton Inference Serverと統合することも可能です。

出典

  1. nvidia/foundationpose (HF: NVIDIA, 2026-09-15)
  2. GitHub