日本語

モデル発表エヌビディアFoundationStereo

FoundationStereo: ゼロショット・ステレオ深度推定のための 基盤モデル

この記事は翻訳です。 原文を読む

FoundationStereoは、ステレオ深度推定のためにNVIDIA Researchによって開発された 基盤モデル です。このモデルは、RGBステレオ画像ペアを入力として受け取り、正確な視差マップを出力します。様々なシナリオにおいて強力なゼロショット汎化を実現するように設計されています。

このモデルは、産業、ロボティクス、およびスマートスペースのアプリケーションにおける 3D 知覚にゼロショット深度を適用する開発者を対象としています。DepthAnythingV2とEdgeNeXtの特徴を取り入れた、混合 Transformer ベースのアーキテクチャを利用しており、これにAttentive Hybrid Cost Filtering (AHCF) コストボリュームと視差 Transformer を組み合わせています。高精度な出力を得るために、初期の視差マップは畳み込みGRUを使用して反復的に精緻化されます。

このモデルは 63 百万のパラメータで構成され、NVIDIA GPUアクセラレーションを備えたシステムで動作するように最適化されています。PyTorch、ONNX、およびTensorRTランタイムをサポートしています。デプロイメントにおいては、NVIDIA Jetsonデバイスと互換性があり、NVIDIA Triton Inference Serverと統合することが可能です。このモデルはNVIDIA Open Model Licenseの下で提供されており、商用利用が可能です。

出典

  1. nvidia/c-foundationstereo-s (HF: NVIDIA, 2026-09-15)