日本語

モデル発表Hugging FaceNeoMME

Hugging Faceがマルチモーダル・マルチリンガル・エンコーダのNeoMMEを発表

Hugging Faceは、260Mおよび800Mのパラメーターを持つマルチリンガル・マルチモーダル・エンコーダ「NeoMME」を発表しました。

NeoMMEは、既存の事前学習済みビジョンタワーや因果言語モデルを使用しません。単一の双方向Transformerが、テキストトークンと生の画像パッチの両方を処理する仕組みです。

モデルはディスクリート・マスク・ディフュージョン目的関数を用いて、ゼロから学習されています。

学習データには、多言語テキスト、コード、数学、自然画像、ドキュメント画像が含まれます。モデルは、テキストのみの例を含む約5240億個のパッキング入力トークンを処理しました。

NeoMMEは、ColPaliのページ画像アプローチを用いて、視覚的ドキュメント検索用に微調整されています。260Mモデルは、NVIDIA L40S GPU上で1秒間に約51ページをエンコード可能です。これはColModernVBERTの約2倍のスループットとなります。

また、階層的なトークンプーリングと非対称量子化により、ベースラインのnDCG@10を95%以上維持したまま、インデックスのストレージ容量をページあたり約1.5MBから6kBへと大幅に削減しています。

NeoMMEはHugging Face Transformersで利用可能であり、すべてのモデルチェックポイントはApache 2.0ライセンスの下でリリースされます。


出典: NeoMME: an efficient Multimodal-native and Multilingual Encoder(Hugging Face Blog、2026-09-03)