日本語

モデル発表LinumJiT-DDT

LinumがJiT-DDTをリリース:3.6倍の高速化を実現したピクセル空間でのテキストから画像への生成学習

この記事は翻訳です。 原文を読む

Linumは、2.5Bパラメータを持つピクセル空間のテキストから画像への拡散TransformerであるJiT-DDTをリリースしました。この研究成果は、エンコーダー・デコーダーアーキテクチャを使用してクリーンな画像を直接予測するものであり、潜在拡散モデル(LDM)で通常使用される個別の変分オートエンコーダー(VAE)の必要性を排除しています。

同社のLinum v2ベースラインと比較して、JiT-DDTは3.6倍高速に学習し、512x512の解像度で画像を生成します。これは、256x256ベースラインの画素数と比較して4倍に相当します。高次元の入力を管理するために、このアーキテクチャは視覚トークンとテキストトークンを同時に処理するシングルストリームのDiffusion Transformer(DiT)を採用しており、エンコーダーの隠れ状態をDINOv3の特徴量に整合させる表現整列技術であるPixelREPAを活用しています。

このモデルは、微細な詳細の復元を改善するために特化型のノイズスケジュールを組み込んでおり、テキストエンコーダーにはQwen3.5-4Bを使用しています。重みとコードはApache 2.0ライセンスの下で利用可能です。実装は、約24 GBのメモリを持つCUDA GPUと互換性があります。

出典

  1. Training Text-to-Image Models 3.6× Faster (Hacker News Frontpage, 2026-09-16)
  2. Model code