Cumulus Labsは、オープンソースモデルやファインチューニング済みモデル向けの推論API「IonRouter」をリリースしました。既存のOpenAIクライアントコードでそのまま利用可能となっており、ベースURLの変更だけで接続できます。
Cumulus Labs、GH200最適化推論エンジン搭載のAPIサービスIonRouterをリリース
同社は、推論プロバイダが「高速だが高コスト」または「安いが設定が面倒」の二択に限られていた問題点を指摘しています。そこで、GH200のメモリアーキテクチャに特化したC++推論ランタイム「IonAttention」を開発しました。
このランタイムは、900GB/sのCPU-GPUリンクや452GBのLPDDR5Xメモリを効果的に活用します。ハードウェアキャッシュコヒーレンスを利用し、CUDAグラフが動的パラメータを持つかのようにゼロコストで動作させる技術などが特徴です。
マルチモーダル処理では、Together AIの298 tok/sに対し588 tok/sという性能を記録しました。ただし、p50レイテンシは1.46秒と競合他社より劣る点も認めています。現在改善に取り組んでいる段階です。
料金体系はトークン課金で、アイドルコストは発生しません。GPT-OSS-120Bの入力トークン単価は0.02ドル、出力は0.095ドルと設定されています。
出典: Launch HN: IonRouter (YC W26) – High-throughput, low-cost inference(HN 72pt・37コメント)(HN Search (backfill)、2026-03-13)