Manticore Searchは、データベースエンジン内でドキュメントのチャンキングを直接処理する新しい 特集 を導入しました。CREATE TABLE 文内のベクトルカラムに chunk_strategy を追加することで、ユーザーは長文を埋め込みと検索用に小さな断片へ自動的に分割できるようになります。
Manticore Searchがエンジン内チャンキング機能を追加、長文に対するベクトル検索を向上
この記事は翻訳です。 原文を読む
この 特集 は、モデルの入力ウィンドウの制限に対処するものです。例えば、5,000 トークンのドキュメントに対し、512 トークン制限を持つモデルを使用する場合、標準的な埋め込みプロセスではテキストの冒頭部分しか取得できません。Manticoreの手法では、エンジンがドキュメントを分割し、すべてのチャンクを埋め込み、それらすべてを検索できるため、ドキュメントの深い場所に隠された関連情報が失われないようになっています。
Manticoreはいくつかのチャンキング戦略をサポートしています:
- Truncate: デフォルトのメソッドであり、モデル自身のトークン制限を使用します。
- Mean: ドキュメントを分割し、チャンクのベクトルを単一のベクトルに平均化します。これによりデータの損失は防げますが、特定のトピックが希釈される可能性があります。
- Fixed: 特定のトークン間隔でテキストを切断します。
- Recursive: 空行、改行、または文末などの自然な境界でテキストを分割します。これは同社のベンチマークにおいて最も高いスコアを獲得しました。
- Sentence: Unicode UAX #29 を使用して文の境界を検出し、チャンクが文の途中で切れないようにします。
この実装には、追加の取り込みパイプライン、外部のsplitterライブラリ、またはチャンク用の二次テーブルは必要ありません。ユーザーは、複数のベクトルカラムを使用することで、同じテーブル内の異なるカラムに対して異なる戦略を管理できます。この機能は、ドキュメントや法的契約書などの長文コンテンツにおけるセマンティック検索を、より精密で管理しやすくすることを目指しています。
出典
- Better Vector Search for Long Documents: Chunking Inside Manticore Search (Hacker News Frontpage, 2026-09-17)