現在のAI製品は、堅牢なソフトウェアツールというよりも、信頼性の低いチャットボットのように振る舞うことが多く、専門的な業務の要件を満たせないことが頻繁にあります。最近の批判では、LLM(大規模言語モデル)が引用を混乱させたり誤って提示したりする傾向や、出力の正確性を検証するためのツールの欠如など、いくつかのシステム的な問題が浮き彫りにされています。
AIが研究やソフトウェア開発において実行可能なツールとなるためには、検証可能な引用や統合されたデータ処理機能のような機能を提供しなければなりません。この批判では、既存のツールの多くが、ウェブAPIやスクレイピングされたコンテンツといった多様なデータソースを均一に提示することで機能しており、その結果、権威あるデータとハルシネーション(幻覚)によるコンテンツとの違いが隠されてしまう可能性があると指摘しています。
さらに、現在の「エージェント的」なワークフローは、コンテキスト管理に関する課題に直面しています。ユーザーは、どの程度のコンテキストが使用されているか、あるいはそれがどのように圧縮されているかを把握できないことがよくあります。著者は、本格的な製品であれば、コンテキストウィンドウの使用に関する透明性を提供し、反復可能で決定論的なデータ操作を可能にするために、会話の非決定的な部分を固定できるツールを提供すべきであると示唆しています。
出典
- What Would a Serious AI Product Look Like? (Hacker News Frontpage, 2026-09-28)
- Mastodon