Canaryは、コードベースへの接続後、ルートやコントローラー、バリデーションロジックなどのアプリ構造を理解します。PRがプッシュされると差分を読み取り、変更の意図を解釈した上で、プレビュー環境に対してエンドツーエンドでテストを実行します。
結果はPRにコメントとして反映され、変更点を示す録画動画や期待通りに動作しない箇所へのフラグ付けが行われます。また、PRコメント経由で特定のユーザーフローテストをトリガーすることも可能です。
生成されたテストはリグレッションスイートに移動でき、自然言語でのプロンプトからテストスイートを生成・スケジュール化して継続的に実行する機能も備えています。建設テック企業では、請求書フローで約1,600ドルの金額ずれを検出する事例がありました。
同社は、QAがソースコードやDOM、デバイスエミュレーターなど多様なモーダルを跨ぐため、単一のファウンデーションモデルでは困難だと述べています。また、カスタムブラウザフリートやエフェメラル環境などのインフラも必要としています。
性能評価のため、コード検証向けベンチマーク「QA-Bench v0」を公開しました。GrafanaやMattermostなど4リポジトリの実PR35件で、GPT 5.4やClaude Code (Opus 4.6)などとの比較を行います。
カバレッジの次元では、CanaryはGPT 5.4より11ポイント、Claude Codeより18ポイント、Sonnet 4.6より26ポイント高い結果となりました。詳細な手法やリポジトリ別内訳はベンチマークレポートにまとめられています。
出典: Launch HN: Canary (YC W26) – AI QA that understands your code(HN 58pt・26コメント)(HN Search (backfill)、2026-03-20)