RAGの限界とTAKCの登場背景

AWSの機械学習ブログは、数百件の文書にまたがる複雑な分析タスクにおいてRetrieval-Augmented Generation(RAG)が「天井」にぶつかっていると指摘している。類似度検索は関連する断片を表示できても、文書間の横断的なつながりを見逃すことが多いためだ。記事はプライベートエクイティ企業が5億ドル規模の製造業買収を評価するケースを例に挙げ、12の子会社・5年分の財務諸表、200件超のサプライヤー契約、8拠点分の環境コンプライアンス報告書、50件超の訴訟案件を分析する必要があると説明している。

アナリストが「現行のサプライヤー条件と係属中の訴訟を踏まえた連結財務リスク」を尋ねた場合、関連情報は数百の文書に分散し、それらの間には語彙的な類似性がないため、RAGの類似度検索ではその回答を提示できないという。この課題に対応する技術として提示されているのがtask-aware knowledge compression(TAKC)であり、記事はこれを「知識ベース全体をタスク固有の表現に事前圧縮し、AWS上にデプロイする手法」と定義している。AWSは、TAKCがRAGのベースラインを上回り、インフラのオーバーヘッドを削減し、推論のレイテンシを改善すると主張しており、これが本記事の核心的な主張である。

(出典: aws.amazon.com

TAKCの仕組み:タスク単位の知識圧縮

TAKCはLLMを用いて、文書ごとにタスクに応じた短い要約を生成する。同じ年次報告書でも、財務分析向けの圧縮では収益・利益率・キャッシュフローのデータを保持し、コンプライアンスレビュー向けの圧縮では規制引用や違反履歴を保持するというように、圧縮結果はタスクごとに異なる。汎用的な要約はすべてを網羅しようとするため、特定用途における情報密度が薄まってしまう、とAWSは説明している。

処理フローとしては、文書は「タスクごと・文書ごとに1回」オフラインで圧縮される。クエリ実行時には元の文書ではなく事前圧縮済みの表現が取得され、システムはその圧縮版を使って質問に回答する。圧縮表現が十分な詳細を含んでいない場合は、クエリ複雑度アナライザが質問をより多くの文脈を保持する低圧縮率のティアへルーティングする。

TAKCは類似度検索が返す上位k件のチャンクだけでなく、知識ベース全体を圧縮形式でアクセス可能にする点が特徴だ。圧縮処理が複数文書をまとめて見るため文書間のつながりが保持され、同じ