LLMに到達させないものを決定することから始まるRAG推論コストの6倍削減
Cutting RAG inference costs 6x starts with deciding what never reaches the LLM
高リスク分類のためのRAGシステム構築において、すべての曖昧なケースを言語モデル(LLM)にルーティングするアプローチは、デモでは機能するものの、監査や規制当局の scrutiny には耐えられない。LLMへの全パイプラインのコストは、監査可能性、スケール時のコスト、および容易なケースにおけるモデルドリフトの3点で問題が生じる。解決策として、LLMを最前線ではなくエスカレーションパスとして扱うカスケードアーキテクチャが提案されている。このアプローチでは、まず決定論的なステージ1で明確なルールに基づいてケースを解決し、次にステージ2で曖昧なケースに対して関連証拠を検索する。LLMはステージ3で、ステージ1と2で解決できなかった残りのケースのみに適用される。これにより、推論コストを約6倍削減し、決定論的な多数派の整合性をほぼ完璧に向上させることができる。また、LLMに到達するケースの不確実性をエスカレーションの理由として扱い、非対称リスクプロンプトを使用することで、誤分類のリスクを管理する。評価においては、検索品質と最終分類精度を独立して測定し、ステージ3に到達するケースをオーバーサンプリングした評価セットを使用することが重要である。さらに、人間のレビュー担当者からのフィードバックループを構築し、誤った決定を検索コーパスに組み込むことで、システムの改善を図る。
- 高リスク分類のためのRAGシステムにおいて、LLMを最前線ではなくエスカレーションパスとして扱うカスケードアーキテクチャを提案し、推論コストを約6倍削減できることを示した
- 決定論的なステージ1とステージ2での関連証拠検索により、LLMに到達するケースを最小化し、決定論的な多数派の整合性をほぼ完璧に向上させる
RAGシステムのコスト最適化と監査可能性を両立するカスケードアーキテクチャの提案で、LLM推論コストを約6倍削減できる点は、企業のAI運用コスト削減ニーズに直結する実用的な価値がある。高リスク分類用途でのAI実装が進む中、決定論的ルールとLLMを組み合わせたハイブリッド設計は、規制対応や監査要件を満たしながらスケール可能なAIシステム構築のトレンドを示しており、AIプラットフォーム企業や企業向けAIソリューション事業の競争優位性に影響を与え得る。