Deep Research: State of the Artの達成方法
Building Deep Research: How we Achieved State of the Art
本記事は、モデルのランタイム実行を強化するソフトウェア層であるエージェントハーネスの構築について解説している。急速に進化するモデル上でアプリケーションを構築する際の課題として、将来のモデルリリースによるパフォーマンス向上を吸収できるソフトウェア設計が挙げられる。過去7ヶ月でモデル能力、特にツール呼び出し能力が進化し、ワークフローからエージェントへと移行した。将来のモデルは、コンテキスト圧縮のための高リコール要約、ツール呼び出しの信頼性、記述の簡潔さにおいて改善されると期待される。ツールもLLMとエージェントハーネスをサポートするように進化すべきであり、コンテキストエンジニアリングを行い、関連データのみを返すことが望ましい。Tavilyの高度な検索機能は、コンテキストエンジニアリングを組み込み、幻覚やレイテンシを低減する。エージェント設計の課題として、時間経過とともにクリーンで最適化されたコンテキストウィンドウを維持することが挙げられる。Tavilyの高度な検索は、生のWebコンテンツの処理を抽象化し、関連性の高いコンテンツチャンクのみを返すことでこの課題に対処する。また、グローバル状態の永続化とソースの重複排除により、エージェントが単一の研究スレッドに過剰適合するのを防ぎ、新鮮な情報へのアクセスを保証し、情報スコープの縮小を認識できるようにする。従来のReActエージェントアーキテクチャでは、ツール呼び出しと出力がコンテキストウィンドウに永続化され、トークン消費が二次関数的に増加するのに対し、提案手法ではコンテキストエンジニアリングによりトークン伝播を除去し、線形系列でモデル化できる。この方法により、トークン消費を66%削減し、DeepResearch BenchでSOTAを達成した。本番グレードのエージェント構築では、自律性を最大化しつつ、レイテンシ、コスト、信頼性といった厳格な要件を満たすバランスが求められる。LLMの非決定性を考慮し、ガードレール付きの自由度を与えることで最良の結果が得られる。失敗モードを設計上の考慮事項として扱い、プロンプトの強化やエッジケーステストが重要である。少数の必須ツールセットをエージェントに公開することが、多数の複雑なツールよりも効果的である。LLM-as-a-judgeの評価は信頼性に欠けるため、ベンチマークスコアではなく、方向性フィードバックを最適化した。改善点は、トークン使用量の削減、信頼性、低レイテンシ、失敗回数の減少であり、評価スコアのわずかな向上よりも価値がある。
- Tavilyの高度な検索を用いたコンテキストエンジニアリングにより、トークン消費を66%削減しDeepResearch BenchでSOTAを達成した
本記事は、エージェントハーネス(モデルランタイムを強化するソフトウェア層)の設計思想と、Tavilyの高度な検索機能を用いたコンテキストエンジニアリングによる効率化を解説している。特に、トークン消費を66%削減しDeepResearch BenchでSOTAを達成した点は、エージェントのコスト構造とレイテンシ改善に直結するため注目に値する。エージェント型AIの実用化が進む中で、推論コストの最適化は収益性とスケーラビリティの鍵であり、こうしたソフトウェア基盤の進化はAIスタートアップの競争優位性に直接影響する。