分散サービスシステムにおける正確で追跡可能な障害診断のための知識強化型反復推論フレームワーク
A Knowledge-Enhanced Iterative Reasoning Framework for Accurate and Traceable Fault Diagnosis in Distributed Service Systems
分散システムにおける障害診断は、複雑なサービス依存関係、連鎖的な異常伝播、類似した症状パターンといった課題に直面している。本論文では、大規模言語モデル(LLM)と数値ドメイン知識グラフ(KG)を統合した知識強化型反復推論フレームワークを提案する。KGは、障害と症状の関係、異常の方向性、およびトレーニングから導出された平均・標準偏差区間をエンコードする。構造化プロンプトにより候補となる障害が生成され、区間検証によって数値的に矛盾する候補が除外される。残った候補に対して、反事実推論により階層的な因果連鎖が構築され、KGトラバーサルによって欠落または矛盾したリンクが修正され、決定論的な証拠スコアが最大5回の反復で受容、除外、早期停止、フォールバックをサポートする。一般的な68ケース評価プロトコル(8つの既知の単一原因障害)において、提案フレームワークはGPT-4oとGPT-5.2で精度、マクロF1、バランス精度ともに100.00%を達成した。これは、KGのみの推論(91.18%)や、Random Forest、XGBoost、Transformerのベースライン(85.29–89.71%)を上回る。GPT-3.5は98.53%、LLaMA-3.1-8Bは80.88%であり、KGとLLMの増分ゲインはバックボーンに依存することが示された。5回のGPT-4oおよび3回のGPT-5.2の繰り返しで100.00% ± 0.00を達成し、評価されたZスコア閾値、反復回数制限、区間許容誤差全体で3つのメトリクスすべてが100.00%を維持した。このフレームワークは、評価されたRedisベースの分散サービスプロトコル内で、高精度で安定した追跡可能な診断を提供し、明示的な中間推論とソリューション検索を可能にする。
本稿はLLMとナレッジグラフを統合した障害診断フレームワークの研究であり、学術的な性能評価が中心。特定企業の製品発表や資金調達などの投資事象を含まず、投資判断に直結する具体的なビジネスインパクトは確認できない。