Kimi Linear: 表現力豊かで効率的なアテンションアーキテクチャ
Kimi Linear: An Expressive, Efficient Attention Architecture
Kimi Linearは、短・長コンテキスト、強化学習(RL)スケーリングなど、様々なシナリオで公平な比較において初めてフルアテンションを上回る性能を発揮するハイブリッド線形アテンションアーキテクチャである。その中核には、Gated DeltaNetをよりきめ細かなゲーティング機構で拡張した表現力豊かな線形アテンションモジュールであるKimi Delta Attention(KDA)があり、限られた有限状態RNNメモリの効果的な利用を可能にする。特注のチャンクワイズアルゴリズムは、対角線プラス低ランク(DPLR)遷移行列の特殊なバリアントを通じて高いハードウェア効率を達成し、一般的なDPLR定式化と比較して計算量を大幅に削減する。30億のアクティブパラメータと480億の総パラメータを持つKimi Linearモデルを、KDAとMulti-Head Latent Attention(MLA)のレイヤーワイズハイブリッドに基づいて事前学習した。実験の結果、同一のトレーニングレシピで、Kimi Linearは評価されたすべてのタスクでMLAを大幅に上回り、KVキャッシュ使用量を最大75%削減し、100万コンテキストで最大6倍のデコーディングスループットを達成した。Kimi Linearは、より長い入力および出力長を持つタスクを含む、優れたパフォーマンスと効率を持つフルアテンションアーキテクチャのドロップインリプレイスメントとなり得る。KDAカーネルとvLLMの実装をオープンソース化し、事前学習済みおよび指示チューニング済みモデルのチェックポイントをリリースする。
- Kimi Linearは、公平な比較において初めてフルアテンションを上回る性能を発揮するハイブリッド線形アテンションアーキテクチャである
- Kimi LinearはKVキャッシュ使用量を最大75%削減し、100万コンテキストで最大6倍のデコーディングスループットを達成した
- KDAカーネルとvLLMの実装をオープンソース化し、事前学習済みおよび指示チューニング済みモデルのチェックポイントをリリースする
Moonshot AIが公開したKimi Linearは、線形アテンションアーキテクチャでありながらフルアテンションを初めて上回る性能を達成し、かつKVキャッシュを最大75%削減、100万トークンコンテキストでデコーディングスループットを最大6倍向上させる。これはLLMの推論コスト構造を大きく変える可能性があり、長文脈処理を必要とするエンタープライズ向けAIサービスやRAGシステムの経済性を劇的に改善しうる。さらに、モデルチェックポイントとカーネル実装をオープンソース化している点も、エコシステムへの普及と競合との差別化を促進する戦略として注目に値する。