単一のTransformer層で完全パラメータの強化学習トレーニングに匹敵
Is One Layer Enough? A Single Transformer Layer Matches Full-Parameter RL Train
大規模言語モデル(LLM)の後処理における強化学習(RL)の重要性が増しているが、RL適応がTransformer層全体にどのように分散しているかはほとんど理解されていない。本研究では、RLトレーニングの層ごとの体系的な研究を通じて、この仮説に疑問を投げかける。驚くべきことに、単一のTransformer層のトレーニングで、完全パラメータのRLトレーニングで達成される成果の大部分を回復でき、場合によってはそれを上回ることさえあることがわかった。この現象を定量化するために、層貢献度という指標を導入し、単独で層をトレーニングすることによって回復された完全RL改善の割合を測定する。Qwen3、Qwen2.5の2つのモデルファミリー、GRPO、GiGPO、Dr. GRPOの3つのRLアルゴリズム、および数学的推論、コード生成、エージェント意思決定を含む複数のタスクドメインにわたる7つのモデルで、RLの成果は少数の、多くの場合単一のTransformer層に高度に集中しているという、驚くほど安定したパターンが観察された。さらに顕著なのは、同じ構造パターンが一貫して現れることである。高貢献層はTransformerスタックの中央付近に集中し、入力端と出力端に近い層は大幅に寄与が少ない。結果として得られる層のランキングは、データセット、タスク、モデルファミリー、RLアルゴリズム間で強く相関したままである。
- 単一のTransformer層へのトレーニングで、完全パラメータのRLトレーニングと同等以上の成果が得られることが7モデルで確認された
- RLの成果は少数のTransformer層に高度に集中しており、高貢献層はスタック中央付近に集中する安定したパターンが観察された
- Qwen3, Qwen2.5のモデルファミリー、GRPO, GiGPO, Dr.GRPOの3つのRLアルゴリズムで検証され、数学的推論・コード生成・エージェント意思決定のタスクで一貫した結果が得られた
本研究は、大規模言語モデルのRLトレーニングにおいて、Transformer層全体ではなく単一層へのトレーニングで同等以上の成果が得られることを示した。この発見は、LLM後処理の計算コストを劇的に削減できる可能性を示唆しており、AIモデルの効率的なファインチューニング手法として実用化されれば、GPUリソースの節約や推論速度の向上につながる。Qwenシリーズなど実モデルでの検証が進んでいる点も重要で、この方向性が業界標準となるか注視すべき。