Transformer回路の数学的フレームワーク
A Mathematical Framework for Transformer Circuits (2021)
本論文は、Transformerモデルの計算を逆解析するための数学的フレームワークを提案する。特に、単純なモデルから始め、より複雑なモデルへと拡張していくアプローチを取る。2層以下のAttentionのみのTransformerを対象とし、その内部動作を理解するために、計算を数学的に等価な新しい方法で概念化する。その結果、「誘導ヘッド」と呼ばれる特定のAttentionヘッドが、これらの小規模モデルにおけるインコンテキスト学習を説明できること、そしてこれらのヘッドは少なくとも2つのAttention層を持つモデルでのみ出現することを発見した。この研究は、将来的に大規模モデルへの応用を目指しているが、現時点では小規模モデルに焦点を当てている。論文では、Transformerの構造を再検討し、特にAttention層の独立したヘッドの動作を分析する。Attentionの計算を、クエリ(Q)、キー(K)、バリュー(V)の行列積に分解し、QとKの相互作用(QK回路)とVの処理(OV回路)を分離して理解する手法を提案する。これにより、モデルの振る舞いを「スキップトリグラム」という形で解釈可能にする。多くのAttentionヘッドが、トークンのコピー(インコンテキスト学習の初歩的な形態)を行っていることを発見した。さらに、LaTeXやHTMLのエスケープシーケンスの学習、トークン化の特性(例:スペースの有無による単語の分割)への対応、プログラミング言語の構文(if/else、関数呼び出し)の学習など、多様なパターンが観察された。これらの発見は、Transformerの解釈可能性を高め、将来のモデルの安全性や能力の理解に貢献する可能性がある。
- 2層以下のAttentionのみのTransformerを対象に、計算を数学的に等価な新手法で概念化する解釈可能性フレームワークを提案
- 「誘導ヘッド」が小規模モデルのインコンテキスト学習を説明でき、少なくとも2つのAttention層を持つモデルでのみ出現すると発見
- Attention計算をQK回路とOV回路に分解し、モデル挙動を「スキップトリグラム」として解釈可能にする手法を提示
- 多くのAttentionヘッドがトークンのコピーを行うほか、LaTeX/HTMLエスケープシーケンス、トークン化特性、if/elseや関数呼び出しなどプログラミング構文の学習も観察された
Transformerの内部計算をQK回路/OV回路に分解し「スキップトリグラム」として解釈可能にする数学的フレームワークの提案で、内容自体は基礎研究であり直接の事業・収益インパクトは小さい。ただし「誘導ヘッドが2層以上のAttentionでのみ出現する」という知見は、モデル設計やスケーリング則、ひいては解釈可能性を前提とした安全性・監査技術の方向性を左右し得る。解釈可能性は規制対応やモデル信頼性の差別化要因になりつつあるため、この分野の研究動向と大手ラボの採用状況は継続ウォッチに値する。