Kei Moriyama / Activation Scaling for Steering and Interpreting Language Models

Created Wed, 15 Apr 2026 00:00:00 +0900 Modified Thu, 23 Jul 2026 04:26:52 +0200
631 Words

📄論文情報

🔑この論文のキーメッセージ

  • (1, 2文でまとめる)

🎓どういう問題に取り組んだのか

  • LLMに介入する時の、介入量を調整することの効果を検証する

🧑‍🎓その問題に取り組むことがなぜ重要なのか

  • LLMの内部表現を特定の方向に動かすことで、LLMの応答が改善する
  • この現象は、特定のタスクに有効な特徴が局所的に存在していることを示している
  • そのため、出力に解釈性を持たせることができるが、モデル間で一貫した結果を得るための方法が存在しない

💡問題解決に向けたキーアイデアは何か

  • 勾配法を用いて、介入ベクトルを学習する
    • 介入ベクトルは、トークンの場所ごとに学習する
  • 介入ベクトルは{-1,0,1}の値を持つパラメータと介入の方向を決めるベクトルから構成される
    • 一つ目の方法では、ベクトルを勾配法により学習する
    • 二つ目の方法では、ベクトルの変わりにスカラー値を学習する
  • 目的関数には、マージンベースの損失関数と、KL情報量とL1ノルムの正則化項がある
    • データセットは、あるプロンプトに対する正答と誤答があり、正答が生成されやすいように設計されている

👀新たに分かったことは何か

  • 介入ベクトルの学習をすることで、生成される名詞が良いパターンを示している
    • 相関係数を使って分析している
  • 詳しい分析が良く分からなかった

❓疑問点は何か

  • 生成できるトークンの長さが限定的である仮定があるのは致命的では?
    • トークンの位置毎にベクトルを学習するというのは筋が良くないと思った
  • パラメータ数の比較はポジショントーク臭がした