Kei Moriyama / Steerable Chatbots: Personalizing LLMs with Preference-Based Activation Steering

Created Wed, 15 Apr 2026 00:00:00 +0900 Modified Thu, 23 Jul 2026 04:26:52 +0200
489 Words

📄論文情報

🔑この論文のキーメッセージ

  • (1, 2文でまとめる)

🎓どういう問題に取り組んだのか

  • 人間の暗黙的な選好情報を反映して、LLMの生成文章を最適化すること

🧑‍🎓その問題に取り組むことがなぜ重要なのか

  • 既存の手法で、LLMの出力をパーソナライズするためには、過去のインタラクション結果が必要である。
  • この時、新規のユーザーに対して対応することが難しい
  • LLMの内部表現に介入する手法は、挙動を制御する手法として提案されている
    • 人間のインタラクションを通してこれを制御することで、cold-start問題に対応する

💡問題解決に向けたキーアイデアは何か

  • Probingを使用して、LLMの内部表現に介入する方向を決定する
    • 分析には様々なドメインのデータを使用して、複数の軸のアンサンブルをしている
  • それぞれの軸に対して重みが設定されている
    • ユーザーのフィードバック毎にこの重みが更新される

👀新たに分かったことは何か

  • 重みを調整する事で良い調整前と比較して良い結果が得られている
    • シミュレーション実験と実実験の両方でその有効性が示されている

❓疑問点は何か

  • 重みの更新方法が良く分からなかった