ページ

2026年2月23日月曜日

言語モデルにおけるステアリングベクトルの信頼性の理解:幾何学的な予測因子と線形近似の限界

#aidexx #news

2026年02月23日




## 要約:
言語モデルの挙動を制御するステアリングベクトルは、サンプルによって効果が異なり、信頼性に欠ける場合がある。本研究では、ステアリングベクトルの信頼性が挙動によって異なる理由と、学習データの影響を調査。学習データの活性化の違いとコサイン類似性、活性化の分離などが信頼性に影響を与えることを明らかにした。

---

## 翻訳:
arXiv:2602.17881v1発表タイプ:新規
抄録:ステアリングベクトルは、推論時に活性化に学習バイアスを加えることで言語モデルの挙動を制御する軽量な手法です。平均的には効果的ですが、ステアリングの効果の大きさはサンプルによって異なり、多くのターゲット挙動に対して信頼性がありません。本論文では、ステアリングの信頼性が挙動によって異なる理由と、ステアリングベクトルトレーニングデータがどのように影響するかを調査します。まず、トレーニング活性化の違いとコサイン類似性の高さが、より信頼性の高いステアリングを予測することを見つけました。次に、ステアリング方向で正と負の活性化がより良く分離されている挙動データセットは、より信頼性のあるステアリングが可能であることがわかりました。最後に、異なるプロンプトのバリエーションでトレーニングされたステアリングベクトルは、方向性が異なりながらも同様に良好なパフォーマンスを示し、データセット間で相関した有効性を示します。これらの知見は、潜在的なターゲット挙動の表現が線形ステアリング方向で効果的に近似されていない場合、ステアリングベクトルは信頼できないことを示唆しています。全体として、これらの洞察は、ステアリングの信頼性のなさに関する実用的な診断を提供し、非線形な潜在的な挙動表現を明示的に考慮する、より堅牢なステアリング手法の開発を促します。

[📰 原文はこちら](https://arxiv.org/abs/2602.17881)

---

※本記事はAI(Ollama)による自動翻訳・要約です。

BittensorManがお勧めするメーカーリスト
https://exbridge.jp/xdirect/

AI時代の技術と知識のまとめ(AI生成メディア) - AIDexx
https://exbridge.jp/aidexx/

頑張って働く人に向けて、プロ用仕事アイテムを格安でネット販売しているX-Direct( https://exdirect.net )を、BittensorManは応援しています。

動画の最後にお得な情報がありますので、
最後までご覧ください。

Anthropicが放つClaude Opus 5の衝撃と、AIデータセンターを襲う電力インフラの脆弱性 07-26

本記事はHorizonを使いAI/LLM・バイブコーディング・Web3・スタートアップのニュースを自動収集・要約したものです。 Anthropicが放つClaude Opus 5の衝撃と、AIデータセンターを襲う電力インフラの脆弱性 Anthropicが新モデル「Cla...