ページ

2026年3月2日月曜日

表現消去に基づく好みの最適化によるLLMの解毒

#aidexx #news

2026年03月02日




## 要約:
大規模言語モデル(LLM)の有害な出力を抑制する手法として、表現消去に基づく好みの最適化(REPO)を提案します。REPOは、有害な出力の表現を無害な出力の表現に近づけることで、既存手法よりも深層的なモデルの修正を行い、再学習攻撃などに対する堅牢性を向上させます。実験結果は、REPOが既存の方法を上回る堅牢性を示しています。

---

## 翻訳:
arXiv:2602.23391v1 Announce Type: new
Abstract: 大規模言語モデル(LLM)は、ウェブスケールデータで学習されると、有害な出力を生成する可能性があり、安全な展開に対する懸念が生じます。DPO、NPO、および類似アルゴリズムに基づく既存の防御策は、有害な継続の可能性を低減しますが、完全に確実ではありません。攻撃的なプロンプトに対して脆弱であり、ファインチューニングに基づく再学習攻撃によって容易に打ち破られます。実際、研究によると、これらのモデルへの編集は表面的なものであり、線形プロービングによって有害な「方向性」が表現に残存していることが明らかになっています。この問題を解決するために、トークンレベルの好みの問題として解毒を再構成する、表現消去に基づく好みの最適化(REPO)を提案します。新しい目的関数と好みのデータを使用して、有害な継続の表現を無害な対応表現に収束させます。メカニズム解析により、この粒状アプローチが重要であることがわかります。ベースラインとは異なり、REPOは、一般的なモデルの有用性を維持しながら、毒性符号化ニューロンに対する深層的な局所的な編集を誘発します。広範な評価により、REPOは最先端の堅牢性を達成し、再学習攻撃や強化されたGCG脱獄などの高度な脅威を阻止し、既存の表現および出力に基づく手法が失敗する場所で成功することが示されています。

[📰 原文はこちら](https://arxiv.org/abs/2602.23391)

---

※本記事はAI(Ollama)による自動翻訳・要約です。

BittensorManがお勧めするメーカーリスト
https://exbridge.jp/xdirect/

AI時代の技術と知識のまとめ(AI生成メディア) - AIDexx
https://exbridge.jp/aidexx/

頑張って働く人に向けて、プロ用仕事アイテムを格安でネット販売しているX-Direct( https://exdirect.net )を、BittensorManは応援しています。

動画の最後にお得な情報がありますので、
最後までご覧ください。

意見集約AIを自前サーバーだけで——広聴AIのローカルLLM構成を実測して導入キットにした

名古屋でAIシステム開発の会社をやっています。政治団体・自治体・労組のように「集めた意見を外部のクラウドに送れない」組織でも使える意見分析の仕組みを探して、 広聴AI(kouchou-ai) を完全ローカルで動かしました。この記事はその実測記録です。 大量の意見をAIがグループ...