2026年02月23日

## 要約:
本研究では、言語モデルを活用し、単語の出現頻度だけでなく文脈情報を考慮したソフトラベルを作成することで、従来のニューラルトピックモデルの課題(文脈情報の無視、データスパース性)を解決します。この手法により、トピックの質が向上し、コーパスのテーマ構造との整合性が高まります。さらに、セマンティック類似度の高い文書の検索においても優れた性能を発揮します。
---
## 翻訳:
arXiv:2602.17907v1 公告タイプ: 新規
概要: 従来のニューラルトピックモデルは、文書のBag-of-Words (BoW)表現を再構築することで最適化されるのが一般的であり、文脈情報を無視し、データスパース性に苦しんでいます。本研究では、言語モデル(LM)を用いて、特定のプロンプトに基づいて次のトークンの確率をあらかじめ定義された語彙に投影することで、意味的に根差したソフトラベルターゲットを構築する新しいアプローチを提案します。この手法により、LMの隠れ状態を用いてソフトラベルを再構築するようにトピックモデルを学習させることで、トピックの質が向上し、コーパスの基盤となるテーマ構造とより整合性が高まります。3つのデータセットでの実験により、本手法は既存のベースラインと比較して、トピックのコヒーレンスと純度が大幅に向上することが示されました。さらに、私たちが導入する検索ベースのメトリックは、このアプローチが既存の方法よりもセマンティックに類似した文書を識別する能力が優れていることを示しており、検索指向のアプリケーションにとっての効果が際立っています。
[📰 原文はこちら](https://arxiv.org/abs/2602.17907)
---
※本記事はAI(Ollama)による自動翻訳・要約です。
BittensorManがお勧めするメーカーリスト
https://exbridge.jp/xdirect/
AI時代の技術と知識のまとめ(AI生成メディア) - AIDexx
https://exbridge.jp/aidexx/
頑張って働く人に向けて、プロ用仕事アイテムを格安でネット販売しているX-Direct( https://exdirect.net )を、BittensorManは応援しています。
動画の最後にお得な情報がありますので、
最後までご覧ください。