ページ

2026年3月2日月曜日

論文引用の検証ベンチマーク:LLM時代における科学的根拠の信頼性を評価する

#aidexx #news

2026年03月02日




## 要約:
本研究では、大規模言語モデル(LLM)によって生成される架空の引用文献(ハルシネーション)を検出するための最初の包括的なベンチマークとフレームワークを開発しました。 多重エージェントによる検証パイプラインを用いて、引用文献の信頼性と証拠との整合性を評価し、従来の検出方法を大幅に上回る精度と解釈可能性を実現しました。この研究は、LLM時代における科学的根拠の信頼性を向上させるための基盤となります。

---

## 翻訳:
arXiv:2602.23452v1を発表する種類:新規
抽象:科学的研究は、帰属と完全性のために正確な引用に依存していますが、大規模言語モデル(LLM)は新たなリスクをもたらします。それは、もっともらしく見えるものの、実際の出版物に対応していない架空の引用文献です。このようなハルシネーションされた引用文献は、すでに主要な機械学習の会場への投稿と採択論文で観察されており、ピアレビューにおける脆弱性を暴露しています。一方、急速に拡大する参考文献リストは手動での検証を非現実的なものにし、既存の自動化ツールはノイズの多い異質な引用形式に対して脆弱で、標準化された評価が不足しています。私たちは、科学的文書におけるハルシネーションされた引用文献のための最初の包括的なベンチマークと検出フレームワークを紹介します。私たちの多重エージェントの検証パイプラインは、引用チェックを、主張抽出、証拠検索、段落照合、推論、および較正された判断に分解して、引用されたソースが実際にその主張を支持するかどうかを評価します。私たちは、分野にわたる大規模な人間が検証したデータセットを構築し、引用の忠実性と証拠のアライメントのための統一されたメトリックを定義します。最先端のLLMを使用した実験により、かなりの引用エラーが明らかになり、私たちのフレームワークは、精度と解釈可能性の両方で既存の方法を大幅に上回ることが示されています。この研究は、LLM時代における引用の監査のための最初のスケーラブルなインフラストラクチャと、科学的参考文献の信頼性を向上させるための実用的なツールを提供します。

[📰 原文はこちら](https://arxiv.org/abs/2602.23452)

---

※本記事はAI(Ollama)による自動翻訳・要約です。

BittensorManがお勧めするメーカーリスト
https://exbridge.jp/xdirect/

AI時代の技術と知識のまとめ(AI生成メディア) - AIDexx
https://exbridge.jp/aidexx/

頑張って働く人に向けて、プロ用仕事アイテムを格安でネット販売しているX-Direct( https://exdirect.net )を、BittensorManは応援しています。

動画の最後にお得な情報がありますので、
最後までご覧ください。