RAGを作るとき、当たり前のようにベクトルDBを選んでいないでしょうか。先日お受けしたカスタマイズでは、ベクトルDBを使わず全文検索エンジンで組みました。対象は科学系の技術専門雑誌の数年分、数万ファイルのPDFです。
検索役に選んだのは、1990年代から続く日本語の全文検索システム Namazu でした。理由は3つあります。専門用語・型番・規格番号はキーワード検索のほうが確実に当たること。どの語がどのページに当たったかを人に説明できること。埋め込みモデルもGPUも要らず、社内で完全に閉じられること。
検索は枯れた技術に任せ、AIは読んで答える役に限定する。AIの得意不得意を、そのまま役割分担にした構成です。
正直に書くと、これがうまくいったのは対象が本文テキストのPDFだったからです。スキャンしただけのPDFや手書きが混ざる資料では、先にOCRの工程が要ります。
土台は当社が販売しているAIチャットボット製品で、変えたのは1箇所だけ。知識の取り込み口を、フォルダのMarkdownからNamazuの検索結果に差し替えました。
この記事は要約版です。続きは元記事でどうぞ: