研究

AIが社内文書を答えられない理由とRAGの仕組み

RAG(検索拡張生成)は、外部の情報を検索してからAIに答えさせる仕組み。検索と生成の二段階、従来の生成AIとの違い、精度が落ちる場面と対策を解説する。

佐藤健太佐藤健太
人気度:860
AIが社内文書を答えられない理由とRAGの仕組み

社内の規程を尋ねたのに、AIが的外れな答えを返す。理由は単純で、そのAIは自社の文書を知らないからだ。この不足を埋めるのがRAG(検索拡張生成)。仕組みを押さえれば、どこで精度が落ちるかも見えてくる。

RAG(検索拡張生成)とは何か

RAGとは、Retrieval-Augmented Generationの略で、日本語では検索拡張生成と訳される。検索と生成を組み合わせ、外部の情報を参照してからAIに回答を作らせる仕組みだ。

素の生成AIは、学習済みの知識だけで答える。学習した時点より後の出来事や、社内にしかない情報は持っていない。だから最新の話題や自社固有の質問には、答えられないか、もっともらしい誤りを返す。

RAGはこの限界を、学習のやり直しなしに埋める。必要な情報をその場で検索し、渡してから答えさせる。記憶だけで答える人と、資料を確認しながら答える人の違いに近い。

検索と生成の二段階で動く

RAGは二つの段階を踏む。まず検索の段階で、質問に関連する文書を外部データから取り出す。次に生成の段階で、取り出した内容をもとに回答を組み立てる。

検索の段階では、文書をあらかじめ細かく分割し、意味を数値に変換して保管しておく。質問が来ると、その数値に近い文書を探し出す。この準備の質が、回答の質を大きく左右する。

生成の段階では、取り出した文書をAIに渡し、「この内容をもとに答えよ」と指示する。文書に書かれていないことを補わせない点が重要だ。根拠のある範囲で答えさせることが、RAGの狙いである。

従来の生成AIと何が変わるのか

一番の変化は、追加学習が要らなくなることだ。新しい知識を入れたいとき、通常は専用のデータを用意して再学習させる。RAGなら、参照先の文書を更新するだけで済む。

もう一つは、回答に根拠を示せることだ。どの文書から答えたかを示せれば、利用者は内容を確かめられる。事実に基づく回答が求められる業務では、この透明性が効く。

回答の正確さも上がりやすい。学習時点の記憶に頼らず、手元の資料を参照するためだ。ただし、参照する文書自体が古かったり誤っていたりすれば、回答もそれに引きずられる。検索対象の整備が前提になる。

精度が落ちる場面と対策

RAGが期待通りに働かない場面は、いくつかある。

第一に、検索が外れる場合だ。質問と文書の言い回しが離れていると、関連する文書を取り出せない。文書の分割の仕方や、検索の工夫で改善できる。

第二に、文書が多すぎて肝心の部分が埋もれる場合だ。大量の文書をそのまま渡すと、AIが要点をつかみにくくなる。取り出す件数を絞り、関連の高いものに集中させたい。

第三に、社内文書特有の難しさだ。表や図の多い文書、用語の統一がされていない文書は、検索の精度を下げる。導入前に、対象文書を整理しておく価値は大きい。

よくある質問

RAGとファインチューニングはどう使い分けるのか。 最新情報や社内固有の事実を扱うならRAGが向く。話し方や出力の形式を染めたいなら、追加学習のほうが適する。両方を組にする場合もある。

RAGを入れれば誤りはなくなるのか。 ならない。参照先に誤りがあれば、回答も誤る。検索が外れれば、的外れな答えになる。根拠を確かめる運用と合わせて初めて効果が出る。

どの文書を対象にすればいいのか。 よく聞かれる質問に対応する文書から始めるのが現実的だ。全部を一度に入れるより、精度を確かめながら範囲を広げたほうが、問題の切り分けがしやすい。

RAGは、AIに自社の知識を教える近道だ。ただし、答えの質は参照する文書の質に比例する。仕組みを理解し、対象を整えることが、活用の第一歩になる。

このニュースを共有

出典

関連AIニュース

AIチップとソフトウエア層を組み合わせた抽象ビジュアル
研究

DeepSeekが華為昇騰向け基盤ソフトをオープンソース化、Nvidia向けと対をなす構成

DeepSeekが、華為のAIチップ「昇騰」向けの基盤ソフトウエア一式をオープンソース化した。Nvidia向けと一対一で対応する構成で、開発者は自前の環境で高性能な処理を組めるようになる。

人気度:1,450
LLM評価ツール比較:公開ベンチマークと自前テストの使い分け
研究

LLM評価ツール比較:公開ベンチマークと自前テストの使い分け

LLM評価ツールが何を測り、公開ベンチマークとどう違うのかを整理。DeepEval・Ragasなど代表ツールの比較、LLM-as-a-Judgeの限界、自前テストの作り方までをまとめる。

人気度:810
LLMとは何の略か?大規模言語モデルの仕組みと限界
研究

LLMとは何の略か?大規模言語モデルの仕組みと限界

LLMはLarge Language Modelの略で、大量のテキストを学習し言葉の続きを予測する仕組み。トランスフォーマーの構造、パラメータの意味、生成AIとの違い、苦手なことを基礎から整理する。

人気度:720
作ったモデルが現場で動かない:AIデプロイの落とし穴
研究

作ったモデルが現場で動かない:AIデプロイの落とし穴

学習済みモデルを本番で動かす配備には、精度の低下、コストと速度の壁、運用の維持という難しさがある。つまずきやすい地点と対策を整理する。

人気度:820