【生成AI】企業における生成AI活用のポイント・その1知識の活用

◆「AIの選択に迷っています」

「ChatGPT、Gemini、Claude、どれを導入すべきでしょうか?」
生成AIに関するご相談を受けると、このような質問をいただくことが少なくありません。しかし、企業の生成AI活用において本当に重要なのは、実はAIモデルの選択ではありません。

企業がAI活用で業務価値を生み出せるかどうかは、どのLLMを選ぶかではなく、企業が持つデータや知識を、AIが活用できる状態に整備できているか、によって決まります。
AIを活かすためには、「AIが働ける環境」を整えることが重要です。

◆AIが働ける環境とは?

AIの心臓部であるLLMは、予め学習済ですが、公開されていない情報は学習していません。
そのため、企業が生成AIを本格活用するには、「自社内の知識」をAIに活用させる仕組みが必要になります。

自社内の知識とは具体的には、社内に保管してある提案書や設計書、業務マニュアル、社内ルールなどが該当します。企業の競争力は、貴社の人材が作ってきた文書の中にあるのです。

◆文書サーバをそのままAIに、はアウトです

注意すべき点は、私たちにとって見やすい文書であっても、それがAIにとっても学習しやすいデータであるとは限らないことです。

例えば、セル結合された表をAIが読み込み、データの繋がりを誤認した結果、出張費の計算ミスが発生したという事例もありました。
これは、セル結合があるExcelや、1ページの中に左右2ブロックで文章が分かれているPDFをそのままAIに渡しても、AIは、左の行を読んだ後、そのまま右の行へジャンプする、という人間の視線移動ができないことが原因です。

AIは文字通り、上から下へ、左から右へと機械的に文字を拾うため、関連しないはずの内容が関連すると判断され、結果としてハルシネーションを出力してしまうのです。

企業内に散在する文書を整理し、生成AIが検索・活用できる状態に整理すること。
これが、AIが働ける環境の構築です。

◆では、文書をどう整備すれば良いのでしょうか

先の例のように、文書サーバにある文書そのままでは、AIは文書を正しく読むことができません。企業の知識をAIに活用してもらうためには、下記の準備が必要です。

① AIに読んでもらうための構造化「データクレンジング」

Excelのセル結合の解消、PDFの不要な改行の削除、多段見出しをプレーンなテキストに並び替えるなど、人間向けの見栄えを排除し、AIが文脈を1行ずつ正しく解釈できる状態にデータを整理することが必要です。

② 適切な意味の塊にする「チャンキング」

AIは、膨大な数のドキュメントから、回答に関係がありそうな一節を瞬時に検索して拾い出します。このとき、文書が長すぎると関係のない情報まで拾ってしまい、回答の精度が落ちます。
AIが検索しやすいように、文書の内容を意味のある適切な長さに分割し、インデックスを貼って登録する技術がチャンキングです。

③ 企業知識をAIが活用できる形に変換する「ベクトル化」

切り分けたテキストの塊を、AIが計算できる多次元の数字の列に変換(エンベディング)して、
AIが検索しやすいベクトルデータベースに格納します。
ベクトル化によって、キーワードの一致だけでなく、意味の近さでの検索が可能になります。

④ 古いデータを弾く運用「パイプライン化

ドキュメントは日々更新されますが、手作業での更新には限界があります。
ドキュメントが更新されたら、なるべく人手をかけずにデータクレンジングからチャンキング、ベクトル化まで行える仕組みを構築し、手作業での運用の手間を削減することが、継続的なAI活用には重要です。


企業がAI活用を推進するために重要なことは、LLMの選択ではなく、AIが必要とする企業知識を、必要なときに正確に取り出せる状態を実現し、維持することです。
これを「ナレッジ基盤」と呼んでいます。企業に蓄積された知識を、AIが活用できる「企業資産」へ変えるための基盤です。

◆データ整備こそが、今後の企業の格差になる

AIモデルそのものは、いまやどの企業も同じものをクラウドで使えます。つまり、AIの性能で差別化できる時代は終わりました。

今後は、企業固有のノウハウを、AIが誤解しない形に整理してナレッジとして活用することが、企業の価値を高めます。

◆当社がご支援いたします

「うちの社内規定、今のままでAIに読ませられるかな?」という素朴な疑問でも構いません。

まずは無料相談にて、貴社のデータ活用をご支援いたします。

お問い合わせはこちらで承ります
株式会社システムコンサルタント 営業統括部


最後までお読みいただき、ありがとうございました。

SNSでのシェアはこちらから