◆「AIの選択に迷っています」
「ChatGPT、Gemini、Claude、どれを導入すべきでしょうか?」
生成AIに関するご相談を受けると、このような質問をいただくことが少なくありません。しかし、企業の生成AI活用において本当に重要なのは、実はAIモデルの選択ではありません。
企業がAI活用で業務価値を生み出せるかどうかは、どのLLMを選ぶかではなく、企業が持つデータや知識を、AIが活用できる状態に整備できているか、によって決まります。
AIを活かすためには、「AIが働ける環境」を整えることが重要です。

◆AIが働ける環境とは?
AIの心臓部であるLLMは、予め学習済ですが、公開されていない情報は学習していません。
そのため、企業が生成AIを本格活用するには、「自社内の知識」をAIに活用させる仕組みが必要になります。
自社内の知識とは具体的には、社内に保管してある提案書や設計書、業務マニュアル、社内ルールなどが該当します。企業の競争力は、貴社の人材が作ってきた文書の中にあるのです。
◆文書サーバをそのままAIに、はアウトです
注意すべき点は、私たちにとって見やすい文書であっても、それがAIにとっても学習しやすいデータであるとは限らないことです。
例えば、セル結合された表をAIが読み込み、データの繋がりを誤認した結果、出張費の計算ミスが発生したという事例もありました。
これは、セル結合があるExcelや、1ページの中に左右2ブロックで文章が分かれているPDFをそのままAIに渡しても、AIは、左の行を読んだ後、そのまま右の行へジャンプする、という人間の視線移動ができないことが原因です。
AIは文字通り、上から下へ、左から右へと機械的に文字を拾うため、関連しないはずの内容が関連すると判断され、結果としてハルシネーションを出力してしまうのです。

企業内に散在する文書を整理し、生成AIが検索・活用できる状態に整理すること。
これが、AIが働ける環境の構築です。
◆では、文書をどう整備すれば良いのでしょうか
先の例のように、文書サーバにある文書そのままでは、AIは文書を正しく読むことができません。企業の知識をAIに活用してもらうためには、下記の準備が必要です。
① AIに読んでもらうための構造化「データクレンジング」
Excelのセル結合の解消、PDFの不要な改行の削除、多段見出しをプレーンなテキストに並び替えるなど、人間向けの見栄えを排除し、AIが文脈を1行ずつ正しく解釈できる状態にデータを整理することが必要です。
② 適切な意味の塊にする「チャンキング」
AIは、膨大な数のドキュメントから、回答に関係がありそうな一節を瞬時に検索して拾い出します。このとき、文書が長すぎると関係のない情報まで拾ってしまい、回答の精度が落ちます。
AIが検索しやすいように、文書の内容を意味のある適切な長さに分割し、インデックスを貼って登録する技術がチャンキングです。
③ 企業知識をAIが活用できる形に変換する「ベクトル化」
切り分けたテキストの塊を、AIが計算できる多次元の数字の列に変換(エンベディング)して、
AIが検索しやすいベクトルデータベースに格納します。
ベクトル化によって、キーワードの一致だけでなく、意味の近さでの検索が可能になります。
④ 古いデータを弾く運用「パイプライン化
ドキュメントは日々更新されますが、手作業での更新には限界があります。
ドキュメントが更新されたら、なるべく人手をかけずにデータクレンジングからチャンキング、ベクトル化まで行える仕組みを構築し、手作業での運用の手間を削減することが、継続的なAI活用には重要です。

企業がAI活用を推進するために重要なことは、LLMの選択ではなく、AIが必要とする企業知識を、必要なときに正確に取り出せる状態を実現し、維持することです。
これを「ナレッジ基盤」と呼んでいます。企業に蓄積された知識を、AIが活用できる「企業資産」へ変えるための基盤です。
◆データ整備こそが、今後の企業の格差になる
AIモデルそのものは、いまやどの企業も同じものをクラウドで使えます。つまり、AIの性能で差別化できる時代は終わりました。
今後は、企業固有のノウハウを、AIが誤解しない形に整理してナレッジとして活用することが、企業の価値を高めます。
◆当社がご支援いたします
「うちの社内規定、今のままでAIに読ませられるかな?」という素朴な疑問でも構いません。
まずは無料相談にて、貴社のデータ活用をご支援いたします。
お問い合わせはこちらで承ります
株式会社システムコンサルタント 営業統括部


