AIエージェントのトレーニングデータ

更新日:2026-08-25読了目安:5分

AIエージェントのカスタマイズに使うトレーニングデータの収集・準備・管理方法を解説します。

トレーニングデータの種類

AIエージェントのトレーニングに使われるデータには、大きく分けて以下の種類があります。

  1. 会話データ:過去のカスタマーサポートチャット・メール交換
  2. Q&Aデータ:よくある質問と望ましい回答のペア
  3. 製品・サービスドキュメント:仕様書・マニュアル・価格表
  4. 業務フロー定義:エスカレーション条件・対応手順
  5. ネガティブ例:回避すべき回答パターンのサンプル

Cotonityでは、これらのデータを組み合わせてRAGデータベースとシステムプロンプトを構築します。

データ収集の方法

良質なトレーニングデータを収集するための実践的な方法を紹介します。

  1. 既存サポートチケットのエクスポート:HubSpotやZendeskから過去1〜2年分を収集
  2. FAQドキュメントの整備:現在はドキュメント化されていない暗黙知を言語化
  3. 営業トークスクリプトの文書化:ベストな営業担当者の応答パターンを記録
  4. 顧客アンケートのフィードバック:不満点や混乱点から必要情報を特定

データ収集の際は、個人情報を含む場合は適切な匿名化処理を行ってください。

データ品質管理のポイント

収集したデータをそのままトレーニングに使うと、過去の誤った回答や古い情報も学習されてしまいます。データ品質管理が不可欠です。

  1. 品質チェックポイント:
  2. 正確性:情報が現在の製品・サービスに合っているか
  3. 一貫性:同様の質問に対して回答が矛盾していないか
  4. 完全性:重要な情報が欠けていないか
  5. 関連性:エージェントのスコープに関連する情報か

Cotonityではデータレビュープロセスを標準化しており、品質の高いナレッジベース構築を支援します。