AIエージェントのカスタマイズに使うトレーニングデータの収集・準備・管理方法を解説します。
トレーニングデータの種類
AIエージェントのトレーニングに使われるデータには、大きく分けて以下の種類があります。
- 会話データ:過去のカスタマーサポートチャット・メール交換
- Q&Aデータ:よくある質問と望ましい回答のペア
- 製品・サービスドキュメント:仕様書・マニュアル・価格表
- 業務フロー定義:エスカレーション条件・対応手順
- ネガティブ例:回避すべき回答パターンのサンプル
Cotonityでは、これらのデータを組み合わせてRAGデータベースとシステムプロンプトを構築します。
データ収集の方法
良質なトレーニングデータを収集するための実践的な方法を紹介します。
- 既存サポートチケットのエクスポート:HubSpotやZendeskから過去1〜2年分を収集
- FAQドキュメントの整備:現在はドキュメント化されていない暗黙知を言語化
- 営業トークスクリプトの文書化:ベストな営業担当者の応答パターンを記録
- 顧客アンケートのフィードバック:不満点や混乱点から必要情報を特定
データ収集の際は、個人情報を含む場合は適切な匿名化処理を行ってください。
データ品質管理のポイント
収集したデータをそのままトレーニングに使うと、過去の誤った回答や古い情報も学習されてしまいます。データ品質管理が不可欠です。
- 品質チェックポイント:
- 正確性:情報が現在の製品・サービスに合っているか
- 一貫性:同様の質問に対して回答が矛盾していないか
- 完全性:重要な情報が欠けていないか
- 関連性:エージェントのスコープに関連する情報か
Cotonityではデータレビュープロセスを標準化しており、品質の高いナレッジベース構築を支援します。