Skip to main content
2026年10月6日 · 導入・運用 AIチャットボットの回答を短くしたら、必要な条件まで省かれてしまった。モデルを変えたら、以前は答えられた質問に答えられなくなった。こうした変化を見つけるには、変更した部分だけを試すのでは不十分です。 更新前に使った質問を残し、更新後も同じ条件で試す。 小規模なサイトでも、この習慣があれば改善と引き換えに何かを失っていないか確認しやすくなります。

Finのテスト機能から学べること

IntercomのFin公式ガイドでは、実際の問い合わせをもとに複数の質問を試し、質問グループを保存して再実行する方法を案内しています。回答への評価は、それだけでFinを再学習させるものではありません。参照コンテンツや指示を直し、もう一度確認するために使います。 また、テスト方法を比較した公式ガイドは、手動で会話を試すPreviewと、複数の質問をまとめて確認するBatch testを区別しています。一つの回答をその場で見ることと、以前の結果と比較できる質問セットを持つことは、役割が違います。 両資料の表示日はそれぞれ2026年5月13日、7月31日です。本記事は10月6日に確認した既存のガイドをもとにした運用の解説で、新機能の発表ではありません。

質問より先に「残すべき答え」を決める

最初から大量のテストを用意する必要はありません。よく聞かれることと、間違えると困ることを選び、質問ごとに最低限伝えてほしい内容をメモします。 たとえば「解約はいつまでに必要ですか」という質問なら、正しい締切だけでなく、対象プランや例外条件を落としていないかを見ます。これは確認方法を説明する例で、特定のサービスの解約条件ではありません。 文章を一字一句そろえる必要はありません。言い回しが変わっても、必要な事実と案内先が保たれていればよいからです。反対に、読みやすくなっても大事な条件が消えたら、改善したとは言い切れません。 質問セットには、次の3種類を入れると確認の偏りを減らせます。
  • 答えがある質問:必要な事実を、適切なページに基づいて案内できるか
  • 条件が足りない質問:プランや利用状況を勝手に決めつけていないか
  • サイトに答えがない質問:根拠のない説明を作っていないか
これは本記事の運用提案です。質問数を増やすことより、公開してはいけない回答を見分けられることを重視します。

更新前後を比べる小さな手順

まず、質問、回答に必要な要点、参考ページ、実際の結果を同じ表に残します。回答指示とモデルを一度に変えず、一つずつ試すと違いの原因を追いやすくなります。 更新後は、新しい会話で同じ質問を聞きます。前の会話に残った説明が、回答を助けてしまうことがあるためです。料金や解約など間違いの影響が大きい質問は、言い方を少し変えても確認します。一度の成功だけで、毎回正しく答える保証にはなりません。 期待と違う結果が出たら、すぐに指示を長くする前に、参照ページに必要な情報があるか、回答がその条件を正しく扱っているかを見直します。直した質問だけでなく、ほかの質問も再確認してから公開します。

Genkeychatでも、保存前に回答を確かめる

Genkeychatでは、ボット設定画面で未保存のモデル・回答言語・回答指示・参照URLをテストできます。テスト中の設定は公開ウィジェットには反映されず、設定を変えると新しいテスト会話が始まります。テストして公開するに操作をまとめています。 ここで紹介した質問セットは、手元の表などで管理し、テスト画面で順に確認する使い方です。Finのような一括テストや自動採点をGenkeychatの機能として案内するものではありません。 回答履歴ではテスト会話とウィジェットの会話を区別して、回答と引用元を確認できます。ただし、Freeで閲覧・CSV出力できるのは直近30日です。更新前後を長く比較したい場合は、必要な結果を自分で記録しておきます。 APIキー未登録時のデモ回答では、サイトの情報を使った回答品質は確認できません。自分のAnthropic APIキーを登録してテストすると、検索・取得・回答生成のAPI利用料が別途発生します。テストも無料とは限らない点を確認して始めてください。 公開前の最後の確認は、「今回直した質問によく答えるか」だけでなく、これまで答えられていた質問にも、引き続き適切に答えられるかです。