営業支援AIの精度はどう測る?商談メモ・提案文を30件で試す手順
営業支援AIの精度は、文章の自然さだけでは判断できません。顧客の課題、金額、期限、約束した内容が正しく反映され、人の確認時間まで含めて作業が減るかを、過去30件で確かめます。

30秒で分かる結論
- 「商談メモの整理」か「提案文の下書き」のどちらか1業務だけを選びます。
- 通常・例外・重要案件を10件ずつ用意し、人が確認済みの正解表をAI実行前に固定します。
- 必須情報一致率、根拠なし断定率、重大誤り率、実用初稿率、確認・修正込みの時間削減率で判断します。
- 顧客向けの提案文は自動送信せず、顧客名、数字、期限、約束、根拠を担当者が原資料と照合します。
営業ロープレの精度とは分けて考える
「営業AI」でも、研修の会話評価と、実案件の文書作成では正解が違います。2つを同じ採点表で混ぜると、何が改善したのか分からなくなります。
| 用途 | 測るもの |
|---|---|
| 営業ロープレ | 質問、傾聴、反論対応、次の行動について、AI採点と上司の評価が一致するか。 |
| 商談メモ整理 | 顧客課題、確認済みの数字、期限、担当者、次回行動を正確に抽出できるか。 |
| 提案文の下書き | 確認済みの情報だけで構成し、未確認の価格・仕様・実績・約束を追加しないか。 |
新人研修の会話評価が目的なら、AI営業ロープレの評価軸6つを使います。本記事は、実案件に近い文書の精度へ範囲を限定します。
最初に試す作業を1つ選ぶ
低リスク側: 商談メモから次回行動を整理する
顧客の課題、確認済みの数字、示された条件、次回行動、担当者、期限を決めた形式へ整理します。外部へそのまま送らないため、最初の試験に向きます。
高リスク側: 商談メモから提案文の下書きを作る
顧客課題と提案内容が対応しているか、未確認の価格・仕様・実績を追加していないか、契約条件や効果を断定していないかを確認します。顧客向け文章なので、人の最終承認を外しません。
要約と提案文を同じ30件へ混ぜないでください。作業の開始点・終了点・重大誤りが違うため、別の試験として記録します。
通常・例外・重要案件を10件ずつ選ぶ
- 通常案件10件: 情報が揃い、普段どおり処理できた案件。
- 例外案件10件: 情報不足、曖昧な表現、途中変更、複数の担当者などを含む案件。
- 重要案件10件: 金額、期限、契約、苦情、特別な約束など、誤りの影響が大きい案件。
成功例だけを集めず、直近の同じ商品・同じ作業から選びます。顧客名、連絡先、未公開価格などは匿名化し、正しい最終結果を確認できない案件は評価用に使いません。
30件は公的な標準ではなく、Signal Deskが初期比較の例として置く件数です。30件で分かるのは次の限定試験へ進むかまでで、本番自動化の安全性や受注率への因果効果を証明するものではありません。
AIへ渡す前に、正解表と重大誤りを固定する
案件ID、区分、入力資料、必須情報と正解、禁止表現、根拠資料、重大誤り、現行作業時間、評価者を1件ずつ記録します。AIの出力を見てから合格条件を変えると、都合のよい評価になります。
重大誤りには、顧客・担当者の取り違え、金額・期限・数量の誤り、約束していない対応の追加、根拠のない効果や実績の断定、他案件情報の混入、個人情報や社外秘の不要な転記を含めます。
営業支援AIの精度を測る5つの数字
| 指標 | 計算式 | 見る意味 |
|---|---|---|
| 必須情報一致率 | 正しく反映した必須項目数 ÷ 必須項目総数 × 100 | 顧客課題、数字、期限、次回行動を落とさず反映したか。 |
| 根拠なし断定率 | 根拠のない数字・仕様・実績・約束を含む件数 ÷ 試験件数 × 100 | もっともらしい創作を顧客向け文書へ入れていないか。 |
| 重大誤り率 | 重大誤りを1つ以上含む件数 ÷ 試験件数 × 100 | 平均点では相殺できない事故候補がないか。 |
| 実用初稿率 | 修正なし、または表記だけの軽微修正で使えた件数 ÷ 試験件数 × 100 | 実際に下書きとして役立つ割合。 |
| 時間削減率 | (現行平均総時間 − AI平均総時間)÷ 現行平均総時間 × 100 | 準備・確認・修正を含めても作業が減ったか。 |
AI平均総時間には、匿名化・入力準備、生成待ち、事実確認、修正、CRMなどへの転記を含めます。現行時間の信頼できる記録がなければ、時間削減率は出さず、まず現行作業を測ります。
30件テストを同じ条件で実施する
- 対象業務と30件を固定する。
- 正解表と重大誤りを人が先に確定する。
- 顧客情報を匿名化する。
- プロンプト、モデル、設定、参照資料を固定する。
- 出力、処理日時、モデル・プロンプト版を保存する。
- 可能なら出力を作った担当者とは別の人が正解表と照合する。
- 準備、確認、修正時間を案件ごとに記録する。
- 不合格になった案件を通常・例外・重要案件別に確認する。
NIST AI RMFは、導入する文脈に近い条件で性能を測り、テストセット・指標・人の監督を記録する考え方を示しています。AISIの評価観点ガイドも、AIエージェントを含むシステムの評価観点を更新しています。どちらも本記事の30件や仮の合格率を公的基準として定めるものではありません。
続ける・用途を狭める・見送る
| 判断 | 仮の条件 |
|---|---|
| 次の限定試験へ進む | 重大誤り0件。顧客名・金額・期限・約束は全件一致し、その他の必須情報一致率は95%以上。人の確認を維持したまま総時間が減る。 |
| 用途を狭める | 重大誤りは0件だが提案文の修正が多い。商談メモの項目抽出や文章整形だけへ限定する。 |
| 見送る | 重大誤りが1件以上、根拠のない断定が残る、入力データの利用条件を確認できない、または確認込みで現行より遅い。 |
95%や「重大誤り0件」はSignal Deskの初期試験例で、公的な合格基準ではありません。業務の失敗コストと社内規程に合わせ、試験前に責任者が基準を決めてください。合格は自動送信の許可ではなく、範囲を限定した次の試験へ進む判断です。
月額ではなく、確認時間まで費用へ入れる
- 月間純削減時間: (現行平均総時間 − AI平均総時間)× 月間案件数
- 削減候補額: 月間純削減時間 ÷ 60 × 担当者の時間単価
- 月間差額: 削減候補額 − ツール月額 − 月間運用費 − 初期設定費の月割額
- 使える初稿1件あたり費用: (同じ試験期間のツール費 + 人件費 + 運用費)÷ 実用初稿件数
ツール費、人件費、案件数は同じ期間にそろえます。実用初稿が0件なら1件あたり費用は算出せず、見送ります。まず品質条件を満たし、その後に費用を比べます。安いことを理由に重大誤りを許容しません。削減候補額は時間価値の試算であり、同額の現金利益や人件費削減を保証しません。
商談メモを入力する前に確認すること
利用目的、入力最小化、学習利用、保存地域・保持期間、管理者権限、削除・出力、誤入力時の停止手順を確認します。個人情報保護委員会も、個人情報を含むプロンプト入力について利用目的や提供事業者の取扱いを確認するよう注意喚起しています。
失敗しやすい測り方
- AIの自己採点だけで精度を出す。
- 文章の自然さや長さだけを評価する。
- 通常案件だけを選び、失敗しやすい例外を外す。
- 要約と提案文を同じ母数で集計する。
- 確認・修正時間を除いて時間削減を計算する。
- 途中でモデルやプロンプトを変え、同じ試験として合算する。
- 30件の結果から、全営業業務や受注率への効果を断定する。
明日やること
- 商談メモ整理か提案文下書きのどちらか1つを選ぶ。
- 1件でもあれば止める重大誤りを5項目以内で定義する。
- 通常・例外・重要案件を各10件選び、個人情報を匿名化する。
- 正解表を作ってから、同じ条件でAIを実行する。
一次情報と確認日
- NIST: AI Risk Management Framework Core確認日: 2026年8月14日
- NIST: Generative AI Profile確認日: 2026年8月14日
- 経済産業省: AI事業者ガイドライン(第1.2版)確認日: 2026年8月14日
- AISI: AIセーフティに関する評価観点ガイド(第1.20版)確認日: 2026年8月14日
- 個人情報保護委員会: 生成AIサービスの利用に関する注意喚起確認日: 2026年8月14日
この記事は一般的な試験設計の整理であり、個別案件の法的助言や効果保証ではありません。顧客送信、契約、価格提示などは責任者が原資料と照合して承認してください。