AI開発の効果測定でつまずく原因の大半は、導入前の数値を取っていないことです。 「前より楽になった気がする」という感覚だけでは、続けるか、広げるか、作り直すかの判断ができません。稟議を通した側も、次の予算を取るときに説明する材料がなくなります。
この記事では、AIツールや業務自動化の仕組みを導入した後に、何をいつ測り、どう判断するかを整理します。後半では、通販会社のカスタマーサポート部門で一次回答の自動化の効果を測る例を通して、指標を実際の業務に当てはめます。読み手として想定しているのは、導入の効果を社内に報告する立場の担当者と、これから発注する側で「効果をどう見るか」を先に決めておきたい方です。
効果測定が置き去りになる背景
総務省の令和7年版情報通信白書によると、生成AIの活用が想定される業務について活用状況を尋ねた調査で、何らかの業務で生成AIを利用していると回答した割合は、日本で55.2%(「業務で使用中」と回答した割合)でした。「積極的に活用する方針」「活用する領域を限定して利用する方針」を定めている企業の比率も、2024年度調査で49.7%と、2023年度の42.7%から増えています。一方、導入に際しての懸念事項として日本で最も多かったのは「効果的な活用方法がわからない」で、次いで「社内情報の漏えい等のセキュリティリスク」「ランニングコストがかかる」「初期コストがかかる」が挙がっています。活用による自社への影響については「業務効率化や人員不足の解消につながる」が最多でした(出典1)。
この結果を効果測定の観点で読み直すと、次のことが分かります。期待されている効果は「業務効率化」、つまり時間です。ところが「効果的な活用方法がわからない」まま導入が先に進むと、時間をどこで、どう測るかが決まらないまま運用が始まります。ランニングコストへの懸念があるのに、それを引いた純効果を出す設計になっていないことも多くあります。効果測定は導入後に始める作業ではなく、着手前に「何を測るか」を決めることで成立します。
導入前に取る3つの数値
着手が決まった時点で、1〜2週間の実測を始めてください。 導入後に「前はどうだったか」を思い出そうとしても、正確な数値は出ません。見込みや感覚ではなく、実測が必要です。
| 数値 | 測り方 | 記録の単位 |
|---|---|---|
| 作業時間 | 対象業務にかかった時間を、着手から完了まで毎回記録する | 1件あたりの分数と、1日の合計 |
| ミスの件数 | やり直し・差し戻し・訂正連絡が発生した回数 | 件数と、発生した原因の分類 |
| 担当できる人の数 | その業務を一人で完結できる人が何名いるか | 人数と、その人の他業務との兼務状況 |
3番目を測っておくと、時間に表れない効果を拾えます。 1名しかできなかった業務を3名ができるようになれば、それはその人が休暇を取れる状態になったということであり、退職や異動が起きても業務が止まらないということです。属人化の解消は時間の数値には出にくい一方で、事業への影響は大きい効果です。
実測の期間は、業務の周期に合わせて決めます。日次で発生する業務なら1〜2週間で足りますが、月末に集中する業務なら、その月末を含む期間を取らないと平常時の数値しか残りません。
導入後に見る4つの指標
1. 作業時間
最も分かりやすい指標です。ただし運用開始から1ヶ月は慣れの期間として扱ってください。操作に慣れていない期間は、かえって時間がかかることがあります。新しい手順を覚えながら元の手順も並行して確認するため、一時的に二重の作業になるからです。
判断は2〜3ヶ月目の数値で行います。導入前と同じ単位(1件あたりの分数と1日の合計)で記録し、並べて比較できる形にしておきます。
2. 使われている頻度
実際に何回使われたかを記録してください。 作ったものが使われていないケースは実際にあります。使われていなければ、時間の指標は動きません。
| 状態 | 読み方 | 次の打ち手 |
|---|---|---|
| 想定した頻度で使われている | 順調 | 他の指標に進む |
| 使う人が限られている | 使い方が共有されていない、または一部の人にしか合っていない | 使っていない人に理由を聞く |
| 最初は使われたが減ってきた | 元のやり方に戻っている。手順が面倒か、出力の直しが多い | 確認・修正の時間を見る |
| ほとんど使われていない | 対象業務の選び方に問題がある可能性 | 対象業務を見直す |
使用回数を人が数えるのは続きません。開発の段階で、使用回数が自動で記録される形にしておくことが前提です。 発注時に「使用ログを取れる形にしてほしい」と伝えるだけで、この指標は取れるようになります。
3. 確認・修正にかかる時間
AIの出力を人が確認・修正している場合、この時間が全体の効果を左右します。 自動化で作業が5分から1分になっても、出力の確認に4分かかるなら効果は限定的です。確認時間は作業時間とは別に記録してください。
確認時間が長い原因は、出力の精度が低いか、確認の手順が決まっていないかのどちらかです。前者なら指示文や参照情報の見直し、後者なら「何を見れば確認が終わりか」のチェック項目づくりが打ち手になります。原因を分けずに「AIの精度が悪い」と結論づけると、改善が進みません。
4. ミスと事故の件数
自動化によってミスが減ったか、逆に新しい種類のミスが増えていないかを見ます。新しい種類のミスが出ること自体は普通です。 重要なのは、それに気づける仕組みがあるかどうかです。
生成AIには、従来のシステムにはなかった種類の間違いがあります。個人情報保護委員会は2023年6月の注意喚起で、一般の利用者向けの留意点として、生成AIサービスの応答結果には不正確な内容が含まれることがあり、自然な文章として出力されても確率的な相関関係に基づいて生成されるため、不正確な個人情報が含まれるリスクがあると指摘しています(出典2)。もっともらしい文章で間違ったことを答える、というミスは、人の入力ミスとは性質が異なります。
セキュリティ面でも同じです。IPAが2026年1月に公表した「情報セキュリティ10大脅威 2026」では、組織向けの脅威の3位に「AIの利用をめぐるサイバーリスク」が初めて選出されました。7位には「内部不正による情報漏えい等」が入っています(出典3)。AIを組み込んだ仕組みが誤った情報を出す、外部からの入力で想定外の動作をする、参照してよい範囲を超えた情報を出す、といった事象は、導入前には存在しなかったミスの種類です。ミスの件数を数えるときは、「従来型のミス」と「AI固有のミス・事故」を分けて記録してください。 前者が減って後者が増えたなら、その内訳を見て設計を直します。
指標をいつ、誰が、どこで取るか
4つの指標は、取り方を決めておかないと途中で途切れます。
| 指標 | 取り方 | 頻度 | 担当 |
|---|---|---|---|
| 作業時間 | 業務の担当者が1件ごとに記録。集計は月1回 | 毎回記録・月次集計 | 業務の担当者と管理者 |
| 使われている頻度 | システム側の使用ログを自動集計 | 自動・月次で確認 | 開発側が仕組みを用意し、管理者が確認 |
| 確認・修正の時間 | 出力を確認した人が、直した箇所と時間を記録 | 毎回記録(抜き取りでも可) | 確認担当者 |
| ミスと事故の件数 | 差し戻し・訂正・想定外の出力を一覧に追記 | 発生時に記録・月次で分類 | 管理者 |
人の手で取る指標は、抜き取りで構いません。 全件記録を求めると続かず、途中で途切れた記録は比較に使えません。月のうち1週間だけ全件記録する、あるいは1日10件だけ記録する、といった形で、導入前と同じ方法で取ることを優先してください。
投資回収の計算
3ヶ月目の数値で、次を計算してください。数値は計算の形を示すための例です。
| 項目 | 例 |
|---|---|
| 削減できた月間工数 | 21時間 |
| 人件費換算(3,000円/時として) | 63,000円 |
| 月額の運用費(API利用料・保守など) | 3,000円 |
| 月間の純効果 | 60,000円 |
| 開発費 | 300,000円 |
| 回収月数 | 5ヶ月 |
運用費を引くのを忘れないでください。 API利用料は使うほど増えるため、使われている頻度が上がると運用費も上がります。効果が出ているほど運用費が増えるのは正常な状態ですが、純効果で見ないと「効果が出たのに費用が増えた」という誤った印象になります。API利用料の見積り方はAI開発のAPI利用料|月額の見積り方にまとめています。保守・改修の費用はAI開発の保守・運用費用|納品後にかかる内訳を参照してください。
人件費換算の単価は、社内で使っている数値に合わせてください。時給の実額ではなく、社会保険料などを含めた総額を使う会社もあります。どちらでもよいのですが、報告のたびに単価を変えると比較できなくなるので、最初に決めた単価を固定します。
続けるか作り直すかの判断
| 状況 | 判断 |
|---|---|
| 使われていて、時間も減っている | 継続。他業務への展開を検討する |
| 使われているが、時間が減っていない | 確認・修正の工数を見直す |
| 使われていない(使い方が分からない) | 説明や操作性を改善する |
| 使われていない(そもそも不要だった) | 対象業務を選び直す |
| 想定と違う使われ方をしている | その使い方に合わせて作り直す |
5番目は前向きな結果です。 想定外の使われ方が出ているなら、実際のニーズが見つかったということです。仕様どおりに使わせようとするより、その使い方に寄せて作り直したほうが定着します。
「使われていない」の原因を分ける
効果が出ない場合、まず原因を2つに分けてください。
- 使われていない — 説明不足・操作が面倒・元のやり方のほうが速い
- 使われているが効果が出ない — 対象業務の選び方・確認工数の多さ
混同すると打ち手を間違えます。 使われていないのに機能を追加しても状況は変わりませんし、使われているのに使い方の説明会を開いても時間は減りません。原因を分けるには、使用ログと確認時間の記録の両方が要ります。ここでも、取っていない数値は後から作れません。
報告するときの形
社内で報告する際は、次の3点を並べてください。
- 導入前の数値(実測)
- 導入後の数値(2〜3ヶ月目)
- 運用費を引いた月間の純効果
削減率だけでは判断材料になりません。 元の数値と金額を併記してください。「半分になった」と書かれても、元が月10時間なのか100時間なのかで意味が変わります。あわせて、ミスと事故の件数の推移と、使われている頻度も1行ずつ添えます。時間だけを報告すると、「使われていないから時間が減っていない」のか「使われているのに減っていない」のかが読み手に伝わりません。
業種×部門で当てはめる
4つの指標を、実際の業務に当てはめて確認します。以下は想定の典型例で、特定の顧客の実績ではありません。
例:通販会社のカスタマーサポート部門で一次回答の自動化の効果を測る
通販会社のカスタマーサポートには、配送状況の確認、返品・交換の手続き、注文内容の変更、支払い方法の質問、商品の在庫や再入荷の問い合わせが、メールとフォームから届きます。内容の多くは、注文情報と社内のFAQを見れば答えが決まる定型の問い合わせです。そこで、届いた問い合わせを分類し、定型のものにはAIが一次回答の下書きを作り、担当者が確認して送る、判断が要るものは最初から人が対応する、という仕組みを導入したとします。一次回答の設計そのものは問い合わせ対応のAI自動化開発|一次回答ボットと有人エスカレーション設計で扱っているので、ここでは効果の測り方に絞ります。
導入前に取る数値は、問い合わせ1件あたりの返信作成時間、1日の対応件数、返信後の再問い合わせ(答えが足りずに戻ってきた件数)、そして回答できる担当者の人数です。返信作成時間は、担当者が問い合わせを開いた時刻と送信した時刻の差で取れるため、特別な仕組みがなくても2週間の記録が可能です。このとき、繁忙期と平常時を分けて記録してください。 セール直後の1週間だけを導入前の基準にすると、導入後の平常時と比べて効果が過大に見えます。
導入後に見る指標は、次のように4つの指標に対応させます。
| 指標 | この業務での測り方 |
|---|---|
| 作業時間 | 下書きを確認して送信するまでの1件あたりの時間。導入前の返信作成時間と同じ単位で比較する |
| 使われている頻度 | 一次回答の下書きが生成された件数と、そのまま送信・修正して送信・破棄の内訳 |
| 確認・修正の時間 | 下書きを直した箇所と所要時間。修正が多い問い合わせの種類を特定する |
| ミスと事故の件数 | 誤った案内による再問い合わせ、返品条件など規約と異なる回答、別の顧客の注文情報が混入した回答 |
4番目の指標が、この業務では特に重要です。注文番号や氏名、住所を含む問い合わせをAIに渡して下書きを作らせる以上、個人情報保護委員会が示した個人情報取扱事業者向けの注意点がそのまま当てはまります。個人情報を含むプロンプトの入力は、特定した利用目的を達成するために必要な範囲内であることを確認すること、あらかじめ本人の同意を得ずに個人データを含むプロンプトを入力し、それが応答結果の出力以外の目的で取り扱われる場合は個人情報保護法に違反する可能性があるため、提供事業者が機械学習に利用しないこと等を確認すること、の2点です(出典2)。これは導入前に確認する事項ですが、導入後も「別の顧客の情報が回答に混ざっていないか」を、ミスの一種として数え続ける必要があります。件数がゼロであることを記録し続けること自体が、この仕組みを続けてよいという根拠になります。
判断は3ヶ月目に行います。下書きがそのまま、または軽微な修正で送信された割合が高く、1件あたりの時間が導入前より短く、再問い合わせが増えていなければ継続です。下書きの破棄が多い問い合わせの種類があれば、その種類だけを自動化の対象から外すか、参照するFAQを補います。一方、下書きは生成されているのに担当者がほとんど使わず、元のテンプレートから返信している状態なら、それは「使われていない」に分類され、機能追加ではなく使い方の共有や操作の手間の見直しが打ち手です。
通販の場合、もう一つ見ておきたいのが有人対応の内容の変化です。定型の問い合わせが一次回答で片付くようになると、担当者に残るのは苦情や複雑な相談になります。1件あたりの対応時間の平均は、むしろ上がることがあります。これは効果が出ていない兆候ではなく、時間のかかる案件だけが残った結果です。全体の平均だけを見ると効果を見誤るため、問い合わせの種類ごとに時間を分けて記録してください。
当社が自社で運用して分かったこと
当社は自社サイト500ページ超をAIで開発・運用し、記事の自動公開パイプラインとサイト上のAIチャットも自社で構築して運用しています。そこで実感しているのは、効果測定は「やろうと思ったときにできる」ものではなく、記録が残る形で仕組みを作っておいたときにだけできる、ということです。たとえばAI検索経由のサイト流入は、参照元を分けて記録する設定を先に入れていたことで、2026年7月時点で週59〜68ユーザー(検索流入の約3%)という数値として追えています(AI検索経由の流入の計測)。設定を入れる前の期間の数値は、後からは出せません。
この経験は、業務自動化の効果測定にもそのまま当てはまります。使用ログを取る設計、確認時間を残す運用、ミスの分類を決めておくこと。 この3つを開発の段階で組み込んでおけば、3ヶ月後の判断は数値でできます。組み込んでいなければ、感覚で判断するしかなくなります。当社では、相談の時点で「何を測っておくか」をお伝えし、開発では使用回数が記録される形にしています。
当社の費用
| プラン | 料金 | 初期費用・契約条件 | 含まれるもの |
|---|---|---|---|
| 業務自動化ミニ開発 | ¥300,000〜(税抜・単発) | — | 1業務の自動化ツールを設計・開発/例: 見積書生成・日報集計・レポート自動作成/要件整理から納品まで2〜4週間/納品後1ヶ月の動作フォロー付き |
| AI組込み開発おすすめ | ¥800,000〜(税抜・要件見積) | — | 社内チャットボット・RAG(社内ナレッジAI)/Claude・GPT・Gemini API統合/業務アプリ・ダッシュボード開発/開発期間1〜3ヶ月・保守プランは別途 |
| AI開発顧問 | ¥300,000/ 月(税抜) | 契約期間 最低3ヶ月(以降1ヶ月単位) 最低期間の総額 ¥900,000(¥300,000×3ヶ月) | Claude Code環境構築・開発伴走/社内メンバーの内製化支援/月次の開発ロードマップ設計/チャット相談・コードレビュー |
まず1業務に絞って業務自動化ミニ開発(300,000円〜・税抜・単発)で動かし、3ヶ月目の数値を見てから対象を広げる進め方を基本にしています。ミニ開発には納品後1ヶ月の動作フォローが含まれます。問い合わせ対応の一次回答のように、既存システムとの連携や複数の問い合わせ経路をまとめる案件はAI組込み開発(800,000円〜・税抜・要件見積)になります。効果測定と改善を継続する場合は、AI開発顧問(300,000円/月・税抜・最低3ヶ月)で月次の数値を一緒に見て、次の打ち手を決めます。
「効果が出ていないので作り直すべき」という判断もお伝えします。 使われていない仕組みに保守費用をかけ続ける意味はありません。初回30分の相談は無料・オンライン対応・秘密厳守です。
商談で聞かれる質問
Q1. 効果測定まで作業範囲に含まれますか
測る仕組みと読み方までは開発の範囲に含めますが、実測そのものは発注側で行っていただきます。当社が担うのは、導入前に測る項目の決定、実測の記録様式の提示、使用ログが残る形での開発、納品後の数値の読み方の引き渡しです。発注側にお願いするのは、導入前1〜2週間の実測の実施と、導入後の作業時間・確認時間の記録です。業務の担当者が何分かけたかは、当社では測れません。 ここは発注側の作業として、着手前に担当者の時間を確保していただきます。使用ログの自動記録は開発に含めますが、それをどの指標に対応させるかは着手時に一緒に決めます。導入後の月次の数値確認を当社が継続して担うのは、単発の開発ではなくAI開発顧問(300,000円/月・税抜・最低3ヶ月)の範囲です。
Q2. 導入後の運用は誰がやりますか
日常の運用は発注側の担当者が担います。具体的には、月に一度の使用ログの確認、確認・修正時間の抜き取り記録、ミスと事故の一覧への追記、3ヶ月目の判断です。納品時に、ログの見方と月次集計の手順を画面付きで引き渡します。数値を見て改修が必要になった場合は都度見積り、または開発顧問で継続的にご一緒する形のどちらかです。「納品後に数値を誰が見るか」が決まっていない状態で運用を始めると、2ヶ月目には記録が途切れます。契約前に担当者を1名決めてください。
Q3. 依頼前に何を用意すればよいですか
3点です。第一に、対象業務にかかっている時間のおおよその記録。完成した実測でなくてよく、「1日に何件、1件あたり何分くらい」という見立てで構いません。第二に、その業務で起きたミスややり直しの例。第三に、効果が出たと判断する基準についての現時点の考え。「月20時間減れば続ける」のような1行で十分です。いずれも初回の相談で一緒に整理できますが、第三の点だけは発注側で決めていただく必要があります。基準を開発側が決めると、開発側に都合のよい指標が選ばれてしまうからです。
まとめ
- 導入前に1〜2週間の実測を取る。後から思い出しても正確には出ない
- 測るのは「作業時間・ミスの件数・担当できる人の数」
- 導入後は「作業時間・使われている頻度・確認と修正の時間・ミスと事故の件数」の4指標。判断は2〜3ヶ月目の数値で行う
- 生成AIの応答には不正確な内容が含まれ得る(個人情報保護委員会)。IPAの10大脅威2026では「AIの利用をめぐるサイバーリスク」が組織向け3位に初選出。AI固有のミス・事故を分けて数える
- 投資回収は運用費を引いてから計算する
- 効果が出ないときは「使われていない」と「使われているが効かない」を分ける
- 使用ログ・確認時間・ミスの分類は開発の段階で組み込む。後からは取れない
あわせて読みたい
- 問い合わせ対応のAI自動化開発|一次回答ボットと有人エスカレーション設計
- 業務自動化PoCの進め方|30万円規模で小さく検証する手順と成功基準
- AI開発のAPI利用料|月額の見積り方
- AI開発の保守・運用費用|納品後にかかるAPI利用料・改修コストの内訳
- AIチャットボット|既製品と自社開発
- AI研修の効果測定テンプレート|削減時間・活用率・定着度の計り方
- カスタマーサポート部門の生成AI活用12例
- AI開発の記事一覧
出典
- 総務省「令和7年版 情報通信白書」企業におけるAI利用の現状 — 何らかの業務で生成AIを利用している日本企業の割合(55.2%)、活用方針の策定状況(2024年度49.7%・2023年度42.7%)、導入に際しての懸念事項、活用による効果・影響
- 個人情報保護委員会「生成AIサービスの利用に関する注意喚起等について」(令和5年6月2日) — 個人情報取扱事業者が個人情報を含むプロンプトを入力する際の注意点(利用目的の範囲内であることの確認、機械学習に利用しないことの確認)、応答結果に不正確な内容が含まれ得るという一般利用者向けの留意点
- IPA「情報セキュリティ10大脅威 2026」 — 組織向け脅威の順位(3位「AIの利用をめぐるサイバーリスク」初選出、7位「内部不正による情報漏えい等」)