「有効回答 1,068 件、信頼水準 95% で標本誤差 ±3%」。顧客満足度調査や市場調査など、電話調査の報告書によく出てくる一行ですが、正しく理解している人は多くありません。調査員が人から AI に変わっても、これらの概念は変わらず、むしろ重要になります。AI 電話調査が変えるのは誤差の出どころと形であって、統計のルールではありません。
本記事はチュートリアルです。AI 電話調査や電話アンケートの設計前に知っておくべき 7 つの概念を、ビジネス調査の計算例とともに解説します。読み終えれば、電話調査の数字をどこまで信頼できるか判断できるはずです。
概念 1:信頼水準と標本誤差、1,068 の由来
比率(例:満足と答えた顧客の割合)を単純無作為抽出で推定するときの必要標本数は次のとおりです。
n = z² × p(1−p) ÷ e²
計算例:信頼水準 95%、p = 0.5、e = 0.03 なら n = 1.96² × 0.25 ÷ 0.0009 = 1,067.1、切り上げて 1,068 件。
「信頼水準 95%」とは、同じ方法で何度も標本を取れば約 95% の区間が真の値を含む、という意味です。「今回の区間に真の値が 95% の確率で入る」という意味ではありません。99% で ±3% を保つには約 1,844 件が必要です。
また ±3% は p = 0.5 のときの最大値です。結果が 10% の設問なら、同じ 1,068 件でも誤差は約 ±1.8% です。
概念 2:標本数の表とサブグループの誤差
| 標本数 | 最大標本誤差(信頼水準 95%) |
|---|---|
| 100 | ±9.8% |
| 200 | ±6.9% |
| 300 | ±5.7% |
| 500 | ±4.4% |
| 1,068 | ±3.0% |
| 1,500 | ±2.5% |
| 2,401 | ±2.0% |
ポイントは 2 つ。誤差は標本数の平方根に反比例するため、半分にするには 4 倍の標本が必要です。そして ±3% は全体の標本にのみ当てはまります。
計算例:1,068 件の顧客満足度調査で「この 1 年の新規顧客」が 200 人なら、その誤差は約 ±6.9%。「新規顧客の満足度 52%、全体 48%」という差 4 ポイントはサブグループの誤差の範囲内で、新規顧客の方が満足していると結論づけることはできません。
概念 3:回答率、なぜ何倍もの番号に発信するのか
1,068 は完了数で、発信数ではありません。よく使われる指標は接触率(有効番号のうち対象者に接触できた割合)、協力率(接触できた適格者のうち完了した割合)、回答率(適格ケース全体に対する完了数)です。米国世論調査学会 AAPOR の「標準定義」が広く使われる基準です。
計算例(説明用。比率は仮定であり業界統計ではありません):
| 段階 | 仮定の比率 | 件数 |
|---|---|---|
| 発信した番号 | — | 12,715 |
| 有効番号 | 70% | 約 8,900 |
| 適格な対象者に接触 | 40% | 約 3,560 |
| 回答完了 | 30% | 約 1,068 |
この仮定では 1 件の完了に約 12 番号の発信が必要で、再発信は含みません。回答率が低いこと自体が結果の誤りを意味するわけではありませんが、次の疑問が生まれます。答えなかった人は、答えた人と同じでしょうか。
概念 4:標本誤差と非標本誤差
標本誤差は一部の人だけに聞くことで生じる偶然の誤差で、公式で計算でき、標本を増やせば小さくなります。非標本誤差は系統的で、標本を増やしても消えません。
| 種類 | ひとことで | 例 |
|---|---|---|
| カバレッジ誤差 | 台帳に含まれない人がいる | 固定電話だけに発信し、携帯のみの顧客を逃す |
| 無回答誤差 | 回答者と拒否者が違う | 忙しい勤労者ほど完了しにくい |
| 測定誤差 | 回答が本心を反映しない | 調査員の口調、言い回し、聞き間違い、記録ミス |
| 処理誤差 | データ処理のミス | 手入力やコーディングの誤り |
報告書の ±3% は最初の標本誤差しかカバーしていません。同じテーマの 2 つの調査が 8 ポイント違うとき、原因はたいていこの表の中にあります。
概念 5:調査員効果、AI が調査員になると何が変わるか
同じ質問票でも、調査員によって回答に系統的な差が出ます。これが調査員効果で、調査員内相関 ρ で測定でき、分散を膨らませます。
デザイン効果 ≈ 1 + ρ ×(調査員 1 人あたりの平均完了数 − 1)
計算例:20 人の調査員で 1,068 件(1 人約 53 件)、ρ = 0.01(例示値)と仮定すると、デザイン効果は約 1 + 0.01 × 52 = 1.52。有効標本は約 701 件に減り、誤差は ±3.0% から約 ±3.7% に広がります。それでも報告書には ±3% と書かれます。
調査員が AI なら、全通話で同じ言い回し・口調・速さで逐語に読むため、調査員間の差という成分が消えます。これは統計的な性質であり、宣伝文句ではありません。言い回しが一定なら測定条件も一定です。
裏返しもあります。全通話が 1 人の「調査員」を共有するため、スクリプトが誘導的なら偏りは相殺されず、すべての通話に同じようにかかります。AI は調査員のばらつきを「スクリプトが中立かどうか」の問題に置き換えるので、パイロットと設問レビューがより重要になります。音声認識の聞き間違いやモード効果(機械相手だと答え方が変わる)も検証が必要な測定誤差です。
概念 6:無回答バイアスとウェイト付け、直せるもの・直せないもの
無回答バイアスはおおよそ無回答の割合 × 回答者と非回答者の差です。
計算例:回答率 30%、回答者の 60% が満足、非回答者は実は 50%。真の値は 0.3 × 60% + 0.7 × 50% = 53% なのに報告は 60%。7 ポイントの偏りで、±3% よりはるかに大きい値です。
よく使う補正がウェイト付けで、標本の構成を母集団に合わせます。計算例:60 歳以上が顧客全体の 40%、標本では 30% なら、ウェイトは 40 ÷ 30 ≈ 1.33、それ以外の人は 60 ÷ 70 ≈ 0.86 です。
ウェイト付けで直せるのは、補正変数(年齢、性別、地域)の構成比の偏りです。直せないのは、同じ層の中での応じる人と応じない人の違いや、台帳にそもそも含まれない人です。代償もあり、ウェイトの差が大きいほど有効標本は小さくなります。上の例では 1,068 件の有効標本が約 1,019 件に減り、変数が多くウェイトが極端なほど誤差は広がります。
概念 7:音声調査での言い回しと順序効果
質問票を「読む」のと「聞く」のとでは、回答者の行動が違います。
これらは人でも AI でも起こりますが、AI は設計を一字一句そのまま繰り返します。良い設計なら全通話が良く、偏った設計なら全通話が偏ります。
コンプライアンスの注意点(台湾)
7 つの概念をまとめると、±3% は標本誤差だけを表します。電話調査が信頼できるかどうかは、カバレッジ・無回答・測定という非標本誤差と、ウェイト付けの代償で決まります。AI 調査員には測定面で明確な統計上の利点があります。同じスクリプトを全通話で逐語に適用して調査員間の差をなくし、各通話の録音と文字起こしを残して、何を聞き何と答えたかを監査できることです。抽出、ウェイト付け、質問票設計は引き続き調査者の仕事です。
関連記事:
よくある質問
電話調査はなぜ有効回答 1,068 件が多いのですか?
信頼水準 95%、想定比率を最も保守的な 0.5、標本誤差 ±3% とすると、n = 1.96² × 0.5 × 0.5 ÷ 0.03² = 1,067.1 となり、切り上げて 1,068 件です。
信頼水準 95% とはどういう意味ですか?
同じ方法で何度も標本を取れば、約 95% の信頼区間が真の値を含むという意味です。今回の区間に 95% の確率で真の値が入るという意味ではありません。
標本誤差 ±3% なら結果は必ず ±3% 以内で正確ですか?
いいえ。±3% は標本誤差だけを、しかも全体の標本についてのみ表します。カバレッジ誤差、無回答バイアス、調査員効果、言い回しによる誤差は含まれず、サブグループの誤差はさらに大きくなります。
AI 電話調査は人の調査員より正確ですか?
AI は標本誤差を変えませんが、全通話で同じスクリプトを逐語で読むため調査員間の差をなくせます。一方、偏ったスクリプトは全通話を偏らせ、音声認識やモード効果の検証も必要です。既存手法と比較してください。
ウェイト付けですべての偏りを補正できますか?
できません。補正できるのは年齢・性別・地域など補正変数の構成比の偏りだけで、同じ層内の回答者と拒否者の違いは直せず、有効標本も小さくなります。
顧客満足度の電話調査は何件あれば足りますか?
必要な精度と比較するサブグループの数によります。信頼水準 95% で ±5% なら約 385 件、±3% なら約 1,068 件。店舗や顧客層ごとに比べるなら、各サブグループにも十分な件数が必要です。

