「有效樣本 1,068 份,95% 信心水準下抽樣誤差 ±3%」——從客戶滿意度調查、市場調查到民調,這行字常出現在電話調查報告上,但真正看懂它的人不多。當訪員從真人換成 AI,這些統計觀念不會變,反而更重要:AI 電訪改變的是誤差的來源與形狀,不是統計的規則。
這篇是一份教學。我們把做 AI 電訪、規劃電訪問卷前必須懂的 7 個觀念,各配一個商業調查的算例講清楚。看完你應該能判斷一份電訪調查報告的數字可信到什麼程度。
觀念 1:信心水準與抽樣誤差——1,068 從哪裡來
估計一個比例(例如「滿意」的比例)時,簡單隨機抽樣所需的樣本數是:
n = z² × p(1−p) ÷ e²
算例:95% 信心水準、p = 0.5、e = 0.03,n = 1.96² × 0.25 ÷ 0.0009 = 1,067.1,進位得 1,068。
「95% 信心水準」的意思是:如果用同樣方法重複抽樣很多次,約 95% 的區間會涵蓋真值。它不是「真值有 95% 機率落在這個區間」,也不保證這一次一定涵蓋。若要 99% 信心水準、同樣 ±3%,樣本要增加到約 1,844 份。
另外,±3% 是 p = 0.5 時的最大值。若某題結果是 10%,同樣 1,068 份的誤差約 ±1.8%。
觀念 2:樣本數表與子群誤差
| 樣本數 | 最大抽樣誤差(95% 信心水準) |
|---|---|
| 100 | ±9.8% |
| 200 | ±6.9% |
| 300 | ±5.7% |
| 500 | ±4.4% |
| 1,068 | ±3.0% |
| 1,500 | ±2.5% |
| 2,401 | ±2.0% |
兩個重點:誤差與樣本數的平方根成反比,誤差減半要四倍樣本;以及±3% 只屬於全體樣本。
算例:一份 1,068 份的客戶滿意度電訪中,「近一年新客戶」只有 200 人,這個子群的誤差約 ±6.9%。若報告說「新客戶滿意度 52%、全體 48%」,這 4 個百分點的差距其實落在子群誤差範圍內,不能直接下結論說新客戶比較滿意。
觀念 3:完訪率——為什麼要撥多出好幾倍的號碼
1,068 是完訪數,不是撥號數。常用的漏斗指標有:接觸率(有效號碼中接觸到受訪者的比例)、合作率(接觸到的合格者中完成訪問的比例)、回應率(完訪數相對全部合格樣本的比例)。國際上常用美國民意研究學會 AAPOR 的「標準定義」計算。
算例(示意,比率為說明而假設,非業界統計):
| 階段 | 假設比率 | 號碼數 |
|---|---|---|
| 撥出號碼 | — | 12,715 |
| 有效號碼 | 70% | 約 8,900 |
| 接觸到合格受訪者 | 40% | 約 3,560 |
| 完成訪問 | 30% | 約 1,068 |
這組假設下,每份完訪要撥約 12 個號碼,還不含重撥。回應率低本身不等於結果錯,但它打開了下一個問題:沒回答的人,跟回答的人一樣嗎?
觀念 4:抽樣誤差 vs 非抽樣誤差
抽樣誤差是「只訪問一部分人」造成的隨機誤差,可以用公式算、會隨樣本變大而縮小。非抽樣誤差則是系統性的,加大樣本也不會消失:
| 類型 | 白話 | 例子 |
|---|---|---|
| 涵蓋誤差 | 底冊裡沒有某些人 | 只撥市話,漏掉只用手機的人 |
| 無反應誤差 | 回答的人和拒訪的人不同 | 忙碌的上班族較少完訪 |
| 測量誤差 | 答案沒有反映真實想法 | 訪員語氣、題目措辭、聽錯記錯 |
| 處理誤差 | 資料整理出錯 | 手動登錄、編碼錯誤 |
報告上的 ±3% 只涵蓋第一種。兩份同主題的調查差了 8 個百分點,原因通常在這張表裡。
觀念 5:訪員效應——AI 當訪員時,什麼改變了
不同訪員問同一份問卷,答案會因訪員而系統性不同,這叫訪員效應。統計上可以用訪員內相關係數 ρ 衡量,它會放大變異:
設計效應 ≈ 1 + ρ ×(每位訪員的平均完訪數 − 1)
算例:20 位訪員分攤 1,068 份(每人約 53 份),假設 ρ = 0.01(示意值),設計效應 ≈ 1 + 0.01 × 52 = 1.52。等效樣本只剩約 701 份,誤差從 ±3.0% 擴大到約 ±3.7%——報告上卻仍寫 ±3%。
當訪員是 AI,每一通都用同樣的措辭、語氣與速度逐字念題,訪員之間的差異這一項就消失了。這是統計性質,不是行銷說法:措辭一致,代表測量條件一致。
但要看清楚另一面:所有通話共用同一個「訪員」,若腳本本身有引導性,偏差不會互相抵銷,而是一致地套用在每一通。換句話說,AI 把「訪員變異」轉成了「腳本是否中立」的問題,所以試訪與題目審查更重要。語音辨識聽錯,以及受訪者面對機器作答方式不同(模式效應),也屬於這一類需要驗證的測量誤差。
觀念 6:無反應偏差與加權——加權能修什麼、修不了什麼
無反應偏差約等於:無反應比例 × 回答者與未回答者的差距。
算例:回應率 30%,回答者中 60% 滿意、未回答者其實只有 50% 滿意。真值 = 0.3 × 60% + 0.7 × 50% = 53%,報告卻寫 60%,偏差 7 個百分點,遠大於 ±3%。
加權是常見的修正方法:讓樣本結構對齊母體。算例:母體中 60 歲以上占 40%,樣本只有 30%,這群人的權重 = 40 ÷ 30 ≈ 1.33;其餘的人權重 = 60 ÷ 70 ≈ 0.86。
加權能修的是加權變數(年齡、性別、地區)上的比例失衡;修不了的是同一年齡層內「願意受訪的人」與「不願意的人」想法不同,以及底冊完全沒涵蓋到的人。加權還有代價:權重差異越大,等效樣本越小。上面這組權重會讓 1,068 份的等效樣本降到約 1,019 份;加權變數越多、權重越懸殊,誤差放大越明顯。
觀念 7:題目措辭與順序效應(語音問卷特別要注意)
用聽的問卷和用看的問卷,受訪者行為不同:
這些效應不分真人或 AI 訪員都存在,但 AI 會一字不差地重複你的設計——設計好,每一通都好;設計有偏,每一通都偏。
合規小提醒
把 7 個觀念串起來:±3% 只描述抽樣誤差;真正決定一份電訪可不可信的,是涵蓋、無反應與測量這些非抽樣誤差,以及加權的代價。AI 訪員在測量這一環有一個明確的統計優勢:它能把同一份腳本一字不差地套用到每一通,消除訪員之間的差異;同時保留每一通的錄音與逐字稿,讓問了什麼、答了什麼都能回頭稽核。抽樣、加權與問卷設計,仍然是研究者的工作。
延伸閱讀:
常見問題
電話調查為什麼常常是 1,068 份有效樣本?
在 95% 信心水準、預期比例取最保守的 0.5、可接受抽樣誤差 ±3% 時,n = 1.96² × 0.5 × 0.5 ÷ 0.03² = 1,067.1,進位後就是 1,068 份。
95% 信心水準是什麼意思?
意思是用同樣方法重複抽樣很多次,約 95% 的信賴區間會涵蓋真值;不是「這次的真值有 95% 機率落在區間內」。
抽樣誤差 ±3% 代表結果一定準確到 ±3% 嗎?
不是。±3% 只涵蓋抽樣誤差,且只適用全體樣本;涵蓋誤差、無反應偏差、訪員效應與題目措辭造成的誤差都不包含在內,子群的誤差也更大。
AI 電訪會比真人電訪更準嗎?
AI 不改變抽樣誤差,但每通逐字念同一份腳本,可消除訪員之間的差異;代價是腳本若有偏差會一致套用到每一通,且需驗證語音辨識與模式效應。建議與既有方法對照。
加權可以修正所有偏差嗎?
不行。加權只能修正加權變數(如年齡、性別、地區)上的比例失衡,修不了同一群體內受訪者與拒訪者的差異,也會讓等效樣本變小、誤差變大。
滿意度電訪調查要做幾份樣本才夠?
看你要的精準度與要拆幾個子群。95% 信心水準下,誤差 ±5% 約需 385 份、±3% 約需 1,068 份;若要比較各分店或各客群,每個子群本身也要有足夠樣本,否則子群誤差會很大。

