試打電話 AI,不要只說「你好」。用同一套 10 題的腳本打:三題測聽不聽得懂(台灣國語腔、中英夾雜、回讀數字)、兩題測對話能力(打斷、一句話兩件事)、兩題測它查的是真實資料還是背稿、一題測轉真人、一題測情緒與沉默、最後一題看有沒有紀錄。一通三分鐘的電話,就能看出兩套系統八成的差異。
廠商的示範專線是你能拿到最誠實的資訊,但它只對「知道要問什麼」的人誠實。太多決策者打進去,聽到一個好聽的聲音說「您好,很高興為您服務」,覺得不錯就選了那家;三個月後上線,才發現它聽不懂櫃檯阿姨的台語、客人一打斷就亂掉、問到庫存就開始編。
這篇給你一套可以直接照念的腳本:每題在測哪項能力、好的回答像什麼、警訊像什麼,打完再用一張評分表讓兩家廠商用同一把尺比。
先講結論:三分鐘看八成,前提是你知道要問什麼
一套電話 AI 好不好,最終看四件事:聽不聽得懂、對話會不會亂、答案是查來的還是編的、接不住時會不會好好交給人。這四件事在示範專線上都測得到,不需要技術背景,只需要一份腳本。建議把下表開在手機上,邊打邊勾。
| 題號 | 你要說的話 | 在測什麼 | 好的表現 | 警訊 |
|---|---|---|---|---|
| 1 | 平常語速、夾一點台語:「恁遐今仔日有開無?」 | 台灣國語腔、台語夾雜 | 聽懂,用國語自然回答 | 「請再說一次」超過兩次,或答非所問 |
| 2 | 「我要問 iPhone 17 Pro 維修,還有 AirPods 的 case 壞了」 | 中英夾雜、品牌型號 | 正確複述型號 | 型號聽錯沒確認,或直接略過 |
| 3 | 「電話 0912-345-678,訂單 A2026-0829,你唸一次給我聽」 | 數字串辨識與回讀 | 逐字正確回讀,錯了可更正 | 唸錯不自知,或不肯回讀 |
| 4 | 它講到一半時插話:「等等,我不是要問這個」 | 打斷處理(barge-in) | 立刻停下來聽你講 | 唸完稿才理你,或兩個聲音疊在一起 |
| 5 | 「我要改時間,順便問一下有沒有停車位」 | 一句話多意圖 | 兩件都處理,或說明先處理哪件 | 第二件事消失 |
| 6 | 「今天下午三點還有位子嗎?」(換成你這行的即時庫存) | 是否查真實系統 | 有查詢動作,答案有具體內容 | 秒回「有」,問哪個時段都有 |
| 7 | 知識庫外的題目:「你們老闆姓什麼?」 | 面對未知會不會編 | 誠實說沒有資料,提供替代方案 | 自信地給一個答案 |
| 8 | 「我要找真人」 | 轉接與交接 | 說明會轉接、先摘要、真人不用你重講 | 轉不了,或真人問「請問有什麼事」 |
| 9 | 不耐煩的語氣,然後沉默五秒 | 情緒與異常處理 | 語氣放軟、主動確認你還在線 | 無視情緒;沉默後直接掛斷 |
| 10 | 掛斷後問廠商:「剛才那通的紀錄在哪?」 | 通話紀錄與可視性 | 幾分鐘內看到摘要、逐字稿、寫進了哪個系統 | 拿不出來,或只有錄音檔 |
第 1–3 題:它聽得懂嗎
語音辨識是電話 AI 的地基,地基歪了上面全部白搭。台灣的來電有三個特別難的點:腔調、夾雜、數字。
第 1 題:台灣國語腔與台語夾雜
用你平常打給店家的方式講,不要字正腔圓;會台語就夾一兩句,或請一位年長的同事、家人打。這在測辨識模型有沒有針對台灣口音與國台語混講調校過,因為你的客人不會用標準國語跟它講話。
好的表現是它聽懂「今天有沒有營業」並自然回答;沒完全聽懂時,會複述它理解的部分讓你確認。警訊是連續兩次以上「請再說一次」,或者它自信地回答了一個不相干的問題。後者更危險,上線後它會用同樣的自信誤答你的客人。
第 2 題:中英夾雜的品牌名與型號
用你這行真實會出現的產品名:3C 業是「iPhone 17 Pro」「AirPods 的 case」,診所是「約 PRP 和 HIFU」。測的是中英混講時,英文詞會不會被拆成怪音、型號的數字與字母會不會掉。
好的表現是它在回覆裡正確複述型號,甚至追問「17 Pro 還是 17 Pro Max?」警訊是型號聽錯但沒確認就往下走,或完全跳過型號只回「好的,維修的話⋯⋯」。
第 3 題:報一串數字請它回讀
「我的電話是 0912-345-678,訂單編號 A2026-0829,你唸一次給我聽。」電話號碼、訂單號、身分證末四碼是電話客服最常出錯也最不能出錯的資料,「回讀」也在測它有沒有被設計成會主動確認關鍵資料。
好的表現是逐字正確回讀,你更正時只改錯的那段。以 Pathors 的經驗,好的系統會把「一」「七」「四」「十」這類容易混淆的音放慢唸清楚。警訊是唸錯了沒請你確認,或回「已經記下了」卻不肯唸出來,上線後你永遠不知道它記的對不對。
第 4–5 題:對話能力,不是問答能力
聽得懂單句和能跟人「對話」差很多。真實來電的人會打斷、會跳題、會一句話講兩件事。
第 4 題:中途打斷它
等它開始講一段較長的說明(營業時間、服務項目)時,直接插話:「等等,我不是要問這個。」業界叫 barge-in,白話講就是它會不會讓步。
好的表現是你開口後約一秒內它就停下來聽,更好的是接得上:「好的,那您想問的是?」警訊是它把稿唸完才理你,或兩個聲音疊在一起、內容亂掉。這種系統上線後最常見的客訴就是「它一直講、都不聽我說」。
第 5 題:一句話講兩件事
「我要改時間,然後順便問一下你們有沒有停車位。」一句話兩個意圖,它能不能都接住。這其實在測它背後是 LLM 在理解語意,還是舊式的關鍵字比對。
好的表現是兩件事都處理:先改時間,處理完主動說「另外您剛才問停車⋯⋯」,或一開始就說「我先幫您改時間,等一下再說停車」。警訊是停車那件事就這樣消失,你不再問它就不會回來。
第 6–7 題:查真實資料,還是背稿
這是示範專線最容易「作弊」的地方。一套只會背稿的系統,聲音再自然,本質上還是一台會講話的 FAQ 錄音機。
第 6 題:問一個必須查系統才知道的問題
問這一行的即時庫存:餐廳是「今天下午三點還有位子嗎」,診所是「王醫師明天早上還有號嗎」,旅宿是「這週六雙人房還有幾間」。測它有沒有真的串到訂位、掛號或房態系統。這是電話 AI 和按鍵式 IVR 最根本的差別:把事情當場辦完,而不是把人分流到別的地方。
好的表現是有一個明顯的查詢動作(「我幫您查一下」,停頓半秒到一秒),然後給有具體內容的結果:「三點有,三點半就滿了。」換個時段再問,答案應該不一樣。警訊是秒回「有的,歡迎您來」,連問三個時段都「有」,那它根本沒查。廠商若說「示範專線沒串資料」,請他們至少用測試資料庫示範查詢動作。
第 7 題:問一個知識庫外的問題
找一個它不可能有資料的問題:「你們老闆姓什麼?」或故意用錯誤前提:「你們不是有送免費停車三小時嗎?」(實際上沒有)。測的是面對不知道的事,它是誠實承認還是自信地編。研究指出約 25% 的自然提問含有錯誤前提、超過 50% 有歧義(來源),真實客人有一大部分的問題,本來就是它「不該直接回答」的。
好的表現是「這部分我沒有資料,可以幫您轉給店裡確認」,或「我們沒有免費停車三小時,目前的規則是⋯⋯」。糾正錯誤前提比回答問題更重要。警訊是它給了一個答案,任何答案都是警訊:「老闆姓陳」「對,停車三小時免費」,上線後就是客訴與賠償的來源。怎麼從知識庫設計避免這件事,見電話 AI 知識庫怎麼建。
第 8 題:要求轉真人
「我要找真人。」不用給理由,它問為什麼就說「我就是想跟人講」。測三件事:轉不轉得了(有些示範專線根本沒接轉接);轉之前有沒有先摘要(「我會把您剛才的改時間和停車問題一起轉給同事」);轉過去之後,你要不要重講一次。
好的表現是它不勸退、直接說會轉接、簡短說明會帶什麼資訊過去,接起來的真人已經知道你是誰、要幹嘛;示範專線沒有真人接聽時,它應該說明真人不在線怎麼處理(留言、回撥)。警訊是它反覆問「請問我可以幫您什麼」試圖留住你,或真人第一句是「您好,請問有什麼事?」那前面三分鐘就白講了。轉真人的設計是一整個題目,見人機協作:電話 AI 轉真人怎麼設計。
第 9 題:情緒與異常
分兩段。先用明顯不耐煩的語氣講:「我已經打第三次了,到底可不可以處理?」然後在它問你問題時,故意沉默五秒。不耐煩測的是它會不會偵測語氣並調整;沉默測的是異常處理,真實通話裡客人會分心、被小孩打斷、在翻找資料。
好的表現是面對不耐煩時用詞變短、先道歉再直接處理;面對沉默,三到五秒後主動確認「請問您還在線上嗎?」,再沉默一陣才說明會怎麼結束通話。警訊是對語氣完全無感、繼續唸一樣的稿,或沉默五秒後一句話都沒有就掛斷,客人會以為系統壞了。
第 10 題:結束之後,有沒有紀錄
掛掉後問廠商:「剛才那通的紀錄在哪?我可以看嗎?」電話 AI 最被低估的價值是每一通都有紀錄:摘要、逐字稿、辨識出的意圖、寫進了哪個系統(CRM、訂位表、工單)。這決定你上線後能不能管理它、改善它。
好的表現是廠商幾分鐘內打開後台給你看:逐字稿、AI 摘要、你報的電話與訂單號有沒有正確被抓成欄位。警訊是拿不出來、要「之後寄給你」、或只有一個錄音檔。沒有結構化紀錄,等於上線後你看不到它每天在跟客人說什麼。
打完之後怎麼評分
十題打完,用同一張表評。每題 0、1、2 分:
| 分數區間 | 建議 |
|---|---|
| 16–20 分 | 進下一步:拿你自己的真實 FAQ 與資料做 POC |
| 11–15 分 | 有基礎,但列出 0 分的題目,要求廠商說明是產品限制還是示範環境限制 |
| 10 分以下 | 不建議繼續,除非那幾個 0 分都是「示範環境沒串資料」這類可驗證的理由 |
兩條規則比總分更重要。第一,第 6 與第 7 題任一題 0 分,直接視為不及格:聽不清楚可以調,會編答案的系統上線就是風險。第二,同一套系統請三個不同的人各打一次:老闆、櫃檯或客服、一個完全不懂的家人。三個人分數差很多,通常表示這套系統只對「講得好的人」友善,而你的客人是一般人。
測試時常見的誤判
多數評估失誤不是廠商騙人,而是測的人自己踩到這幾個坑:
示範專線是免費的,三分鐘也很短。差別只在於你打進去的時候,手上有沒有這十題。同一套腳本打兩家、用同一張評分表比,會比看十份簡報更接近真相。
如果你還在釐清電話 AI 到底能做什麼、費用怎麼算,先看電話 AI 是什麼?2026 完整指南;如果第 6、7 題讓你在意「它到底根據什麼在回答」,電話 AI 知識庫怎麼建會把那一層講清楚。
這份腳本當然也適用於 Pathors。歡迎到 AI 電話客服頁面實際打一通,用這十題來試。
常見問題
試打電話 AI 一通要打多久?
三到五分鐘。十題照順序問完大約三分鐘,加上你臨時想追問的,五分鐘內一定結束。建議不要一次打太久,反而應該分成不同時段多打幾次,因為語音系統有隨機性,同一題兩次的結果可能不同。
要用什麼手機或電話打才準?
用你的客人最可能用的方式打:一般手機、開擴音、在有點吵的環境。不要用耳機在安靜的會議室打,那是最理想的條件,測不出真實表現。可以的話也用一支市話打一次,因為市話的音質壓縮方式跟手機不同。
可以測台語嗎?
可以,而且應該測。台灣有相當比例的來電是國台語夾雜,尤其在餐飲、診所、傳產。第 1 題就是為此設計的。如果廠商說「台語還在開發中」,請他們明確講會不會支援、什麼時候支援,並寫進合約。不要接受「大概可以」。
廠商的示範專線跟正式上線後會一樣嗎?
不會完全一樣,差別主要在資料。示範專線通常用假資料或沒串資料,正式上線會接你的訂位、CRM、知識庫。所以第 6、7、10 題在示範專線上看到的是「能力」,正式上線後要用你自己的資料再驗一次。辨識、打斷、轉接這些能力,示範與正式通常一致。
同一套系統要打幾次?
至少三次,由三個不同的人打:老闆、第一線同事、一個完全不懂的人。加上不同時段(上午、中午尖峰、晚上)各一次更好。三個人的分數如果差距很大,表示它對口音或講話方式很挑,這比平均分數更重要。
兩家廠商怎麼比較?
用同一套十題、同一批人、同一週打,然後把兩張評分表並排。先看第 6、7 題有沒有 0 分,再看總分,最後看三個人之間的分數落差。分數接近時,用第 10 題的後台決勝:哪一家的紀錄讓你看得懂、能直接拿來改善,那家上線後比較好管。

