Pathors
ソリューションガイド2026 年 8 月 28 日

多言語 AI カスタマーサービス完全ガイド:電話音声で方言・英語・中国語・東南アジア言語をどこまで扱えるか

ブランドン・ルー

ブランドン・ルー

COO

多言語 AI カスタマーサービス完全ガイド:電話音声で方言・英語・中国語・東南アジア言語をどこまで扱えるか

多言語 AI カスタマーサービスの難所は翻訳ではなく、音声にあります。 テキスト対応の多言語は「訳が正確かどうか」ですが、音声対応の多言語は「聞き取れるかどうか」です。関西弁や東北弁のなまり、文の途中に混ざるカタカナ英語、敬語とくだけた話し方の切り替わり、高齢のお客様の言い直し。これらは翻訳の問題ではなく、相手が話し始めてから 2 秒以内に判断して話し出さなければならない、リアルタイムの問題です。

この記事では 2 つのことをまとめて扱います。テキストと音声で多言語の何が違うのか、そしてお客様が電話をかけてくる場合、選定でどんな質問をすべきなのか。方言と外来語の混在の実務的な扱い方、単一モデルと言語別パイプラインの構成上の取捨、文化に合わせた語調の設定、そして東南アジア市場に展開する際の言語の優先順位までを扱います。

多言語 AI カスタマーサービスとは?まずテキストと音声を分ける

多言語 AI カスタマーサービスとは、同じ 1 つのサービス基盤で複数の言語のお客様を受け、しかも言語ごとに人員を抱えなくてよい状態を指します。ただしこの一文の難易度は、テキストチャネルと音声チャネルでまったく違います。

中心にある問題翻訳の品質聞き取れるか、自然に話せるか
反応までの時間数秒待てる2 秒以内に判断して話し出す
難しいところ言い回しの現地化、固有名詞なまり、方言、敬語の切り替え、外来語の混在
失敗の見え方訳文が硬い、意味が通らないそのまま聞き違える、答えがずれる
言語を 1 つ足すときほぼ内容制作の仕事内容 + 音声認識 + 音声合成 + 調整

「多言語 AI カスタマーサービス」を扱う記事の多くは、実際にはテキスト対応の話をしています。それ自体は間違いではありませんが、お客様が電話をかけてくるなら、それは別の課題です。

テキストと音声では、多言語の難しさが別物

違いは 3 つの場所にはっきり出ます。

第 1 に、時間の圧力がまったく違います。 テキストなら一文を最後まで読んでから、どの言語で返すか決められます。音声では、相手が話し始めてから 2 秒以内に言語を判断し、その言語ですぐ話し出さなければなりません。判断が遅ければ誰もいないと思われ、判断を誤れば、お客様は自分の分からない言葉を聞かされます。

第 2 に、間違い方が違います。 翻訳が多少ずれても、お客様はたいてい大意をつかめます。聞き違えると、文全体の意味が入れ替わります。「予約を変更したい」が「予約を返金したい」と取られる、「7 時(しちじ)」が「1 時(いちじ)」になる。ここを外すと、その後の応答はすべて的外れになります。

第 3 に、「自然に話せる」は音声だけの関門です。 同じ日本語でも、敬語で話すかくだけた語尾で話すかで、電話越しの専門性の印象はまるで別物になります。地名や店名のアクセントが崩れれば、お客様は最初の一言で違和感に気づきます。テキストにはこの関門がなく、音声にはあります。

結論は単純です。お客様が電話をかけてくるなら、多言語は翻訳品質の確認だけでは足りず、必ず実際の通話でテストしなければなりません。

方言・敬語・外来語の混在をどう扱うか

ここは日本語という言語で最も特有で、しかも正面から語られることの少ない部分です。

英語由来の語の混在は例外ではなく日常です。 お客様は「その件、いったんホールドしてください」「サブスクをキャンセルしたいんですが」「アポをリスケできますか」と話します。カタカナ英語や和製英語は日本語の文の中に自然に入り込みます。音声認識のパイプラインが「英語を検知したら英語モデルへ切り替える」という設計だと、一文の途中で切り替えることはできないため、こうした語は発音の似た別の日本語に押し込まれ、文全体の意味がずれます。正しい対処は、日本語の認識パイプライン自体が、外来語と業界用語を含む実際の話し方に合わせて調整されていることです。

地域方言と話者の幅がもう一段の壁です。 関西弁のイントネーション、東北や九州のなまり、高齢のお客様のゆっくりした間と言い直し、そして敬語とくだけた話し方が混ざる場面。プラットフォームごとの実力差は大きく、仕様表の「日本語対応」は、標準語のはっきりした音声を認識できるという意味にとどまることがよくあります。一通の会話を最後まで支えられることとは別です。現実的な評価は 3 段階で行います。

  • 実際の場面に近い方言・混在表現の録音を 10 本用意する(合成音声は使わない)
  • 認識結果をそのまま確認し、重要な情報(日付、数字、氏名)が何件外れたかを見る
  • 答えられないときの振る舞いを確認する。有人に渡すのか、強引に答えるのか
  • モデルより設計のほうが効きます。 認識精度がどうであれ、重要な情報は必ず 1 回復唱して確認する。聞き取れないときは同じ文を繰り返さず、聞き方を変える。この 2 つを守るだけで、方言やなまりのある場面での実用度は、モデルを入れ替えるより大きく上がります。

    多言語 AI 音声カスタマーサービスの技術構成

    音声で多言語を成立させるには、4 つの層が同時に整っている必要があります。

    層 1:音声認識(ASR)の多言語対応

    最も過小評価されている課題です。音声認識は「言語の版が複数ある」ことではなく、「言語ごとになまりの版が複数ある」ことを扱います。ベトナム語は北部と南部で発音が大きく違います。マレー語とインドネシア語は近い言語ですが、語彙と言い回しには明確な差があります。タイ語は声調言語で、声調の識別精度がそのまま全体の認識性能に効きます。

    良い多言語 ASR は、汎用モデルをそのまま当てるのではなく、言語ごとの現地版に対して個別の調整を行っています。

    層 2:対話 AI の多言語ナレッジベース

    同じ製品知識を、複数の言語で正確に答えられる必要があります。これは翻訳だけの問題ではありません。直訳はその土地の文脈では不自然に響くことがあり、現地に合った言い方が要ります。

    さらに重要なのは、市場によって製品仕様、価格、キャンペーンが違いうることです。ナレッジベースの構造は、「共通の知識」と「市場固有の知識」を階層で管理できる必要があります。

    層 3:音声合成(TTS)の現地化

    お客様が電話で聞くのが「自分の言語を話す外国人の声」なのか「その土地の人の声」なのかで、体験の差は非常に大きくなります。

    質の高い多言語 TTS は、言語ごとに現地で学習された声を使い、話す速さ、抑揚、間の取り方がその言語の自然な習慣に合っている必要があります。

    層 4:言語の自動判定

    お客様は「タイ語で話します」と先に宣言してはくれません。システムは会話の最初の数秒で、相手の第一声から言語を判定し、対応する言語モードへ切り替える必要があります。この判定の速さと正確さが、そのまま第一印象を決めます。

    構成の選択:単一モデルか、言語別パイプラインか

    案 A:汎用の多言語モデル

    1 つの音声認識モデルと 1 つの意味理解でどの言語も処理します。保守は簡単ですが、資源の少ない言語では精度が落ちます。

    案 B:言語別パイプライン

    まず言語を判定し、言語ごとに専用の認識・理解・合成のパイプラインへ振り分けます。精度は高くなりますが、基盤は複雑になります。

    実務上の折衷案

    多くの本番環境はハイブリッド構成を採ります。前段に軽量な言語判定を置き、その後ろに言語ごとに最適化されたモデルを並べる形です。対話のロジックと業務ルールは共通のまま保ち、専用化するのは音声と言語の層だけにします。 ここは要点で、言語ごとにフローを書き直す設計だと、言語が増えるほど保守コストが制御不能になります。

    精度主要言語は可、少数言語は低下最も高い高い
    保守コスト低い高い中程度
    言語を 1 つ足す速い遅い中程度
    外来語の混在安定しない追加対応が必要主言語に合わせて調整可能

    文化に合った応対

    そのまま翻訳するだけでは足りません。日本のお客様は敬語を期待し、台湾のお客様は温かさと辛抱強さを期待し、米国のお客様は効率と簡潔さを期待します。AI の人格設定は、言葉を訳すだけでなく、文化的な規範に合わせる必要があります。

    実務ではこれが具体的な形で現れます。日本語の応答は既定で敬語と適切な謙譲表現を使う。中国語の応答は台湾の口語習慣に合わせる。英語の応答は簡潔で直接的にし、社交辞令を減らす。こうした設定は、同じ原稿を 4 回訳したものではなく、言語ごとに 1 つずつ用意された語調の設定ファイルであるべきです。

    東南アジア市場に展開する企業の言語導入の優先順位

    東南アジアへの進出を進めている、あるいは計画している企業に向けて、推奨する言語の導入順は次のとおりです。

    第 1 優先:英語。 東南アジアのほぼすべての国で商談の窓口は英語を使い、しかも英語は音声認識・音声合成の成熟度が最も高い言語です。まず 1 言語だけ足すなら英語です。

    第 2 優先:タイ語。 タイは台湾企業にとって東南アジアで最も基盤の整った市場の 1 つであり、タイ語圏のお客様は電話の利用習慣も比較的強く残っています。

    第 3 優先:ベトナム語。 ベトナムは東南アジアで最も成長の速い製造・消費市場で、ベトナム語の音声 AI の成熟度も急速に上がっています。

    第 4 優先:マレー語/インドネシア語。 この 2 つは相互理解度が高く、まとめて計画できます。マレーシアとインドネシアという 2 つの大きな市場を同時に覆えます。

    多言語対応の運用面の 3 つの課題

    多言語展開で見落とされやすいのは立ち上げではなく、稼働後の運用です。

    ナレッジベースの同期:本社の製品更新があったとき、すべての言語のナレッジベースを同時に更新するにはどうするか。推奨する構成は、主となるナレッジベースを 1 つ持ち、AI 支援で各言語版へ翻訳し、現地言語のレビュー担当が現地化の品質を確認する形です。

    品質のモニタリング:自社の品質管理チームに、タイ語の通話品質を審査する力はありますか。ないのであれば、言語市場ごとに現地言語の品質監視の仕組みを置くか、AI 支援の多言語対話品質評価ツールを導入する必要があります。

    スクリプトの改善:多言語の対話スクリプトの改善には、その言語ができる人の関与が要ります。言語ごとに現地の「スクリプト担当者」という役割を置くことが、長期的なサービス品質を保つ鍵になります。

    多言語 AI カスタマーサービスのツールをどう選ぶか

    市場のツールはチャネルで 3 つに分かれ、できることの境界がかなり違います。

    タイプ代表的なやり方多言語の強み弱み
    テキスト型カスタマーサービス基盤LINE や公式サイトのチャットボット、SNS の自動応答内容の翻訳とテンプレート管理が成熟電話音声はほぼ扱えない
    ナレッジベース型 AI アシスタント文書検索型の質問応答多言語の文書検索、回答の一貫性音声チャネルがなく、リアルタイムの会話ができない
    音声型 AI カスタマーサービス電話の着信と発信なまり、方言、リアルタイムの言語判定、語調の現地化構築に調整が要り、言語追加のコストが高め

    選定はこの順で質問するのがおすすめです。

  • お客様は主にどのチャネルから来ますか。 メッセージ中心ならテキスト型から、電話中心なら音声型を直接見ます。
  • 言語は「読めればよい」のか「話せなければならない」のか。 前者は翻訳の問題、後者は音声の問題です。
  • 言語を 1 つ足すコストは何ですか。 初期費用を再度取られるか、フローを書き直す必要があるかを確認します。
  • 実際の通話でテストできますか。 なまりや外来語の混在を検証できる方法はこれだけです。
  • 答えられないときの振る舞いは何ですか。 多言語の場面では、強引に答えるより正直に有人へ渡すことのほうがはるかに重要です。
  • Pathors の多言語対応

    Pathors の音声 AI プラットフォームは現在、日本語(敬語と外来語の混在に合わせた調整を含む)、繁体字中国語(台湾アクセントと英語混在の調整を含む)、英語、そしてタイ語・ベトナム語などの東南アジア言語に対応しており、対応言語を継続的に広げています。

    構成はハイブリッド型です。前段に軽量な言語判定を置き、発信者が話し始めてから 2 秒以内に言語を判断して対応するパイプラインへ振り分けます。業務ルール、フロー、API 連携は一度定義すれば全言語で共通に使えます。語調の設定ファイルは言語ごとに独立していて、日本語は既定で敬語、中国語は台湾の口語スタイル、英語は明快で直接的な話し方になります。

    多言語展開が必要な企業に対して Pathors が提供するのはプラットフォームだけではありません。多言語ナレッジベースの構造設計、現地化した声の選定と調整、言語をまたいだ対話品質の監視の枠組み、そして言語拡張を段階的に進める導入計画までを含みます。

    多言語対応の本質にある問いは、「人員コストを言語の数だけ増やさずに、複数の言語市場へ一貫した品質のサービスを届けるにはどうするか」です。テキストチャネルではこの問いはほぼ解かれました。電話音声では、まともな答えが出始めたばかりです。

    お客様が電話をかけてくるなら、選定で覚えておくことは 3 つだけです。仕様表ではなく実際の通話でテストすること、言語を 1 つ足すときのコスト構造を確認すること、そして答えられないときに正直に有人へ渡すかどうかを確認すること。新しい市場へ入る速度が、その言語ができる人材の採用速度に縛られる必要はありません。

    あわせて読む:電話 AI 完全ガイド、宿泊業の AI カスタマーサービスはどう選ぶか、中国語音声認識の実際の課題。

    よくある質問

    AI カスタマーサービスはどの言語に対応できますか?

    音声型 AI カスタマーサービスで現在いちばん成熟しているのは、日本語、英語、繁体字中国語(台湾アクセントを含む)、韓国語です。東南アジアの言語ではタイ語とベトナム語の成熟度が急速に上がっており、マレー語とインドネシア語はまとめて計画できます。注意したいのは、仕様表の「対応」がたいてい「認識できる」という意味にとどまり、実際の通話品質で使えることを意味しない点です。評価は実際の録音で行ってください。

    お客様が関西弁や強いなまりで話しても聞き取れますか?

    ある程度は聞き取れますが、プラットフォームごとの差が大きく、仕様表の「日本語対応」はたいてい標準語のはっきりした音声しか含みません。一通の会話を最後まで支えられることとは別です。現実的な検証方法は、実際の場面に近い関西弁・東北弁・高齢話者の録音を 10 本用意し(合成音声は使わない)、認識結果をそのまま見て、日付・数字・氏名といった重要情報が何件外れたかを数えることです。そしてモデルそのものより設計のほうが効きます。重要な情報は必ず復唱して確認し、聞き取れないときは聞き方を変え、答えられないときは有人に渡す。この 3 つを守ってください。

    音声とテキストで、多言語対応は何が違いますか?

    違いは 3 つです。第 1 は時間で、テキストは一文を読み切ってから返せますが、音声は 2 秒以内に言語を判断して話し出す必要があります。第 2 は間違い方で、翻訳のずれは大意が伝わりますが、聞き違えると文の意味そのものが入れ替わります。第 3 は「自然に話せるか」で、同じ日本語でも敬語かどうかで電話越しの専門性の印象はまったく変わります。テキストにはこの関門がありません。だから音声の多言語は、原稿を読んで確認するのではなく、実際の通話で検証する必要があります。

    多言語対応では、言語ごとに別のナレッジベースを作る必要がありますか?

    言語ごとに別々に作るのではなく、階層で持つことをおすすめします。共通の知識(製品仕様、規定、手順)は主となるナレッジベースを 1 つ維持し、AI 支援で各言語版へ翻訳したうえで、現地言語のレビュー担当が確認します。市場固有の知識(現地の価格、キャンペーン、規制の違い)だけを別の階層で管理します。業務ルールと対話フローは一度だけ定義して全言語で共有すべきです。言語を足すたびにフローを書き直す設計では、保守コストが言語数に比例して制御不能になります。

    多言語の音声カスタマーサービスの導入にはどれくらいかかりますか?費用は倍になりますか?

    1 言語の導入は通常 4〜6 週間に収まります。言語を 1 つ増やすときに主に増えるのは、ナレッジベースの現地化と、声の選定・調整にかかる時間で、実務では 1〜2 週間程度です。最初からやり直しになるわけではありません。費用面では 3 点を必ず確認してください。言語追加で初期費用を再度取られるか、月額が言語数で課金されるか、そしてフローを書き直す必要があるか。対話ロジックを共通化した構成なら、2 言語目以降の追加コストははっきり下がります。

    ブランドン・ルー

    ブランドン・ルー

    COO

    AI テクノロジーを活用して顧客サービスとビジネス運営を変革することに情熱を注いでいます。

    もっと記事を読む

    重要な会話をすべて自動化。