"AI가 전화를 받는다고 하면 고객이 '이거 뭐야?' 하고 바로 끊어버리는 거 아닐까요?" 이런 걱정, 한 번쯤 해보셨을 겁니다. 예전에 자동응답 전화(ARS)를 쓰다가 고객한테 불만을 들어본 경험이 있다면 더욱 그럴 수 있어요.
예전 ARS와 지금 전화 AI는 어떻게 다를까요?
예전 ARS는 미리 녹음된 목소리를 재생하는 방식이었어요. 마치 테이프를 틀어놓은 것처럼, 정해진 말만 반복했죠. 고객이 "잠깐, 그게 아니고요—" 해도 전화기는 이미 다음 문장으로 넘어가 있었습니다. 이게 바로 고객이 짜증을 냈던 이유예요.
지금의 전화 AI는 구조 자체가 다릅니다. 핵심은 두 가지 기술입니다.
- STT(Speech-to-Text) — 고객이 말하면 그 목소리를 실시간으로 글자로 바꿉니다. 받아쓰기 기계라고 생각하면 쉬워요.
- TTS(Text-to-Speech) — AI가 답변을 정하면, 그걸 사람 목소리처럼 읽어줍니다. 단순히 저장된 음성을 재생하는 게 아니라, 문장을 그 자리에서 '합성'해서 말하는 거예요.
이 두 기술이 연결되면, AI는 고객이 방금 한 말을 듣고 → 이해하고 → 그 말에 맞는 대답을 바로 말해줄 수 있습니다. 대화가 흘러가는 방향이 고객의 말에 따라 달라지는 거죠.
목소리가 '어색하게' 들리지 않으려면?
TTS 기술이 발전하면서 요즘 AI 목소리는 높낮이, 쉬는 타이밍, 강조 방식이 실제 사람과 꽤 비슷해졌습니다. 물론 전문가가 들으면 차이를 느낄 수 있지만, 일상적인 안내 전화 수준에서는 대부분의 고객이 크게 어색함을 느끼지 않아요.
더 중요한 건 이겁니다. 고객이 AI인지 사람인지를 따지기 전에, '내 말을 제대로 알아들었나?'를 먼저 느낍니다. 말을 끊지 않고, 엉뚱한 답을 하지 않고, 내가 원하는 방향으로 대화가 흘러가면 — 고객은 그냥 '전화 잘 된다'고 느낍니다.
이 대화처럼, AI가 고객의 말을 끊지 않고 자연스럽게 이어받으면 고객은 '어, AI네' 보다 '아, 빠르네'를 먼저 느낍니다. 전화 AI의 자연스러움은 목소리 품질만의 문제가 아니라, 대화의 흐름이 끊기지 않는 것에서 옵니다.
처음엔 낯설게 느껴질 수 있지만, 원리를 알고 나면 오히려 '이게 더 빠르고 정확하겠구나' 싶어지실 거예요.