Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations
이 논문은 음성 전사 오류가 토큰 구조를 방해하고 추론을 저해함으로써 LLM의 성능을 심각하게 저하시우는 반면 키보드 오타는 더 쉽게 흡수된다는 것을 보여주는 섭동 제품군인 HIVE를 소개하며, 이는 원래의 토큰을 보존하는 것이 견고성에 결정적이라는 점과 표준 훈련이나 사고 예산이 음성 특유의 취약성을 완전히 완화하는 데 실패한다는 점을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 이야기를 쓰고, 수학 문제를 풀고, 컴퓨터 코드를 작성할 수 있는 아주 똑똑한 로봇과 대화하고 있다고 상상해 보세요. 이 로봇은 거대 언어 모델(Large Language Model), 줄여서 LLM이라고 불립니다. 오랫동안 우리는 키보드로 글자를 입력하여, 마치 문자 메시지를 보내는 것처럼 이 로봇들과 대화해 왔습니다. 하지만 이제 우리는 친구와 대화하는 것처럼 목소리로 직접 로봇에게 말을 걸 수도 있습니다. 여기서 중요한 질문은, 우리가 '어떻게' 말하느냐가 중요할까요?
글을 타이핑할 때는 손가락이 미끄러져서 엉뚱한 글자를 누르거나, 스페이스 바를 누르는 것을 잊어버리는 것 같은 작은 실수를 할 수 있습니다. 반면 말을 할 때는 로봇이 당신의 목소리를 듣고, 이를 텍스트로 변환한 뒤, 그 내용을 읽어야 합니다. 이 과정은 엉망이 될 수 있습니다. 당신의 목소리에 "음...", "아..." 같은 추임새가 들어갈 수도 있고, 컴퓨터가 단어를 비슷한 발음의 다른 단어로 잘못 알아들을 수도 있습니다(예를 들어 "their"를 "there"로 듣는 경우). 더 심각한 것은, 어떤 똑똑한 도구들은 로봇에게 문장을 보내기 전에 당신의 말을 "정리"하여 더 격식 있는 문장으로 다시 쓰기도 한다는 점입니다. 과학자들은 이 엉성한 입력값들이 로봇을 혼란스럽게 만드는지, 아니면 로봇이 이를 감당할 만큼 강인한지를 알고 싶었습니다. 그들은 타이핑이 나을지 혹은 말하는 것이 나을지, 그리고 어떤 종류의 실수가 로봇의 두뇌를 고장 내는지 알아내고자 했습니다.
이를 알아내기 위해 연구진은 HIVE(Human Input-Variation Engine)라는 특별한 테스트 기계를 만들었습니다. HIVE를 완벽한 질문을 가져다가 의도적으로 아주 구체적인 방식으로 망가뜨리는 거대한 "오류 공장"이라고 생각해보세요. 그들은 두 가지 종류의 엉망인 상태를 만들었습니다. 하나는 서투른 타이피스트처럼 보이는 것(QWERTY 키보드 오류)이고, 다른 하나는 음성 녹음기에서 나온 지저분한 전사 기록처럼 보이는 것(음성 오류)입니다. 그런 다음 이 엉망이 된 질문들을 다섯 대의 똑똑한 로봇에게 입력하고 어떤 일이 일어나는지 관찰했습니다.
그 결과는 다음과 같으며, 다소 놀랍습니다.
1. 말하기는 로봇에게 "하드 모드"입니다
사람들이 로봇에게 말을 할 때, 로봇은 타이핑을 할 때보다 훨씬 더 자주 혼란에 빠집니다. 하지만 이는 "음...", "아..." 같은 추임새(필러) 때문이 아닙니다. 진짜 문제는 당신의 말이 어떻게 재구성되느냐에 있습니다. 만약 어떤 도구가 당신의 말을 가져다가 깔끔하고 교과서적인 문장으로 재조직한다면, 로봇의 성능은 폭락합니다. 실제로 구어체 질문을 짧고 깔끔한 요약본으로 압축했을 때, 로봇의 수학 문제 정답률은 24.1 퍼센트 포인트나 떨어졌습니다. 알고 보니 로봇은 당신의 문장이 비록 조금 지저분하더라도 원래의 구조를 선호하는 것이었습니다. 당신의 말 순서를 바꾸거나 문장을 다시 쓰는 것은 마치 지도를 가져다가 도로를 새로 그리는 것과 같습니다. 그러면 로봇은 길을 잃게 됩니다.
2. 타이핑 실수는 놀라울 정도로 무시하기 쉽습니다
반면에, 로봇은 타이핑 오류에 대해서는 믿기 힘들 정도로 강인합니다. 만약 당신이 키를 잘못 누르거나, 두 글자의 순서를 바꾸거나, 공백을 빠뜨리더라도 로봇은 보통 이를 이해해 냅니다. 연구진은 로봇이 실패하기 전까지 꽤 많은 양의 타이핑 실수를 처리할 수 있다는 것을 발견했습니다. 로봇이 포기하는 경우는 실수가 정말 집중되어 나타날 때, 즉 거의 모든 단어를 망가뜨렸을 때뿐입니다. 이는 로봇이 핵심 단어들이 여전히 남아 있는 한, 당신이 타이핑한 의도를 파악하는 데 매우 능숙하다는 것을 시사합니다.
3. "토큰 생존" 법칙
왜 한 종류의 실수가 다른 쪽보다 더 해로운지에 대한 가장 큰 발견은, 로봇의 두뇌가 깨지는 이유가 질문 속의 **원래 단어(토큰)**들이 파괴되거나 교체될 때라는 것입니다.
- 새로운 단어를 추가하는 것(예를 들어 추가적인 "음..."이나 긴 설명)은 로봇에게 비용이 적게 들며, 큰 해를 끼치지 않습니다.
- 원래의 단어를 파괴하는 것(문장을 재구성하거나 핵심 글자를 무작위 글자로 바꾸는 것)은 비용이 많이 듭니다.
퍼즐을 생각해보세요. 만약 어울리지 않는 퍼즐 조각 몇 개를 더 넣는다면, 로봇은 여전히 그림을 볼 수 있습니다. 하지만 그 그림을 형성하는 실제 조각들을 가져가 버린다면, 로봇은 문제를 풀 수 없습니다. "말하기" 채널은 종종 질문의 원래 구조를 파괴하지만, "타이핑" 채널은 대개 그림을 깨뜨리지 않고 약간의 노이즈만 추가할 뿐입니다.
4. 작업의 종류에 따라 달라집니다
타이핑과 말하기 사이의 격차는 로봇이 답을 처음부터 직접 만들어내야 하는, 즉 수학 문제를 풀거나 코드를 작성하는 것과 같이 깊이 생각해야 하는 작업에서 나타납니다. 이런 경우, 말하기는 타이핑보다 훨씬 성능이 떨어집니다. 그러나 로봇이 목록에서 답을 고르기만 하면 되는 경우(예: 객관식 퀴퀴즈), 타이핑을 하든 말을 하든 상관없으며 성능은 동일합니다. 로봇이 고도의 추론을 수행하기 위해서는 원래 질문의 깔끔한 구조가 필요합니다.
5. 단순히 "학습"해서 해결할 수 있는 문제가 아닙니다
연구진은 로봇이 이러한 지저한 입력값을 더 잘 다룰 수 있도록 가르치려고 노력했습니다. 그들은 로봇에게 지저분한 음성에 대한 빠른 속성 과외를 주는 것과 같은 "경량 적응(lightweight adaptation)" 기술을 시도했습니다. 하지만 효과가 없었습니다. 로봇은 문장을 재구성함으로써 발생하는 피해를 무시하는 법을 배우지 못했습니다. 또한 이 문제가 로봇이 이미 정답을 본 적이 있어서 발생하는 문제(흔히 '테스트 세트 오염'이라 불리는 현상)도 아님을 발견했습니다. 로봇이 본 적 없는 완전히 새로운 수학 문제를 사용했을 때도, 구어체 채널의 성능은 여전히 낮았습니다.
6. "생각하기"는 타이핑에는 도움이 되지만, 말하기에는 도움이 되지 않습니다
테스트한 로봇 중 하나는 답변하기 전에 잠시 멈춰 생각하는 "생상하기" 모드가 있었습니다. 이 "생각하는 시간(thinking budget)"은 타이핑 실수를 바로잡는 데 놀라운 효과를 보였습니다. 그것은 로봇이 지저분한 타이핑 질문을 이해하는 능력을 거의 완벽하게 회복시켜 주었습니다. 하지만 말하기 질문에는 거의 아무런 도움이 되지 않았습니다. 만약 말이 재구성되거나 압축되었다면, 로봇의 "생각하기"도 이를 구제할 수 없었습니다. 이는 구어체 입력으로 인한 손상이 너무 깊다는 것을 확인시켜 줍니다. 즉, 로봇이 잘못된 퍼즐 조각을 가지고 작업하고 있다면, 더 많이 생각하는 것도 도움이 되지 않습니다.
결론
스마트한 AI로부터 최선의 결과를 얻고 싶다면, 특히 수학이나 코딩 같은 어려운 작업을 할 때는 타이핑이 여전히 더 안전한 선택입니다. 만약 꼭 말을 해야 한다면, 당신의 말을 "정리"하거나 대신 써주는 도구에 의존하지 마세요. 로봇은 오히려 당신의 가공되지 않은, 약간 지저분한 목소리를 더 선호합니다. 그리고 만약 당신이 음성을 텍 thức로 변환하는 도구를 만들고 있다면, 가장 중요한 조언은 다음과 같습니다: 사용자가 말한 내용을 재구조화하지 마세요. "음...", "아..." 같은 것들만 제거하고 나머지는 그대로 두세요. 로봇은 퍼즐을 깨뜨리지 않는 한, 그 지저분함을 감당할 수 있을 만큼 충분히 강인합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.