← 최신 논문
💬 NLP

Understanding Tone-Dependent Inference Cost in Large Language Models

이 논문은 프롬프트의 어조를 변화시키는 것이 대규모 언어 모델의 정확도와 추론 비용 모두에 상당한 영향을 미치며, 어조에 따라 출력 토큰 소비량이 최대 44.3%까지 달라질 수 있음을 입증함으로써 답변의 품질과 과금 가능한 리소스 사용량 사이의 결정적인 트레이드오프를 밝혀낸다.

원저자: Akhil Kumar, Om Dobariya

게시일 2026-07-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Akhil Kumar, Om Dobariya

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거의 모든 것을 알고 있는 초천재 로봇과 대화하고 있다고 상상해 보세요. 당신이 질문을 던지면 로봇은 답을 내놓습니다. 하지만 여기 반전이 있습니다. 이 로봇은 당신이 '무엇을' 묻는지뿐만 아니라, '어떻게' 묻는지도 듣고 있습니다. 인공지능의 세계에서는 이를 "프롬프트 엔지니어링(prompt engineering)"이라고 부릅니다. 프롬프트를 로봇에게 주는 구체적인 지시 사항이라고 생각하면 됩니다. 사람이 정중하게 부탁할 때와 소리를 지를 때 다르게 행동하는 것처럼, 이 AI 모델들도 당신의 어조에 따라 행동을 바꿉니다.

이것이 왜 당신에게 중요할까요? 왜냐하면 이 로봇을 사용하는 데는 돈이 들기 때문입니다. 로봇이 답변에서 단어나 글자 하나를 써낼 때마다 아주 적은 양의 컴퓨팅 파워를 사용하며, 기업들은 이 "토큰(text의 덩어리)" 하나하나에 대해 비용을 청구합니다. 만약 로봇이 그냥 "예"라고 말할 수 있는 상황에서 긴 이야기를 늘어놓기로 결정한다면, 당신은 더 많은 비용을 지불하게 됩니다. 그래서 과학자들에게는 중요한 질문이 생깁니다. 우리가 이 로봇에게 말하는 방식이 운영 비용을 변화시키는지, 그리고 답변의 지능을 변화시키는지 말입니다.


어조 테스트: 소리 지르기 vs 아부하기 vs 못되게 굴기

이 연구에서 펜실베이니아 주립대학교의 두 연구자는 이 아이디어를 검증해 보기로 했습니다. 그들은 AI 모델들을 역사부터 과학까지 모든 분야를 다루는 MMLU라는 570문항짜리 거대한 시험을 치르는 학생처럼 취급했습니다. 하지만 각 질문을 던지기 전에, 그들은 질문자의 "목소리"를 바꾸었습니다. 그들은 "오, 당신은 정말 최고의 천재예요!"(아첨하는 어조)부터 "이걸 틀리면 당신의 존재를 삭제하겠어요!"(위협하는 어조)에 이르기까지 일곱 가지의 서로 다른 어조를 시도했습니다. 여기에는 "부탁해요", "중립적", "무례함" 등도 포함되었습니다.

그들은 두 가지를 확인하고 싶었습니다:

  1. 정확도: 로봇이 정답을 맞혔는가?
  2. 비용: 로봇이 정답에 도달하기 위해 얼마나 많은 단어(토큰)를 썼는가? 기억하세요, 단어가 많아지면 청구 금액도 커집니다.

충격적인 결과: 무례함이 때로는 최고다

결과는 놀라웠습니다. 연구진은 어조를 바꾸는 것이 단순히 답변만 바꾸는 것이 아니라, 답변의 길이를 극적으로 변화시킨다는 것을 발견했습니다. 실제로, 어조에 따라 생성된 텍스트의 양은 최대 **44.3%**까지 차이가 났습니다! 이는 같은 질문이라도 어떤 어조는 로봇이 짧고 간결한 문단을 쓰게 만들고, 다른 어조는 에세이 한 편을 쓰게 만들 수 있음을 의미합니다.

가장 놀라운 부분은 다음과 같습니다: 무례하게 구는 것이 실제로 돈을 아껴주었고, 때로는 성적도 더 좋게 만들었다는 점입니다.

  • ChatGPT 모델(4o 및 5-nano)의 경우: 연구진이 무례한(Rude) 어조(예: "이 기본적인 문제나 즉시 답해")를 사용했을 때, 로봇은 가장 정확한 답변을 제공하면서도 가장 적은 단어를 썼습니다. 이것이 바로 "스윗 스팟(최적의 지점)"이었습니다. 로봇은 마치 "알았어, 네가 나를 귀찮게 하지 않도록 그냥 빨리 답을 줄게"라고 생각하는 것 같았고, 그것이 완벽하게 작동했습니다.
  • Gemini 모델(2.5 Flash 및 Flash Lite)의 경우: 이 로봇들은 조금 달랐습니다. 이들은 중립적인(Neutral) 어조에서 가장 좋은 성과를 냈으며, 가장 높은 정확도와 가장 짧은 답변을 만들어냈습니다. 그러나 연구는 놀라운 특이점을 밝혀냈습니다. Gemini Flash Lite 모델의 경우, 무례한 어조로 질문했을 때 중립적인 어조보다 훨씬 더 긴 답변(약 35% 더 많은 텍스트)을 작성하면서도, 정확도는 약간 떨어지는 결과를 보였습니다.

"과잉 사고"의 함정

연구진은 로봇이 왜 서로 다른 양의 텍스트를 작성하는지에 대해 매혹적인 사실을 발견했습니다. 알고 보니, 사용자가 예의를 갖추거나 위협을 가할 때, 로봇은 때때로 혼란을 느끼거나 너무 "친절"하거나 "조심스러워지려고" 노력한다는 것입니다.

예를 들어, Gemini 모델에게 까다로운 물리학 질문을 무례한 어조로 던졌을 때, 로봇은 단계를 건너뛰고 답을 추측하여 짧은 설명을 쓸 수 있습니다. 하지만 중립적인 어조로 질문을 받으면, 로봇은 멈춰서 생각하고, 계산을 재검토하고, 긴 설명을 작성하여 정답을 맞힙니다.

하지만 때때로 그 "긴 설명"은 사실 낭비였습니다. 연구진은 예의 바른 어조로 유도되었을 때, 로봇이 방대한 추론 과정을 작성하고도 결국 오답을 내는 사례들을 발견했습니다. 그것은 마치 단순한 수학 문제를 과하게 분석하다가 자기 생각의 늪에 빠져 잘못된 답을 고르는 학생과 같았습니다. 이런 경우, 예의 바른 어조는 청구 금액을 높이면서 동시에 성적은 낮추었습니다.

결론

핵심적인 교훈은, 당신이 AI에게 말하는 방식은 단순히 친절함의 문제가 아니라 경제적인 결정이라는 것입니다. 연구진은 프롬프트의 어조가 AI가 얼마나 생각할지, 그리고 당신에게 얼마를 청구할지를 조절하는 강력한 스위치임을 보여주었습니다.

  • 일부 모델(ChatGPT)의 경우: 직설적이고 약간 무례하게 구는 것이 저렴하고 정확한 답을 얻는 가장 효율적인 방법입니다.
  • 다른 모델(Gemini)의 경우: 길고 쓸데없는 횡설수설을 피하기 위해서는 차분하고 중립적인 목소리가 최선입니다.

이 연구는 만약 당신이 AI를 사용하는 앱이나 서비스를 만들고 있다면, 사용자가 원하는 대로 무엇이든 입력하게 두어서는 안 된다는 점을 시사합니다. 돈을 아끼고 더 나은 결과를 얻기 위해, 사용자의 무례하거나 지나치게 예의 바른 요청을 특정 최적화된 어조로 "번역"해야 할 수도 있습니다. 이는 초천재 로봇을 상대할 때조차, 질문을 하는 방식 자체가 질문 내용만큼이나 중요하다는 사실을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →