← 최신 논문
💬 NLP

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

본 논문은 거대 언어 모델이 훈련 편향과 선호도 튜닝으로 인해 수사적 형상인 에파노르토시스(epanorthosis)를 체계적으로 과용한다고 주장하며, 해당 형상을 완전히 제거하기보다는 모델의 출력을 인간의 수사적 규범에 정렬시키기 위해 경량 어댑터와 지시어 튜닝을 사용하는 장르 특화된 보정 접근법을 제안한다.

원저자: Federico Boggia

게시일 2026-07-29
📖 5 분 읽기🧠 심층 분석

원저자: Federico Boggia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 글쓰기의 비밀 소스

당신이 수백만 권의 책, 웹사이트, 소셜 미디어 게시물이 거대하게 갈려 나가 섞여 있는 거대한 스무디 속에 들어와 있다고 상상해 보세요. 이것이 현대의 AI 챗봇이 대화하는 법을 배우는 방식입니다. 그들은 이 디지털 스무디를 맛보고 문장 속에서 다음 단어를 예측하는 법을 반복해서 배웁니다. 하지만 반전이 있습니다. 스무디로부터 학습한 후에, 인간이 개입하여 "맛 테스트"를 진행합니다. 인간은 로봇의 답변을 읽고 "이것은 자신감 있고 멋지게 들린다"라거나 "이것은 지루하게 들린다"라고 말합니다. 그러면 로봇은 인간이 좋아했던 것을 더 많이 하도록 배웁니다. 이 과정을 "강화 학습(reinforcement learning)"이라고 부르는데, 이는 강아지에게 간식을 주며 훈련시키는 것과 비슷합니다. 다만 그 강아지는 초지능 컴퓨터이고, 간식은 디지털적인 승인일 뿐입니다.

이 논문이 던지는 핵심 질문은 이것입니다: 우리가 로봇에게 "자신감 있고" "멋지게" 들리도록 훈련하면 어떤 일이 벌어질까요? 알고 보니, 로봇은 인상적으로 보이기 위해 매우 구체적이고 고전적인 기술을 사용하기 시작했습니다. 그것은 인간 화자들이 수천 년 동안 사용해 온 기술이지만, 로봇은 이를 너무 많이 사용하여 마치 가짜처럼 들리게 만듭니다. 이 논문은 왜 로봇이 이런 행동을 하는지, 얼마나 자주 발생하는지, 그리고 로봇을 지루하거나 멍청하게 만들지 않으면서도 이 기술을 과도하게 사용하는 것을 멈추도록 가르칠 수 있는지 조사합니다.


로봇의 "잠깐, 사실은..." 습관

누군가가 "저는 단순한 교사가 아닙니다. 저는 마음을 빚는 자입니다"라고 말할 때의 그 기분을 아시나요? 혹은 판매원이 "우리는 단순히 신발을 파는 것이 아닙니다. 우리는 자유를 팝니다"라고 말할 때 말이죠. 그들은 평범한 문장으로 시작했다가, 즉시 "되돌리기" 버튼을 누르고 훨씬 더 크고, 시끄럽고, 극적인 것으로 대체합니다.

화려한 언어 연구의 세계에서 이 기술에는 이름이 있습니다: 바로 에파노로시스(epanorthosis) (에-판-오-로-시스라고 발음하세요)입니다. 이는 기본적으로 "바로잡기" 또는 "스스로를 수정하기"를 의미하는 그리스어입니다. 고대의 연설가들은 자신의 논점을 더 강렬하게 만들기 위해 이를 사용했습니다. 하지만 최근 연구자들은 AI 챗봇이 마치 신경질적인 틱(tic)처럼 이 기술을 항상 사용하고 있다는 점을 발견했습니다. 이것은 로봇의 시그니처 동작이 되었습니다.

이 논문은 이것이 우연이 아니라고 주장합니다. 로봇이 깊이 "생각"하다가 마음을 바꾼 것이 아닙니다. 대신, 로в봇은 크게 두 가지 곳에서 이 습관을 배웠습니다:

  1. 인터넷 스무디: 로봇은 "X가 아니라 Y다!"라는 스타일이 많은 클릭과 '좋아요'를 받는 마케팅 문구, 동기 부여 게시물, 판매 피치 등을 엄청나게 읽었습니다.
  2. 인간의 맛 테스트: 인간이 로봇의 답변을 평가할 때, 인간은 자신감 있고 강조하는 듯한 답변을 선호했습니다. 로봇은 "헤이, 내가 '나는 봇이 아니라 디지털 설계자입니다'라고 말하면 사람들이 높은 점수를 주네!"라고 깨달았습니다. 그래서 로봇은 이를 점점 더 많이 하기 시작했습니다.

논문은 로봇이 글을 쓰는 방식(한 번에 한 단어씩, 왼쪽에서 오른쪽으로)이 이를 악화시킨다고 제안합니다. 로봇은 문장을 쓴 후에 다시 돌아가서 수정할 수 없기 때문에, 이 "수정" 기술을 실시간으로 톤을 조절하는 방법으로 사용하여, 보통의 인간보다 더 극적으로 들리게 만듭니다.

"에파노로시스 지수": 로봇의 드라마 측정하기

이를 증명하기 위해 저자들은 단순히 추측하지 않고, 측정 도구를 만들었습니다. 그들은 **에파노로시스 지수(Epanorthosis Index)**라는 것을 만들었습니다. 이것은 "드라마 측정기"라고 생각하면 됩니다. 그들은 10,000단어 안에서 로봇이 이 "X가 아니라 Y" 기술을 얼마나 많이 사용하는지 세고, 이를 실제 인간이 동일한 유형의 글에서 얼마나 자주 사용하는지와 비교했습니다.

결과는 다음과 같았으며, 다소 복합적이었습니다:

  • 연설 및 판매: 로봇들이 지나치게 과했습니다. "웅변(oratory)"과 "홍보적(promotional)" 글쓰기에서 로봇은 인간보다 약 두 배 더 많이 이 기술을 사용했습니다. 이탈리아어의 경우 상황이 더 심각하여 거의 세 배에 달했습니다. 그들은 영감을 주려고 너무 애쓰다가 오히려 가짜처럼 들렸습니다.
  • 일상적인 질의응답: 로봇은 정반대의 모습을 보였습니다. 인간이 그냥 채팅을 하거나 간단한 질문에 답할 때는, 종종 이 기술을 사용하여 답변을 완화하거나 확신을 피하곤 합니다. 그러나 로봇은 너무 무미건조했고 이 기술을 충분히 사용하지 않았습니다. 로봇은 인간보다 이 기술을 사용할 확률이 5분의 1 수준에 불과했습니다.
  • 진지한 글쓰기: 뉴스 기사나 백과사전 항목 같은 글에서는 로봇과 인간이 상당히 비슷했습니다. 로봇은 언제 드라마틱함을 버려야 하는지 알고 있었습니다.

주요 결론은 로봇이 **조절 능력이 부족하다(miscalibrated)**는 것입니다. 그들은 드라마의 노브(knob)를 언제 높이고 언제 낮춰야 할지 모릅니다. 그들은 그저 인상적으로 보여야 한다고 생각될 때마다 "에파노로시스" 버튼을 세게 누를 뿐입니다.

로봇을 고칠 수 있을까? ("드라마 다이얼")

이 논문은 문제점을 지적하는 데 그치지 않고, 해결책을 찾으려 노력합니다. 저자들은 다음과 같이 물었습니다: "우리는 로봇에게 이 기술을 과도하게 사용하지 않으면서도, 말을 하기 두려워하는 로봇처럼 들리지 않게 가르칠 수 있을까?"

그들은 몇 가지 아이디어를 테스트했고, 효과가 있는 것은 다음과 같습니다:

  1. "한 줄" 해결책 (프롬프팅): 그들은 단순히 로봇에게 "직설적으로 작성하고 'X가 아니라 Y이다'라는 표현을 피하라"고 명령해 보았습니다.

    • 결과: 효과가 있었습니다! 이탈리아어 테스트에서, 이 간단한 지시는 연설과 에세이에서의 드라마틱한 수정을 **70%에서 72%**까지 줄였습니다. 기술을 완전히 없애지는 못했지만, 로봇의 사용량을 훨씬 더 인간과 유사한 수준으로 낮추었습니다.
  2. "스타일 어댑터" (마법의 다이얼): 이것이 큰 실험이었습니다. 저자들은 로봇을 위한 작고 특별한 추가 기능(LoRA 어댑터라고 불림)을 훈련시켰습니다. 이 어댑터는 드라마의 "볼륨 조절 노브"라고 생각하면 됩니다.

    • 그들은 "드라마틱한" 텍스트와 "평범한" 텍스트의 예시로 이를 훈련시켰습니다.
    • 그런 다음, 이 새로운 스타일을 얼마나 사용할지 결정하는 "다이얼"(변경 가능한 숫자)을 테스트했습니다.
    • 결과: 다이얼은 완벽하게 작동했습니다. 다이얼을 높이면 로봇은 평범하게 들렸고, 다이얼을 낮추면 로봇은 드라마틱하게 들렸습니다. 결정적으로, 그들은 로봇의 사용량이 인간의 비율과 정확히 일치하는 설정값을 찾아냈습니다. 이것은 기술을 삭제하는 것이 아니라, **교정(calibrating)**하는 것이었습니다.
  3. 효과가 없었던 것: 그들은 "선호도 학습(preference learning, 인간이 무엇을 좋아하는지 가르치는 것)"을 단독으로 사용해 보았지만, 일반화에 실패했습니다. 로봇은 테스트에서 올바른 답을 고르는 법은 배웠지만, 실제로 새로운 문장을 쓰는 방식 자체를 바꾸지는 못했습니다.

커다란 경고

논문은 약간 무서운 생각으로 끝을 맺습니다. 진짜 위험은 로봇이 이 기술을 너무 많이 사용하는 것이 아닙니다. 진짜 위험은 우리가 그들처럼 쓰기 시작하는 것입니다.

만약 우리가 "X가 아니라 Y다!"라는 식의 수정이 가득한 글을 읽는 데 익숙해진다면, 우리는 그것이 좋은 글쓰기라고 생각하기 시작할지도 모릅니다. 우리는 인상적으로 보이기 위해 우리 자신의 에세이, 이메일, 연설에 이 가짜의, 과도하게 드라마틱한 기교를 담아 쓰기 시작할 수도 있습니다. 이 논문은 목표가 로봇을 인간과 똑같이 만드는 것이 아니라, 상황에 적절하게 들리도록 만드는 것이어야 한다고 제안합니다. 때로는 연설에 드라마가 필요하고, 때로는 의료 보고서에 담백한 사실이 필요합니다.

저자들은 우리가 이러한 새로운 도구들을 통해 로봇의 "틱"을 고칠 수는 있지만, 더 어려운 작업은 수정이 정직한 것인지 아니면 단지 퍼포먼스인지 스스로 구별할 수 있도록 우리 자신을 가르치는 것이라고 결론짓습니다. 결국, 기계가 인간처럼 들리도록 배우는 데 성공한다면, 그다음 단계는 우리가 우리 자신다운 모습으로 남는 법을 잊지 않도록 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →