← 최신 논문
💬 NLP

CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

"Cavewoman" 연구는 모델의 출력을 압축하는 것이 추론 비용을 크게 줄일 수 있는 반면, 사용자의 입력을 압축하는 것은 모델이 더 긴 응답을 생성하도록 강제하여 순 비용을 증가시키고 정확도를 저하시키기 때문에 역효과를 낸다는 사실을 밝혀냈다.

원저자: Morayo Danielle Adeyemi, Ryan A. Rossi, Franck Dernoncourt

게시일 2026-06-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Morayo Danielle Adeyemi, Ryan A. Rossi, Franck Dernoncourt

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 문제를 해결하기 위해 매우 똑똑하지만 비싼 개인 비서를 고용했다고 상상해 보세요. 당신은 그들이 얼마나 많이 읽는지(입력)와 얼마나 많이 쓰는지(출력)에 따라 비용을 지불합니다. 보통, 쓰는 것이 읽는 것보다 훨씬 더 많은 비용이 듭니다.

"CAVEWOMAN"이라는 논문은 한 가지 인기 있는 아이디어를 조사합니다: 만약 우리가 비서에게 원시인처럼 말하도록 강제한다면 어떻게 될까? (예: "짧게 말해. 문법 버려. 토큰 아껴.") 목표는 대화를 짧게 만들어 돈을 아끼는 것입니다.

연구진들은 이것이 실제로 효과가 있는지 확인하기 위해 영리한 실험을 설계했습니다. 그들은 5가지 유형의 퍼즐에 대해 8개의 서로 다른 AI 모델을 대상으로 "원시인 말투"를 사용하는 두 가지 다른 방법을 테스트했습니다.

연구 결과는 다음과 같습니다 (쉽게 설명되었습니다):

1. "원시인 말투"를 사용하는 두 가지 방법

연구진은 마치 명령을 내리는 두 가지 서로 다른 채널처럼 두 가지 다른 채널을 테스트했습니다:

  • 채널 A ("망가진 프롬프트"): 질문에서 모든 "연결어"(예: "the", "is", "and", "to")를 제거하여 제공하는 방식입니다.

    • 예시: "What is the capital of France?"(프랑스의 수도는 무엇입니까?) 대신 "Capital France?"(수도 프랑스?)라고 입력합니다.
    • 결과: 이것은 함정입니다. 실제로 돈이 더 많이 듭니다. 왜냐하면 AI가 망가지고 혼란스러운 질문을 받으면, 이를 이해하려고 훨씬 더 길고 상세한 답변을 작성하며 당황하기 때문입니다. 쓰는 것이 비싸기 때문에, 질문에서 아낀 몇 단어보다 추가로 작성된 길이 때문에 더 많은 비용이 발생합니다. 이는 "패배-패배(lose-lose)" 상황입니다.
  • 채널 B ("원시인 명령"): AI에게 전체적이고 정상적인 질문을 주되, "나에게 원시인처럼 답해라. 문법 없이 키워드만 사용해라"라고 말하는 방식입니다.

    • 예시: "What is the capital of France?"라고 물으면, AI는 "Paris"라고 답합니다.
    • 결과: 이것은 돈을 아껴줍니다. AI가 답변을 짧게 하도록 강제되기 때문에, 더 적은 단어를 씁니다. 쓰는 것이 비싼 부분이기 때문에, 이 방식은 실제로 청구 금액을 크게 줄여줍니다 (때로는 절반 또는 3분의 2까지).

2. "기계 속의 유령" 문제

여기 가장 놀라운 발견이 있습니다. AI가 원시인처럼 답하도록 강제될 때(채널 B), AI는 종종 정답을 맞히지만, 사용하는 단어는 평소에 자신을 설명할 때와는 완전히 다릅니다.

  • 비유: 어떤 요리사가 보통 케이크 레시피를 아름답게 10페이지에 걸쳐 쓰는 것을 상상해 보세요. 당신이 그에게 "재료 목록만 줘"라고 말합니다. 그러면 그들은 "밀가루, 설탕, 달걀"이라고 적힌 목록을 건넵니다.
    • 그 목록은 정확합니다 (당신은 케이크를 구울 수 있습니다).
    • 하지만 그 목록은 당신이 짧게 만들라고 하기 전의 그 아름다운 레시피와는 같지 않습니다.
  • 논문의 주장: 약 **52%**의 경우, AI는 정답을 맞히지만, "원시인" 버전의 답변은 정상적인 "완전한 문장" 버전과 너무 달라서 컴퓨터가 그것이 같은 것을 말하고 있다는 것을 식별할 수 없습니다.
  • 왜 중요한가: 만약 당신이 최종 정답(예: "Paris")에만 관심이 있다면 이는 문제가 되지 않습니다. 하지만 AI의 추론 과정이나 사고 과정을 기록으로 남기거나 읽어야 한다면, "원시인" 버전은 비록 결과는 맞을지라도 원래의 풍미와 논리를 잃어버린 상태입니다.

3. 모든 AI가 같지는 않다

연구진은 일부 AI가 이러한 "원시인" 규칙을 처리하는 데 훨씬 더 능숙하다는 것을 발견했습니다.

  • 일부 모델(예: 오픈 소스인 "Gemma-4")은 매우 견고하여, 짧게 말하도록 강제되어도 여전히 좋은 답변을 제공할 수 있습니다.
  • 다른 모델(예: 매우 똑똑한 "GPT-5.4")은 보통 일반적인 작업에서는 최고임에도 불구하고, 짧게 말하도록 강제되면 훨씬 더 성능이 저하됩니다.
  • 교훈: 단순히 "가장 똑똑한" AI를 고르기만 해서는 안 됩니다. 당신이 사용할 특정 "원시인" 규칙에 어떤 AI가 가장 잘 작동하는지 테스트해야 합니다.

요약

  • 질문을 망가뜨리지 마세요: 질문에서 단어를 제거하면 AI가 혼란을 느껴 더 많이 쓰게 되고, 결국 돈을 더 쓰게 됩니다.
  • 답변을 망가뜨리세요: AI에게 짧은 답변을 하라고 지시하면 많은 돈을 아낄 수 있습니다.
  • "유령"을 주의하세요: 짧은 답변은 정답일 수 있지만, 종종 AI의 일반적인 사고 방식과는 완전히 다르게 보입니다. 만약 답변 뒤에 숨겨진 "이유"를 알고 싶다면, 짧은 버전은 오해의 소지가 있을 수 있습니다.

논문은 돈을 아끼고 좋은 결과를 얻으려면, 질문(입력)이 아니라 출력(답변)을 압축해야 하며, AI가 단순히 맞는 숫자(결과)를 내놓는 것뿐만 아니라 여전히 올바르게 "생각"하고 있는지 확인해야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →