← 최신 논문
💬 NLP

Researchers waste 80% of LLM annotation costs by classifying one text at a time

이 논문은 대규모 언어 모델 (LLM) 을 활용한 텍스트 분류 시, 한 번에 여러 텍스트와 변수를 배치하여 처리하는 방식이 비용은 80% 이상 절감하면서도 기존 단일 항목 처리 방식과 동등한 정확도를 유지함을 실증했습니다.

원저자: Christian Pipal, Eva-Maria Vogel, Morgan Wack, Frank Esser

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Christian Pipal, Eva-Maria Vogel, Morgan Wack, Frank Esser

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍕 1. 문제: "한 입씩만 시키는 비효율적인 주문"

지금까지 많은 연구자들은 인공지능에게 텍스트를 분석할 때, 한 번에 한 가지 질문 (변수) 을 한 문장 (텍스트) 에만 던지는 방식을 썼습니다.

  • 비유: 식당에서 100 명의 손님이 와서 "피자 100 판"을 시켰는데, 주문 방식이 이러합니다.
    • "피자 1 판 주세요. (한 입)" -> 주문 완료
    • "피자 1 판 주세요. (한 입)" -> 주문 완료
    • ...이걸 100 번 반복합니다.
    • 게다가 각 피자에 대해 "치즈는?", "토마토는?", "페퍼로니는?" 등 4 가지 질문을 따로따로 물어봐야 한다면? 400 번이나 주문을 해야 합니다.
  • 현실: 이렇게 하면 **API 호출 비용 (돈)**이 80% 이상 낭비됩니다. 매번 주문할 때마다 "주문서 (지시사항)"를 새로 작성하고 전달해야 하니까요.

📦 2. 해결책: "한 번에 통으로 시키기 (Batching & Stacking)"

저자들은 "왜 한 번에 여러 개를 묶어서 주문하지?"라고 생각했습니다.

  • 배치 (Batching): 한 번에 피자를 25 판씩 통으로 시키기.
  • 스택 (Stacking): 한 판의 피자에 대해 "치즈, 토마토, 페퍼로니, 두부" 등 4 가지 질문을 한 번에 다 물어보기.

이렇게 하면 주문 횟수가 400 번에서 4 번으로 줄어듭니다. 비용은 80% 이상 절약되는데, 정작 **맛 (정확도)**은 어떨까요?

🧪 3. 실험 결과: "통으로 시켜도 맛은 그대로!"

저자들은 8 가지 다른 인공지능 모델로 4,000 개 이상의 트윗을 분석해 보았습니다. 결과는 놀라웠습니다.

  • 안전한 범위: 한 번에 100 개까지 묶어서 분석해도, 한 번에 하나씩 분석했을 때와 정확도가 거의 비슷했습니다. (오차 2% 미만)
  • 질문도 많이 해도 OK: 한 번에 10 가지 질문을 동시에 던져도 결과가 크게 나빠지지 않았습니다.
  • 왜 나빠질까? 나빠지는 이유는 질문이 길어서가 아니라, 질문 자체가 너무 복잡해서였습니다. (예: "이 트윗이 유해한가?", "감정은 어떤가?", "누가 썼는가?" 등 너무 많은 것을 동시에 판단하라고 하면 AI 가 혼란스러워함)

💡 4. 중요한 발견: "모델 선택이 더 중요해"

  • 비유: 비싼 고급 주방 (최고급 AI 모델) 에서 한 번에 100 개 요리를 해도 맛은 좋지만, 싼 주방 (저가형 AI 모델) 에서 한 번에 하나만 요리해도 맛이 떨어질 수 있습니다.
  • 결론: 한 번에 몇 개를 묶어서 처리하느냐 (배치 크기) 보다는, 어떤 AI 모델을 쓰느냐가 결과에 더 큰 영향을 미칩니다.

💰 5. 실제 효과: "수천 달러를 아낄 수 있다"

  • 연구자가 10 만 개의 트윗을 4 가지 기준으로 분석한다고 가정해 봅시다.
  • 기존 방식: 약 337 달러 (약 45 만 원) 이상 듭니다.
  • 이 논문 제안 방식: 약 50 달러 (약 6 만 7 천 원) 이하, 혹은 더 싼 모델을 쓰면 10 달러 (약 1 만 3 천 원) 미만으로 가능합니다.
  • 중요한 점: 이렇게 아낀 비용으로 생긴 오차는, 사람이 직접 분석했을 때 서로 의견이 달라지는 정도 (인간 간 오차) 보다 훨씬 작습니다. 즉, 인간이 분석할 때보다 더 정확하거나 비슷하면서도 훨씬 싸게 할 수 있다는 뜻입니다.

📝 요약: "한 번에 많이, 여러 가지로"

이 논문의 핵심 메시지는 다음과 같습니다:

"AI 에게 텍스트를 분석시킬 때, 한 번에 하나씩 하나씩 시키지 마세요.
한 번에 25~100 개 정도 묶어서 (Batching), 한 번에 10 가지 질문까지 동시에 (Stacking) 던지세요.
이렇게 하면 비용은 80% 이상 줄고, 정확도는 거의 떨어지지 않습니다.
다만, 너무 많은 질문을 한 번에 던지거나, 너무 많은 텍스트를 한 번에 넣으면 (1,000 개 이상) AI 가 혼란스러워할 수 있으니 **적당한 선 (Safety Zone)**을 지키세요."

이제 연구자들은 이 방법을 써서 예산을 아끼고, 더 많은 데이터를 분석할 수 있게 되었습니다. 마치 한 번에 큰 트럭으로 화물을 실어 나르는 것처럼 효율적인 시대가 온 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →