← 최신 논문
💬 NLP

Decoupling Task-Solving and Output Formatting in LLM Generation

이 논문은 복잡한 작업에서 대규모 언어 모델의 성능을 향상시키기 위해, 추론을 방해하지 않으면서도 규격 준수를 보장하는 전용 형식 추정 모듈(Format Estimation Module)을 통해 문제 해결과 엄격한 형식 요구 사항을 분리하는 디코딩 프레임워크인 Deco-G를 소개한다.

원저자: Haikang Deng, Po-Nien Kung, Nanyun Peng

게시일 2026-07-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haikang Deng, Po-Nien Kung, Nanyun Peng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초고성능 로봇에게 까다로운 수학 문제를 풀도록 요청하면서, 동시에 "최종 정답은 42입니다"와 같이 매우 구체적이고 엄격한 형식으로 답을 쓰라고 요구한다고 상상해 보세요. 보통, "열심히 생각하라"는 부분과 "완벽하게 써라"는 부분을 하나의 커다란 지시사항으로 섞으면, 로봇은 혼란에 빠집니다. 이는 마치 외줄 타기를 하면서 저글링을 하는 것과 같습니다. 로봇은 종종 공을 떨어뜨리거나(수학 문제) 줄에서 발을 헛디딥니다(형식 규칙).

Haikang Deng과 동료들이 발표한 논문은 이 문제를 해결하기 위해 DECO-G라는 새로운 시스템을 소개합니다. DECO-G를 두 명의 전문가가 팀을 이룬 것이라고 생각해보세요: 바로 **문제 해결사(Problem Solver)**와 **형식 경찰관(Format Police Officer)**입니다.

문제점: "얽혀버린" 혼란

기존 방식에서는 로봇에게 "이 수학 문제를 풀고, 반드시 JSON 박스 안에 답을 작성하세요"와 같은 하나의 거대한 프롬프트를 제공했습니다. 논문은 이러한 "얽힘(entanglement)"이 로봇의 두뇌에 해를 끼친다고 주장합니다. 로봇이 두 가지 일을 동시에 수행하려고 할 때, 형식을 맞추기 위해 수학적 추론을 망가뜨리기 시작한다는 것입니다.

저자들은 단순히 로봇에게 "주의하라"고 말하거나, 엄격하게 미리 만들어진 템플릿(예: 단계별로 엄격한 JSON 스키마를 따르도록 강제하는 것)을 사용하는 것이 최선의 해결책이 아니라고 명시적으로 반박합니다. 그들은 이러한 경직된 방법들이 로봇의 사고 과정을 중간에 끊어버려, 형식이 완벽해 보일지라도 답변이 비논리적이거나 수학적으로 틀리게 만든다는 것을 발견했습니다.

해결책: 두 팀 전략

DECO-G는 업무를 분리합니다.

  1. 문제 해결사 (LLM): 이것이 메인 로봇입니다. 이 로봇은 오직 수학 문제만을 받습니다. 형식에 대해서는 전혀 신경 쓰지 않습니다. 그저 자유롭게 생각하고, 추론하고, 문제를 풉니다.
  2. 형식 경찰 (FEM): 이것은 별도의 더 작은 보조 모듈입니다. 수학을 풀지는 않습니다. 이 모듈의 유일한 임무는 로봇의 출력을 지켜보며, "이봐요, 거의 끝에 다 왔는데, 숫자를 말하기 전에 '최종 정답은'이라고 말해야 해요"라고 속삭이는 것입니다.

마법은 이들이 대화하는 방식에서 일어납니다. 형식 경찰은 특수한 "확률적 예측(probabilistic lookahead)"(미래를 엿보는 세련된 방식)을 사용하여 다음과 같이 예측합니다. "만약 로봇이 지금 '최종'이라고 말한다면, 문장을 올바르게 마칠 확률이 얼마나 될까?" 만약 확률이 낮다면, 경찰은 로봇의 생각을 멈추게 하지 않으면서도, 다음 단어 선택을 부드럽게 유도하여 경로를 다시 잡아줍니다.

비밀 병기

이 팀워크가 컴퓨터 속도를 늦추지 않고 빠르게 작동하도록 하기 위해, 저자들은 세 가지 멋진 기술을 도입했습니다:

  • 지시 사항 인지 증류 (Instruction-Aware Distillation): 형식 경찰을 무작위의 지루한 채팅 데이터로 훈련시키는 대신, 로봇이 실제로 문제를 풀려고 할 때 어떻게 행동하는지에 초점을 맞춰 훈련시켰습니다. 이를 통해 경찰은 로봇이 다음에 무엇을 할 가능성이 높은지 훨씬 더 똑똑하게 파악할 수 있게 되었습니다.
  • 유연한 트라이 구축 (Flexible Trie Building): 정답이 나타날 수 있는 모든 가능한 경로의 지도를 상상해 보세요. 보통 정답의 길이가 다양하면 이 지도는 거대하고 복잡해집니다. 저자들은 경로를 병합하여 컴퓨터가 모든 가능성을 확인하느라 과부하가 걸리지 않도록 하는 "유연한" 지도를 구축했습니다.
  • HMM 상태 가지치기 (HMM State Pruning): 형식 경찰은 수천 개의 숨겨진 상태를 가진 거대한 두뇌를 가지고 있습니다. 저자들은 대부분의 시간 동안 로봇이 아주 적은 수의 상태에만 관심을 갖는다는 점을 깨달았습니다. 그래서 경찰이 나머지 상태들을 무시하도록 하여, 정확도는 거의 유지하면서도 계산량을 약 13배 줄였습니다 (단계당 약 1.08 GFLOPs에서 0.08 GFLOPs로 감소).

수치가 말해주는 것

연구팀은 세 가지 서로 다른 과제를 통해 이를 테스트했습니다:

  1. 수학 문제 (GSM8k): 초등학교 수준의 수학 문제를 풀 때, DECO-G는 다른 방법들을 지속적으로 앞질렀습니다. 예를 들어, Llama-3.1-8B 모델의 경우, DE-CO-G는 **85.2%**의 정답률을 기록하면서 **100%**의 형식 준수율을 유지했습니다. 반면, "Outlines"라는 엄격한 방식은 **81.3%**의 정답률을 보였고, 표준적인 "프롬프트 전용(Prompt-Only)" 방식은 **82.3%**의 정답률을 보였으나 형식을 지키는 데 대부분 실패했습니다.
  2. 이벤트 추출 (Event Extraction): 뉴스 기사에서 특정 세부 정보를 추출하도록 요청했을 때, DECO-G는 누가 무엇을 했는지 식별하는 점수(Llama 기준 "Argument Id" 지표가 39.4까지 상승)를 개선했습니다.
  3. LLM-as-a-Judge: 로봇이 요약문을 채점해야 할 때, DECO-G는 인간 심판과의 정렬을 개선하여 가장 높은 평균 상관관계 점수(Llama의 일관성(Coherence) 기준 0.418)를 달ت했습니다.

결론

이 논문은 "생각하는 것"과 "형식을 맞추는 것"을 분리함으로써, 수학적으로 정확하면서도 형식이 완벽한 답변이라는 두 마리 토끼를 모두 잡을 수 있다고 제안합니다. 저자들은 실제 데이터셋을 통해 측정했을 때, DECO-G가 모든 것을 한꺼번에 처리하거나 엄격한 제약을 가하는 방식보다 일관되게 우수한 성능을 보였다는 점을 확인했습니다.

하지만 몇 가지 주의사항도 언급했습니다. 이 시스템은 어떤 로봇에게나 즉시 적용되는 마법 지팡이가 아닙니다. 사용하는 각 로봇 모델마다 새로운 "형식 경찰"을 훈련시켜야 합니다. 또한, 일부 모델(Qwen 시리즈 등)의 경우 로봇의 집중력이 매우 높아서, 경찰이 말을 잘 듣도록 더 강하게 밀어붙여야 합니다(제어 계수 γ=2\gamma=2 사용).

요약하자면, DECO-G는 로봇이 수학 천재이면서 동시에 형식의 완벽주의자가 되길 원한다면, 두 가지를 동시에 시키지 말라고 조언합니다. 규칙을 담당할 파트너를 붙여준다면, 로봇은 자신의 능력을 마음껏 발휘할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →