← 최신 논문
💬 NLP

Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast

본 논문은 자기 대조를 통해 고정보 밀도 토큰의 초기 수렴을 활용하여 생성 품질을 동시에 향상시키고 추론 속도를 가속화하는 확산형 대규모 언어 모델을 위한 학습이 불필요한 디코딩 전략인 FoCore 를 소개합니다.

원저자: Jinyuan Feng, Xin Yu, Yiqun Chen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jinyuan Feng, Xin Yu, Yiqun Chen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 퍼즐, 예를 들어 수학 문제나 코드 작성을 해결하려고 상상해 보세요. 여러분에게는 (전통적인 로봇이 한 장씩 쌓아 올리는 방식이 아니라) 한 번에 전체 그림을 볼 수 있는 매우 똑똑한 조력자 (확산 기반 대규모 언어 모델) 가 있습니다. 이는 초능력입니다. 전체적인 그림을 보고 모든 조각이 어떻게 전역적으로 맞물리는지 이해할 수 있기 때문입니다.

하지만 함정이 하나 있습니다. 이 조력자가 빈칸을 채우려고 할 때, 즉각적인 주변에 산만해지기 쉽습니다. 빈 공간 바로 옆의 단어들에 너무 집중하여 문장 다른 곳에 숨겨진 중요한 단서들을 놓칩니다. 마치 범죄가 일어난 이유를 설명하는 다른 방에서 발견된 결정적인 메모를 무시한 채, 피해자 바로 옆의 발자국만 보고 미스터리를 해결하려는 것과 같습니다.

이 논문의 저자들, **FoCore (핵심에 집중)**는 문장의 모든 단어가 동등하게 만들어지지 않았음을 발견했습니다.

"고밀도" 대 "저밀도" 토큰

문장을 하나의 풍경으로 생각해 보세요.

  • 저밀도 (LD) 토큰: 이들은 "풍경"입니다. "the", "is", "and", "in" 같은 단어들입니다. 문법적으로는 중요하지만, 이를 제거해도 논리의 핵심 의미는 보통 그대로 유지됩니다. 숲속의 풀과 나무와 같습니다. 공간을 채우지만 목적지는 아닙니다.
  • 고밀도 (HD) 토큰: 이들은 "랜드마크"입니다. 숫자, 구체적인 이름, 핵심 동사, 또는 시간 문제의 "4 년 후"와 같은 중요한 논리 단어들입니다. 이를 놓치면 전체 답이 틀리게 됩니다. 이들은 산꼭대기나 등대와 같습니다. 전체 여정을 안내합니다.

이 논문은 현재 AI 모델들이 바로 옆의 풀을 보느라 바빠서 이러한 랜드마크들을 종종 무시한다고 밝혔습니다.

문제: 세부 사항에 빠지는 것

AI 가 답을 생성하려고 할 때, 보통 즉각적인 주변에 기반하여 "가장 안전한" 다음 단어를 선택합니다. 이 논문은 이것이 AI 가 HD 토큰을 놓치게 만든다고 보여줍니다.

  • 예시: "Sarah 는 4 년 후에 20 세가 될 것이다"라는 문장에서 **"in"**은 HD 토큰입니다. 이는 수학이 미래에 관한 것임을 알려줍니다. AI 가 이를 무시하고 "20"과 "4"만 본다면, 그녀의 현재 나이를 찾기 위해 빼야 함에도 불구하고 더해야 한다고 생각할 수 있습니다 (20 + 4 = 24). AI 는 지역적인 함정에 갇혀 전역적인 진실을 놓칩니다.

해결책: FoCore (핵심에 집중)

저자들은 AI 가 생각하는 새로운 방식을 고안했는데, 이를 FoCore라고 합니다. 이는 AI 를 재학습시킬 필요가 없으며, AI 가 작업하는 동안 "생각하는" 방식만 변경합니다.

여기 비유가 있습니다: "자기 대비" 게임.

AI 가 수수께끼를 풀려고 상상해 보세요.

  1. 일반적인 방식: AI 는 자신이 보는 것에 기반하여 다음 단어를 추측합니다.
  2. FoCore 방식: AI 는 "만약 그렇다면?" 게임을 합니다.
    • 이미 파악한 가장 중요한 단어들 (HD 토큰) 을 식별합니다.
    • 그 중요한 단어들을 일시적으로 숨깁니다 (마스킹). 마치 모른 척하는 것입니다.
    • 질문합니다: "만약 이 핵심 단서를 모른다면, 무엇을 추측할까?" (이것이 "부정적인" 추측입니다).
    • 그런 다음, 그 잘못된 추측을 원래 추측과 비교합니다.
    • 결과: "단서를 아는 것"과 "단서를 모르는 것" 사이의 차이를 봄으로써, AI 는 깨닫습니다. "아! 그 단서는 정말 중요해. 그 경로에 집중해야 해."

이 과정은 AI 가 소음으로 떠도는 것이 아니라 중요한 논리 (HD 토큰) 에 주의를 고정하도록 강제합니다.

추가 혜택: FoCore_A (스피드 스타)

이 논문은 또한 흥미로운 점을 발견했습니다: AI 가 "HD 토큰" (랜드마크) 을 파악하면, 실제로 이를 매우 빠르고 확신 있게 안다는 것입니다. 주변의 "LD 토큰" (풍경) 을 결정하는 데는 더 오래 걸립니다.

FoCore_A는 이를 활용하여 속도를 높입니다.

  • 비유: 숲을 걷고 있다고 상상해 보세요. 여러분은 산꼭대기 (HD 토큰) 를 빠르게 발견합니다. 꼭대기를 보면 어느 방향으로 가야 할지 정확히 알게 됩니다. 경로상의 모든 나무 (LD 토큰) 를 하나씩 확인하며 멈출 필요가 없습니다.
  • 작동 원리: AI 가 "랜드마크"가 안정적임을 감지하자마자, 하나씩 확인하는 것을 중단합니다. 대신 나머지 "풍경" 단어들을 병렬로 (한 번에) 채웁니다.
  • 이익: 이로 인해 AI 가 훨씬 빨라집니다. 논문은 오류 없이 답을 생성하는 데 걸리는 시간을 절반 이상 (~20 초에서 ~8 초로) 단축할 수 있다고 주장합니다.

그들이 증명한 것

저자들은 이를 다음과 같은 분야에서 테스트했습니다:

  • 수학 문제: 논리가 중요한 단어 문제 해결.
  • 코딩: 구문과 논리가 완벽해야 하는 컴퓨터 코드 작성.
  • 추론: 논리 퍼즐 해결.

결과:

  • 더 나은 품질: AI 는 실수를 줄이고 더 어려운 문제를 올바르게 해결했습니다. 예를 들어, 코딩 테스트 (HumanEval) 에서 성공률은 약 39% 에서 42% 로 상승했습니다.
  • 더 빠른 속도: 가속화된 버전 (FoCore_A) 은 훨씬 빨라져 답을 생성하는 데 걸리는 시간을 약 58% 단축했습니다.

요약

이 논문은 확산 기반 AI 모델이 전체 그림을 보는 초능력을 가지고 있지만, 현재는 그 그림에서 가장 중요한 부분을 보지 못하게 만드는 전략을 사용하고 있다고 주장합니다. FoCore는 AI 가 그 단서들과 유무에 따라 추측을 비교함으로써 *"나는 중요한 단서에 집중하고 있는가?"*를 끊임없이 확인하도록 가르쳐 이를 해결합니다. 이는 더 똑똑하고, 정확하며, 빠른 답으로 이어집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →