← 최신 논문
💻 computer science

Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination

이 논문은 게임 이론 기반의 멀티 에이전트 프레임워크인 G-Frame을 소개하며, 이는 특화된 학습 데이터를 합성하여 과학 분야에서 GPT-4o mini 수준의 성능을 달성하는 동시에 구조적이고 공리적인 추론을 통해 환각 현상을 현저히 줄인 7B 언어 모델인 OmniChem을 생성합니다.

원저자: Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu, Xinghai Li, Harry Yang, Wenbo Yang, Jinzhe Cao, Shengyang Tao

게시일 2026-07-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu, Xinghai Li, Harry Yang, Wenbo Yang, Jinzhe Cao, Shengyang Tao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수백만 권의 책을 읽고 몇 초 만에 이야기를 쓸 수 있는, 매우 똑똑하고 매우 빠른 로봇 비서가 있다고 상상해 보세요. 하지만 한 가지 함정이 있습니다. 이 로봇은 약간의 공상가 기질이 있어서, 당신이 까다로운 과학 질문을 던지면 완벽하게 들리지만 실제로는 완전히 틀린 사실들을 지어내곤 합니다. 이를 "환각(hallucination)"이라고 부르며, 이는 새로운 약물이나 신소재를 설계하려는 사람들에게는 매우 큰 문제입니다.

당신이 읽고 있는 이 논문은 이 공상가 문제를 해결하기 위해 G-Frame이라는 영리한 새로운 시스템을 소개합니다. G-Frame을 단일 로봇이 아니라, 고도의 긴장감이 흐르는 게임 쇼의 패널들처럼 협력하는 특화된 에이전트 팀이라고 생각해보세요.

문제점: 공상하는 로봇

표준 AI 모델은 문장이 어떻게 '보이는지'는 잘 기억하지만, 논리나 물리학의 엄격한 규칙을 이해하는 데는 서툰 학생과 같습니다. 만약 당신이 가볍고 빠른(작은) AI 모델에게 화학 반응을 설계하라고 요청한다면, 그 모델은 실제 존재하는 것처럼 보이지만 실제로는 존재할 수 없는 분자를 만들어낼 수도 있습니다. 논문은 단순히 AI를 더 크게 만들거나 더 많은 데이터를 주는 것만이 정답은 아니라고 주장합니다. AI는 단순히 다음에 올 내용을 추측하는 것이 아니라, 엄격한 "게임의 규칙"(공리적 추론)을 따르는 법을 배워야 합니다.

해결책: 게임을 수행하는 팀

연구진은 AI가 공상을 멈추고 논리적으로 생각하도록 강제하기 위해 두 가지 주요 게임 전략을 사용하는 G-Frame을 구축했습니다.

  1. 팀 게임 ( "단계별로 나누기" 전략):
    복잡한 화학 문제가 거대하고 무시무시한 산이라고 상상해 보세요. 혼자서 그 산을 오르려는 단일 로봇은 길을 잃고 미끄러질 수 있습니다. G-Frame은 이 산을 작고 관리 가능한 단계들로 나눕니다. 그리고 특정 작업들을 처리하기 위해 서로 다른 "에이전트"(작은 로봇 조수들)를 배정합니다. 한 에이전트는 데이터를 정제하고, 다른 에이전트는 논리를 점검하며, 세 번째 에이전트는 엄격한 감독관 역할을 합니다. 이들은 서로의 숙제를 검사하며 업무를 전달합니다. 이는 AI가 압도당해 침묵을 메우기 위해 사실을 지어내는 것을 방지합니다.

  2. 베이지안 게임 ( "스마트한 도박사" 전략):
    이 부분은 새로운 카드가 나올 때마다 끊임없이 전략을 업데이트하는 포커 플레이어와 같습니다. 시스템은 단순히 추측하는 것이 아니라, "사전(prior)" 추측(자신이 아는 바를 바탕으로 한 최선의 추측)을 한 다음 결과를 확인합니다. 만약 결과가 이상해 보이면, 자신의 "믿음"을 업데이트하고 다시 시도합니다. 이 루프를 반복하며 결정 사항을 정교화하여, 화학의 엄격한 규칙에 부합하는 가장 논리적인 답을 찾아냅니다.

결과: OmniChem를 만나다

이 게임 플레이 프레임워크를 사용하여, 연구진은 OmniChem이라는 이름의 새로운 70억 파라미터 AI 모델을 훈련시켰습니다. 그들은 단순히 무작위로 책을 읽힌 것이 아니라, G-Frame을 사용하여 화학 분야에 특화된 **363,045개의 사고의 사슬(chains-of-thought, 단계별 추론 가이드)**과 199,589개의 질의응답 쌍으로 구성된 방대한 라이브러리를 생성했습니다.

결과는 인상적입니다:

  • 성능: OmniChem은 커스텀 화학 테스트와 ChemBench 벤치마크에서 유명한 GPT-4o mini만큼 우수한 성능을 보여주었습니다.
  • 환각 감소: 기본 버전과 비교했을 때, OmniChem은 "공상"(환각)을 무려 **79.46%**나 줄였습니다.
  • 실제 기술: 이 모델은 단순히 테스트에만 강한 것이 아니었습니다. OmniChem은 심적외선을 흡수하는 새로운 분자를 설계하는 데 성공했고, 흔한 마취제인 **리도카인(lidocaine)**을 단 두 단계 만에 만드는 방법을 알아냈으며, 심지어 딥 블루 소재를 만드는 것에 대한 상세한 연구 보고서를 작성하여 GeminiGPT-o3와 같은 최고 수준의 AI 모델들이 작성한 보고서 품질의 **90%**에 달하는 점수를 받았습니다.

이것이 의미하는 바

이 논문은 AI 훈련을 엄격한 규칙과 팀워크가 있는 구조화된 게임처럼 다룸으로써, 우리는 더 작고 빠른 모델들이 신뢰할 수 있는 과학자가 되도록 가르칠 수 있다는 점을 시사합니다. 모델이 훌륭한 일을 하기 위해 반드시 거대하고 비싼 슈퍼컴퓨터일 필요는 없습니다. 그저 적절한 "게임 계획"이 있으면 됩니다.

연구진은 다른 이들도 자신들의 과학 분야에 이 "팀 게임" 접근 방식을 적용해 볼 수 있도록 코드와 데이터를 공개했습니다. 이는 AI를 단순한 창의적 이야기꾼이 아닌, 발견을 위한 신뢰할 수 있는 파트너로 만드는 유망한 새로운 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →