← 최신 논문
💬 NLP

Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation

이 논문은 사용자가 텍스트 생성 시 사실성 제약 조건을 지정하여 정확성과 정보성 사이의 절충안을 탐색할 수 있게 하는 프레임워크인 사실성 제어 생성(Factuality-Controlled Generation, FCG)을 소개하며, 합성 데이터로 학습하는 것이 이러한 상충하는 목표 사이의 균형을 맞추는 모델의 능력을 크게 향상시킨다는 점을 입증한다.

원저자: Ziwei Gong, Yanda Chen, Julia Hirschberg, Chen Zhao, He He, Zhou Yu, Kathleen Mckeown

게시일 2026-02-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziwei Gong, Yanda Chen, Julia Hirschberg, Chen Zhao, He He, Zhou Yu, Kathleen Mckeown

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신에게 아주 똑똑하고 박학다식한 로봇 비서가 하나 있습니다. 이 로봇은 아는 것이 매우 많지만, 까다로운 성격을 가지고 있습니다. 때로는 어떤 사실에 대해 100% 확신하지만, 또 어떤 때는 그저 흥미롭게 들리려고 추측하거나 말을 지어내기도 합니다.

당신이 로봇에게 질문을 던지면, 로봇은 딜레마에 빠집니다.

  • 옵션 A: 매우 짧고 지루하지만 100% 진실인 답변을 줄 수 있습니다. 하지만 흥미로운 세부 사항들을 놓칠 수 있습니다.
  • 옵션 B: 길고 흥미진진하며 상세한 답변을 줄 수 있지만, 그 세부 사항 중 일부가 지어낸 것이거나 틀릴 위험이 있습니다.

보통 로봇은 둘 중 하나를 선택하며, 당신은 로봇에게 "헤이, 90% 정도 정확한 답변을 줘"라거나 "흥미로운 내용은 포기하더라도 무조건 100% 사실만 말해줘"라고 말할 수 없습니다.

문제점: 로봇이 말을 듣지 않는다

연구진들은 단순히 로봇에게 "더 사실적으로 말해줘!"라거나 "80% 정확한 답변을 줘"라고 말하는 방식으로 이 문제를 해결하려 했습니다.

불행히도, 로봇은 말을 듣지 않았습니다. 이는 마치 이야기에 한창 몰입해 있는 수다스러운 친구에게 "짧게 말해줘"라고 부탁하는 것과 같습니다. 그들은 계속해서 이야기를 늘어놓을 뿐입니다. 연구진이 매우 엄격하게(100% 정확하게) 요청했을 때조차, 로봇은 이를 안정적으로 수행하지 못했습니다. 로봇은 틀린 답을 내놓거나, 아예 말을 멈춰버리곤 했습니다.

해결책: "팩트 필터"로 로봇을 훈련시키기

연구진은 **사실성 제어 생성(Factuality-Controlled Generation, FCG)**이라는 새로운 시스템을 만들었습니다. 단순히 로봇에게 친절하게 부탁하는 대신, 학생을 가르치듯 로봇을 훈련시키기로 결정했습니다.

그들이 이 과정을 수행한 방법은 다음과 같습니다. 간단한 비유를 들어 설명하겠습니다.

1. "초안 작성" 단계:
먼저, 로봇에게 아무런 규칙 없이 유명 인사의 상세한 전기를 쓰라고 요청했습니다. 로봇은 거대한 이야기를 써 내려갔습니다.

2. "신뢰도 확인" 단계:
다음으로, 로봇에게 자신이 쓴 모든 문장을 검토하고 그 문장이 얼마나 사실이라고 확신하는지 점수를 매기게 했습니다.

  • 문장: "달은 치즈로 만들어졌다." -> 로봇의 답변: "이 문장이 사실이라고 확신하는 정도는 0%입니다."
  • 문장: "달은 지구의 궤도를 돈다." -> 로봇의 답변: "이 문장이 사실이라고 100% 확신합니다."

3. "편집" 단계:
이제 구체적인 규칙을 만들었습니다. 로봇에게 이렇게 말했습니다. "만약 네가 80% 정확한 답변을 주고 싶다면, 목표치인 80%에 도달할 때까지 확신이 가장 낮은 문장들을 삭제해야 한다."

그들은 이를 수학적으로 처리했습니다. 만약 로봇에게 80% 정확한 답변을 요구했다면, 로봇의 긴 초안에서 '불확실한' 사실들을 잘라내고 '확실한' 사실들만 남겼습니다. 이 과정은 다양한 수준(80%, 90%, 100%)에 대해 반복되었습니다.

4. "학습" 단계:
이 편집된 예시들(질문 + "80% 정확하게 작성" + 편집된 답변)을 사용하여 로봇을 재학습시켰습니다. 로봇에게 이렇게 가르친 것입니다. "숫자 80을 보면, 너는 자신의 생각을 어떻게 편집하여 그 목표치에 도달해야 하는지 정확히 알게 된다."

결과: 스스로 조절할 수 있는 로봇
이 훈련을 거친 후, 로봇은 지시를 따르는 능력이 훨씬 좋아졌습니다.

  • 훈련 전: 100% 정확도를 요구하면, 로봇은 자주 실패하거나 빈 답변을 내놓았습니다.
  • 훈련 후: 100% 정확도를 요구했을 때, 로봇은 완전히 진실한 답변을 성공적으로 제공했습니다. 80% 정확도를 요구했을 때는, 여전히 대부분 정확하면서도 더 길고 흥미로운 답변을 제공했습니다.

"트레이드오프(Trade-off)" 비유:
로봇의 출력물을 과일 샐러드라고 생각해 보세요.

  • **사실성(Factuality)**은 과일이 얼마나 신선하고 진짜인지의 정도입니다.
  • **정보성(Informativeness)**은 과일 그릇의 크기입니다.

보통 100% 신선한 과일만을 원한다면, 거의 모든 것을 버려야 하므로 아주 작은 그릇이 남게 됩니다. 반대로 아주 큰 그릇을 원한다면, 멍들거나 의심스러운 과일을 포함해야 합니다.

연구진은 이 새로운 훈련 방식이 로봇으로 하여금 (이전과 같은 수준의) 신선함을 유지하면서도 더 큰 그릇(더 많은 정보)을 만들 수 있게 해준다는 것을 발견했습니다. 즉, 나쁜 과일 없이도 더 맛있는 과일 샐러드를 만들 수 있도록 한계를 끌어올린 것입니다.

요약

이 논문은 똑똑한 AI에게 단순히 "더 사실적으로 말해줘"라고 말하는 것만으로는 기대한 효과를 얻을 수 없음을 보여줍니다. 대신, 특정 정확도 목표를 달성하기 위해 자신의 답변을 어떻게 편집해야 하는지 예시를 통해 직접 보여주어야 합니다. 이렇게 훈련되면, 로봇은 마치 다이얼처럼 작동할 수 있습니다. 당신이 노브를 돌려 "높은 정확도, 낮은 디테일" 또는 "중간 정도의 정확도, 높은 디테일"로 설정하면, 로봇은 당신이 요구한 그대로를 확실하게 제공할 것입니다.

참고: 연구진은 이 방법을 인물 전기 작성에 특화하여 테스트했습니다. 이 논문에서 의료 조언, 법률 문서 또는 기타 특정 현실 세계의 응용 분야에 대한 테스트는 수행하지 않았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →