UTS at CheckThat! 2026: Cite-Frame Engineering for Generated Fact-Checking Articles
UTS 시스템은 산문 생성이 아닌 인용 검증만을 위해 소형 LLM을 활용하여 함의 및 커버리지 점수를 극대화하는 도메인 귀속 인용 프레임과 섀도우 검증 앵커 피커로 강화된 결정론적 템플릿 기반 생성기를 채택함으로써 CheckThat! 2026 Task 3에서 2위를 달성했다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 정보 생태계에서 주장의 진위 여부를 확인하는 것은 전투의 절반에 불과하며, 나머지 절반은 왜 그것이 참인지 혹은 거짓인지를 인간 독자에게 설명하는 것입니다. 이것이 바로 자동 팩트체크의 영역이며, 컴퓨터가 저널리스트의 엄격한 업무를 모방하려고 시도하는 분야입니다. 과제는 단순히 적절한 증거를 찾는 것뿐만 아니라, 그 증거를 인간이 신뢰할 수 있고 컴퓨터가 검증할 수 있는 일관된 기사로 엮어내는 것입니다. 최근 열린 CheckThat! 2026 대회는 팀들에게 이러한 팩트체크 기사를 자동으로 생성하는 시스템을 구축하도록 과제를 부여했습니다. 시스템은 특정 주장을 받아들여, 웹 링크 목록에서 뒷받침하는 증거를 찾아내고, 해당 링크들을 인용하여 짧은 보고서를 작성해야 했습니다. 채점 방식은 가차 없었습니다. 한 컴퓨터 프로그램이 인간이 작성한 예시와 얼마나 잘 일치하는지, 그리고 결정적으로 출처를 인용하는 모든 문장이 실제로 그 출처의 텍스트에 의해 뒷받침되는지를 기준으로 기사를 채점했습니다. 만약 시스템이 세부 사항을 지어내거나 출처를 조금이라도 잘못 인용한다면, 컴퓨터는 이를 매우 엄격하게 감점했습니다.
시드니 공과대학교(University of Technology Sydney)의 한 팀은 대부분의 팀과는 다른 경로를 택하는 시스템을 가지고 이 대회에 참가했습니다. 다른 팀들이 강력한 인공지능을 사용하여 전체 기사를 처음부터 작성하려고 노력한 반면, 시드니 팀은 본문에는 엄격하고 예측 가능한 템플릿을 사용하고, 인공지능은 오직 출처를 확인하는 엄격한 문지기로만 사용하는 시스템을 구축했습니다. 그들의 접근 방식 덕분에 그들은 11개 팀 중 2위를 차지했습니다. 그들의 성공 비결은 더 창의적인 산문을 만들어내는 데 있는 것이 아니라, 컴퓨터 심사위원이 정확히 어떻게 작동하는지를 이해하는 데 있었습니다. 그들은 심사위원이 매우 보수적이며, 제공된 사실에 밀접하게 붙어 있는 기사는 보상하지만, 추가적인 미사여구나 검증되지 않은 세부 사항을 더하는 문장은 거부한다는 사실을 발견했습니다. 이러한 엄격한 규칙을 준과하도록 시스템을 설계함으로써, 그들은 비록 아주 우아하지는 않더라도 정확한 팩트체크 기사를 안정적으로 생산할 수 있는 기계를 만들어냈습니다.
연구진은 가장 당연한 아이디어, 즉 대규모 언어 모델(전문적인 팩트체커처럼 글을 쓸 수 있는 유형의 인공지능)이 전체 기사의 초안을 작성하게 하는 것부터 테스트를 시작했습니다. 그들은 기계가 전문적인 팩트체커처럼 들리기를 바라며 다양한 크기의 모델로 이를 시도했습니다. 하지만 실패했습니다. 이 모델들이 생성한 기사들은 컴퓨터 채점 시스템을 지속적으로 통과하지 못했습니다. 문제는 구조적이었습니다. 컴퓨터 심사위원은 텍스트 내의 특정 패턴, 특히 출처가 인용되는 방식을 살폈습니다. 인공지능이 자연스럽게 글을 쓰려고 할 때, 출처를 언급하는 방식을 바꾸거나 원본 증거와 대조하여 검증할 수 없는 단어를 추가하는 경우가 빈번했습니다. 리뷰어의 이름이나 날짜를 추가하는 것과 같은 아주 작은 변화조차도 컴퓨터가 해당 문장을 거부하게 만들었습니다. 인공지능이 글을 더 잘 쓰는 능력이 뛰어날수록, 심사위원이 요구하는 엄격한 패턴에서 더 많이 벗어나게 되었습니다. 팀은 기계를 더 "잘 쓰게" 만드는 것이 오히려 성능을 떨어뜨리고 있다는 사실을 깨달았습니다.
글쓰기를 개선하는 대신, 팀은 구조를 개선하기로 결정했습니다. 그들은 단순하고 변하지 않는 템플릿으로 시작하는 시스템을 구축했습니다. 이 템플릿은 헤드라인, 각 증거에 대한 단일 문장, 그리고 결론을 가진 기본적인 기사를 생성합니다. 이 "스텁(stub)" 초안은 지루했지만 안전했습니다. 그것은 규칙을 완벽하게 따랐습니다. 팀은 품질 관리 검사관 역할을 하는 두 가지 특정 도구를 이 시스템에 추가했습니다. 첫 번째 도구인 '도메인 귀속 프레임(domain-attribution frame)'은 각 인용구를 "웹사이트에 따르면, [사실]"과 같은 표준 문구로 감싸는 역할을 합니다. 이 작은 변화는 사실을 바꾸지 않으면서도 문장이 컴퓨터가 비교 대상으로 삼는 인간 작성 예시와 더 비슷하게 들리도록 만들었습니다. 두 번째 도구는 '섀도우 밸리데이터(shadow validator)'였습니다. 시스템이 문장을 확정하기 전에, 작은 인공지능 모델에게 해당 특정 문장이 출처 링크에 의해 실제로 뒷받침되는지 확인하도록 요청했습니다. 만약 모델이 아니라고 답하면, 시스템은 소스 텍스트의 다음 문장으로 넘어갔습니다. 만약 그것마저 실패한다면, 원래의 안전한 문장을 그대로 유지했습니다. 이를 통해 시스템이 생성하는 모든 인용구가 컴퓨터 심사위원이 수용할 수 있는 내용임을 보장했습니다.
이러한 접근 방식의 결과는 명확하고 측정 가능했습니다. 대회 전 시스템을 테스트하기 위해 사용된 검증 데이터에서, 그들의 방법은 기본 템플릿에 비해 작지만 유의미한 차이로 전체 점수를 향상시켰습니다. 프레이밍 도구와 섀도우 밸리데이터를 결합했을 때 향상은 더욱 컸습니다. 시스템은 영리해지려 하지 않았습니다. 그저 모든 문장이 검증 가능하고 올바른 형식을 따르도록 보장했습니다. 최종 대회에서 그들의 시스템은 0.484점을 기록하며 11개 팀 중 2위를 차지했습니다. 우승한 팀은 더 높은 점수를 받았는데, 그 격차는 전적으로 '인용 정밀도(citation precision)'라는 특정 지표 때문이었습니다. 우승 팀은 아마도 확신이 없는 인용을 생략하는 방식을 선택함으로써 훨씬 더 높은 정확도로 출소를 인용했을 것이며, 반면 시드니 팀은 주어진 모든 출처를 인용했습니다. 시드니 팀의 시스템은 매우 신뢰할 수 있어서 거의 모든 가용 증거를 인용했지만, 불확실한 것을 제외하지 않았기 때문에 정밀도 점수가 낮았습니다.
팀의 연구는 자동 팩트체킹의 미래에 대한 두 가지 중요한 교훈을 남겼습니다. 첫째, 컴퓨터 심사위원이 검증에 대해 엄격하게 설계된 경우, 추가적인 단어를 넣거나 텍스트를 더 인간처럼 들리게 하려는 시도는 오히려 점수에 해가 됩니다. 가장 효과적인 전략은 텍스트를 단순하게 유지하고 증거에 엄격하게 결합하는 것이었습니다. 둘째, 문장을 선택하는 데 사용되는 도구들은 종종 오해의 소지가 있었습니다. 팀은 소스에서 "최선의" 문장을 고르는 표준적인 방법들, 예를 들어 가장 긴 문장을 찾거나 주장과 가장 관련 있는 문장을 찾는 방식이 컴퓨터 심사위원이 거부할 문장을 고르게 된다는 것을 발견했습니다. 가장 신뢰할 수 있는 문장 선택 방법은 심사위위에게 직접 물어보는 것이었습니다. 이 통찰은 정확도가 엄격한 검증에 의해 측정되는 작업에서는 새로운 콘텐츠를 생성하는 것이 아니라, 기존 콘텐츠를 신중하게 선별하고 검증하는 것이 최선이라는 점을 시사합니다.
연구진은 또한 자신들의 시스템에 한계가 있음을 언급했습니다. 제공된 모든 증거를 반드시 인용해야 했기 때문에, 정확도 점수를 높이기 위해 불확실한 출처를 건너뛰었을 것으로 추정되는 우승 팀의 전략을 채택할 수 없었습니다. 시드니 팀은 만약 심사위원이 확신하지 못하는 인용을 제외하는 규칙을 추가했다면 점수가 더 높았을 수도 있다고 가설을 세웠습니다. 그러나 대회 기간 중에는 이를 테스트하지 않았습니다. 그들의 연구는 고도의 검증 작업에서, 인간처럼 쓰려고 노력하는 복잡한 인공지능 모델보다 정확성을 우선시하는 단순하고 결정론적인 시스템이 더 나은 성과를 낼 수 있음을 보여주는 입증 사례입니다. 논문은 차세대 시스템의 초점이 더 나은 산문을 생성하는 것에서, 기계가 쓰는 모든 단어가 진실임을 증명할 수 있도록 무엇을 포함하고 무엇을 제외할지 결정하는 더 스마트한 방법을 개발하는 것으로 이동해야 한다고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.