상상해 보세요. 인터넷 뉴스와 SNS 에 매일 수천만 개의 정보가 쏟아집니다. 그중에는 진짜 사실도 있지만, 거짓말이나 과장된 소문도 섞여 있죠. 이런 '거짓 정보 (Misinformation)'는 마치 불타는 산불처럼 순식간에 퍼집니다. 하지만 그 불을 끄는 '팩트체크 (사실 확인)' 작업은 수공으로 하는 정밀한 소방 작업이라서 너무 느립니다.
현재의 문제: 사람이 일일이 모든 뉴스를 읽고 "이게 사실일까?"라고 확인하려면 시간이 너무 걸립니다. 거짓말이 퍼진 뒤에야 "아니, 그건 거짓이었어요"라고 말하면 이미 늦은 경우가 많죠.
목표: 컴퓨터가 자동으로 "이 문장은 사실 확인이 필요해!"라고 찾아내서, 사람이 그 부분만 집중해서 빠르게 확인하게 도와주는 것입니다.
2. ClaimPT 란 무엇인가요? (해결책)
지금까지 이런 작업을 돕는 데이터는 영어로만 많이 있었습니다. 하지만 포르투갈어 (특히 유럽 포르투갈어) 로는 이런 자료가 거의 없었습니다. 그래서 연구팀이 ClaimPT를 만들었습니다.
비유: ClaimPT 는 **컴퓨터가 '팩트체크'를 배우기 위한 '교과서'**입니다.
구성: 포르투갈 뉴스 통신사 (LUSA) 와 협력하여 1,308 개의 실제 뉴스 기사를 모았습니다.
특이점: 대부분의 기존 자료는 트위터 같은 SNS 글이나 정치 토론 기록을 사용했는데, ClaimPT 는 전문 기자가 쓴 정제된 뉴스 기사를 다룹니다. 이는 더 신뢰할 수 있고 중요한 정보들을 다루기 때문입니다.
3. 어떻게 만들었나요? (작업 과정)
이 '교과서'를 만들기 위해 연구팀은 아주 꼼꼼하게 작업을 했습니다.
데이터 수집: 2022 년부터 2023 년까지의 뉴스 기사 1,308 개를 모았습니다. 정치, 사회, 경제 등 다양한 주제를 다뤘습니다.
이중 검증 (Double Check): 각 기사를 전문가 2 명이 따로따로 읽으며 "이 문장이 사실 확인이 필요한가?"를 표시했습니다.
심사위원 (Curator): 두 사람의 의견이 다르면, 제 3 의 전문가가 최종적으로 결정했습니다. 마치 법정에서 배심원 2 명이 의견을 내고 판사가 최종 판결을 내리는 것과 비슷합니다.
세부 정보 기록: 단순히 "이게 거짓이야"라고만 표시한 게 아니라, **누가 (Claimer), 언제 (Time), 어떤 주제 (Topic) 로, 어떤 태도 (Stance)**로 말했는지까지 세세하게 분류했습니다.
4. 데이터는 어떤가요? (결과물)
양: 1,308 개의 기사에 총 6,875 개의 표시가 달렸습니다.
난이도: 뉴스 기사 전체 중에서 '사실 확인이 필요한 문장'은 약 10% 미만으로 매우 드뭅니다. 마치 바다에서 바늘을 찾는 것처럼 어렵습니다. 하지만 이 드문 바늘들을 찾아내는 것이 바로 이 데이터의 핵심 가치입니다.
품질: 두 전문가가 같은 문장을 표시했을 때의 일치율이 어느 정도였는지 (약 50~70%) 를 공개하여, 이 데이터가 얼마나 신뢰할 만한지 투명하게 보여줍니다.
5. 컴퓨터는 잘할까요? (실험 결과)
연구팀은 최신 인공지능 (AI) 모델들을 이 '교과서'로 훈련시켜 보았습니다.
생성형 AI (Gemini 등): "이 문장이 사실일까?"라고 물으면 대략적인 감은 잡지만, 정확한 문장 끝과 시작을 찾아내는 데는 약했습니다. 마치 "이 책에 거짓말이 있겠지"라고 추측은 하지만, 정확한 페이지 번호를 못 찾는 것과 비슷합니다.
전통적 AI (BERT 등): 문장 단위로 잘게 나누어 분석하는 방식이 더 잘 작동했습니다.
결론: 아직 완벽하지는 않지만, 이 데이터가 있으면 AI 가 점점 더 똑똑해져서 뉴스 속의 거짓말을 찾아내는 속도가 빨라질 것입니다.
6. 요약 및 의의
이 논문은 **"포르투갈어 뉴스 속의 거짓말을 찾아내는 AI 를 키우기 위한 최고의 훈련 자료 (ClaimPT) 를 공개했다"**는 소식입니다.
의미: 이제 포르투갈어 연구자들도 영어 연구자들과 마찬가지로, 뉴스 속의 허위 정보를 막기 위한 AI 기술을 개발할 수 있게 되었습니다.
미래: 이 데이터를 바탕으로 더 똑똑한 AI 가 만들어지면, 우리가 뉴스를 볼 때 "이건 사실일까?"라는 걱정을 덜고, 더 빠르게 정확한 정보를 얻을 수 있게 될 것입니다.
한 줄 요약:
"거짓 뉴스가 산불처럼 퍼지는 시대에, 컴퓨터가 자동으로 '진짜와 가짜'를 구별할 수 있도록 포르투갈어 뉴스로 만든 정밀한 훈련 지도를 공개했습니다."
1. 문제 정의 (Problem)
팩트체크의 한계: 온라인 허위 정보 (Misinformation) 의 확산 속도에 비해 팩트체크는 여전히 수동적이고 시간이 많이 소요되는 작업입니다. 허위 정보를 반박하는 데 걸리는 시간이 정보 전파 시간보다 길어 자동화가 시급합니다.
데이터 부족: 자동화된 팩트체크 연구는 '주장 (Claim)' 식별이 첫 단계이나, 현재 대부분의 학습 데이터는 영어 기반이며 소셜 미디어나 의회 발언에 집중되어 있습니다.
포르투갈어 리소스 부재: 포르투갈어 (특히 유럽 포르투갈어) 는 저자원 (Low-resource) 언어로, 뉴스 기사와 같은 전문 저널리즘 콘텐츠에 대한 공인된 어노테이션 데이터셋이 부족하여 NLP 연구와 응용 개발이 제한받고 있습니다.
2. 방법론 (Methodology)
A. 데이터 수집 (Data Acquisition)
소스: 포르투갈 뉴스 에이전시인 LUSA와의 파트너십을 통해 2022 년 1 월 4 일부터 2023 년 12 월 28 일까지의 뉴스 기사를 수집했습니다.
선정 기준: 정치, 사회, 경제 등 다양한 주제를 포함하되, 주장이 풍부한 직접 인용 (Direct Speech) 문장을 포함하는 기사를 우선적으로 선정했습니다.
규모: 최종적으로 1,308 개의 뉴스 기사를 확보했습니다.
B. 어노테이션 스키마 (Annotation Scheme)
ClaimPT 는 기존 스키마 (NewsClaims, ClaimBuster) 를 기반으로 하지만, 뉴스 기사의 특성을 반영하여 다층 구조 (Multi-layer architecture) 를 도입했습니다.
주장 (Claim) 정의: 검증 가능한 사실적 진술로, 공공의 이익과 관련 있으며 외부 출처 (기자가 아닌 화자) 에 의해 발표된 직접 화법 내의 문장.
주요 레이블 및 속성:
Claim vs. Non-Claim: 사실적 주장과 의견/예측/신념 등을 구분.
Claim Span: 주장이 포함된 텍스트 구간.
Claimer (화자): 주장을 한 주체 (개인, 기관 등). 단, WHO 등 공식적이고 검증 불필요한 출처는 제외.
Topic (주제): 주장의 주제 (정치, 사회 등).
Stance (태도): 주장의 긍정 (Affirm) 또는 부정 (Refute).
Time (시간): 주장이 이루어진 시간적 범위.
Link Structures: 화자의 동일성 (Identity_link) 및 속성 연결.
프로세스: 두 명의 훈련된 어노테이터가 독립적으로 작업하고, 숙련된 큐레이터가 검증하여 일관성을 확보했습니다.
C. 실험 설정 (Baselines)
작업: 텍스트 내 주장의 시작과 끝 위치를 예측하는 스팬 분류 (Span Classification) 작업.
모델:
Generative Models: Gemini 2.5 Flash 및 Flash-Lite (Few-shot learning 사용).
Encoder Models: BERTimbau (포르투갈어 BERT) 를 미세 조정 (Fine-tuning). 문장 단위 분할 (Sentence-level) 과 청킹 (Chunking with overlap) 전략 적용.
3. 주요 기여 (Key Contributions)
ClaimPT 데이터셋 공개: 유럽 포르투갈어 뉴스 기사 기반의 첫 번째 대규모 주장 어노테이션 데이터셋 (1,308 개 기사, 6,875 개 어노테이션) 을 공개했습니다.
새로운 어노테이션 스키마 제안: 뉴스 저널리즘의 맥락 (직접 인용, 화자 속성, 시간적 맥락) 을 포착할 수 있도록 설계된 정교한 스키마를 제안했습니다.
벤치마크 확립: 최신 LLM 과 BERT 기반 모델을 활용한 베이스라인 실험을 수행하여 포르투갈어 주장 탐지 작업의 초기 성능 기준을 제시했습니다.
4. 실험 결과 (Results)
A. 어노테이터 간 일치도 (Inter-Annotator Agreement)
Claim/Non-Claim 식별: F1 점수 0.5236, Jaccard 33.65% 로 moderate 수준. 이는 주장 식별 작업의 본질적인 모호성 (예: 신뢰할 수 있는 출처의 판단 기준) 을 반영합니다.
속성 일치도: Claimer(화자) 와 Time(시간) 은 높은 일치도 (F1 0.79~0.93) 를 보였으나, Claim Object(주장 대상) 는 해석의 여지로 인해 일치도가 낮았습니다 (F1 0.44).
B. 모델 성능 (Baseline Performance)
Generative Models (Gemini): 주장 탐지 (Claim) 의 F1 점수가 낮음 (Flash: 12.05%, Flash-Lite: 5.35%). 모델이 인용구 전체를 주장으로 잘못 인식하거나, 검증 불가능한 일반화를 주장으로 오인하는 경향이 있었습니다.
Encoder Models (BERT):BERT-Sent(문장 단위) 전략이 가장 우수했습니다.
Claim F1: 30.57%
Non-Claim F1: 69.27%
Micro Avg F1: 66.38%
분석: 생성형 모델은 긴 문맥 이해에는 강점이 있으나, 정확한 텍스트 스팬 (Span) 추출에는 한계가 있음을 보였습니다. 반면, BERT 기반 모델이 실제 뉴스 텍스트에서의 주장 경계를 더 정확하게 식별했습니다.
5. 의의 및 결론 (Significance & Conclusion)
저자원 언어 연구 촉진: 영어 중심의 팩트체크 연구 생태계에서 포르투갈어 저변을 넓혀, 저자원 언어에서의 자동 팩트체크 연구 기반을 마련했습니다.
실제 적용 가능성: 소셜 미디어가 아닌 전문 뉴스 기사를 대상으로 하여, 저널리즘 환경에서의 허위 정보 탐지 및 자동 팩트체크 시스템 개발에 직접적으로 기여합니다.
향후 방향:
다국어 확장 (Guidelines 활용).
최신 모델 (ModernBERT 등) 을 활용한 성능 개선.
어노테이션된 속성 (화자, 주제, 태도) 을 활용한 설명 가능한 (Explainable) 구조화 모델 개발.
이 논문은 ClaimPT 데이터셋과 이를 활용한 벤치마크를 통해 포르투갈어 자연어 처리 (NLP) 분야, 특히 팩트체크 및 허위 정보 탐지 연구에 중요한 자원을 제공한다는 점에서 큰 의의가 있습니다.