← 최신 논문
💬 NLP

Duluth at SemEval-2026 Task 6: DeBERTa with LLM-Augmented Data for Unmasking Political Question Evasions

이 논문은 LLM 기반의 합성 데이터 증강과 DeBERTa-V3 모델을 결합하여 미국 대통령 인터뷰의 정치적 답변 회피를 식별하는 SemEval-2026 태스크 6 에서 40 개 팀 중 8 위를 기록한 Duluth 팀의 접근 방식을 제시합니다.

원저자: Shujauddin Syed, Ted Pedersen

게시일 2026-04-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shujauddin Syed, Ted Pedersen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

정치인의 답변을 '투명하게' 만드는 AI: Duluth 팀의 SemEval-2026 도전기

이 논문은 2026 년에 열린 'SemEval'이라는 인공지능 대회에서, 정치인들이 질문을 피하거나 모호하게 답변하는 순간을 찾아내는 AI를 개발한 'Duluth' 팀의 이야기를 담고 있습니다.

이 복잡한 기술을 일상적인 비유로 쉽게 설명해 드리겠습니다.


1. 문제 상황: "정치인의 답변은 왜 이렇게 모호할까?"

상상해 보세요. TV 토론에서 기자가 "교육 예산을 늘리시겠습니까?"라고 묻습니다.
정치인은 다음과 같이 답할 수 있습니다.

  • 명확한 답변: "네, 늘리겠습니다." (Clear Reply)
  • 회피적인 답변: "그건 복잡한 문제라 더 연구해 봐야겠어요." (Ambivalent - 애매모호)
  • 거부 답변: "그건 지금 말할 수 없습니다." (Clear Non-Reply)

문제는 사람들도 이 세 가지를 구분하기 힘들다는 점입니다. 특히 "조금만 더 연구해 봐야겠다"는 말은 답변인 것 같기도 하고, 회피인 것 같기도 하죠. 이 대회는 AI 가 이 미묘한 뉘앙스를 구분하도록 하는 것이 목표였습니다.

2. Duluth 팀의 해결책: "AI 스승과 학생"

Duluth 팀은 이 문제를 해결하기 위해 세 가지 핵심 전략을 사용했습니다.

① 기본 모델: 'DeBERTa'라는 똑똑한 학생

팀이 선택한 기본 AI 는 DeBERTa라는 이름의 언어 모델입니다. 이는 방대한 양의 책을 읽은 '고등학생' 같은 존재로, 문맥을 이해하는 능력이 뛰어납니다. 하지만 이 학생만으로는 정치인의 미묘한 말투를 완벽히 구분하기엔 부족했습니다.

② 데이터 부족 해결: "가짜 친구들"을 만들어라 (LLM 증강)

가장 큰 문제는 데이터 불균형이었습니다.

  • 비유: 시험을 치르는데, '명확한 답변' 예제는 100 개 있는데, '회피적인 답변' 예제는 10 개뿐이라면? AI 는 '회피'라는 것을 배우기 어렵습니다.
  • 해결책: 팀은 Gemini 3Claude Sonnet 4.5라는 두 명의 '초지능 AI'를 고용했습니다. 이들에게 "회피적인 답변 예시를 2,000 개 만들어줘"라고 시켰습니다.
  • 결과: 이렇게 만들어진 **가짜 데이터 (Synthetic Data)**를 실제 데이터에 섞어주니, AI 학생이 '회피'라는 개념을 훨씬 잘 이해하게 되었습니다. 마치 희귀한 동물을 보러 가는 대신, VR(가상현실) 로 수많은 희귀 동물을 체험하게 해준 것과 같습니다.

③ 학습 방법 개선: "어려운 문제"에 집중하기

AI 는 쉬운 문제만 풀고 넘어가는 경향이 있습니다. 팀은 Focal Loss라는 기술을 써서, AI 가 틀리기 쉬운 '어려운 문제 (회피적인 답변)'에 더 많은 점수를 매기도록 학습시켰습니다. 또한, 정치적인 맥락을 이해하는 데 도움이 되는 특수한 부울 (Boolean) 기능 (예: "질문이 긍정형인가?", "질문이 여러 개인가?") 을 추가했습니다.

3. 결과: 40 개 팀 중 8 위, 그리고 남은 과제

이 시스템은 대회에서 40 개 팀 중 8 위를 차지했습니다. (최고 점수는 0.89, 팀의 점수는 0.76).

  • 성공: AI 가 '거부'나 '명확한 답변'을 구분하는 데는 매우 뛰어났습니다.
  • 실패 (혼란): 하지만 **'애매모호한 답변 (Ambivalent)'**과 '명확한 답변 (Clear Reply)' 사이를 구분하는 데는 여전히 어려움을 겪었습니다.

왜 그랬을까요?

  • 비유: 정치인이 "네, 하지만..."이라고 말할 때, AI 는 '네'라는 단어에 꽂혀서 '명확한 답변'으로 오해하거나, '하지만'이라는 단어에 꽂혀서 '회피'로 오해합니다.
  • 현실: 사실 이 구분은 사람들 사이에서도 의견이 엇갈리는 영역입니다. 인간 심사위원들끼리도 "이건 애매한 거야, 아니면 명확한 거야?"라고争论 (논쟁) 하곤 합니다. AI 가 인간보다 더 잘할 수는 없는 노릇이죠.

4. 결론: 무엇을 배웠을까?

이 연구는 두 가지 중요한 교훈을 남깁니다.

  1. AI 가 부족한 데이터를 채워줄 수 있다: 다른 초지능 AI(Gemini, Claude) 가 만들어낸 가짜 데이터를 활용하면, 실제 데이터가 부족한 분야에서도 AI 성능을 크게 높일 수 있습니다.
  2. 정치적 언어의 미묘함은 여전히 어렵다: AI 가 정치인의 말투에서 '회피'를 찾아내는 것은 가능하지만, 어디까지가 '답변'이고 어디까지가 '회피'인지의 경계선은 여전히 인간과 AI 모두에게 난제입니다.

한 줄 요약:

"Duluth 팀은 AI 에게 '가짜 정치 인터뷰'를 많이 보여주게 해서, 정치인의 모호한 답변을 찾아내는 능력을 키웠습니다. 비록 완벽한 구분에는 실패했지만, AI 가 정치적 언어를 이해하는 데 한 걸음 더 다가갔음을 증명했습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →