← 최신 논문
💻 computer science

Fixing Abstention with Token Probability: A Budget-Matched Causal Test Across Four Small Open-Weight Models

이 논문은 언어화된 확신을 예산에 맞춘 토큰 확률 기반 기권 정책으로 대체하는 것이 llama3.2:1b 모델에서 관찰된 특정 정확도 저하 효과를 인과적으로 제거한다는 것을 입증하지만, 이러한 이점이 다른 소규모 오픈 웨이트 모델들로 일반화되지 못함을 보여줌으로써, 그러한 수정 방식이 모델 특이적이며 고정 예산 기권 방식은 타겟팅이 개선되더라도 여전히 순손실(net-harmful)로 남을 수 있음을 나타낸다.

원저자: Kunal Dhanda

게시일 2026-09-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kunal Dhanda

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 발전하는 세상에서, 연구자들은 컴퓨터 프로그램이 질문에 답하도록 끊임없이 가르치고 있습니다. 하지만 중요한 과제가 남아 있습니다. 바로 프로그램이 정답을 모를 때를 아는 것입니다. 인간은 확신이 없을 때 "모르겠습니다"라고 말할 수 있습니다. 이러한 후퇴 행위, 즉 '기권(abstention)'은 기계가 무분별하게 추측하여 잘못된 정보를 퍼뜨리는 것을 방지하는 안전 장치로 간주됩니다. 그러나 최근의 조사에 따르면, 이러한 시스템 중 일부에서 기묘한 결함이 발견되었습니다. 불확실성을 인정하도록 요청받았을 때, 특정 오픈 소스 프로그램 제품군 중 가장 작고 가벼운 모델들은 단순히 매번 추측하도록 강요받았을 때보다 오히려 성능이 저하되는 모습을 보였습니다. 이 모델들에게 자신의 확신에 대해 말하도록 요청하는 것이 오히려 역효과를 일으켜, 신중하게 처리하려던 질문들에 대한 정확도를 떨어뜨리는 현상이 발생하는 것으로 보입니다.

이 새로운 연구는 이러한 성능 저하를 면밀히 살펴보고 이를 해결할 수 있는지 확인하고자 합니다. 연구진은 네 가지 작은 오픈 웨이트(open-weight) 모델—표준 컴퓨터에서도 실행 가능할 만큼 컴팩트하면서도 복잡한 추론이 가능한 인공지능 버전들—에 집중했습니다. 연구진은 이전에 가장 작은 모델에게 확신이 없을 경우 "모르겠습니다"라고 말하도록 유도했을 때, 의료 및 정신 의학 질문 전반에 걸쳐 정확도가 크게 떨어진다는 점을 관찰한 바 있습니다. 연구팀은 문제가 기권 행위 그 자체에 있는 것이 아니라, 언제 기권할지를 결정하는 방식에 있다고 의심했습니다. 모델에게 자신의 확신을 말로 표현하도록 요청하는 것은 통계적으로 무용하며, 본질적으로 동전 던지기와 다를 바 없는 신호라는 것이 밝혀졌습니다. 반면, 모델이 각 단어를 생성할 때 사용하는 내부 수학적 수치인 '토큰 확률(token probability)'은 정답 여부를 판단하는 훨씬 더 강력한 지표였습니다. 연구의 핵심은 의사결정 과정을 모델의 구두 확신에서 내부 수학적 수치로 전환했을 때 이 정확도 저하를 막을 수 있는지였습니다.

이 답을 찾기 위해 연구진은 새로운 실험을 수행하거나 새로운 텍스트를 생성하게 하는 대신, 이미 수집된 세 가지 이전 연구의 데이터를 정밀하게 재분석했습니다. 연구진은 모델이 질문에 답한 기존 기록을 가져와, 답변을 건너뛸지 결정하는 두 가지 서로 다른 방식을 비교했습니다. 첫 번째 방식은 원래의 방식이었습니다. 모델이 구두로 불확실하다고 진술할 때만 답변을 건너뛰는 것입니다. 두 번째 방식은 새로운 정책입니다. 모델의 내부 수학적 수치가 정답일 확률이 낮음을 보여줄 때 답변을 건너뛰는 것입니다. 결정적으로, 연구진은 두 번째 방식이 첫 번째 방식과 정확히 동일한 수의 답변을 건너뛰도록 조정했습니다. 이를 통해 결과의 차이가 '얼마나 많은 질문을 건너뛰었는지'가 아니라, '어떤 질문을 건너뛰었는지'에 의한 것임을 보장했습니다.

결과는 매우 놀라웠습니다. 가장 작은 모델의 경우, 구두 확신 체크를 내부 확률 체크로 대체하자 심각했던 정확도 저하가 사라졌습니다. 기존 방식에서는 모델의 정확도가 7퍼센트 포인트 하락하며 상당한 손실을 입었습니다. 그러나 새로운 방식 아래에서는 그 하락 폭이 거의 제로에 가깝게 줄어들었으며, 이는 효과가 없는 것과 통계적으로 구별할 수 없는 수준이었습니다. 이 수정 작업은 일반적인 의료 질문과 정신 의학 시나리오 모두에서 일관되게 작동했습니다. 이는 원래의 실패가 모델이 자신의 확신을 정확하게 보고하지 못하는 능력 부족 때문이었음을 확인시켜 주었으며, 내부 수학을 가이드로 사용하는 것이 오류를 성공적으로 교정했음을 입증했습니다.

하지만 이 연구는 이 해결책이 만병통치약은 아니라는 점도 밝혀냈습니다. 연구진이 구두 확신 문제를 겪었던 그룹 내의 다른 모델에 동일한 수정을 적용했을 때, 결과는 달랐습니다. 이 두 번째 모델은 테스트된 모든 모델 중 가장 우수한 내부 수학 신호를 가지고 있었음에도 불구하고, 새로운 정책을 적용했을 때 여전히 정확도가 크게 떨어졌습니다. 연구진은 이 모델이 애초에 "모르겠습니다"라고 말하는 비율이 훨씬 높다는 사실을 발견했습니다. 이 모델은 너무 많은 질문을 건너뛰었기 때문에, 틀린 답변뿐만 아니라 옳은 답변까지 대량으로 버리고 있었습니다. 내부 수학이 정답을 분류하는 데는 뛰어났지만, 건너뛴 항목의 절대적인 양이 너무 많아 이점이 되지 못했던 것입니다. 이는 이미 매우 정확한 모델들의 경우, 단순히 무엇을 건너뛸지 결정하는 신호를 바꾸는 것만으로는 부족하며, 건너뛰는 항목의 수를 줄여야 할 수도 있음을 시사합니다.

연구는 결론적으로, 기권을 결정하는 경로를 구두 확신에서 내부 수학으로 돌리는 것이 특정 실패에 대해서는 강력한 해결책이 될 수 있지만, 모든 시스템에 적용되는 만능 해결책은 아니라고 명시합니다. 가장 작은 모델에게 이 변화는 해로운 명령을 중립적인 명령으로 바꾸어 놓은 완전한 구제책이었습니다. 반면, 더 크고 정확한 모델의 경우 문제는 신호가 아니라 건너뛰는 항목의 예산(budget) 문제였습니다. 이 연구 결과는 인공지능 분야에서 모든 시스템에 작동하는 단 하나의 안전 패치는 없다는 점을 강조합니다. 각 모델은 불확실성을 어떻게 처리하는지 이해하기 위해 고유한 검증이 필요하며, 한 모델의 교정책이 다른 모델에는 작동하지 않을 수 있습니다. 연구진은 이러한 결과가 특정 데이터 세트에 기반하고 있으므로 최종적인 배포 지침이라기보다는 추가 연구를 위한 가설로 간데 보아야 한다고 경고하면서도, 통신 채널을 수정하는 것이 때로는 결과를 바로잡을 수 있다는 명확한 인과적 증거를 제시했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →