← 최신 논문
💬 NLP

Virgil: Navigating Explainability for Transformer-based Language Models

본 논문은 큐레이션된 지식 베이스에 의해 지원되는 통합 인터페이스를 통해, 사용자가 트랜스포머 기반 언어 모델을 위한 설명 가능성 도구들의 점점 더 파편화되는 생태계를 탐색, 발견 및 비교할 수 있도록 설계된 대화형 시스템인 Virgil을 소개한다.

원저자: Martino Ciaperoni, Sezer Kutluk, Benedetta Muscato, Marta Marchiori Manerba, Fosca Giannotti

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Martino Ciaperoni, Sezer Kutluk, Benedetta Muscato, Marta Marchiori Manerba, Fosca Giannotti

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 사회에서 인공지능은 우리의 가장 중요한 결정 중 일부에서 조용한 파트너가 되었습니다. 의사가 질병을 진단하는 것을 돕는 것부터 변호사가 계약서를 검토하는 것을 보조하는 것에 이르기까지, 이러한 시스템은 점점 더 높은 이해관계가 걸린 결과에 대한 신뢰를 얻고 있습니다. 이러한 시스템의 중심에는 트랜스포머 기반 언어 모델이라고 알려진 강력한 컴퓨터 프로그램들이 있습니다. 이 도구들은 인간의 언어를 이해하고 생성하는 데 매우 뛰어나지만, 복잡한 블랙박스처럼 작동합니다. 이러한 모델이 결정을 내릴 때, 어떤 단어나 정보 조각이 그 결론에 도가 했는지 정확히 파악하기는 어려운 경우가 많습니다. 이러한 명확성의 부족은 심각한 우려를 낳습니다. 만약 시스템이 자신의 추론 과정을 설명할 수 없다면, 우리가 어떻게 그것을 신뢰할 수 있겠습니까? 시스템이 실수를 했을 때 어떻게 수정할 수 있으며, 편향성을 숨기고 있지 않다는 것을 어떻게 보장할 수 있겠습니까? 이러한 기술이 연구실을 넘어 실제 세상으로 이동함에 따라, 그 내부 작동 방식을 이해하는 능력은 단순한 '있으면 좋은 기능'에서 '절대적인 필수 요소'로 바뀌었습니다.

이러한 명확성에 대한 요구가 커짐에 따라, 한 연구팀은 '버질(Virgil)'이라는 새로운 디지털 도구를 구축했습니다. 이 시스템은 언어 모델이 어떻게 생각하는지를 설명하는 방법론의 압도적이고 빠르게 변화하는 지형을 사람들이 탐색할 수 있도록 설계되었습니다. 현재는 모델이 결정에 도달하는 방식을 밝혀내기 위해 단순한 시각적 강조부터 복 복잡한 수학적 분석에 이르기까지 수십 가지의 서로 다른 기법들이 존재합니다. 그러나 실무자나 연구자에게 특정 작업에 적합한 도구를 찾는 일은 혼란스러울 수 있습니다. 기존의 가이드들은 광범위한 개요를 제공하긴 하지만, 특정 상황에서 어떤 도구를 선택해야 하는지에 대한 실질적인 조언을 제공하지 못합니다. 버질은 이 간극을 메우기 위해 등장하여, 사용자가 기초적인 수학 전문가가 아니더라도 이러한 설명 도구들을 발견하고, 비교하고, 심지어 테스트할 수 있도록 돕는 대화형 가이드 역할을 합니다.

연구진은 버질을 전문화된 도서관처럼 기능하는 웹 기반 애플리케이션으로 구축했습니다. 그 핵심에는 43가지의 서로 다른 설명 도구에 대한 정교하게 큐레이션된 정보 컬렉션이 있습니다. 각 도구는 텍스트 분류나 텍스트 생성 분석과 같이 무엇을 위해 설계되었는지, 그리고 어떤 종류의 컴퓨터 모델과 작동하는지에 대한 상세한 정보를 담은 구조화된 카드로 설명됩니다. 또한 시스템은 해당 도구를 사용하는 데 깊은 기술적 지식이 필요한지, 아니면 비전문가도 접근 가능한지를 기록합니다. 사용자가 인터페이스를 방문하면, 수행 중인 작업 유형이나 컴퓨터 모델에 대한 접근 수준과 같은 간단한 필터를 사용하여 도구를 검색할 수 있습니다. 또는 일상적인 언어로 질문을 입력하면, 시스템은 각 도구의 역량과 한계에 대한 상세한 설명을 바탕으로 사용자의 요청에 가장 적합한 도구를 매칭해 줍니다.

시스템이 관련 도구를 찾으면, 사용자는 이를 심층적으로 탐색할 수 있습니다. 인터페이스는 각 도구가 무엇을 하는지에 대한 명확한 요약을 제시하며, 각각의 강점과 약점을 강조합니다. 더 중요한 것은, 버질이 단순히 정보를 나열하는 데 그치지 않고 사용자가 도구를 직접 실행해 볼 수 있게 한다는 점입니다. 사용자는 특정 설명 방법을 선택하고, 텍스트 조각과 사전 학습된 컴퓨터 모델을 입력한 뒤, 시스템이 설명을 생성하는 과정을 지켜볼 수 있습니다. 이 상호작용 기능은 매우 중요한데, 사용자가 실제 환경에서 서로 다른 도구들이 어떻게 작동하는지 정확히 볼 수 있게 해주기 때문입니다. 예를 들어, 연구진은 사용자가 컴퓨터 모델이 왜 영화 리뷰를 긍정적으로 분류했는지 이해하려고 노력하는 시나리오를 시연했습니다. 한 도구를 실행했을 때, 사용자는 특정 단어에 할당된 중요도가 불안정하고 일관되지 않다는 것을 확인했습니다. 하지만 동일한 인터페이스 내에서 다른 도구로 전환함으로써, 사용자는 시스템이 긍정적인 정서를 유도한 특정 단어들을 강조하며 훨씬 더 명확하고 신뢰할 수 있는 설명을 제공하는 것을 즉시 확인할 수 있었습니다.

또한 이 시스템은 나란히 비교하는 기능을 지원하여, 사용자가 여러 설명 방법을 동일한 입력값에 실행해 보고 결과가 어떻게 다른지 확인할 수 있게 합니다. 이러한 비교 뷰는 사용자가 자신의 특정 요구에 가장 적합한 도구가 무엇인지 정보에 입각한 결정을 내릴 수 있도록 돕습니다. 시스템이 얼마나 잘 작동하는지 테스트하기 위해 연구진은 10명의 익명 연구자들에게 사용해 볼 것을 요청했습니다. 피드백은 고무적이었는데, 참가자의 80%가 시스템이 직관적이라고 느꼈으며 90%가 동료들에게 추천하겠다고 답했습니다. 비록 소규모 그룹을 대상으로 한 연구였지만, 이 결과는 버질이 복잡한 AI 설명 가능성의 세계를 성공적으로 더 접근하기 쉽게 만들었음을 시사합니다. 연구진은 향후 시스템을 확장하여, 학술 연구자와 산업 전문가 모두를 위한 핵심 자원으로 만드는 것을 목표로 하고 있습니다. 이러한 도구들을 단일하고 사용하기 쉬운 플랫폼으로 정리함으로써, 버질은 인공지능의 신비함을 제거하고, 이 강력한 시스템들이 더욱 흔해짐에 따라 그 결정이 이해와 검토의 대상이 될 수 있도록 돕습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →