← 최신 논문
💬 NLP

Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations

이 논문은 트랜스포머 기반 대규모 언어 모델을 위한 국소적 설명 가능성 및 기계론적 해석 가능성 접근법을 검토하고, 신뢰성 함의를 평가하기 위해 의료 및 자율 주행 분야에서의 적용에 관한 실험적 연구를 제시하며, 인간과 정렬된 신뢰할 수 있는 설명을 생성하기 위한 향후 과제와 기회를 개괄한다.

원저자: Shahin Atakishiyev, Housam K. B. Babiker, Jiayi Dai, Nawshad Farruque, Teruaki Hayashi, Nafisa Sadaf Hriti, Md Abed Rahman, Iain Smith, Mi-Young Kim, Osmar R. Zaïane, Randy Goebel

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shahin Atakishiyev, Housam K. B. Babiker, Jiayi Dai, Nawshad Farruque, Teruaki Hayashi, Nafisa Sadaf Hriti, Md Abed Rahman, Iain Smith, Mi-Young Kim, Osmar R. Zaïane, Randy Goebel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 거대하고 복잡한 주방에 있는, 매우 유능하지만 다소 신비로운 셰프라고 상상해 보세요. 그들은 프롬프트 하나만 읽고도 완벽한 레시피를 만들어내거나, 복잡한 시를 쓰거나, 의학적 문제를 진단할 수 있습니다. 하지만 여기에는 함정이 있습니다. 그들이 정확히 어떻게 그렇게 하는지는 아무도 모른다는 것입니다. 그들은 "블랙박스"입니다. 당신이 요리를 요청하면 맛있는 음식이 나오지만, 그들이 실제로 레시피를 따랐는지, 아니면 주방의 냄새를 보고 그냥 때려 맞춘 것인지, 혹은 파슬리처럼 보이지만 실수로 독성이 있는 재료를 넣은 것인지(이것이 "환각"입니다)는 알 길이 없습니다.

이 논문은 이 셰프들을 신뢰할 수 있게 만들기 위해 노력하는 음식 비평가와 주방 검사관 팀에 관한 이야기입니다. 그들은 다음과 같은 질문을 던집니다. 우리가 그 요리가 안전하다는 것을 알 수 있도록, 셰프가 자신의 요리 과정을 우리가 이해할 수 있는 방식으로 설명하게 만들 수 있을까?

다음은 쉬운 비유를 사용한 이들의 조사 내용 요약입니다.

1. 셰프의 마음을 이해하는 두 가지 방법

논문은 이 AI 셰프들을 이해하기 위한 두 가지 주요 접근 방식을 제시합니다.

  • 로컬 설명 가능성 (Local Explainability - "왜 요리를 만들었나요?" 방식):
    이는 셰프가 방금 만든 특정 요리에 대해 설명하도록 요청하는 것입니다.

    • 자연어 (Natural Language): 셰프가 "수프가 싱거워서 소금을 넣었습니다"라고 말합니다. (논문은 주의를 줍니다. 때때로 셰프는 실제 이유가 무엇이었든 상관없이 똑똑해 보이기 위해 그냥 이야기를 지어내는 경우가 있습니다.)
    • 사고의 사슬 (Chain-of-Thought): 셰프가 단계를 나누어 설명합니다. "먼저 양파를 썰고, 그다음 볶았습니다..." (논문은 주의를 줍니다. 때때로 셰프는 단계별로 생각하는 척하지만, 실제로는 답을 즉각적으로 추측했을 뿐일 수도 있습니다.)
    • 검색 (Retrieval/RAG): 셰프가 자신이 어디에서 레시피를 가져왔는지 증명하기 위해 요리책이나 참조 카드를 꺼내 보여줍니다. 이는 실제 출처를 가리키기 때문에 가장 신뢰할 수 있는 방식입니다.
    • 특성 기여도 (Feature Attribution): 셰프가 조리대 위의 특정 재료들을 가리키며 말합니다. "이 세 개의 양파가 이 수프에서 가장 중요한 부분이었습니다."
  • 기계적 해석 가능성 (Mechanistic Interpretability - "주방이 어떻게 돌아가나요?" 방식):
    이는 셰프의 뇌 내부를 들여다보며 기어와 전선을 확인하는 것입니다.

    • 셰프의 뇌가 거대한 회로 기판이라고 상상해 보세요. 연구자들은 특정 작업을 수행하는 특정 "회로"(뉴런의 집합)를 찾으려고 노력합니다. 예를 들어, 그들은 "Mr. Dursley"라는 이름이 이야기에서 보통 "Dursley" 앞에 온다는 패턴을 인식하는 데 도움을 주는 특정 회로를 발견했습니다.
    • 문제점: 주방이 너무 크고 복잡해서 회로들이 뒤엉켜 있습니다. 하나의 전선이 여러 가지 일을 동시에 수행할 수 있는데(마치 스위스 아미 나이프처럼), 이 때문에 정확히 어떤 일이 일어나고 있는지 파악하기가 매우 어렵습니다.

2. "가짜" 설명의 위험성

논문은 **작화증(Confabulation)**이라는 중대한 문제를 강조합니다.
때때로 셰프는 말을 너무 잘해서 마치 논리적인 경로를 따랐던 것처럼 당신을 설득할 수 있지만, 실제로는 그냥 답을 때려 맞춘 것일 수 있습니다.

  • 비유: 수학 시험을 치르는 학생을 상상해 보세요. 정답(12)은 맞혔지만, 풀이 과정을 보여달라고 하면 논리적으로 보이지만 실제로는 틀린 계산 과정을 써 내려가는 것과 같습니다. 답은 맞았지만, 그 이유는 거짓인 것입니다.
  • 논문은 의료 분야(크론병 진단)나 자율 주행(빨간불에 멈추기)과 같은 핵심 분야에서 이것이 얼마나 위험한지 보여줍니다. 만약 의사가 AI의 가짜 설명을 믿는다면, 잘못된 결정을 내릴 수 있습니다. 만약 자율 주행차가 정지 표지판을 보고 있다고 "생각"하지만 실제로는 환각을 보고 있는 것이라면, 사고가 날 수 있습니다.

3. 셰프를 대상으로 하는 "스트레스 테스트"

셰프가 진실을 말하고 있는지 어떻게 알 수 있을까요? 논문은 셰프에게 스트레스 테스트를 실시해야 한다고 제안합니다.

  • 비유: 단순히 "왜 멈췄나요?"라고 묻는 대신(이 질문에는 셰프가 쉽게 대답할 수 있습니다), "만약 신호가 초록불인데 보행자가 건너고 있다면 어떻게 했을 것인가요?" 또는 "만 만약 앞차의 색깔이 빨간색이 아니라 파란색이었다면 어떻게 했을 것인가요?"라고 물어보는 것입니다.
  • 만약 셰프가 이러한 까다로운 "만약에(what-if)" 질문에 일관되고 논리적인 답변을 내놓는다면, 우리는 그들을 더 신뢰할 수 있습니다. 만약 셰프가 혼란스러워하거나 이야기를 지어낸다면, 그들은 아직 현실 세계에 나갈 준비가 되지 않은 것입니다.

4. 청중에 맞춘 설명 제공

모든 사람이 요리 과정에 대해 똑같은 수준의 지식을 필요로 하지는 않습니다. 논문은 세 가지 수준의 설명을 제안합니다.

  • 일반 대중을 위한 설명 (Coarse): "신호가 빨간불이라서 멈췄습니다." (단순하고 이해하기 쉽습니다).
  • 의사/전문가를 위한 설명 (Coarse-to-Fine): "신호가 빨간불이라서 멈췄으며, 구체적으로 센서가 횡단보도 3미터 지점에 보행자를 감지했습니다." (단순하게 시작하여 구체적인 증거를 제공합니다).
  • 엔지니어를 위한 설명 (Fine): "'빨간불 감지'를 담당하는 신경 회로가 작동하여 '브레이크' 경로를 활성화했습니다." (설계자를 위한 깊이 있는 기술적 세부 사항을 제공합니다).

5. 신뢰할 수 있는 셰프를 위한 8가지 규칙

마지막으로, 논문은 AI가 진정으로 신뢰받기 위해서는 설명이 8가지 규칙(TrustLLM이라는 프레임워크 기반)을 따라야 한다고 제안합니다.

  1. 진실성 (Truthfulness): 거짓말을 하거나 없는 사실을 지어내지 마십시오.
  2. 안전성 (Safety): 위험한 조언(예: "이 독을 드세요")을 하지 마십시오.
  3. 강건성 (Robustness): 까다로운 질문을 받아도 혼란에 빠지지 마십시오.
  4. 공정성 (Fairness): 특정 집단에 대해 편향되지 마십시오.
  5. 개인정보 보호 (Privacy): 비밀 정보를 실수로 노출하지 마십시오.
  6. 기계 윤리 (Machine Ethics): 아무도 보지 않을 때도 옳은 일을 하십시오.
  7. 투명성 (Transparency): 작동 방식에 대해 솔직하십시오.
  8. 책임성 (Accountability): 실수를 했을 때 책임을 질 수 있어야 합니다.

결론

논문은 결론적으로, 이 AI 셰프들이 놀랍기는 하지만, 현재로서는 생사가 걸린 상황에서 완전히 신뢰하기에는 너무 신비롭다고 말합니다. 우리는 그들의 작업 내용을 확인할 더 나은 방법, 그들이 단순히 "말만 번지르르하게 하는 것"이 아닌지 확인하는 방법, 그리고 그들의 설명이 정직하고 정확하며 질문하는 사람에게 적절한지를 보장하는 방법을 찾아야 합니다. 우리가 그것을 할 수 있을 때까지는, 그들에게 우리의 자동차를 운전하게 하거나 환자를 진단하게 하는 것에 대해 주의해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →