← 최신 논문
💬 NLP

Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment

본 연구는 LLM의 선택과 대화 맥락이 생성된 답변의 의미론적 일관성에 상당한 영향을 미친다는 점을 입증하며, 이는 현재의 프롬프팅 전략이 대화 기반 평가에서 서로 다른 모델 간에 안정적이고 비교 가능한 응답을 보장하기에는 불충분하다는 것을 시사한다.

원저자: Jiangang Hao

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiangang Hao

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 교육의 세계에서 사람들이 얼마나 잘 소통하고 협력하는지를 측정하는 것은 오랫동안 풀리지 않는 난제로 남아 있었습니다. 학생이 정답을 알고 있음을 단 하나의 숫자로 증명하는 수학 시험과 달리, 협업과 같은 기술은 대화의 복잡하고 흐르는 듯한 주고받음 속에서 발생하기 때문입니다. 이를 공정하게 측정하기 위해 교육자들은 설령 대화가 서로 다른 경로를 거치더라도 모든 학생이 유사한 과제에 직면하도록 보장해야 합니다. 최근 인공지능은 이를 해결할 새로운 방법을 제시했습니다. 대화하고 들을 수 있는 컴퓨터 프로그램을 사용함으로써, 학교는 학생들이 연습할 수 있는 가상의 파트너를 만들 수 있습니다. 이러한 프로그램은 학생이 말하는 내용에 적응하여 자연스러운 대화를 만들어내며, 이를 통해 학생이 얼마나 잘 사고하고 협력하는지를 드러낼 수 있습니다. 그러나 전문가들 사이에서는 조용한 우려가 커지고 있습니다. 만약 컴퓨터 프로그램이 변한다면, 대화도 함께 변하는가 하는 점입니다. 만약 한 학생이 오늘 특정 버전의 소프트웨어로 테스트를 치르고, 다른 학생이 내년에 더 새로운 버전으로 테스트를 치른다면, 두 학생이 동일한 질문에 동일한 방식으로 답하게 될까요? 이 질문은 공정성의 핵심을 찌릅니다. 만약 어떤 모델이 실행되느냐에 따라 컴퓨터의 답변이 크게 달라진다면, 그 시험은 학생의 능력을 측정하는 것이 아니라 소프트웨어의 특이한 성질을 측정하게 될 수도 있기 때문입니다.

교육측정평가원(ETS)의 한 연구자는 바로 이 문제를 조사하기 위해 나섰습니다. 연구자는 근본적인 소프트웨어가 바뀔 때 컴퓨터의 답변 의미가 그대로 유지되는지 알고 싶었습니다. 이를 알아내기 위해 연구자는 가짜 대화를 만들어내는 대신, 두 사람이 함께 문제를 해결했던 과거의 온라인 과학 프로젝트에서 실제 메시지들을 가져왔습니다. 연구자는 두 사람이 대화하던 중 한 사람이 중요한 발언을 하고, 다른 사람이 명확하고 도움이 되는 답변을 주었던 구체적인 순간 61곳을 선정했습니다. 그런 다음 연구자는 인간의 언어를 이해하고 생성하도록 설계된 인공지능의 한 유형인 거대 언어 모델(LLM)의 네 가지 서로 다른 버전에 해당 61개의 메시지에 대해 답변하도록 요청했습니다. 연구자는 각 메시지에 대해 실험을 두 번 실시했습니다. 첫 번째 실행에서는 컴퓨터가 답변해야 할 단일 메시지만을 보았습니다. 두 번째 실행에서는 해당 메시지와 그 이전의 전체 대화 기록을 함께 보여주었습니다. 모든 메시지에 대해, 각 컴퓨터 모델은 답변이 얼마나 다양하게 나타나는지 확인하기 위해 100개의 서로 다른 답변을 생성했습니다.

결과에 따르면, 컴퓨터 모델의 선택과 대화 맥락 모두가 응답 유사성에 영향을 미치는 것으로 나타났습니다. 단일 모델이 생성한 100개의 답변을 비교했을 때, 답변들은 서로 상당히 유사했으며 유사도 점수는 0.715에서 0.795 사이였습니다. 하지만 한 모델의 답변을 다른 모델의 답변과 비교했을 때는 유사도가 현저히 떨어졌습니다. 마치 각 모델이 자신만의 독특한 목소리와 사고방식을 가진 것처럼 보였습니다. 대화 기록을 추가하는 효과는 사용된 특정 모델에 따라 달랐습니다. 어떤 경우에는 대화 기록을 포함하는 것이 인간의 응답과 답변의 일치도를 약간 향상시켰지만, 모든 경우에 모델 간의 합의를 더 높여주지는 않았습니다. 또한 연구는 동일한 소프트웨어 계열의 최신 모델들이 서로 다른 구형 모델들보다 서로 더 유사한 답변을 생성하는 경향이 있다는 것을 발견했습니다. 이는 소프트웨어의 '가계도'가 주어진 지침에 따라 어떻게 행동하는지에 중요한 역할을 한다는 것을 시사합니다.

아마도 가장 중요한 점은, 근본적인 LLM이 바뀔 때 프롬프트와 대화 맥락에만 의존하는 것만으로는 매우 유사한 응답 동작을 보장하기에 충분하지 않을 수 있다는 사실을 연구자가 발견했다는 것입니다. 모델들에게 정확히 동일한 프롬프트와 동일한 대화 기록을 제공했음에도 불구하고, 모델의 선택은 여전히 답변의 의미론적 내용에서 상당한 차이를 불러일으켰습니다. 이 연구는 인공지능 시스템의 자연스러운 유연성에 의존하는 것이 고부담 시험(high-stakes testing)에서는 위험할 수 있음을 시사합니다. 만약 시험이 컴퓨터가 대화의 흐름을 유지하도록 맡기고 있는데, 컴퓨터가 업데이트될 때마다 그 스타일이 바뀐다면, 시험 결과는 신뢰할 수 없게 될 수 있습니다. 연구자는 지속 가능한 공정한 시험 시스템을 구축하기 위해서는 단순히 소프트웨어가 스스로 올바르게 작동하기를 기다려서는 안 된다고 결론지었습니다. 대신, 어떤 버전의 소프트웨어가 실행되더라도 컴퓨터의 답변이 안전하고 일관된 범위 내에 머물도록 보장하는 규칙이나 템플릿과 같은 추가적인 제어 계층을 구축해야 합니다. 이러한 안전장치가 없다면, 인공지능의 급격한 진화는 교육 평가가 보호하고자 하는 바로 그 공정성을 훼손할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →