Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs
본 연구는 제로샷 추정을 자기 보고 기술과 비교하여 슬랙 커뮤니케이션 로그에서 개별 도메인 지식을 추론하는 일곱 개의 대형 언어 모델의 능력을 평가한 결과, 제미니 2.5 플래시가 가장 높은 정확도를 달성했으나 추론 성능은 메시지 양에 약하게만 의존하며 프라이버시 보호 및 구조 인식 접근법의 필요성을 강조한다는 점을 발견했다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
마사한 활기찬 사무실에 들어섰다고 상상해 보세요. 당신은 까다로운 문제를 안고 있지만, 누구에게 물어봐야 할지 모릅니다. 구석에서 하루 종일 코딩에 대해 이야기하는 사람일까요? 아니면 프로젝트 관리에 대해 모든 것을 아는 것처럼 보이는 사람일까요? 보통은 주변을 돌아다니며 몇몇 사람에게 물어보고, 올바른 전문가를 찾기를 바랄 수밖에 없습니다. 이 "추측 게임"은 시간과 돈을 낭비합니다.
이 논문은 단순한 질문을 던집니다: AI 가 모든 사람의 채팅 기록을 읽어보고 누가 무엇을 알고 있는지 즉시 알려주는 초관찰적인 인턴처럼 행동할 수 있을까요?
다음은 그들의 실험을 쉽게 설명한 내용입니다:
설정: "채팅 탐정"
연구진은 회사의 슬랙 (Slack) 계정에서 나온 실제 채팅 메시지 거대한 더미 (수년 동안 43 명의 사람이 보낸 약 27,000 개의 메시지) 를 가져왔습니다. 그리고 이 메시지들을 GPT, Claude, Gemini 와 같은 7 가지 다른 "초두뇌"(대규모 언어 모델) 에 입력했습니다.
이러한 AI 모델을 다양한 유형의 탐정으로 생각해 보세요:
- 어떤 모델은 빠르지만 다소 얕을 수 있습니다 (빠른 스캐너처럼).
- 어떤 모델은 느리지만 깊이 생각하는 편입니다 (책을 분석하는 교수처럼).
- 어떤 모델은 일반 전문가라면, 다른 모델은 특화 전문가입니다.
AI 의 임무는 채팅을 읽어 각 사람마다 "기술 보고서"를 작성하는 것이었습니다. 예를 들어, 누군가 "Python"과 "데이터 과학"에 대해 계속 이야기했다면, AI 는 "이 사람은 Python 을 알고 있다"고 추측할 것입니다.
현실 점검: "자기 평가"
AI 가 실제로 그 일을 잘하는지 확인하기 위해, 연구진은 실제 인간들에게 스스로를 평가하게 했습니다. 연구진은 간단한 웹사이트를 만들어 각 사람이 AI 가 찾은 기술 목록을 보고 "네, 저는 이것을 알고 있습니다" 또는 "아니요, 모릅니다"라고 말하게 했습니다.
그런 다음 연구진은 AI 의 추측과 인간의 실제 답변을 비교했습니다. 이는 마치 선생님이 학생이 시험 답안을 추측한 것을 실제 정답 키와 비교하여 채점하는 것과 같습니다.
결과: 누가 대회를 이겼나요?
연구진은 7 가지 다른 AI 모델을 테스트했습니다. 그들의 순위는 다음과 같습니다:
- 승자: Gemini 2.5 Flash가 최고의 추측자였습니다. 0~100 점 척도에서 약 21 점 정도 틀렸습니다. (사람이 80% 전문가라고 말하면, AI 는 약 59% 또는 101% 로 추측했습니다.)
- 준우승: Gemini 2.5 Pro가 그 뒤를 바짝 추격했습니다.
- 중간 그룹: Claude모델 (Haiku 와 Sonnet) 은 괜찮았지만 Gemini 모델만큼 날카롭지는 않았습니다.
- 부진한 그룹: GPT모델 (매우 유명한 GPT-4o 와 GPT-5 포함) 이 가장 나쁜 성적을 거두었습니다. 평균적으로 약 33 점 정도 틀렸습니다.
핵심 교훈: 최고의 AI 조차 완벽하지는 않았습니다. AI 는 누가 무엇을 알고 있는지에 대한 일반적인 아이디어를 파악할 수는 있었지만, 높은 정밀도로 전문성의 정확한 수준을 파악하지는 못했습니다.
놀라운 반전: 텍스트가 많다고 해서 추측이 더 잘되는 것은 아님
"만약 AI 에게 천 개의 메시지 대신 백만 개의 메시지를 주면, 더 똑똑해질 것 아니냐"고 생각할 수 있습니다.
반드시 그런 것은 아닙니다. 연구진은 단순히 채팅 기록이 더 많다고 해서 AI 의 추측이 자동으로 더 정확해지지 않는다는 것을 발견했습니다.
- 이유는 무엇일까요? 많은 채팅 메시지가 단순히 "알겠습니다", "알겠습니다", "점심 1 시에 어때요?"와 같은 것들이기 때문입니다. 이러한 메시지들은 누군가가 무엇을 알고 있는지 알려주지 않습니다.
- 한계점: AI 가 작업을 할 수 있는 채팅의 최소 양을 확보한 후에는 더 많은 것을 추가해도 큰 도움이 되지 않았습니다. 이는 장바구니 목록을 읽어서 누군가의 favorite 영화를 추측하려는 것과 같습니다. 목록이 아무리 길더라도 영화 취향에 대해 많은 것을 알려주지 않습니다.
결론
이 연구는 AI 가 우리의 채팅 로그를 엿보고 우리의 기술에 대해 그럴듯한 추측을 할 수 있음을 증명합니다. 이는 회사 내에서 "누가 무엇을 알고 있는지"에 대한 대략적인 지도를 얻기 위한 유용한 도구입니다.
그러나 아직은 마법의 수정구슬이 아닙니다. AI 는 여전히 실수를 하며, 유명한 GPT 모델조차 이 특정 테스트에서 1 위를 차지하지 못했습니다. 연구진은 또한 이것이 현실에서 작동하려면 회사들이 사생활 보호에 매우 주의해야 한다고 지적했습니다. 외부 AI 서버에 회사 내부의 개인적인 채팅을 보내는 것은 민감한 문제이기 때문입니다.
간단히 말해: AI 는 분위기를 읽는 데 점점 더 능숙해지고 있지만, 여전히 사람의 실제 전문성과 단순한 일상적인 수다를 구별하는 법을 배워야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.