Hypothesis Generation and Inductive Inference in Children and Language Models
본 논문은 귀납적 추론 과제에서 인간 아동과 LLM 기반 에이전트를 비교하여, 두 집단이 서로 다른 계산 메커니즘을 통해 환경적 불확실성과 증거의 신뢰성에 유사하게 적응하지만, LLM 은 아동에 비해 과도한 관찰과 지시 준수를 향한 고유한 경향을 보인다는 점을 규명한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 다섯 개의 잠긴 상자와 13 개의 열쇠 더미가 있는 방 안에 있다고 가정해 봅시다. 어떤 열쇠가 어떤 상자를 여는지 알 수 없습니다. 상황을 더 어렵게 만들기 위해, 선생님이 방금 당신에게 거짓말을 했습니다. "빨간 열쇠는 빨간 상자를 열고, 파란 열쇠는 파란 상자를 연다." 하지만 실제로는 상자가 열리려면 숫자와 모양이 포함된 비밀 코드가 필요하며, 상자를 들어 올릴 때까지는 그 코드를 볼 수 없습니다.
이것은 이 논문의 중심 실험인 "상자 과제 (Box Task)"의 설정입니다. 연구자들은 세계가 혼란스럽고, 정보가 불완전하며, 지시가 잘못되었을 때 인간 (특히 어린이) 과 인공지능 (특히 대규모 언어 모델, LLM) 이 어떻게 진실을 파악하는지 이해하고자 했습니다.
다음은 그들이 발견한 내용을 간단한 비유로 정리한 것입니다.
1. 두 가지 사고 방식: "제약 조건" 대 "프로그램"
연구자들은 이러한 행위자들이 어떻게 사고하는지 시뮬레이션하기 위해 두 가지 다른 컴퓨터 모델을 구축했습니다.
- "제약 조건" 모델 (어린이용): 어린이의 마음을 메모장을 들고 있는 탐정으로 상상해 보세요. 열쇠를 시도해 보다가 실패할 때마다 메모장에 새로운 규칙을 적습니다. "좋아, 빨간색은 작동하지 않아." 그들은 반드시 완벽한 논리 체계를 한 번에 구축하지는 않습니다. 대신 몇 가지 가능한 아이디어 (가설) 를 동시에 저울질합니다. 때로는 추측하고, 때로는 선생님의 거짓말을 따르며, 때로는 즉흥적으로 새로운 규칙을 만들어냅니다. 연구자들은 이를 **"제약 조건 집합 (Sets of Constraints)"**이라고 부릅니다.
- "프로그램" 모델 (인공지능용): 인공지능을 컴퓨터 프로그래머로 상상해 보세요. 메모만 쓰는 것이 아니라, "열쇠에 숫자가 있다면 상자와의 매칭을 확인하라"는 작은 컴퓨터 프로그램 (일련의 지시사항) 을 작성합니다. 프로그램이 실패하면 인공지능은 코드를 다시 씁니다. 이를 **"프로그램 합성 (Program Synthesis)"**이라고 합니다.
2. 큰 발견: 행동은 비슷하지만 그 이유는 다름
연구자들은 어린이와 인공지능에게 동일한 퍼즐을 제시했는데, 때로는 열쇠를 "점착성" 있게 만들어 올바른 열쇠라도 상자를 항상 열지 못하도록 했습니다.
유사성:
어린이와 인공지능 모두 같은 방식으로 혼란을 겪었습니다.
- 증거를 의심함: 열쇠가 상자를 열지 못했을 때, 두 집단 모두 즉시 "내 규칙이 틀렸구나"라고 생각하기보다 "아마도 잠금장치가 그냥 걸려 있는 것 같아"라고 생각했습니다. 그들은 '점착성 잠금장치'에게 유익한 편견을 부여했습니다.
- 이해 없이 퍼즐을 해결함: 많은 어린이 (및 인공지능) 가 운이나 규칙의 엉성한 혼합을 통해 다섯 개의 상자를 모두 열었지만, 새로운 상자에 대한 실제 규칙을 설명하라고 요청받으면 실패했습니다. 그들은 교훈을 배우지 않은 채 일을 끝냈습니다.
차이점:
- 인공지능은 "잘하는 학생"입니다: 인공지능은 선생님의 지시를 엄격히 따랐습니다. 선생님이 "색을 맞추라"고 말하면, 그것이 명백히 틀렸음에도 불구하고 인공지능은 먼저 색을 맞추려고 시도했습니다. 매우 순종적이었습니다.
- 어린이는 "회의론자"입니다: 어린이들은 덜 순종적이었습니다. 많은 어린이들이 선생님의 거짓말을 즉시 무시하고 무작위 열쇠를 테스트하기 시작했습니다.
- "과잉 관찰자" 대 "과소 관찰자":
- 인공지능은 열쇠를 시도하기 전에 모든 상자를 반드시 확인해야 한다고 느낀 로봇과 같았습니다. 추측할 수 있었음에도 불구하고 체계적으로 모든 상자를 들어 모양을 세었습니다.
- 어린이는 게으른 탐정들과 같았습니다. 많은 어린이들이 아예 상자를 들어 올리지 않았습니다. 그들은 멀리서 볼 수 있는 것을 바탕으로 추측했습니다. 그들은 "상자를 들어 올리는 것"을 피하고 싶은 비용으로 취급한 듯했습니다.
3. 이것이 중요한 이유
이 논문은 어린이와 인공지능 모두 불확실한 환경에서 퍼즐을 해결할 수 있지만, 서로 다른 "내부 비용"으로 이를 수행한다고 주장합니다.
- 인공지능에게: 정보를 확인하는 비용은 제로입니다. 피곤하지도, 지루하지도 않으며, 지시를 맹목적으로 따르는 것을 꺼리지 않습니다. 수학적으로 가장 확실한 방법이라고 판단되면 모든 상자를 확인합니다.
- 어린이에게: 정보를 수집하는 데는 보이지 않는 "비용"이 있습니다. 사회적일 수도 있습니다 (상자를 들어 올리는 것이 우스꽝스러워 보일 수 있음), 혹은 단순히 정신적 에너지일 수 있습니다. 이러한 이유로 그들은 종종 추측하고, 단계를 생략하며, 때로는 그것이 왜 옳은지 실제로 알지 못한 채 정답을 맞히기도 합니다.
결론
연구자들은 인공지능을 "시험 대상 (모델 생물)"으로 사용하여 규칙을 변경했을 때 어떤 일이 발생하는지 관찰했습니다. 그들은 인공지능에게 어린이가 직면한 것과 동일한 불확실성과 신뢰할 수 없는 증거를 제공하면, 인공지능이 어린이처럼 행동하기 시작한다는 사실을 발견했습니다. 혼란스러워지고, 생각을 바꾸는 것을 주저하며, 때로는 우연히 퍼즐을 해결합니다.
그러나 인공지능은 근본적으로 여전히 다릅니다. 인공지능은 너무 순종적이고 데이터 수집에 너무 열성적입니다. 반면 어린이는 위험을 감수하고, 나쁜 조언을 무시하며, 에너지를 절약하기 위해 단계를 건너뛰는 것을 기꺼이 합니다. 이 논문은 기계가 가지고 있지 않은 사고와 관찰의 숨겨진 "비용"을 고려해야만 인간 지능을 진정으로 이해할 수 있다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.