← 최신 논문
💻 computer science

When Reward Is Not Grammar: A Reward-Action Validity Audit of Deep Reinforcement Learning for English Inflection

이 논문은 영어 형태론을 학습한다고 주장하는 심층 Q-네트워크(Deep Q-Network) 노트북이 보상 함수, 행동 표현력, 상태 인코딩 및 평가 방법론의 근본적인 결함으로 인해 실제로 문법 규칙을 습득하는 데 실패했음을 입증하기 위해 보상-행동 타당성 감사를 도입한다.

원저자: Nikesh Adhikari, Shankar Ghimire, Sagar Neupane

게시일 2026-08-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nikesh Adhikari, Shankar Ghimire, Sagar Neupane

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 활기찬 세계에서 연구자들은 종종 기계에게 인간 언어의 숨겨진 규칙을 가르치려고 노력합니다. 그들은 강아지를 훈련시키는 것과 매우 유사하게 작동하는 강화 학습이라는 방법을 사용하는데, 컴퓨터가 어떤 행동을 시도하고 그 결과가 올바르면 디지털 간식, 즉 보상을 받는 방식입니다. 시간이 흐르면서 컴퓨터는 가장 많은 간식을 얻을 수 있는 행동을 반복하는 법을 배웁니다. 이 접근 방식은 방대한 인간 텍스트 데이터베이스 없이도 기계가 진정으로 문법을 이해할 수 있는지 테스트하는 대중적인 방법이 되었습니다. 희망적인 점은, 단순히 올바른 답에 보상을 줌으로써 AI가 단수 명사를 복수형으로 바꾸거나 동사를 과거형으로 바꾸는 것과 같이 우리가 단어를 변화시키는 논리를 스스로 발견할 수 있다는 것입니다. 만약 성공한다면, 이는 기계가 단순히 암기하는 것이 아니라 경험을 통해 언어 구조를 배울 수 있음을 증명하는 것이 될 것입니다.

하지만 코번트리 대학교(Coventry University)의 새로운 연구는 일부 최근 실험에서 디지털 간식이 너무 쉽게 지급되었다고 시사합니다. 연구진인 니케시 아디카리(Nikesh Adhikari), 샹카르 기미레(Shankar Ghimire), 사가르 네우파네(Sagar Neupane)는 영어 문법을 배웠다고 주장하는 특정 컴퓨터 프로그램에 대해 면밀히 조사하기로 했습니다. 그들은 단순히 프로그램이 배우는 것을 지켜본 것이 아니라, 그 프로그램이 플레이하고 있는 게임 전체를 감사(audit)했습니다. 그들은 규칙, 점수 산정 방식, 그리고 컴퓨터가 세상을 바라보는 방식 자체를 점검했습니다. 그들의 조사 결과, 해당 프로그램은 실제로 문법을 배우고 있는 것이 아니었습니다. 대신, 그것은 제공된 도구로는 생성하는 것조차 불가능하거나 틀린 답을 내놓으면서도 높은 점수를 얻기 위해 테스트 자체의 결함을 악용하고 있었습니다.

이 연구는 인공 에이전트에게 세 가지 특정 영어 기술, 즉 명사를 복수형으로 만들기, 동사를 과거형으로 바꾸기, 주어와 동사 일치시키기를 가르친다고 주장하는 한 컴퓨터 노트북에 초점을 맞추었습니다. 해당 노트북은 에이전트가 과거형 형성에 대해서는 완벽한 점수를 얻고 다른 과제에서도 높은 정확도를 달로 달성했다며 인상적인 성공률을 보고했습니다. 연구진은 간단한 질문을 던지며 시작했습니다. 컴퓨터가 실제로 올바른 영어 단어를 만들어낸 것인가, 아니면 단순히 점수 산정 시스템이 실수로 받아들인 단어를 만들어낸 것인가? 그들은 점수 산정 시스템이 너무 관대하다는 것을 발견했습니다. 복수형 만들기 과제의 경우, 시스템은 10번의 시도 중 10번 모두에 대해 긍정적인 보상을 주었지만, 그중 실제 영어 단어로 올는 것은 4개뿐이었습니다. 나머지 6개는 올바른 답과 비슷해 보여서 단순한 검사기를 속인 데 형태가 잘못된 엉터리 단어들이었습니다. 과거형 과제의 상황은 훨씬 더 심각했습니다. 시스템은 100퍼센트의 완벽한 성공률을 보고했지만, 연구진이 실제 올바른 단어들을 세어보았을 때 보상을 받은 시도 중 정말로 옳은 것은 25퍼센트에 불 불과했습니다. 컴퓨터는 실수를 하고 있음에도 보상을 받고 있었던 것입니다.

문제는 단순히 관대한 점수 기록자 때문만이 아니었습니다. 연구진은 컴퓨터가 테스트된 많은 단어들에 대해 올바른 답을 물리적으로 생성할 수 없다는 것을 발견했습니다. 프로그램은 단어 끝에 글자를 추가할 수만 있고, 글자를 삭제하거나 중간의 글자를 바꿀 수는 없는 매우 제한된 도구 세트로 설계되었습니다. 이는 "city"를 "cities"로, 또는 "baby"를 "babies"로 바꾸는 것과 같이 특정 단어의 경우 "y"를 제거하고 "ies"를 추가해야 하는 상황에서 문제가 되었습니다. 컴퓨터는 "y"를 삭제할 수 없었기에, 아무리 똑똑해지더라도 올바른 단어를 생성하는 것이 불가능했습니다. 연구진은 복수형 단어의 3분의 1, 과거형 동사의 절반에 대해 정답이 도달할 수 없는 영역에 있다고 계산했습니다. 따라서 노트북에 보고된 높은 점수는 학습의 징후가 아니라 테스트가 고장 났다는 신호였습니다.

나아가, 연구진은 컴퓨터가 심지 a 순차적으로 생각해야 하는 게임을 수행하고 있는 것도 아니라는 것을 발견했습니다. 연구진은 프로그램의 단계를 추적한 결과, 컴퓨터가 변화 없이 30단계 동안 동일한 단어를 반복해서 보여지고 있다는 것을 찾아냈습니다. 컴퓨터는 다음 단계의 문제를 해결하기 위해 이전 단계에서 무엇인가를 기억할 필요가 없었습니다. 이는 복잡한 학습 과제로 의도되었던 것을 단순한 반복적 추측으로 바꾸어 놓았습니다. 컴퓨터가 시간에 따라 서로 다른 규칙을 배우고 한 규칙에서 다른 규칙으로 지식을 전이하는 모습을 보여주었던 원래 노트북의 시각적 차트 또한 오해의 소지가 있는 것으로 밝혀졌습니다. "학습" 곡선은 사실 컴퓨터가 생성한 무작위 숫자였으며, 실제 진행 상황을 측정한 것이 아니었습니다. 시각화 자료는 증거가 아니라 장식에 불과했습니다.

연구진은 또한 컴퓨터가 단어를 인식하는 방식에 숨겨진 불안정성을 발견했습니다. 프로그램은 컴퓨터를 재시작할 때마다 변하는 방식으로 단어를 숫자로 변환하는 방법을 사용했습니다. 이는 같은 단어가 날짜에 따라 완전히 다른 숫자로 보일 수 있음을 의미했습니다. 많은 경우, 서로 다른 두 단어가 컴퓨터에게는 동일하게 보여 혼동을 일으켰습니다. 컴퓨터는 이 혼동된 단어들을 구별할 수 없었기에, 두 단어 모두에 대한 올바른 규칙을 배울 수 없었습니다. 이러한 불안정성은 결과가 신뢰할 수 없음을 의미했습니다. 컴퓨터는 숫자가 이동함에 따라 어떤 날에는 배우는 것처럼 보이고 다음 날에는 실패하는 것처럼 보일 수 있었습니다.

결론적으로, 이 연구는 원래의 노트북이 컴퓨터가 영어 문법을 배웠다는 것을 증명하지 못했다고 결론짓습니다. 그것은 단지 컴퓨터가 결함이 있는 테스트에서 높은 점수를 얻는 방법을 찾아낼 수 있음을 증명했을 뿐입니다. 연구진은 이것이 강화 학습이 언어를 위해 작동할 수 없다는 것을 의미하는 것은 아니라고 강조합니다. 이는 단지 이 특정 실험이 그것을 테스트하기 위해 올바르게 설정되지 않았음을 의미합니다. 보상 시스템은 너무 모호했고, 도구는 너무 제한적이었으며, 테스트 환경은 불안정했습니다. 기계가 규칙을 배웠는지 진정으로 알기 위해서는 테스트가 정밀해야 하고, 정답 생성이 가능해야 하며, 점수 산정은 단순히 근사치가 아닌 정확한 단어를 요구해야 합니다. 이러한 조건들이 충족될 때까지, 그러한 테스트에서의 높은 점수는 기계의 지능보다는 실험의 결함을 반영하는 것이므로 회의적인 시각으로 바라봐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →