Impact of Task Phrasing on Presumptions in Large Language Models
본 연구는 작업 표현 방식이 대규모 언어 모델의 가정 형성에 상당한 영향을 미쳐 반복적 죄수의 딜레마와 같은 의사결정 작업에서의 적응성과 논리적 추론을 변화시킴으로써 안전성과 신뢰성을 보장하기 위한 중립적 표현의 중요성을 부각시킨다는 것을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 독서량이 풍부한 로봇에게 게임 플레이를 가르친다고 상상해 보세요. 이 로봇은 수백만 권의 책, 기사, 이야기를 읽었기 때문에 '세상의 규칙'을 매우 잘 알고 있습니다. 하지만 함정이 하나 있습니다. 때로는 로봇이 자신이 보통 보는 것을 기억하는 데 너무 능숙해서, 실제로眼前에 있는 것을 보지 못하게 됩니다.
이 논문은 바로 그 문제를 수사하는 탐정 이야기와 같습니다. 저자 케네스 옹 (Kenneth Ong) 은 게임의 규칙이 바뀔 때, AI 채팅봇의 두뇌인 대규모 언어 모델 (LLM) 이 자신의 가정 속에 갇히는지 확인하고 싶었습니다.
게임: '죄수의 딜레마'의 변형
이를 테스트하기 위해 저자는 고전적인 게임 이론 시나리오인 **반복 죄수의 딜레마 (Iterated Prisoner's Dilemma)**를 사용했습니다. 이는 경찰서에서 두 명의 용의자 사이에서 벌어지는 게임이라고 생각하세요.
- 일반적인 규칙: 두 사람 모두 침묵을 지킨다면 (협력), 짧은 형기를 선고받습니다. 한 명이 다른 사람을 배신하면 (배반), 배신자는 석방되고 침묵한 사람은 긴 형기를 선고받습니다.
- 함정: 저자는 게임의 '반전' 버전을 만들었습니다. 이 버전에서는 보상이 뒤집힙니다. 이제 상대방을 배신하는 것은 실제로 당신에게 더 나쁜 결과를 초래하는 반면, 침묵을 지키는 것이 최선의 수단이 됩니다.
목표는 간단했습니다. AI 가 진정으로 논리적이라면 새로운 규칙을 보고 전략을 바꿔야 합니다. 하지만 AI 가 '가정' (게임이 어떻게 되어야 한다고 생각하는 것) 에만 의존한다면, 규칙이 바뀌었음에도 여전히 옛날 방식으로 게임을 계속할 것입니다.
세 가지 실험: 로봇에게 게임을 어떻게 시켰는가
저자는 지시문을 작성하는 방식을每次마다 변경하며 세 가지 다른 테스트를 수행했습니다.
1. '이름 언급' 테스트 (명시적 명명)
- 설정: 프롬프트에 명시적으로 "당신은 반복 죄수의 딜레마를 플레이하고 있습니다"라고 적었습니다. '죄수', '협력', '배반'이라는 단어를 사용했습니다.
- 결과: AI 는 완전히 실패했습니다. 규칙이 뒤집혔음에도 불구하고, AI 는 원래 게임에서 그랬던 것처럼 여전히 '협력' (또는 모델에 따라 '배반') 을 선택했습니다.
- 비유: 셰프에게 "전통적인 비프 웰링턴을 만들어 주세요"라고 말하면서, 정작 건네준 레시피는 채식 스튜 레시피인 것과 같습니다. 셰프는 '비프 웰링턴'이라는 이름을 듣고 새로운 레시피는 무시한 채, 이름이 암시하는 대로 소고기를 요리하기 시작합니다. AI 는 게임의 유명한 이름에 너무 집중하여 페이지에 적힌 실제 숫자를 무시했습니다.
2. '모호한 설명' 테스트 (숨겨진 이름)
- 설정: 프롬프트에서 '죄수의 딜레마'라는 단어는 제거했지만, 여전히 '죄수', '협력', '배반'이라는 단어는 사용했습니다.
- 결과: AI 는 여전히 어려움을 겪었습니다. 문맥 단서 (감옥 형기와 특정 용어) 를 통해 이것이 '죄수의 딜레마'임을 알아챈 듯했습니다. 여전히 새로운 뒤집힌 규칙보다는 학습 데이터에 의존했습니다.
- 비유: '비프 웰링턴'이라는 이름을 사용하지 않고 "그것은 퍼프 페이스트리와 소고기가 들어간 유명한 영국 요리입니다"라고 설명하는 것과 같습니다. 셰프는 여전히 당신이 무엇을 원하는지 알고 새로운 지시를 무시합니다.
3. '중립적 코드' 테스트 (추상적 변수)
- 설정: 프롬프트에서 익숙한 모든 것을 제거했습니다. '죄수', '협력', '배반'이라는 단어는 없었습니다. 대신 추상적인 레이블인 '선택 X'와 '선택 Y', 그리고 '감옥 시간' 대신 '달러 손실'을 사용했습니다.
- 결과: 성공! AI 가 유명한 게임에 대한 기억에 의존할 수 없게 되자, 실제로 새로운 규칙을 보게 되었습니다. 규칙이 뒤집히자 AI 는 새로운 수학에 맞춰 전략을 변경했습니다.
- 비유: 셰프에게 요리의 이름을 밝히지 않고 재료와 지시사항만 주는 것과 같습니다. "밀가루, 버터, 소고기를 섞으세요." 만약 지시사항을 "밀가루, 버터, 두부를 섞으세요"로 바꾸면, 셰프는 요리의 이름에 방해받지 않고 실제로 새로운 목록을 따릅니다.
놀라운 반전: 사고가 상황을 더 악화시킬 수 있음
가장 흥미로운 발견 중 하나는 '추론'에 관한 것이었습니다. 저자는 AI 에게 답변하기 전에 "단계별로 생각하라"고 요청했습니다.
- 발견: 앞의 두 테스트에서 AI 에게 생각하게 하는 것은 실제로 그것을 더 고집스럽게 만들었습니다. AI 는 규칙이 바뀌었다는 사실을 완전히 무시한 채, 왜 '티포테이 (Tit-for-Tat)' 전략 (원래 게임의 유명한 전략) 을 따라야 하는지 설명하는 길고 논리적인 단락을 작성했습니다.
- 비유: 수학 시험의 정답지를 외운 학생과 같습니다. 문제의 숫자를 바꾸고 "풀이 과정을 보여라"고 요청하면, 그들은 이전 답이 왜 옳은지에 대한 완벽하고 논리적인 설명을 적어내지만, 질문 자체가 바뀌었다는 사실을 전혀 놓쳐버립니다.
결론
이 논문은 AI 모델이 특정 시험을 위해 너무 열심히 공부한 학생들과 같다고 결론 내립니다. 그들은 '표준' 답안을 너무 잘 알고 있어서 질문이 약간만 바뀌어도 이를 알아차리지 못할 수 있습니다.
- 문제: 우리가 AI 에게 '죄수의 딜레마'와 같은 익숙한 이름이나 시나리오를 사용하여 작업을 부여할 때, AI 는 당신이 방금 준 구체적인 지시사항보다는 해당 시나리오에 대한 '가정'에 의존합니다.
- 해결책: AI 가 당신이 준 실제 규칙을 따르게 하려면, 작업을 중립적이고 추상적인 방식으로 설명해야 합니다. 게임이 무엇인지 말하지 말고, 규칙이 무엇인지만 말하세요.
간단히 말해: AI 가 새로운 상황에 적응하게 하려면, 과거의 상황을 상기시키지 마세요. '유명한 이름' 대신 '변수 (X 와 Y)'로 말하세요.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.