Reversing Arrows in Large Language Models
이 논문은 대규모 언어 모델이 역관계 방향성을 어떻게 처리하는지에 대한 첫 번째 체계적인 연구를 제시하며, 분류 성능에서의 체계적인 비대칭성을 밝히고 모델의 정확도가 엔티티 표현에는 민감하지만 관계 설명은 결과를 일관되게 개선하지 못한다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 단순히 단어를 읽는 것이 아니라, 단어들을 거대한 보이지 않는 사실의 그물로 연결하여 세상을 이해하도록 가르치고 있다고 상상해 보세요. 이것이 바로 **지식 그래프(Knowledge Graphs)**의 세계입니다. 여기에서의 모든 연결은 마치 일방통행 도로처럼 특정한 방향을 가지고 있습니다. 만약 당신이 "앨리스는 Bob의 어머니이다"라는 것을 안다면, 로봇은 또한 "Bob은 앨리스의 자녀이다"라는 것도 이해해야 합니다. 하지만 여기서 까다로운 점은, 만약 당신이 순서를 뒤집어 "Bob에서 앨리스로"에 대해 묻는다면 그 의미가 완전히 달라진다는 것입니다. 이는 열쇠가 자물쇠를 여는 법을 아는 것이 자동으로 자물쇠가 열쇠를 여는 법을 안다는 것을 의미하지 않는 것과 같습니다. 과학자들은 이러한 **역관계(inverse relations)**를 말하며, 이것이 사실을 제대로 파악하는 것과 방향을 거꾸로 알고 있는 것 사이의 차이를 만듭니다.
최근 우리는 **대규모 언어 모델(LLMs)**이라고 불리는 초지능형 컴퓨터들을 구축했습니다. 이들은 인터넷의 거의 모든 것을 읽은 디지털 두뇌와 같습니다. 이들은 이야기를 쓰고 질문에 답하는 데 매우 뛰어납니다. 하지만 한 가지 찜찜한 걱정이 있습니다. 이 디지털 두뇌들이 실제로 이러한 관계의 방향을 이해하고 있는 것일까요, 아니면 그저 단어들이 보통 함께 나타나는 방식에 기반해 추측하고 있는 것일까요? 만약 로봇이 "어머니"와 "자녀"를 서로 교체 가능한 라벨로 생각한다면, 세상의 잘못된 지도를 만들 수도 있습니다. 이 논문은 바로 그 질문, 즉 이 AI 두뇌들이 이름의 순서를 바꿨을 때 부모와 자녀의 차이를 진정으로 구별할 수 있는지에 대한 테스트를 다룹니다.
위대한 화살표 역전 테스트
이 연구에서 연구자들인 세피카 에페올루(Sefika Efeoglu)와 아드리안 파슈케(Adrian Paschke)는 다섯 가지 인기 있는 AI 모델을 궁극의 테스트에 투입하기로 했습니다. 그들은 단순히 AI에게 문장을 쓰라고 시킨 것이 아니라, 5,457개의 서로 다른 시나리오로 구성된 거대한 객관식 퀴즈를 준비했습니다. 마치 게임 쇼 진행자가 "닐스 보어와 그의 아들 아게가 도착했을 때..."와 같은 문장을 읽어준 뒤, AI에게 "닐스에서 아게로 향하는 관계는 '아버지'인가요, '자녀'인가요?"라고 묻는 상황을 상상해 보세요. 그다음 라운드에서는 대본을 뒤집습니다: "아게에서 닐스로 향하는 관계는 무엇인가요?"
연구자들은 화살표가 반대 방향을 가리킬 때 AI가 혼란을 겪는지 확인하고 싶었습니다. AI가 단순히 암기된 패턴(예를 들어 닐스 보어가 실제 과학자라는 사실)에 의존하지 않도록 하기 위해, 그들은 몇 가지 트릭을 사용했습니다. 때로는 실제 인물을 "데빈 로드리게스(Devin Rodriguez)"나 "안젤라 브래들리(Angela Bradley)" 같은 가짜 이름으로 바꿨습니다. 또 어떤 때는 이름을 "XXX"와 "YYY"로 완전히 가려버려, AI가 관련된 인물의 명성이 아닌 오직 문장의 논리에만 의존하게 만들었습니다. 또한, 단어의 정의가 담긴 참조 시트를 제공하여 그것이 도움이 되는지 확인하기도 했습니다.
AI가 실제로 한 것 (그리고 하지 못한 것)
결과는 다소 복합적이었으며, 이 AI 두뇌들이 여전히 방향성에 있어서는 서투르다는 것을 보여주었습니다.
첫째, 연구는 방향이 매우 중요하다는 것을 발견했습니다. AI 모델들은 일관적이지 않았습니다. 때로는 "머리-꼬리(Head-to-Tail)" 관계(예: 부모에서 자녀로)를 파악하는 데 뛰어났지만, 연구자들이 이를 "꼬리-머리(Tail-to-Head)"(자녀에서 부모로)로 뒤집었을 때, 모델에 따라 점수가 급락하거나 요동쳤습니다. 이는 마치 AI가 북쪽으로 가는 지도는 잘 읽지만, 남쪽으로 운전하라고 하면 길을 잃는 것과 같습니다. 예를 들어, 한 데이터셋에서 한 모델은 한 방향으로 갈 때 **67.28%**의 정답률을 보였지만, 다른 모델은 동일한 작업의 반대 방향에서 단 **2.03%**의 정답률만을 보였습니다. 이는 AI가 관계를 진정으로 "이해"하는 것이 아니라, 종종 이전에 보았던 패턴에 반응하고 있을 뿐이라는 점을 시사합니다.
둘째, 연구자들은 AI에게 사전적 정의(관계 설명)를 주는 것이 도움이 될지 테스트했습니다. 그들은 만약 AI에게 "'어머니'는 여성 부모를 뜻한다"라고 알려준다면 성능이 좋아질 것이라고 기대했습니다. 결과는 이것이 일관되게 도움이 되지 않았다는 것을 보여주었습니다. 어떤 경우에는 추가된 단어들이 AI를 약간 더 낫게 만들기도 했지만, 많은 경우에 아무런 변화가 없었거나 심지 true 오히려 상황을 악화시키기도 했습니다. 단지 정의를 읽는 것만으로는 화살표가 어느 방향을 가리키는지에 대한 혼란을 마법처럼 해결할 수 없다는 것이 밝혀졌습니다.
마지막으로, "가짜 이름" 실험은 가장 많은 것을 드러냈습니다. AI가 실제 인물을 다룰 때는 학습 데이터에서 해당 이름과 관계를 이미 보았을 가능성이 높기 때문에 비교적 잘 수행했습니다. 하지만 연구자들이 합성된 이름을 넣거나 이름을 완전히 가렸을 때, 성능은 매우 민-감하게 변했습니다. 어떤 모델은 완전히 무너졌고, 어떤 모델은 놀랍게도 버텨냈습니다. 이는 AI의 성공이 순수한 논리보다는 엔티티(대상)에 대한 친숙도에 의존한다는 것을 시사합니다. 만약 AI가 "닐스 보어"를 인식한다면, 그것은 '부성(fatherhood)'이라는 개념을 이해해서가 아니라 그 이야기를 알고 있기 때문에 정답을 맞혔을 가능성이 큽니다.
결론
이 논문은 대규모 언어 모델이 강력하기는 하지만, **역관계의 방향성(inverse relation directionality)**을 아직 완전히 마스터하지 못했다고 결론짓습니다. 이들은 체계적인 비대칭성을 보이는데, 즉 한쪽 방향에는 강하지만 다른 쪽 방향에는 약한 모습을 보이며, 관계 자체의 논리보다는 특정 인물을 아는 것에 크게 의존하는 것으로 보입니다.
저자들은 자신들이 문제를 "해결"했거나 AI가 영원히 고장 났음을 증명한 것이 아니라는 점을 주의 깊게 언급합니다. 대신, 그들의 연구는 우리가 정밀하고 방향성이 있는 지식이 필요한 작업에 이 모델들을 사용할 때 더 주의를 기울여야 함을 시사합니다. 만약 우리가 AI가 세상의 정확한 지도를 만들기를 원한다면, "어머니"와 "자녀"가 동전의 양면과 같다는 것을 AI가 이해하고 있다고 그냥 가정해서는 안 됩니다. 우리는 계속해서 테스트하고, 화살표를 계속 뒤집어 보며, 로봇이 단순히 자신이 유명하다고 생각하는 사람을 바탕으로 추측하고 있는 것은 아닌지 확인해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.