GPTKB v1.5: A Massive Knowledge Base for Exploring Factual LLM Knowledge
이 논문은 대규모 재귀적 구체화(massive-recursive materialization)를 통해 GPT-4.1로부터 구축된, 체계적인 탐색, 구조화된 질의, 그리고 사실적 LLM 지식의 비교 분석을 가능하게 하는 1억 개 트리플 규모의 비용 효율적인 지식 베이스인 GPTKB v1.5를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 인터넷에 있는 거의 모든 것을 읽은 초천재 로봇이 있다고 상상해 보세요. 당신은 이 로봇이 많은 사실을 알고 있다는 것을 알지만, 만약 당신이 "에펠탑에 대해 무엇을 알고 있니?"라고 물으면 로봇은 몇 가지를 말해줄 뿐일 것입니다. 만약 "루브르 박물관은 어때?"라고 물으면 더 많은 것을 말하겠죠. 하지만 당신은 로봇이 무엇을 모르는지, 혹은 그 지식의 깊이가 정말 어느 정도인지 알 수 없습니다. 왜냐하면 당신은 한 번에 하나의 질문만 던질 수 있기 때문입니다. 이것은 마치 지나가는 길목에 보이는 지점들만 보면서 대륙의 지도를 그리려는 것과 같습니다.
GPTKB v1.5는 이 게임의 판도를 바꾸는 프로젝트입니다. 연구진은 로봇에게 질문을 하나씩 던지는 대신, 로봇(구체적으로 GPT-4.1)이 알고 있는 모든 것에 대한 거대하고 상호 연결된 지도를 구축했습니다. 이것은 흩어져 있는 잡학 사전 카드 더미를 모든 사실이 서로 연결된 거대하고 검색 가능한 도서관으로 바꾸는 것과 같습니다.
그들이 어떻게 이 일을 해냈고 무엇을 발견했는지, 이해하기 쉽게 설명해 드리겠습니다.
1. "스노볼(Snowball)" 방식 (어떻게 구축했나)
연구진은 단순히 로봇에게 무작위로 사실을 묻지 않았습니다. 그들은 영리한 "스노볼" 기법을 사용했습니다:
- 시드(Seed): 그들은 "배네바 버쉬(Vannevar Bush)"(유명한 엔지니어)와 같은 하나의 구체적인 대상에서 시작했습니다.
- 확장: 그들은 로봇에게 "배네바 버쉬에 대해 알고 있는 모든 것을 말해줘"라고 요청했습니다. 로봇은 "그는 X에서 일했다" 또는 "그는 Y를 발명했다"와 같은 사실 목록을 제공했습니다.
- 연쇄 반응: 로봇은 그 답변 속에서 새로운 이름들(예: "X"와 "Y")을 언급했습니다. 연구진은 즉시 그 새로운 이름들에 대해 로봇에게 물었습니다.
- 결과: 이 과정을 재귀적으로 반복하여 10단계 깊이까지 진행했습니다. 이는 610만 개의 서로 다른 사물을 연결하는 1억 개의 사실(이를 "트리플(triples)"이라 부름)로 이루어진 거대한 웹을 만들어냈습니다.
이 전체 라이브러리를 구축하는 데는 약 18일이 걸렸으며, 컴퓨터 연산 비용으로 약 14,000달러가 들었습니다.
2. 엉망인 데이터 정리하기 ("통합")
로봇에게 같은 질문을 다른 방식으로 하면, 로봇은 때때로 약간 다른 답변을 내놓거나 동일한 것에 대해 다른 단어를 사용하기도 합니다(예: 한 문장에서는 어떤 사람을 "인간"이라고 부르고, 다른 문장에서는 "사람"이라고 부르는 경우).
이를 해결하기 위해 연구진은 "정리" 과정을 거쳤습니다. 유사한 단어들을 그룹화하고 중복된 사실들을 병합했습니다. 이를 통해 무질서하고 중복된 데이터 더미를 명확한 카테고리를 가진 깨끗하고 조직화된 데이터베이스로 변 변환했습니다.
3. 이 지도로 무엇을 할 수 있을까요?
이 논문은 누구나 이 거대한 지식 베이스를 세 가지 주요 방식으로 탐색할 수 있는 웹사이트를 소개합니다:
- "위키피디아" 스타일 탐색기: 당신은 어떤 항목(예: 싱가포르의 머라이언 동상)을 클릭하여 로봇이 그에 대해 알고 있는 사실 목록을 볼 수 있습니다. 그런 다음 그 사실 속에 언급된 인물이나 장소를 클릭하여 그들의 페이지로 이동함으로써, 마치 박물관을 걷듯이 로봇의 마음속을 탐험할 수 있습니다.
- "탐정" 쿼리 도구: 당신은 SPARQL이라는 특수 언어를 사용하여 복잡한 질문을 던질 수 있습니다. 예를 들어, "이 로봇이 알고 있는 가장 흔한 유형의 사물 상위 100개를 보여줘"라고 요청할 수 있습니다. 로봇의 지도는 로봇이 사람에 대해 가장 많이 알고 있으며, 그다음으로 영화, 기업, 책 순임을 밝혀냈습니다.
- 흥미로운 발견: 연구진은 로봇의 지식이 공정한지 확인했습니다. 그들은 "로봇이 'A는 B와 결혼했다'를 안다면, 'B는 A와 결혼했다'도 아는가?"라고 물었습니다. 그 결과, 84%의 경우에 그렇지 않다는 것을 발견했습니다. 로봇의 지식은 종종 한쪽으로 치우쳐져 있어, 관계의 한쪽 면은 기억하지만 다른 쪽 면은 잊어버리곤 합니다.
- "맛 테스트" (비교): 서로 다른 AI 모델을 나란히 놓고 비교할 수 있습니다. 연구진은 GPT-4.1을 다른 모델들(Llama 및 DeepSeek 등)과 비교했습니다.
- 예시: 유명한 AI 연구원인 일리야 수츠케버(Ilya Sutskever)에 대해 물었을 때, GPT 모델은 40개의 사실을 쏟아낸 반면, Llama 모델은 14개만을 제공했습니다.
- 함정: 하지만 두 모델 모두 그의 생일을 틀렸습니다! 이는 한 모델이 더 많은 사실을 알고 있을지라도, 둘 다 똑같은 어처구니없는 실수를 저지를 수 있음을 보여줍니다.
4. 얼마나 정확한가요?
연구진은 로봇을 무조건 믿지 않고, 그 작업 내용을 검증했습니다.
- 그들은 무작위로 1,000개의 사실을 뽑아 실제 세상과 대조하여 확인했습니다(웹 검색 활용).
- 점수: 사실 중 약 **75.5%**가 진실이었습니다.
- 문제점: 약 **19.5%**는 거짓이었으며, 일부는 너무 혼란스러워 검증이 불가능했습니다.
- 편향성: 특정 "시드(seed)" 이름들로부터 시작했기 때문에, 이 지도는 연구진이 질문하려고 생각했던 것들에 크게 치우쳐져 있습니다. 이것은 거대한 지도이지만, 우주의 모든 지식을 담은 완전한 지도는 아닙니다.
결론
GPTKB v1.5는 "블랙박스"인 AI를 투명하고 검색 가능한 라이브러리로 바꾼 14,000달러 규모의 거대한 실험입니다. 이 프로젝트는 우리가 AI가 무엇을 알고 있는지 추측하는 대신, 실제로 그것을 볼 수 있게 해주는 도구이며, 이러한 모델들이 믿기 힘들 정도로 박식하면서도(1억 개의 사실 보유), 동시에 사고가 한쪽으로 치우치거나 특정 오류를 범하기 쉽다는 것을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.