← 최신 논문
💬 NLP

Computational conceptual history of scientific concepts: From early digital methods to LLMs

이 논문은 초기 디지털 방법론에서 현대의 거대언어모델(LLM)로 이어지는 진화 과정을 추적함으로써, 과학사, 과학철학 및 과학사회학의 맥락에서 거대언어모델을 계산적 개념 분석의 더 넓은 역사 속에 위치시키며, 이러한 기술들이 어떻게 오랜 숙제였던 방법론적 과제들을 계승하는 동시에 과학적 개념을 연구하기 위한 새로운 기회를 제공하는지 비판적으로 검토한다.

원저자: Michael Zichert, Arno Simons

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Michael Zichert, Arno Simons

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 '원자(atom)'나 '이론(theory)'과 같은 특정 단어의 의미가 지난 200년 동안 과학계에서 어떻게 변해왔는지 이해하려고 노력하고 있다고 상상해 보십시오. 과거에 역사학자들은 수천 권의 책과 논문을 직접 읽으며 각 시대별로 단어가 어떻게 사용되었는지 노트를 작성해야 했습니다. 이것은 마치 모든 길을 일일이 걸어서 숲의 지도를 그리는 것과 같습니다.

이 논문은 역사학자들이 더 빠르고 훨씬 더 큰 규모로 이러한 지도를 그릴 수 있도록 컴퓨터를 사용하는 방법을 안내하는 가이드입니다. 이 글은 '과거의 방식'(현대적 AI가 등장하기 전)과 대규모 언어 모델(LLM, 챗GPT의 기반이 되는 기술과 같은)을 사용하는 '새로운 방식'을 비교합니다.

다음은 이들의 여정을 쉬운 비유를 사용하여 정리한 내용입니다.

1. 옛날 방식: "정적인 지도" (LLM 이전 시대)

현대적 AI가 등장하기 전, 연구자들은 정적이고 흑백인 지도와 같은 디지털 도구들을 사용했습니다.

  • 작동 방식: 그들은 단어들이 얼마나 자주 함께 나타나는지(예를 들어, '중력'과 '사과'가 같은 문장에서 얼마나 자주 언급되는지) 또는 과학자들이 동일한 논문을 얼마나 자주 인용하는지를 살펴보았습니다.
  • 문제점: 이러한 도구들은 단어가 한 번에 오직 하나의 단일한 의미만을 가진다고 취급했습니다. 이는 '은행(bank)'이라는 단어가 오직 돈을 보관하는 곳만을 의미한다고 말하는 사전와 같습니다. 그 사전은 'bank'가 강둑(river bank)을 의미할 수도 있다는 사실을 잊어버립니다.
  • 결과: 만약 과학적 개념이 여러 가지 의미를 가지고 있다면(실제로 대부분 그렇습니다), 컴퓨터는 이 모든 것을 하나로 뭉뚱그려 흐릿한 평균값으로 만들어 버립니다. 도구가 너무 경직되어 있었기 때문에 미묘한 의미의 변화를 포착하기 어려웠습니다.

2. 새로운 방식: "똑똑하고 맥락을 파악하는 가이드" (LLM 시대)

이제 연구자들은 대규모 언어 모델(LLM)을 사용하고 있습니다. 이들을 정적인 지도가 아니라, 문장을 읽고 즉각적으로 뉘앙스를 이해할 수 있는 똑똑하고 맥락을 파악하는 가이드라고 생각하십시오.

  • 맥락이 핵심이다: 기존의 도구들과 달리, LLM은 'bank'가 낚시에 관한 문장에서는 의미가 다르고 금융에 관한 문장에서는 의미가 다르다는 것을 알고 있습니다. 과학에서 이는 컴퓨터가 물리학자가 '입자(particle)'라는 단어를 아주 작은 물질의 조각이라는 의미로 사용하는지, 아니면 은유적으로 사용하는지를 구별할 수 있음을 의미합니다.
  • 두 가지 유형의 가이드:
    • 분석가 (인코더 모델): 이들은 도서관을 순식간에 스캔하여 "1950년대에는 이 단어가 X라는 의미로 80% 사용되었지만, 1990년대에는 Y라는 의미로 변했다"라고 즉시 말해줄 수 있는 초고속 사서와 같습니다. 이들은 변화를 측정하는 데 탁월합니다.
    • 작가 (디코더 모델): 이들은 창의적인 조수와 같습니다. "이 단어가 1920년에 어떻게 사용되었는지 보여주는 문장을 써줘"라거나 "1980년대에 과학자들이 이 개념을 어떻게 정의했는지 요약해줘"라고 요청할 수 있습니다. 이들은 예시를 생성하거나 역사적 데이터가 누락된 부분을 채우는 데 도움을 줍니다.

3. 거대한 도전 과제: 마법이 아니다

저자들은 이러한 강력한 도구들을 가졌다고 해서 역사학의 고된 작업이 사라진 것은 아니라고 주의를 줍니다. 오히려 새로운 문제들이 나타났습니다.

  • "쓰레기를 넣으면 쓰레기가 나온다(Garbage In, Garbage Out)" 법칙: 만약 컴퓨터가 편향되거나 불완전한 서적 컬렉션으로 학습된다면, 그 지도는 틀린 것이 됩니다. 만약 디지털 아카이브에 최근 50년 동안의 책들만 있다면, 컴퓨터는 지난 100년의 이야기를 들려줄 수 없습니다.
  • "블랙박스"의 미스터리: 기존의 도구들을 사용할 때는 수학적 원리를 정확히 볼 수 있었습니다. 하지만 LLM의 경우, 그 과정은 종종 '블랙박스'와 같습니다. 우리는 입력값과 출력값은 알지만, AI가 왜 특정한 결정을 내렸는지 그 이유를 알기는 더 어렵습니다. 이는 결과를 재확인하지 않고는 신뢰하기 어렵게 만듭니다.
  • 단어 vs 실제 현실: 이 논문은 과학적 개념이 단순히 단어만이 아니라는 점을 강조합니다. 개념은 실제 도구, 실험, 도표와 연결되어 있습니다. 컴퓨터는 텍스트를 읽을 수는 있지만, 단어 자체가 변하지 않았더라도 새로운 현미경이 발명됨으로써 개념이 변했을 가능성을 놓칠 수 있습니다. 컴퓨터는 텍스트를 보지만, 실험실 장비는 보지 못합니다.

4. 결론: 멀티 툴 키트 (다용도 도구 세트)

이 논문의 주요 결론은 LLM이 역사학자의 도구 상자에 추가된 강력한 도구이지만, 역사학자를 대체할 수는 없다는 것입니다.

  • 한 가지 도구에만 의존하지 마십시오: AI에게 "이 개념이 무엇을 의미하느냐"고 묻고 그 답을 절대적인 진리로 받아들여서는 안 됩니다.
  • 하이브리드 접근 방식: 가장 좋은 방법은 AI를 사용하여 수천 권의 문서를 스캔하고 흥미로운 패턴을 찾아내고(마치 금속 탐지기가 땅속에 묻힌 동전을 찾는 것처럼), 그 후 인간 역사가가 그 동전을 직접 파내어 면밀히 조사하고 역사적 의미를 설명하는 것입니다.
  • 미래: 저자들은 텍 liệu뿐만 아니라 그림과 도표까지 볼 수 있는 더 나은 도구들이 개발되어, 과학이 작동하는 더 완전한 모습을 보여주기를 희망합니다.

요약하자면: LLM을 통해 역사학자들은 과거에는 불가능했던 방식으로 과학적 언어의 '숲'을 조망하며 트렌드와 의미의 변화를 포착할 수 있게 되었습니다. 그러나 나무를 해석하여 컴퓨터가 숲에서 길을 잃거나 지도를 잘못 해석하지 않도록 하는 것은 여전히 역사학자의 몫입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →