← 최신 논문
💬 NLP

Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era

이 사전 등록된 연구는 69,000개 이상의 medRxiv 프리프린트를 분석하여 대규모 언어 모델의 등장 이후 고찰(discussion) 섹션 내에서 엔 대시(em-dash) 사용이 인구 수준에서 유의미하고 점진적으로 증가했음을 밝혀내며, 이는 2020년대 초반 과학적 글쓰기에서의 뚜렷한 문체적 변화를 시사한다.

원저자: Przemysław Czuma

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Przemysław Czuma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대한 의학 노트의 도서관이 새로운, 보이지 않는 손에 의해 건드려졌는지 알아내려는 탐정이라고 상상해 보십시오. 당신은 지문이나 DNA를 찾는 것이 아니라, 특정한 아주 작은 문장 부호인 엠 대시(em-dash, —)를 찾고 있습니다.

종이가 발견한 이야기를 다음과 같이 알기 쉽게 들려드립니다.

미스터리: 실수가 아닌 "오타"

수년 동안 과학자들은 "대규모 언어 모델"(ChatGPT와 같은)이 엠 대시를 사용하는 것을 좋아한다는 소문을 속삭여 왔습니다. 반면 인간은 보통 그것을 번거롭거나 입력하기 어렵다고 느껴서 드물게 사용합니다. 이는 마치 사람이 문장을 쓸 때 쉼표를 사용하는 반면, 로봇은 더 "전문적으로" 보이게 하기 위해 극적인 대시를 사용하는 것과 같습니다.

하지만 지금까지 이것은 그저 가십에 불과했습니다. 누구도 이 대시의 개수를 수천 편의 실제 과학 논문에서 실제로 세어보며 그 소문이 사실인지 확인하지 않았습니다.

조사: 텍스트의 바다 속에서 대시 세기

연구자 프셰미스와프 추마(Przemysław Czuma)는 거대한 규모로 탐정 놀이를 하기로 했습니다. 그는 편집자에 의해 "정리되어" 원래의 문장 부호가 사라지는 경우가 많은 출판된 서적들을 보는 대신, 과학자들이 논문을 출판하기 전 편집되지 않은 초안(프리프린트)을 올리는 서버인 medRxiv를 조사했습니다.

  • 대상: 그는 논문의 "고찰(Discussion)" 섹션에 집중했습니다. 이 부분은 과학자들이 이야기를 들려주고, 결과에 대한 자신의 견해를 설명하며, 독자를 설득하려고 노력하는 부분입니다. 즉, 가장 "인간적인" 부분입니다.
  • 도구: 그는 컴퓨터 프로그램을 사용하여 69,000개 이상의 초안을 스캔하며, 특히 엠 대시(—) 문자를 찾았습니다.
  • 타임라인: 그는 데이터를 두 시대로 나누었습니다:
    1. ChatGPT 이전 (2022년 11월 이전).
    2. ChatGPT 이후 (2022년 11월 이후).

결과: 번쩍이는 섬광이 아닌 서서히 타오르는 불꽃

결과는 극적이었지만, 전등 스위치를 켜는 것처럼 하룻밤 사이에 일어나지는 않았습니다.

  • AI 붐 이전: 고찰 섹션에 엠 대시가 하나라도 포함된 논문은 약 **4%**에 불과했습니다. 매우 드문 일이었습니다.
  • AI 붐 이후: 그 숫자는 **11.5%**로 급증했습니다.
  • 추세: 2023년에 즉시 발생한 것은 아니었습니다. 숫자는 낮게 유지되다가, 2024년에 서서히 올라가기 시작했고, 2025년에는 **20%**까지 치솟았습니다.

비유: 아무도 빨간 모자를 쓰지 않는 조용한 파티를 상상해 보십시오. 그러다 새로운 패션 트렌드가 시작됩니다. 처음에는 몇 명만이 그것을 시도합니다. 그러다 천천히 더 많은 사람이 동참합니다. 다음 해가 되자, 파티에 온 사람 다섯 명 중 거의 한 명은 빨간 모자를 쓰고 있습니다. 엠 대시에게 일어난 일이 바로 이것입니다.

증거: 다른 용의자 배제하기

좋은 탐정은 다른 설명이 있는지 확인합니다. 연구자는 엠 대시의 증가가 단순히 무작위적인 추세이거나 웹사이트의 텍스트 형식이 변경된 것이 아님을 확인하기 위해 여러 가지 "거짓말 탐지기" 테스트를 실행했습니다.

  1. "지루한 섹션" 테스트: 그는 "감사의 글(Acknowledgments)"과 "데이터 가용성(Data Availability)" 같은 지루하고 표준적인 섹션들을 확인했습니다. 만약 웹사이트 전체의 형식이 바뀌었다면, 이 섹션들에서도 대시가 더 많이 나타났을 것입니다. 하지만 그렇지 않았습니다. 증가는 오직 이야기를 전달하는 부분에서만 나타났습니다.
  2. "가짜 날짜" 테스트: 그는 ChatGPT가 존재하기 전의 시간대를 보고, 임의의 날짜를 "시작점"이라고 가정했습니다. 아무것도 변하지 않았습니다. 이는 증가가 단순히 시간이 흐름에 따라 발생하는 자연스러운 완만한 변화가 아님을 증명했습니다.
  3. "단어 선택" 테스트: 그는 또한 AI 모델이 즐겨 사용하는 특정 단어들(예: "delve", "groundbreaking", "leverage")을 조사했습니다. 이 단어들은 대시와 정확히 같은 시기에 급증했습니다.

이것이 의미하는 것 (그리고 의미하지 않는 것)

이 논문은 자신의 주장에 대해 매우 신중합니다.

  • 이것이 보여주는 것: 2022년과 2025년 사이에 과학 논문이 작성되는 방식에 큰 변화가 있었다는 것을 보여줍니다. 글쓰기 스타일이 AI 도구의 부상과 일치하는 방식으로 변화했습니다. 엠 대시는 모든 개별 인물의 키가 커진 것이 아니라, 군중의 평균 키가 높아진 것을 알아차리는 것과 같은 "인구 수준"의 신호입니다.
  • 이것이 보여주지 않는 것: 엠 대시가 있는 단 하나의 논문만을 보고 "이것은 로봇이 썼다"라고 말할 수는 없습니다. 인간도 대시를 아주 좋아할 수 있기 때문입니다. 또한, 대시가 없는 논문을 보고 "이것은 100% 인간이 썼다"라고도 말할 수 없습니다.
  • 결론: 이 연구는 AI의 글쓰기 "지문"이 과학 문헌에서 점점 더 눈에 띄게 되고 있음을 확인해 줍니다. 그것은 즉각적으로 일어나지 않았습니다. 과학자들이 이 새로운 도구들을 사용하여 자신의 이야기를 다듬고 쓰는 데 점진적으로 신뢰하고 사용하기 시작하면서 일어난 일이었습니다.

요약하자면, 엠 대시는 비록 우리가 모든 냄비마다 정확히 어떤 가스레인지를 사용했는지 지목할 수는 없을지라도, 과학적 글쓰기의 주방에서 불(AI 사용)이 타오르기 시작했음을 암시하는 "연기"와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →