← 最新の論文
💬 NLP

Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era

この事前登録された研究は、69,000件以上のmedRxivプレプリントを分析することで、大規模言語モデルの登場後、考察セクションにおけるエムダッシュ(—)の使用が人口レベルで有意かつ段階的に増加していることを明らかにしており、これは2020年代初頭における科学的記述における明確な文体の変化を示唆している。

原著者: Przemysław Czuma

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Przemysław Czuma

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、膨大な医学的ノートのライブラリが、新しい「見えない手」によって触れられたかどうかを突き止めようとしている探偵だと想像してください。あなたは指紋やDNAを探しているのではなく、特定の、極めて小さな句読点である**エムダッシュ(—)**を探しています。

ここに、紙に書かれた物語が、分かりやすく語られています。

ミステリー:「打ち間違い」ではないもの

長年、科学者たちの間である噂が囁かれてきました。「大規模言語モデル(ChatGPTのようなもの)は、エムダッシュを使うことを好む」という噂です。一方で、人間は通常、エムダッシュを面倒に感じたり、入力するのが難しいと感じたりするため、それらを控えめに使います。それは、人間がコンマを使って文章を書くのに対し、ロボットはより「プロフェッショナル」に見せるためにドラマチックなダッシュを使うようなものです。

しかし、これまでは単なる噂に過ぎませんでした。誰も、この噂が真実かどうかを確認するために、何千もの実際の科学論文の中でダッシュの数を実際に数えたことはなかったのです。

調査:テキストの海におけるダッシュのカウント

研究者の Przemysław Czuma は、大規模なスケールで探偵役を務めることにしました。彼は、出版された書籍(編集者によって「清書」され、元の句読点が失われていることが多いもの)を見るのではなく、科学者が論文を出版する前の、未編集のドラフト(プレプリント)が置かれているサーバーである medRxiv を調査しました。

  • ターゲット: 彼はこれらの論文の「考察(Discussion)」セクションに焦点を当てました。ここは、科学者が結果についての考えや感情を説明し、読者を説得しようとする、物語を伝える部分です。ここは、論文の中で最も「人間らしい」部分です。
  • ツール: 彼はコンピュータープログラムを使用して、69,000件を超えるドラフトをスキャンし、特にエムダッシュ(—)という文字を探しました。
  • タイムライン: 彼はデータを2つの時代に分けました:
    1. ChatGPT以前(2022年11月より前)。
    2. ChatGPT以降(2022年11月より後)。

判明したこと:閃光ではなく、じわじわとした燃焼

結果は劇的でしたが、スイッチが入った時のように一瞬で起きたことではありませんでした。

  • AIブームの前: 考察セクションにエムダッシュが一つでも含まれていた論文は、わずか**4%**でした。それは稀なことでした。
  • AIブームの後: その数字は**11.5%**に跳ね上がりました。
  • 傾向: 2023年にすぐには起こりませんでした。数字は低いまま推移し、その後、2024年にかけて徐々に上昇し始め、2025年までには**20%**へと急増しました。

比喩: 静かなパーティーで、ほとんど誰も赤い帽子を被っていない様子を想像してください。その後、新しいファッションのトレンドが始まります。最初は、ごく少数の人だけがそれを試します。その後、ゆっくりと、より多くの人がそれに加わります。翌年には、パーティーに参加している人の5人に1人が赤い帽子を被っています。それが、エムダッシュに起きたことです。

証拠:他の容疑者を排除する

優れた探偵は、他の説明がないかを確認します。研究者は、エムダッシュの増加が単なるランダムな傾向や、ウェブサイトのテキスト形式の変化によるものではないことを確認するために、いくつかの「嘘発見器」テストを実施しました。

  1. 「退屈なセクション」テスト: 彼は、「謝辞(Acknowledgments)」や「データ利用可能性(Data Availability)」といった、論文の(標準的で)退屈な部分をチェックしました。もしウェブサイト全体のフォーマットが変わったのであれば、これらのセクションにもダッシュが増えていたはずです。しかし、そうではありませんでした。増加が見られたのは、物語を紡ぐ部分だけでした。
  2. 「偽の期日」テスト: 彼は、ChatGPTが存在する前の時間軸において、ランダムな日付を「開始点」であると仮定して調べました。何も変化はありませんでした。これは、この増加が単なる緩やかな自然の推移ではないことを証明しました。
  3. 「語彙」テスト: 彼はまた、AIモデルが好んで使う特定の単語("delve"、"groundbreaking"、"leverage" など)についても調査しました。これらの言葉は、ダッシュと同じ時期に上昇しました。

これが意味すること(および意味しないこと)

この論文は、自らの主張について非常に慎重です。

  • 示していること: 2022年から2025年の間に、科学論文の書き方に大きな変化があったことを示しています。執筆スタイルは、AIツールの台頭と一致する形で変化しました。エムダッシュは、個々の事象ではなく、群衆の平均的な身長の変化に気づくような、「集団レベル」のシグナルです。
  • 示していないこと: エムダッシュが含まれる「単一の論文」を見て、「これはロボットによって書かれた」と言うことはできません。人間がたまたまダッシュを好んで使うこともあります。また、ダッシュのない論文を見て、「これは100%人間によるものだ」と言うこともできません。
  • 結論: この研究は、科学文献におけるAIライティングの「指紋」が可視化されつつあることを裏付けています。それは即座に起きたのではなく、科学者たちがこれらの新しいツールを信頼し、自分たちの物語を磨いたり書いたりするために、徐々に使い始めたことで起きたのです。

要約すると、エムダッシュは、科学的な執筆というキッチンにおいて、火(AIの使用)が灯ったことを示唆する「煙」のようなものです。たとえ、どの鍋に対してどのコンロが使われたのかを正確に指し示すことはできなくても。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →