← 最新の論文
💻 computer science

The Effect of Text Reuse Length and Fragmentation on Similarity Detection: A Controlled Evaluation of WordBinary

本研究は、再利用されたコンテンツが短い一節へと断片化されるにつれてWordBinaryのテキスト類似性検出性能が系統的に低下する一方で、当該システムは堅牢かつ効果的であり、意図的に再利用された単語が多数の小さな断片に分散されている場合でも、それらの90%以上を正常に復元できることを実証している。

原著者: Kiah Curan

公開日 2026-08-23
📖 1 分で読めます☕ さくっと読める

原著者: Kiah Curan

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

執筆の世界において、アイデアの借用と言葉の盗用との境界線は、しばしばソフトウェアによって引かれる。類似性検出器として知られるこれらのプログラムは、文書をスキャンして他のソースと一致するテキストを探し出す。これらは読心術師ではない。書き手が盗用を意図したのか、あるいは単に引用を忘れただけなのかを判断することはできない。彼らの役割は、あくまで重複する言葉を見つけることにある。しかし、根本的な疑問が残る。ソフトウェアは、それらの言葉が「どのように」配置されているかを気にするのだろうか。もし書き手が本から長い段落をコピーした場合、ソフトウェアは一致するテキストの大きな塊を検知する。もし同じ書き手が、全く同じ言葉を使い、それらをエッセイの中にバラバラの小さな断片として散りばめた場合、ソフトウェアは依然としてその盗用を見つけ出すことができるのだろうか。これが、研究者たちが解決しようとした核心的なパズルである。彼らは、コピーされたテキストの物理的な形状――それが一つの固まったブロックであるか、あるいは砕かれたモザイクであるか――が、検出器の能力に影響を与えるのかを知りたかったのである。

これに応えるため、キア・カランという研究者が「WordBinary」と呼ばれる特定のツールを用いた制御実験を設計した。目的は、書き手がコピーした素材を隠そうとする状況を模した条件下で、システムをテストすることであった。研究者は50個のオリジナル文書から始めた。各文書に対して、7つの異なるバージョンを作成した。すべてのバージョンにおいて、既知のソースから採取された正確に300語の言葉を挿入した。唯一の変化は、その300語がどのように分布しているかであった。最初のバージョンでは、300語すべてが一つの長く途切れない一節として現れた。次のバージョンでは、それらは100語ずつの3つの塊に分割された。研究者はこのプロセスを続け、テキストをより小さな断片へと細分化していった。すなわち、50語ずつの6つの塊、30語ずつの10の塊、20語ずつの15の塊、そして最終的に10語ずつの30の極めて小さな塊へと。これにより、合計350のテスト文書が作成され、そこには105,000語の意図的なコピーと、4,250個の個別の断片が含まれていた。

結果は、コピーされたテキストの形状が重要であることを示したが、それはシステムを完全に失敗させるようなレベルではなかった。300語が一続きのブロックとして現れたとき、ソフトウェアはそのうちの97.3%を見つけ出した。テキストがより小さな断片に分割されるにつれて、検出率は緩やかに低下した。言葉が30個の小さな10語ずつの断片に分割されたとき、ソフトウェアはそれらのうち80.3%を見つけ出した。これは、テキストを細分化することが発見を困難にするものの、システムは最も困難なシナリオにおいても、5つの言葉のうち4つ以上を依然として回収できることを意味している。また、研究はソフトウェアが個々の断片を特定できるかどうかも調査した。その結果、すべての長い一節と、すべての100語の塊を特定したことが判明した。テキストが10語の断片にまで細分化された場合でも、ソフトウェアはそれら個別の断片の78.5%を正常に特定した。

実験の重要な部分は、ソフトウェアが文書の他の部分によって混乱させられていないことを確認することであった。研究者は「背景」テキスト(コピーされていない部分)をチェックし、断片化によってシステムが実際には存在しない一致を検知していないかを確認した。背景の類似性はすべてのテストを通じて約2.2%から2.4%の間で安定しており、検出率の低下は、システムが誤作動したり不安定になったりしたためではなく、短い断片を見つけることの難しさによるものであることが証明された。また、研究は、システムが30語以上の断片に対して非常に優れた性能を発揮したことも指摘している。具体的には、それらの一節の96.9%を見つけ出した。このことは、ソフトウェアがその役割を果たすために巨大なテキストの塊を見つけることに依存しているわけではなく、コピーされた素材が小さすぎない限り、散らばっていても効果的に機能し続けることを示唆している。

これらの知見は、断片化がコピーされたテキストの検出能力を低下させるものの、ソフトウェアを無用にするものではないことを明らかにしている。性能の低下は急激なものではなく、緩やかなものであった。システムが機能しなくなる特定の分岐点は存在せず、代わりに、断片が小さくなるにつれて効率がわずかに低下していった。このことは、テキストを小さな断片に分解することで盗用を隠そうとする戦略が、決して確実な策ではないことを示している。システムは、たとえ素材が文書全体に分散していたとしても、再利用された素材の大部分を継続して回収するのである。研究は、テキストの物理的な配置が検出に影響を与えるものの、ソフトウェアは高い堅牢性を維持しており、再利用された言葉が単一の段落内にあろうと、数十の小さな断片の中に散らばっていようと、その大部分を識別できると結論づけている。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →