← 最新の論文
💬 NLP

SEDD: Scalable and Efficient Dataset Deduplication with GPUs

SEDD は、データシャッフルをストリーミング方式に置き換え、ハッシュ関数を最適化することで既存の CPU および GPU ツールを大幅に凌駕し、高い忠実度を維持しながら最大 375 倍の高速化を達成する、大規模データセットの重複排除のための高性能な GPU 加速フレームワークである。

原著者: Youngjun Son, Chaewon Kim, Jaejin Lee

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Youngjun Son, Chaewon Kim, Jaejin Lee

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

すばらしい学生(人工知能)に、膨大な量の書籍を読みさせることで教育しようとしている状況を想像してみてください。しかし、この図書館には問題があります。同じ物語が、フォントがわずかに異なるか、いくつかの単語が変わっただけの何千ものコピーで埋め尽くされているのです。学生が同じ物語を 1,000 回も読めば、新しいことを学ぶ代わりに、何度も何度もそれを暗記することに時間を浪費してしまいます。さらに、その物語だけが重要だと考え始めてしまうかもしれません。

これを解決するには、図書館を巡り、すべての重複した書籍を見つけ、余分なものを捨ててくれる司書が必要です。このプロセスはデータセットの重複除去と呼ばれます。

あなたが提供した論文は、SEDDという、超高速な新しい司書を紹介します。その仕組みを簡単に説明します。

従来の方法:遅く、疲れた司書

SEDD 以前には、この作業を行うための主に 2 つの方法がありました。

  1. CPU 方式(人間の司書): これは、非常に慎重な人間が図書館を歩き、すべての本を読み、一つずつ比較するようなものです。正確でしたが、信じられないほど遅いものでした。インターネット規模の図書館(数兆語)があった場合、この人間が完了するには数年を要しました。
  2. GPU 方式(計画の悪い高速ロボット): NVIDIA は人間よりもはるかに速く読めるロボット(NeMo Curator と呼ばれる)を作成しました。しかし、このロボットには欠点がありました。2 冊の本を比較するたびに、異なる部屋を行き来して本を運び、床にメモを書き、紙の山を整理し直す必要があったのです。この「行ったり来たり」(データシャッフル)があまりにも時間を浪費したため、ロボットの超高速性が、単に列で待つことに浪費されることがよくありました。

新しい方法:SEDD(超効率的な司書)

この論文の著者たちは、GPU(ハイエンドなビデオゲームに使用されているのと同じチップ)上で動作するように設計された新しいシステム、SEDDを構築しました。彼らは、3 つの巧妙なトリックでロボットの欠点を修正しました。

1. 「転がす」スタンプ(より賢いハッシュ化)

重複を見つけるために、システムはすべての本を固有の「指紋」(コード)に変換する必要があります。

  • 従来の方法: 本のすべてのページに、重くて遅いインクスタンプを押すようなものです。
  • SEDD の方法: SEDD は「転がすスタンプ」を使用します。「The cat sat」という文があり、次の文「The cat sat on the mat」に進む場合、SEDD は全体を再スタンプしません。「The」を消し、「on the mat」の部分だけをスタンプするだけです。直前にやった作業を再利用するのです。これにより、指紋の作成は従来のコンピューター方法よりも375 倍高速になります。

2. 「シャッフルなし」パイプライン(ストリーミング)

これが SEDD の最大の革新です。

  • 従来の方法: ロボットはすべての本を集め、床に山分けし、一度立ち去り、戻ってきて再び分類し、結果を書き留めるという、重い箱を移動させる絶え間ないサイクルを行っていました。
  • SEDD の方法: SEDD はストリーミングアプローチを使用します。コンベアベルトを想像してください。本がベルトを下に移動するにつれて、ロボットはそれらを掴み、チェックし、重複品をすぐにゴミ箱に捨てます。まず全体の山を分類するために止まることはありません。また、2 つの作業を同時に行います。1 冊の本をチェックしている間に、次の本をベルトに引き上げているのです。これにより、以前のロボットを遅くしていた「行ったり来たり」が排除されます。

3. 「完璧なサイズ」の箱(賢いバケット)

本を分類する際には箱が必要です。箱が多すぎると、箱の間を歩き回るのに一日中費やしてしまいます。少なさすぎると、箱があふれて散らかり、混乱します。

  • SEDD は、特定の数学的なトリックを使用して、作業対象の図書館のサイズに合わせて最適な箱の数を自動的に計算します。これにより、ロボットは常に忙しく働き、箱が空くのを待つことはなくなります。

結果:どれほど速いのか

論文は、数百万のドキュメントと数兆語を含む膨大な図書館(データセット)で SEDD をテストしました。

  • 人間(CPU)との比較: SEDD は158 倍速かったです。
  • 以前のロボット(GPU)との比較: SEDD は7.8 倍速かったです。
  • 大きな勝利: SEDD は、32 枚のパワーフルなグラフィックカードのクラスターを使用して、1.2 兆語(AI 学習に使用される膨大なデータ量)の図書館をわずか3 時間で整理しました。

重複を見逃したのでしょうか?

速度は素晴らしいですが、正確性も重要です。もし司書が誤ってユニークな本を捨ててしまったら、学生は知識を失ってしまいます。

  • 論文によると、SEDD は非常に正確です。遅くても慎重な人間の方式と同じ重複を95% 以上の確率で見つけました。
  • SEDD によって整理された本を使用して AI 学生をテストしたところ、その学生は、遅い従来の方法で整理された本で訓練された学生と同等(あるいはそれ以上)のパフォーマンスを発揮しました。

まとめ

SEDDは、クリップボードを持った遅い人間から、決して止まらず、自らの道具を再利用し、決して疲れずに棚を整理する方法を正確に知っている、高速な組立ラインロボットへと、図書館の清掃チームをアップグレードするようなものです。これにより、巨大な AI モデルのためのデータ準備が、迅速で、安価で、効率的なものになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →