← 最新の論文
💬 NLP

JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes

本論文は、堅牢なLLM抽出パイプラインを用いて仮名化された多言語の履歴書から導出された35万5,000件以上のキャリア軌跡からなる公開データセットであるJobHop v2を紹介し、労働力計画および労働市場研究を前進させるための豊かなアノテーションと向上した信頼性を提供する。

原著者: Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

仕事の世界を、あらゆる履歴書が一冊の本である、巨大で散らかった図書館だと想像してみてください。長年、人々がどのように一つの仕事から別の仕事へと移動していくのかを理解しようとしていた研究者たちは、行き詰まっていました。なぜなら、これらの「本」は異なる言語で書かれていたり、奇妙なフォーマットであったり、コンピュータには読み取れない落書きでいっぱいだったりしたからです。それはまるで、破れた手書きのメモだけを使って都市の地図を作ろうとしているようなものでした。

以前利用可能だった地図は、規模が非常に小さいもの(数千件のメモ程度)、架空のデータで作られたもの、あるいは誰も開けることのできないプライベートな保管庫に閉じ込められたものだけでした。「JobHop v1」と呼ばれる初期の試みもありましたが、それは少し不具合がありました。コンピュータが乱雑なメモに混乱し、使用できない壊れたファイルを出力してしまうことがあったのです。

そこで登場したのが、巨大な人工知能(AI)の脳を持つ、新しく非常にスマートな司書、JobHop v2です。研究者たちはこのAIに、フランドル公共雇用局(VDAB)から提供された、匿名化された約44万件の実在する履歴書の束を与えました。これらの履歴書は、オランダ語、フランス語、英語が混ざり合った混沌としたものであり、プライバシーを守るために名前や場所は<MASK>トークンの後ろに隠されていました。

魔法のトリック:推論ロボット
この新しいAIは、単に推測するのではなく、「推論制御」されたアプローチを使用します。これは、単に手がかりを読むだけでなく、「待てよ、この日付は妥当か? これは仕事なのか、それとも学校の授業か?」と立ち止まって考える探偵のようなものです。もしAIが行き詰まったり、乱れたファイル(開けないJSONなど)を生成したりした場合、特別な「リトライ」ボタンがあります。AIは、より集中してやり直します。

その結果、最初のクリーニングを通過した約40万件の履歴書のうち、AIは100%を整然としたデジタルファイルへと変換することに成功しました。これは完璧なスコアです! AIは、355,315件のユニークなキャリアストーリーを抽出し、1,993,291件の職務経験と923,981件の教育歴を詳細に記録しました。

箱の中身は何?
JobHop v2は、キャリアデータの宝箱のようなものです。単に職種をリストアップするだけでなく、ESCOと呼ばれる標準的なグローバル辞書を使用して整理します。また、誰かが仕事をいつ開始し終了したのか(「2020年第1四半期」のように四半期単位で)を正確に伝え、教育レベル(初等教育から博士課程まで)や、使用した特定のツール(PythonやSparkなど)までも特定します。

本当にうまく機能したのか?
研究者たちは単に「良い」と言っただけではありません。彼らはテストを行いました。AIの成果物を、人間および他のAIによって生成された3つの異なる「ゴールドスタンダード(黄金基準)」の回答と比較したのです。

  • スコア: 彼らのAIの最高バージョン(巨大な1,200億パラメータのモデルを使用)は、人間や他のAIが一致する「天井」に極めて近いスコートを獲得しました。完璧な一致の限界からわずか1.1〜2.7パーセントポイントの差しかありませんでした。
  • 対決: 旧バージョンのJobHop v1とのブラインド・テスト(判定者がどちらがどちらか知らない状態でのテスト)において、新しいJobHop v2は**68.3%の確率で勝利し、旧バージョンは29.9%**しか勝利できませんでした。判定者は、v2が履歴書の乱雑で隠された部分を扱う能力や、異なる言語における日付の理解において、はるかに優れていると指摘しました。

これではないもの
このデータセットが「何ではないか」を知っておくことも重要です。研究者たちは、抽出が行われる前にAIによって合成された、架空の作り物の履歴書や、事前に標準化されたコードを使用することを明確に排除しました。彼らは、実在する人々による、リアルで生のテキストを求めていたのです。また、推測しすぎないよう細心の注意を払いました。職務エントリの約**6.9%**は、AIが間違った推測をするよりも「分からない」と認める方が安全だと判断したため、「不明」としてラベル付けされました。彼らはすべてに無理やりラベルを付けようとはしませんでした。

結論
JobHop v2は、数百万の履歴書という混沌とした非構造化の塊を、キャリアが実際にどのように進化するかを理解するための、クリーンで大規模なデータセットへと変えることができることを示唆しています。これは未来を完璧に予言する魔法の水晶玉ではありませんが、実在する非構造化テキストから構築された、最も正確で大規模なキャリアパスの地図を提供します。研究者たちは、この地図とそれを構築するために使用したツールを公開しており、他の人々がゼロから始めることなく、労働市場やジョブレコメンデーションの研究に活用できることを期待しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →