A System for Name and Address Parsing with Large Language Models
本論文は、入力の正規化、制約付きデコーディング、および厳格なルールベースのバリデーションを統合することにより、ファインチューニングを行うことなく大規模言語モデルを活用して、非構造化された氏名および住所テキストを一貫した17フィールドのスキーマへと確実に変換する、プロンプト駆動型かつバリデーション中心のフレームワークを提示するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、手書きの手紙が山積みになった、巨大でめちゃくちゃな山を持っています。英語で書かれたものもあれば、スペイン語のものもあり、インクが滲んでいるものもあれば、カンマが抜けていたり、「123 Main St Apt 4B」が「123MainStApt4B」と書かれていたりするタイポ(打ち間違い)があるものもあります。あなたの目標は、この混沌とした山を、あらゆる情報(名前、通り、市区町村、郵便番号)がそれぞれ特定の列に分類された、整然とした整理されたスプレッドシートに変えることです。
この文書は、この作業を行うための新しい方法を説明しています。それは、非常に賢いコンピューターの脳(大規模言語モデル、またはLLMと呼ばれます)を使用しますが、そこには「ひねり」があります。それは、コンピューターの脳にゼロから新しい言語を教え込む(これは新しい従業人を雇って数ヶ月間トレーニングするようなものです)代わりに、その周囲に厳格な「チェックリストと監督者」システムを構築するという方法です。
このシステムがどのように機能するかを、簡単なステップに分解して説明します。
1. 「下準備のシェフ」(入力の正規化)
スマートなコンピューターがデータを見る前に、「下準備のシェフ」がデータを綺麗にします。
- 問題点: 生のデータはめちゃくちゃです。ある人は「Ave.」と書き、別の人は「Avenue」と書いています。ある人は「N.E.」と書き、別の人は「NE」と書いています。
- 解決策: システムは自動的にすべてを標準化します。すべての略称を正式な単語に変換し、大文字・小文字を修正し、奇妙な記号を取り除きます。これは、レシピが毎回完璧に機能するように、料理を作る前にシェフがすべての野菜を全く同じ大きさに刻むようなものです。
2. 「厳格なレシピ」(プロンプトの組み立て)
コンピューターの脳に何をすべきか推測させるのではなく、著者たちは非常に具体的で変更不可能なレシピカードを与えます。
- 問題点: もし単にスマートなコンピューターに「これは住所です。その構成要素を教えてください」と頼むと、コンピューターは事実を捏造したり、毎回異なる形式で回答したりする可能性があります。
- 解決策: レシピカードにはこう書かれています。「あなたは専門のパーサー(解析器)です。必ず正確に17個のフィールドを、この正確な順序で出力しなければなりません。もし不明な点があれば、空欄のままにしてください。データを捏造しないでください。」これは、ロボットに「ここにネジを入れ、あそこにボルトを入れなさい。独断での変更は禁止」という厳格な組み立てマニュアルを与えるようなものです。
3. 「組立ライン」(制約付き推論)
コンピューターは、自動車を一度に16台ずつ組み立てる組立ラインのように、データを小さな固定グループ(バッチサイズ16)ごとに処理します。
- 目的: これにより、コンピューターが「独創的」になったり、疲れたりするのを防ぎます。設定をロックしておくことで、同じ作業を2回実行したとしても、常に全く同じ結果が得られるようにします。これは、速度や設定が決して変わることのない工場の機械のようなものです。
4. 「品質管理検査官」(バリデーション)
これが最も重要な部分です。コンピューターが作業を終えたら、厳格な「品質管理検査官」がすべての行をチェックします。
- ルール:
- 郵便番号は州と一致しているか?(例:カリフォルニア州の郵便番号がニューヨークにあることはできない)
- コンピューターが存在しない通り名を捏造していないか?
- 正確に17個のフィールドがあるか?
- 結果: もしコンピューターが間違いを犯した場合、検査官が即座にそれを検知します。コンピューターが確信を持てない場合は、システムが後で人間が確認できるようにフラグを立てます。これにより、最終的なスプレッドシートがほぼ完璧であることを保証します。
彼らは何を発見したのか?
著者たちは、米国の、プエルトリコの、あるいはその他の国の、乱れたデータを含む1,500件の異なる住所レコードを用いてこのシステムをテストしました。
- スコア: システムは**99.8%**の確率で正解を出しました。
- 比較: これは、従来のルールベースのシステム(これらは硬直した取扱説明書のようなものです)よりもわずかに優れた成績であり、新しいことを「再学習」させたり教え込んだりする必要もありませんでした。
- 信頼性: システムはまた、自分の答えに対してどの程度自信があるかも教えてくれました。自信が90%以上であると言ったときは、ほとんどの場合、正解していました。
大きな要点
著者たちは、乱れたデータを修正するために、高価でカスタムメイドのAIモデルを訓練する必要はないと主張しています。代わりに、強力な既製品のAIモデルを使用し、その周囲に厳格なルールベースのセーフティネットを構築すればよいのです。
これは、非常に創造的で優秀なライター(AI)を、税務書類の作成に雇うようなものだと考えてください。もしただ自由に書かせてしまうと、彼らは数字を捏造してしまうかもしれません。しかし、もし厳格な記入欄、チェックリスト、そして提出前にすべてのボックスをチェックする監督者が付いたフォームを与えれば、毎回完璧な税務書類を手に入れることができます。そして、そのライターに税金の仕組みを一から教え込む必要もありません。
このアプローチにより、新しい国や言語に合わせてAIを再学習させることなく、めちゃくちゃな現実世界のテキストを、クリーンで信頼できるデータへと迅速かつ安価に変換することが可能になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。