Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding
本論文は、時間的に進化する文書理解における大規模言語モデルを評価するための、新たな専門家検証済みベンチマークであるTIDEを紹介し、現在のモデルがバージョンの解決に著しく苦戦していること、そして、権威ある時点固有のテキストよりも、自信に満ちたパラメトリックな知識を優先してしまう傾向があることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ゲームの正しいルールを見つけようとしている場面を想像してみてください。ただし、そのルールブックは毎日変化する生き物のようなものです。人工知能の世界では、知識が扱われる方法には主に2つのやり方があります。1つ目は巨大な百科事典のようなものです。もし事実が変われば、古い事実は単に消去され、新しいものに置き換えられます。もし国の名前が変わった場合の首都について尋ねれば、百科事典はただ新しい名前を表示します。もう1つの方法は、もっとトリッキーで、積み上げられた法的契約書や、パッチが適用されるビデオゲームのようなものです。ここでは、古いルールは消滅するのではなく、それが有効であった期間においては完全に正解であり続けます。そして、後に新しいルールが引き継ぎます。「2015年の制限速度は何キロでしたか?」と尋ねる場合、あなたは2025年のルールではなく、2015年のルールを知る必要があります。もしコンピュータがこれを間違えた場合、それは単なるおかしなミスでは済みません。それは、誰かに間違った税金を支払うよう指示したり、何年も前に廃止された医療ガイドラインに従うよう指示したりすることと同じになってしまうのです。これは「バージョン解決(version resolution)」、つまり特定の日にどのバージョンのルールが支配的であったかを正確に特定するという課題です。
ある研究チームは、今日の最も賢いAIコンピュータが、このトリッキーなタイムトラベル的な論理を扱えるかどうかを検証するために、「TIDE(Temporal Information Drift in Evolving Documents:進化する文書における時間的情報のドリフト)」という新しいテストを構築しました。彼らは単に架空の質問を作ったのではありません。彼らは、関税法、税法、規制など、1969年から2025年までのバングラデシュ政府による644の実際の公式文書を掘り下げました。これらの文書は、英語とベンガル語が混在しており、あるルールが別のルールをキャンセルし、それがさらに第3のルールによってキャンセルされるという、修正の連鎖を含んでいます。研究者たちは、これらの文書に基づいて3,050の質問を作成し、AIに対して「タイムトラベルする弁護士」のように振る舞うよう求めました。彼らは、利用可能な最も強力な9つのAIモデルをテストし、答えを見つけるための3つの異なる方法を与えました。すなわち、トレーニング中に記憶した内容のみに頼る方法(クローズド・ブック形式の試験のようなもの)、提供された正確な文書をそのまま読む方法、そしてデータベースを検索して正しいページを見つける方法です。
結果は、一種の警鐘となりました。たとえ最高のAIモデルであっても、完璧な文書を与えられた状態で、正解率はわずか約68.5%でした。これは、答えが目の前にあるにもかかわらず、彼らが依然として3回に1回以上の割合で失敗していることを意味します。研究によれば、これらのモデルは、どこを探すべきかを正確に知っていれば、正しいテキストを見つけることには非常に長けていますが、読んでいるテキストが実は質問された日付に対して「間違ったバージョン」であることに気づく能力は極めて低いことが分かりました。例えば、ある文書に「税率は10%である」と書かれていても、質問が「税率が5%だった時期」について問うている場合、AIはしばなしぶしぶと文書を無視して、自身の記憶や誤ったテキストに固執してしまいます。実際、研究者が自信満々だが間違った記述を用いてAIを欺こうとした際、モデルは問題があることを察知すること(エラーの検出)には非常に優れていましたが(検出率は約79%)、具体的に何が間違っているのかを特定すること(エラーの特定)については非常に不得手でした(特定率はわずか約19%)。これは、彼らが問題を察知はするものの、自信を持って間違った詳細を原因だと決めつけてしまうことを意味します。
この論文は、AIに単により多くのテキストを読ませたり、より優れた検索ツールを与えたりするだけでは、この問題を解決するには不十分であることを示唆しています。モデルは、出来事を順序立てたり、「3年後にはルールはどうなっていたか」を計算したりといった、タイムラインを組み立てる必要があるタスクに最も苦戦します。彼らは、ルールは厳格化するか、あるいは一方向に変化するものだと仮定しがちであり、法律が撤廃されたり、古いバージョンに戻ったりするという事実を見落としがちです。研究者は、正しい文書を持つことが助けになることは示しましたが、それが成功を保証するわけではないことも示しました。この研究は、「バージョン解決」が依然としてAIにおける主要かつ未解決のハードルであることを結論づけています。これらのモデルが法的文書における時間の流れを真に理解できるようにならない限り、税務申告や通関業務のように、日付を間違えることが深刻な金銭的・法的トラブルにつながる実世界のタスクにおいて、彼らを信頼するのはリスクが高いままなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。