SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay
SeqLLMは、コンパクトな離散語彙、2段階のアライメント・プロジェクター、およびプレフィックス誘導型の能力注入を通じて、大規模言語モデルに振る舞いシーケンス・モデリングを強化させる、WeChat Payに導入された新しいフレームワークであり、元の言語能力を維持しつつ、マーチャントのリスク管理およびレコメンデーションのベンチマークにおいて最先端の結果を達成しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ある謎を解こうとしているところだと想像してください。あなたには、言葉で書かれた手がかり(日記の記述やニュース記事など)を読み解くことに非常に長けた探偵がいます。この探偵は、人間がこれまでに書いたほぼすべての文章で学習されたコンピュータの脳、大規模言語モデル(LLM)です。この探偵は、皮肉を理解し、物語を要約し、複雑な概念を誰よりもうまく説明することができます。しかし、この探偵には弱点があります。それは、「行動の長いリスト」を読み取ることができないという点です。例えば、コーヒーを買ったり、公園を訪れたり、画面をタップしたりした際のタイムラインのようなリストです。このリストは「行動シーケンス(behavioral sequence)」と呼ばれます。
現実の世界、特にオンライン決済の分野では、真実はこれら両方の混ざり合いの中に隠れていることがよくあります。あるショップの記述(テキスト)は完璧に正常に見えるかもしれませんが、その取引履歴(行動)を見ると、午前3時に異なる州で運営され、高齢者をターゲットにしていることが判明するかもしれません。記述だけを読んでいれば、危険を見逃してしまいます。一方で、取引リストだけを見ていれば、文脈を見失ってしまいます。科学者が直面している課題は、この「言葉に強い探偵」に、言葉を話したり思考したりする能力を失わせることなく、いかにして「行動に強いタイムライン」を理解させるかということです。もし、この探偵に百万ものタイムラインを暗記させようとすれば、混乱してしまい、単純な文章を書くことさえ忘れてしまうかもしれません。この論文は、まさにその問題に取り組んでいます。つまり、言語の専門家に、思考能力を損なうことなく、時間のパターンを見抜くというスーパーパワーを授ける方法についてです。
論文のストーリー:探偵にタイムラインを読ませる方法
WeChat Payの研究者といくつかの大学は、SeqLLMと呼ばれる巧妙な新しいフレームワークを考案しました。これは、私たちの「言葉に強い探偵」のための特別な訓練キャンプのようなものです。彼らの目標は、探偵がマーチャント(加盟店)のプロフィール(テキスト)と、その長い取引履歴(行動)を同時に見て、不正を見つけ出すことです。
従来の方法の問題点
以前は、言語モデルに行動のリストを理解させたい場合、そのリストを一つの物語として書き出そうとすることがありました。「まず、ユーザーはシャツを買った。次に、靴を買った……」といった具合です。しかし、これは、あらゆる単語が数字で構成された小説を読もうとするようなもので、あまりにも長くなりすぎて、探偵は圧倒されてしまいます。
別の方法として、行動のためだけに数値による新しい言語を教えるという手もありました。しかし、これには恐ろしい副作用がありました。探偵がこの新しい言語を学ぶにつれて、古い言語を忘れ始めてしまうのです。それは、学生が新しい科目を猛烈に勉強するあまり、母国語を話すことを忘れてしまうようなものでした。これは「破滅的忘却(catastrophic forgetting)」と呼ばれます。論文によれば、標準的な手法を用いてこのようにモデルを教えようとすると、一般的な言語理解能力が0.78という高いスコアから、0.27というひどいレベルまで急落してしまうことが示されています。
SeqLLMの解決策:3つの魔法のトリック
著者たちは、単に大量のデータを投入したのではなく、3つの特定のパーツを持つよりスマートなシステムを構築しました。
- コンパクトな語彙(略記法): 「私は午後2時に200ドルの商品を買った」と書き出す代わりに、彼らは特別な略記コードを作成しました。彼らはあらゆる行動を、
<Time:2PM>、<Amount:200>、<Channel:QR>といった、小さく具体的なトークンへと分解しました。これは、探偵に砂の山を与えるのではなく、レゴブロックのセットを与えるようなものです。これははるかに小さく、整理されており、探偵がすでに知っている言葉と混ざり合うこともありません。 - 翻訳機(架け橋): これらの新しいレゴブロック(トークン)は、最初は探偵にとって無意味なものです。そこで、彼らは「プロジェクター」と呼ばれる、各ブロックの意味を教える翻訳機のようなものを構築しました。彼らは単にブロックをモデルに投げつけたのではなく、2段階のレッスンを用いました。まず、モデルがブロックを通常の英語(例:
<Time:2PM>を「2 PM」にする)に翻訳できるように教えました。モデルが意味を理解した後、彼らは第2段階である「推論」へと進みました。モデルに対し、一連のブロックを見て、「この人は深夜にしか買い物をしない」といったパターンを説明するように求めたのです。 - 秘密のプレフィックス(訓練用マスク): これが最も重要なトリックです。通常、モデルに新しいスキルを教える際は、そのスキルを絶えず練習させますが、そうすると他のことを忘れてしまいます。SeqLLMは「プレフィックス誘導型(prefix-guided)」の手法を使用しています。イメージとしては、探偵が各タスクの前に、「今からタイムライン分析官として振る舞ってください」といった特定の指示カードを与えられるようなものです。モデルは、その特定のカードが存在する場合にのみ、タイムラインのスキルを学習します。カードがなくなれば、モデルはただの賢い自分自身に戻ります。これにより、「タイムライン学習」が広がりすぎて、探偵の一般的な知識を台無しにすることを防いでいます。
彼らが発見したこと
結果は目覚ましいものでした。この新しい手法をテストした際:
- 記憶の喪失なし: モデルは、従来の忘却しやすい手法と同じくらい上手く次の行動を予測できましたが(スコア0.806対0.804)、言語能力を維持できました(0.27に急落する代わりに0.789を記録)。
- WeChat Payでの実社会での成功: 彼らはこのシステムを、毎日数百万のマーチャントをチェックするために導入しました。以前の最高システムと比較して、新しいSeqLLMは**97.5%の精度(precision)**でリスクのあるマーチャントを検知しました(92.0%から上昇)。さらに優れたことに、無実のマーチャントからの抗議(不服申し立て)の数は12%から約2%に減少し、かつ、罪のないマーチャントを誤ってクリアしてしまうこともありませんでした。
- より優れた不正検知: 新しいシステムの「理解力」を別の不正検知器に活用したところ、トップレベルの不正検知が26.8パーセントポイント向上しました。これは、数十億件の取引を処理するシステムにとって、極めて大きな飛躍です。
- 汎用的な天才: 彼らは映画や本のレコメンデーションについてもテストを行いました。競合他社よりも最大32%高い精度で次のアイテムを見つけ出し、かつ、競合よりも4.8倍少ない計算資源で動作しました。
彼らが否定したもの
論文では、行動を長い物語として書き出す(シリアライゼーション)ことはうまくいかないことを明確に示しました。それは実際にはシステムを悪化させ、精度を83%に低下させました。また、単に言語データを追加して後から忘却問題を「修正」することはできないことも証明しました。一度モデルが忘れてしまうと、それを取り戻すのは困難です。唯一うまくいった方法は、彼らのプレフィックス誘導型の手法を用いて、最初から忘却を防ぐことでした。
要するに、SeqLLMは、言葉を話す能力を失うことなく、時間のパターンを見抜くための新しい「目」を言語の専門家に与える方法です。これは、デジタル世界でトラブルを見つけ出すための、よりスマートで、速く、正確な方法であり、一つのスキルを得るために別のスキルを犠牲にする必要はないということを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。