← 最新论文
💻 computer science

TW-LegalBench: Measuring Taiwanese Legal Understanding

本文介紹了 TW-LegalBench,這是一個利用台灣官方法律語料庫來評估大型語言模型在選擇題、論文寫作及判決預測等多方面能力的全面性基準測試,研究結果顯示,雖然頂尖模型已接近律師的資格水準,但仍顯著落後於法官與檢察官,且在精確的法律引用方面仍面臨困難。

原作者: Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick Chung-Chia Huang

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick Chung-Chia Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想像一下,如果你想測試新一代 AI「法學院學生」到底有多聰明。你不能只是讓它們背誦字母表;你需要看它們是否能真正通過真實的考試,並解決台灣使用的真實法律謎題。

這正是這篇論文的作者所做的事情。他們建立了一個巨大的測試場,稱為 TW-LegalBench。把它想像成一個巨大的、專門為 AI 模型設計的「專業健身房」,旨在測試它們理解台灣法律的能力(台灣法律是基於成文法典,即規則手冊,而非像美國或英國那樣基於過往判例)。

以下是他們的「健身房」以及研究發現的詳細解析,我們使用簡單的比喻來說明:

1. 三個「訓練站」

研究人員不只是給 AI 一種類型的測試。他們設置了三個不同的站點來衡量不同的技能:

  • 站點 A:選擇題測驗(「知識問答之夜」)

    • 內容: 包含來自五年內真實政府考試(如律師考試或公務員考試)的 16,000 多道題目。
    • 挑戰: AI 必須從四個選項中選出單一正確答案。
    • 轉折: 他們不只是問「法律是什麼?」,他們還為每道題目標註了它所屬的特定法律(例如規則手冊中的特定章節)。這讓他們可以觀察 AI 是擅長記憶特定規則,還是僅僅在瞎猜。
  • 站點 B:申論題考試(「法學院期末考」)

    • 內容: 117 道開放式問題,AI 必須撰寫完整的法律論證,而不僅僅是勾選字母。
    • 挑戰: 在現實生活中,法官和律師不只是圈選「A」或「B」;他們必須解釋「為什麼」。
    • 評分方式: 由於人類無法瞬間批改 117 篇論文,研究人員使用了一個「超級評分 AI」(另一個扮演法官角色的 AI)。這個超級評分員會根據嚴格的檢查清單(評分標準)來檢查論文,看 AI 是否達到了所有必要的法律要點,並對達成部分論點但遺漏細節的優秀論證給予部分分數。
  • 站點 C:水晶球(「判決預測器」)

    • 內容: 超過 14,000 件真實的刑事案件。
    • 挑戰: AI 被給予犯罪事實(例如:「有人偷了一輛腳踏車」),並且必須預測兩件事:最終判決(有罪/無罪)以及確切刑期(例如:「3 個月監禁」或「500 元罰金」)。
    • 目標: 觀察 AI 是否能觀察混亂的現實世界情況,並正確應用法律來預測結果。

2. 結果:誰通過了課程?

研究人員測試了 13 種不同的 AI 模型,範圍從龐大強大的模型到較小且專業的模型。結果如下:

  • 「律師執照」通過: 頂尖的 AI 模型足以通過律師國家考試。如果這些 AI 是人類,它們將會獲得律師執照!它們的分數足以進入前 33% 的考生行列。
  • 「法官」差距: 然而,當涉及到法官與檢察官考試(這難得多,需要更深層次的專業知識)時,沒有任何一個 AI 通過。它們未能達到人類前 1-2% 優秀考生的水平。這就像 AI 可以成為一名優秀的初級助理,但還沒準備好擔任法官。
  • 「記憶」與「推理」的問題:
    • 擅長猜測: AI 在預測犯罪類型或一般刑期方面表現得相當出色(例如:「這是竊盜,所以可能會有短暫的監禁」)。
    • 不擅長引用條文: 當被要求引用精確的法律條文時(例如:「第 320 條第 1 項」),它們表現掙扎。它們經常編造虛假的法律或引用錯誤的條文。這就像一個知道答案是「42」但卻無法告訴你答案在教科書哪一頁的學生。
  • 「在地專家」的優勢: 有趣的是,針對繁體中文台灣數據進行過專門訓練的 AI 模型,在困難的申論題上,表現優於一些龐大的通用型模型。這就像當地的導遊比帶著通用地圖的遊客更了解城市中的隱藏小徑。

3. 「幻覺」陷阱

關於幻覺(編造事實)的一個重大發現是:

  • 在「水晶球」站點中,AI 非常自信,但在引用特定法律時卻經常出錯。
  • 有些模型會編造不存在的法律(第一類錯誤/Type I error),而有些模型則會引用與案例無關的真實法律(第二類錯誤/Type II error)。
  • 論文指出,某些較小的模型似乎透過「作弊」來獲取高分,即記住了訓練數據中的精確答案,而不是透過實際推理來解決問題。這就像一個背下了去年考試答案表的學生,卻並不理解數學原理。

4. 總結

論文結論指出,雖然 AI 在法律任務方面正變得非常出色——出色到足以通過入門級律師考試——但它還沒準備好取代人類法官或檢察官。

  • 優點: AI 可以很好地處理「知識問答」和一般性推理。
  • 缺點: 它在量刑和引用精確法律所需的精準度方面仍有困難。
  • 教訓: 要讓 AI 在法律領域真正有用,我們需要更多地針對特定的在地法律和語言進行訓練,而不僅僅是通用的知識。

簡而言之,TW-LegalBench 是一次現實檢驗。它顯示了雖然 AI 是一個才華橫溢的法學院學生,但它還不是一名合格的法官。它知道規則,但仍需學習如何以人類專家般的精準與謹慎來應用這些規則。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →