想像一下,如果你想測試新一代 AI「法學院學生」到底有多聰明。你不能只是讓它們背誦字母表;你需要看它們是否能真正通過真實的考試,並解決台灣使用的真實法律謎題。
這正是這篇論文的作者所做的事情。他們建立了一個巨大的測試場,稱為 TW-LegalBench。把它想像成一個巨大的、專門為 AI 模型設計的「專業健身房」,旨在測試它們理解台灣法律的能力(台灣法律是基於成文法典,即規則手冊,而非像美國或英國那樣基於過往判例)。
以下是他們的「健身房」以及研究發現的詳細解析,我們使用簡單的比喻來說明:
1. 三個「訓練站」
研究人員不只是給 AI 一種類型的測試。他們設置了三個不同的站點來衡量不同的技能:
站點 A:選擇題測驗(「知識問答之夜」)
- 內容: 包含來自五年內真實政府考試(如律師考試或公務員考試)的 16,000 多道題目。
- 挑戰: AI 必須從四個選項中選出單一正確答案。
- 轉折: 他們不只是問「法律是什麼?」,他們還為每道題目標註了它所屬的特定法律(例如規則手冊中的特定章節)。這讓他們可以觀察 AI 是擅長記憶特定規則,還是僅僅在瞎猜。
站點 B:申論題考試(「法學院期末考」)
- 內容: 117 道開放式問題,AI 必須撰寫完整的法律論證,而不僅僅是勾選字母。
- 挑戰: 在現實生活中,法官和律師不只是圈選「A」或「B」;他們必須解釋「為什麼」。
- 評分方式: 由於人類無法瞬間批改 117 篇論文,研究人員使用了一個「超級評分 AI」(另一個扮演法官角色的 AI)。這個超級評分員會根據嚴格的檢查清單(評分標準)來檢查論文,看 AI 是否達到了所有必要的法律要點,並對達成部分論點但遺漏細節的優秀論證給予部分分數。
站點 C:水晶球(「判決預測器」)
- 內容: 超過 14,000 件真實的刑事案件。
- 挑戰: AI 被給予犯罪事實(例如:「有人偷了一輛腳踏車」),並且必須預測兩件事:最終判決(有罪/無罪)以及確切刑期(例如:「3 個月監禁」或「500 元罰金」)。
- 目標: 觀察 AI 是否能觀察混亂的現實世界情況,並正確應用法律來預測結果。
2. 結果:誰通過了課程?
研究人員測試了 13 種不同的 AI 模型,範圍從龐大強大的模型到較小且專業的模型。結果如下:
- 「律師執照」通過: 頂尖的 AI 模型足以通過律師國家考試。如果這些 AI 是人類,它們將會獲得律師執照!它們的分數足以進入前 33% 的考生行列。
- 「法官」差距: 然而,當涉及到法官與檢察官考試(這難得多,需要更深層次的專業知識)時,沒有任何一個 AI 通過。它們未能達到人類前 1-2% 優秀考生的水平。這就像 AI 可以成為一名優秀的初級助理,但還沒準備好擔任法官。
- 「記憶」與「推理」的問題:
- 擅長猜測: AI 在預測犯罪類型或一般刑期方面表現得相當出色(例如:「這是竊盜,所以可能會有短暫的監禁」)。
- 不擅長引用條文: 當被要求引用精確的法律條文時(例如:「第 320 條第 1 項」),它們表現掙扎。它們經常編造虛假的法律或引用錯誤的條文。這就像一個知道答案是「42」但卻無法告訴你答案在教科書哪一頁的學生。
- 「在地專家」的優勢: 有趣的是,針對繁體中文和台灣數據進行過專門訓練的 AI 模型,在困難的申論題上,表現優於一些龐大的通用型模型。這就像當地的導遊比帶著通用地圖的遊客更了解城市中的隱藏小徑。
3. 「幻覺」陷阱
關於幻覺(編造事實)的一個重大發現是:
- 在「水晶球」站點中,AI 非常自信,但在引用特定法律時卻經常出錯。
- 有些模型會編造不存在的法律(第一類錯誤/Type I error),而有些模型則會引用與案例無關的真實法律(第二類錯誤/Type II error)。
- 論文指出,某些較小的模型似乎透過「作弊」來獲取高分,即記住了訓練數據中的精確答案,而不是透過實際推理來解決問題。這就像一個背下了去年考試答案表的學生,卻並不理解數學原理。
4. 總結
論文結論指出,雖然 AI 在法律任務方面正變得非常出色——出色到足以通過入門級律師考試——但它還沒準備好取代人類法官或檢察官。
- 優點: AI 可以很好地處理「知識問答」和一般性推理。
- 缺點: 它在量刑和引用精確法律所需的精準度方面仍有困難。
- 教訓: 要讓 AI 在法律領域真正有用,我們需要更多地針對特定的在地法律和語言進行訓練,而不僅僅是通用的知識。
簡而言之,TW-LegalBench 是一次現實檢驗。它顯示了雖然 AI 是一個才華橫溢的法學院學生,但它還不是一名合格的法官。它知道規則,但仍需學習如何以人類專家般的精準與謹慎來應用這些規則。
技術摘要:TW-LegalBench
問題陳述
儘管大型語言模型(LLMs)已在通用領域展現出顯著能力,但其在特定司法管轄區法律推理方面的表現仍缺乏深入研究。現有的法律基準測試存在三個系統性限制:
- 過度粗糙化: 許多基準測試將不同的法律學說歸類為廣泛的範疇(例如,將《行政訴訟法》與《公務員懲戒法》混為一談),這阻礙了對模型專業能力的精確診斷。
- 評估差距: 過度依賴封閉式的選擇題(MCQs)無法模擬現實世界中開放式的法律問題解決過程。
- 司法管轄區失衡: 大多數基準測試側重於普通法(英美法系)或簡化版的中文民法體系,導致在台灣等使用繁體中文的民法體系司法管轄區,缺乏高保真度的資源。
目前的台灣法律基準測試(如 TMLU、TMMLU+、LLAWA)在範圍上受到限制,通常過於抽象,或缺乏全面的任務多樣性(如選擇題 vs. 申論題 vs. 判決預測)。
研究方法
作者推出了 TW-LegalBench,這是一個植根於台灣民法傳統的多層次基準測試,利用來自考試委員會與司法院的官方開放數據。該數據集包含三種不同的任務類型:
1. 選擇題 (MCQs)
- 數據: 來自 18 個專業領域(公務員、司法、警察、專業領域)官方考試(2020–2024)的 16,493 道題目。
- 標註: 每道題目都經過人工標註其特定的法律來源,識別出橫跨 6 個法律類別的 43 種不同法律類型。
- 處理: 篩選題目僅保留單一答案項目。同時,為了研究語言效應,這些題目也被翻譯成簡體中文與英文,並採用司法院官方術語。
2. 開放式申論題 (OEQs)
- 數據: 來自二等司法官與律師考試(2020–2024)的 117 道申論題。
- 評估框架: 作者提出了一個**分解式 LLM-as-Judge(以 LLM 作為裁判)**框架。該裁判模型並非生成單一的數值分數,而是針對每個評分標準點,根據四種狀態標籤進行個別評估:正確 (Correct)、部分正確 (Partial)、錯誤 (Wrong) 與 遺漏 (Miss)。
- 偏差緩解: 使用了兩個裁判模型(GPT-5 與 Claude-Sonnet-4.5),並透過平均分數來減輕自我偏好(self-favoritism)造成的影響。
3. 法律判決預測 (LJP)
- 數據: 14,325 件第一審刑事判決書(2013–2024)。
- 篩選: 判決書經過結構清晰度(主文、事實、理由)與字數長度的篩選。測試集包含 107 個犯罪類別中的 535 個樣本(每類犯罪 5 個),以確保評估的平衡性。
- 指標:
- 判決/刑期: 使用 ROUGE 分數、Token 層級的 F1 值,以及特定類別的準確度(例如:針對監禁刑期的歸一化對數距離,以及針對拘留/罰金的絕對閾值)。
- 法條引用: 準確度、第一類錯誤(幻覺法條)、第二類錯誤(引用不適用的真實法條)以及總錯誤率。
實驗設置
本研究使用零樣本鏈式思考(Zero-shot CoT)提示詞,評估了 13 個 LLM(4 個閉源模型,9 個開源模型)。模型選擇包括前沿模型(GPT-5, Claude-Sonnet-4.5)、大型推理優化開源模型(Qwen3-235b, Llama-3.1-405b),以及專門針對繁體中文/台灣數據進行預訓練或微調的模型(Llama-Taiwan, Breeze)。
關鍵結果
1. 選擇題表現
- 頂尖表現: 閉源模型(Claude-Sonnet-4.5: 81.0%)與 Qwen3-235b(69.1%)達到了最高的準確度。
- 領域差異: 模型在憲法學及無特定法律標籤的問題上表現最好,但在行政法方面表現掙扎,主因是行政法內容龐雜且修訂頻繁。
- 極端難度: 有 290 道題目(1.76%)讓所有 13 個模型都無法回答,這些題目通常涉及晦澀的法規(如:國立故宮博物院組織法)或複雜的計算(如:遺產繼承中的遺產預留分配)。
2. 申論題表現 (人類 vs. AI)
- 通過門檻: 頂尖模型(Qwen3-235b, GPT-5, GPT-5.2)超過了律師考試的通過門檻(約前 33 百分位,通過率約 11%)。
- 司法差距: 沒有任何模型達到司法官/檢察官考試的通過門檻(約前 5–10%,通過率約 1–2%)。前 3% 的人類考生表現優於最強大的模型超過 100 分。
- 語言影響: 經過繁體中文或台灣特定語料訓練的模型(如 Breeze-7b-instruct, Llama-Taiwan-70b),在處理部分推理時,表現往往優於較大型的通用模型。
3. 法律判決預測 (LJP) 表現
- 量刑: 模型在預測判決類型與刑期方面展現出合理的準確度(例如:Claude-Sonnet-4.5 達到了 0.907 的歸一化對數距離)。
- 法條引用: 表現欠佳。表現最好的模型(Llama-Taiwan-8b)在引用正確法條方面的準確度僅為 9.9%。
- 錯誤類型: 閉源模型表現出較高的第一類錯誤(幻覺出不存在的法條),而部分開源模型則表現出較高的第二類錯誤(引用了真實但並不適用的法條)。
- 記憶 vs. 推理: 針對台灣特定模型在 LJP 上強大的表現,假設是源於其訓練數據中對法院判決書的記憶,而非真正的法律推理,這可以從其在 OEQ 上的表現弱於 LJP 的得分中得到證實。
重要性與主張
本文主張 TW-LegalBench 填補了使用繁體中文評估民法體系 LLM 的關鍵空白。其重要性在於:
- 細粒度診斷: 為選擇題提供法條層級的標註,實現了對 43 種法律類型的高解析度專業能力分析,超越了以往基準測試的粗略分類。
- 嚴謹的評估協議: 針對申論題提出的分解式 LLM-as-Judge 框架,提供了比直接評分更穩定且細緻的法律論證評估。
- 現實對齊: LJP 數據集通過實際司法結果評估模型,揭示了雖然 LLM 在資格考試(律師)上能接近人類水平,但目前仍缺乏擔任高風險司法職位(法官/檢察官)所需的可靠性。
- 司法管轄區特異性: 結果強調,經過特定司法管轄區語料(台灣繁體中文)訓練的模型,在開放式問題與判決預測任務上一致優於較大型的通用模型,凸顯了本土化訓練數據對於法律 AI 的必要性。
作者總結指出,雖然 LLM 正趨近於人類在法律資格考試上的表現,但可靠的法律文本生成與精確的法條引用仍是重大挑戰,特別是在高風險的司法應用場景中。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。