Most of the LLM routing gap is task type
本文认为,感知到的 LLM 路由性能差距主要源于任务类型而非模型选择的复杂性,并证明了一种基于任务类型和语言的简单静态路由策略,其表现优于学习型路由器和最佳单体模型,同时显著降低了成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速演進的人工智慧世界中,大型語言模型扮演著強大的數位大腦角色,能夠回答問題、編寫程式碼並解決謎題。然而,沒有任何單一模型是全能的;有些模型擅長數學,而有些則在創意寫作方面表現掙扎;一個在英語中表現卓越的模型,在被要求說印地語時可能會顯得笨拙。為了獲得最佳結果,工程師開發了「路由」(routers),這是一種智能系統,旨在觀察使用者的問題並立即決定在模型池中哪一個特定的模型最適合回答該問題。其目標很簡單:將問題路由到正確的專家,以節省成本並獲得比任何單一模型單獨提供更好的答案。但為了讓這些路由系統發揮作用,它們必須能夠以完美的連貫性,區分出哪些問題對於一個模型來說容易,而對於另一個模型來說則較難。
Janghoon Lee 的一項近期研究挑戰了這些路由系統如我們所希望的那樣精密的假設。研究人員旨在理解為什麼目前的路由系統通常無法擊敗僅僅總是使用最強可用模型的簡單策略。他們建立了一個巨大的測試矩陣,涉及 14 個不同的 AI 模型、7 種不同類型的任務(從編碼到法律文件提取)以及 3 種語言(英語、韓語和印地語)。他們要求每個模型回答測試集中所有 294 個問題中的每一個,然後在完全相同的條件下將整個實驗運行了兩次,以觀察結果是否穩定。他們的發現是,最佳可能結果與目前路由所達到的結果之間的差距,並非由缺乏複雜算法造成的,而是因為如果僅僅觀察任務類型和涉及的語言,大多數「遺漏」的問題實際上是非常容易預測的。
研究首先對 4,116 個「模型-問題」組合進行了兩次相同的運行。即使電腦設置被鎖定為完全確定性的狀態,結果也並不相同。在大約 5.37% 的案例中,第一次答對的模型在第二次卻答錯了,或者反之亦然。這種波動被研究人員稱為「可重複性底限」(reproducibility floor),這意味著任何路由聲稱取得的改進,都必須大於這種自然噪聲,才能被視為真實的改進。當研究人員應用一條嚴格的規則——即只有當模型在兩次運行中都答對時才計為正確——時,他們發現 294 個問題中只有 29 個問題可以透過路由來優化。這是一個非常小的數字,它代表了在這一特定數據集上,路由可能實現的真正「天花板」。
研究人員接著詢問這 29 個困難問題有什麼共同點。他們發現,這些問題中的絕大多數是由所執行的任務類型決定的。例如,如果一個問題是關於編碼的,那麼特定的模型幾乎總是最佳選擇,無論路由進行多麼複雜的計算。通過簡單地將一個特定的模型分配給處理所有編碼問題,並將另一個模型分配給處理所有數學問題,研究人員在沒有使用任何學習智能或複雜決策的情況下,就找回了那 29 個困難問題中的 21 個。將問題的語言加入到這個簡單規則中,又找回了另外兩個。這使得 294 個問題中僅剩 6 個問題仍未被優化,這個數字如此之小,以至於低於研究人員測得的自然噪聲閾值。換句話說,一個精密的路由可能找到的微小增益,小於僅僅運行兩次相同測試所產生的隨機變異。
此外,研究顯示,「最佳」單一模型的身份並非一個固定事實,而是完全取決於你如何衡量成功。根據你是根據單次運行來計算正確,還是要求在兩次運行中都正確,或者是否排除模型因記憶體不足而停止運行的問題,會導致不同的模型贏得「最佳」頭銜。在某些情況下,頂尖模型與亞軍之間的差距非常小——不到 294 個項目中的一個——以至於與系統的自然噪聲無法區分。這表明,在這個數據集上,「哪個模型最好?」這個問題並沒有一個單一、穩定的答案,這使得路由很難學習一個可靠的規則來挑選贏家。
研究人員並未構建複雜的學習型路由,而是採用了一個靜態查找表(static lookup table)。這是一個簡單的預製列表,內容如下:「如果問題是關於韓語編碼,則發送給模型 A;如果問題是關於英語數學,則發送給模型 B。」這個靜態表不需要訓練或學習,就能成功回答 262 個問題。更重要的是,它的成本大約為每次運行 3.33 美元,而作為默認選擇的「最佳單一模型」,回答同樣問題的成本為每次運行 7.69 美元。這個靜態表不僅更準確,而且明顯更便宜,在兩方面都擊敗了最佳單一模型。
研究結論指出,路由的承諾不在於構建日益複雜的系統來尋找隱藏模式,而在於認識到最有價值的模式往往是浮現在表面的。最佳可能結果與現狀之間的距離,主要由可以立即識別的任務類型和語言組成。一旦通過簡單的靜態規則處理了這些因素,剩餘的改進空間就小到會在系統本身的噪聲中消失。研究人員認為,在投資複雜的路由算法之前,我們應該先問:答案中有多少已經在請求中顯而易見了。在這種情況下,答案是大部分的增益已經存在,等待著被一個簡單的表格而非複雜的機器所捕捉。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。