訊息平台

AI 評測標準恐不準確 史丹佛大學指現行方法存隱憂

圖/本報資料庫

商傳媒|林昭衡/綜合外電報導

根據史丹佛大學(Stanford)研究人員近期的一項研究,目前用來評估人工智慧(AI)模型表現的評測標準(benchmarks)可能存在根本性缺陷,導致其結果並不完全準確。這些評測標準在決定 AI 模型的市場價值、政策制定及政府採購上扮演關鍵角色,然而其可靠性正受到質疑。

史丹佛大學助理教授 Oluwasanmi Koyejo 指出,這些評測標準不一定能如宣稱般測量出特定屬性,且設計目的相同的評測標準之間,結果卻常相互矛盾。這項研究借鑒了測量科學(measurement science)和心理計量學(psychometrics,即研究人類能力測量的百年科學),來審視現有 AI 評測方法的有效性。

研究發現,某些評測標準在評估 AI 偏見時,反而更接近於測量 AI 的閱讀理解能力。例如,一個名為 BBQ 的偏見評測標準,會使用帶有刻意不完整資訊的選擇題。一個真正存在偏見但善於識別陷阱題的模型,可能因為選擇「不知道」而獲得無偏見的結果;反之,一個沒有偏見卻未能識破陷阱的模型,反而會被判定為有偏見。這顯示該評測標準所測量的,與其名稱所聲稱的目標有所出入。

研究進一步指出,目前主流的 AI 安全評測標準幾乎都以英文撰寫。當這些標準被翻譯成其他語言時,可能導致模型內建的護欄機制(guardrails,指限制 AI 行為以確保安全性的預防措施)失效,使得翻譯後的測試工具變得不可靠。透過應用測量模型,研究人員能更細緻地分析安全性能,將其拆解成多種構成要素,如與語言無關的安全性穩健程度、提示語(prompt)的難度等,從而更全面地理解問題。

史丹佛大學研究生 Sang Truong 強調,AI 模型的性能排名直接影響其市場價值,並驅動開發者與投資者的財務決策。由於這些評測標準對於資料導向的科學決策至關重要,因此確保其準確性或至少清楚其限制,便顯得格外重要。相關研究成果將於今年十月在舊金山(San Francisco)舉行的第三屆語言模型年會上發表。