← Back to list

從 GPT 到 LLM-Pro:MMLU 如何衡量 AI 的真正智慧

MMLU(Massive Multitask Language Understanding)是衡量大型語言模型(LLMs)能力的關鍵基準。本文深入解析 MMLU 的起源、數據集架構、評估方法與衍生版本(MMLU-Pro、MMLU-CF),並探討它對 AI 研究與應用的深遠影響

SYSTEX Data Lab · 2025-09-15 07:59 · 0 claps · 13.2 min read
#artificial-intelligence #mmlu #large-language-models #zero-shot-learning #few-shot-learning
Open on Medium ↗
Wiki topics: LLM · Large Language Models PE · Prompt Engineering EVAL · Evaluation & Benchmarks AI · AI · General EDU · Education & Learning

從 GPT 到 LLM-Pro:MMLU 如何衡量 AI 的真正智慧

https://informationisbeautiful.net/visualizations/the-rise-of-generative-ai-large-language-models-llms-like-chatgpt/

https://informationisbeautiful.net/visualizations/the-rise-of-generative-ai-large-language-models-llms-like-chatgpt/

AI 領域正經歷著大型語言模型(LLMs)能力的爆炸性成長,這些模型在需要高度語言理解與生成的任務上表現愈加成熟。隨著模型愈來愈強大,如何建立嚴謹的評估方法就成為一項必要的問題。

因此 MMLU 基準測試(Massive Multitask Language Understanding)就這樣出現了。MMLU 是當前 AI 系統的一項全面且具挑戰性的測試,MMLU 分數也成為衡量模型進展的重要指標。

理解 MMLU 的意義及其角色,對於任何從事資料科學或 AI 相關工作的人來說都十分重要。因為它提供了一個標準化的方式,去評估模型在各種領域中展現出來的知識廣度與推理能力,而這些正是大型語言模型發展的核心能力。

什麼是 MMLU?

MMLU(Massive Multitask Language Understanding,大規模多任務語言理解) 是一項全面的基準測試,用來評估大型語言模型(LLMs)在不同領域中的知識掌握與解題能力。它由 57 個任務所組成,題型為選擇題,涵蓋的範圍非常廣泛,包括基礎數學、美國歷史、電腦科學、法律等多個學科。

MMLU 的核心理念是,在 零樣本(zero-shot)或少樣本(few-shot) 的設定下,測試模型的知識與推理能力。換句話說,模型必須在缺乏針對性範例的情況下回答問題。這樣的設計能夠檢驗模型如何將預訓練階段獲得的知識,靈活應用到未經專門微調的任務上,從而反映出一種更普遍且更健壯的智慧。模型的表現通常會以 MMLU 分數 來衡量,代表其在多領域任務上的整體正確率。

MMLU 評估框架對 AI 的研究與發展具有深遠意義,主要體現在以下幾個方面:

  • 全面知識評估:不同於早期僅聚焦於語言技能的基準,MMLU 涵蓋了廣泛的世界知識與專業領域,能更全面地呈現 LLM 的能力。
  • 推動模型進步:MMLU 設立了高標準,要求模型具備廣博知識。這推動了研究人員在模型架構、預訓練策略及微調方法上的創新,以提升 MMLU 分數來證明成果。
  • 標準化比較:MMLU 提供一個統一的衡量標準,便於比較不同 LLM 的表現。這讓 AI 社群能夠追蹤進展、辨識領先模型,並分析不同方法的優缺點。
  • 檢驗真正的理解:透過零樣本與少樣本的測試方式,可以區分出哪些模型真正學會了知識概念,而不是僅僅對訓練資料或特定測試格式「死記硬背」。
  • 找出弱點:MMLU 的 57 個任務能揭示模型在不同領域的強項與短處。例如,如果在需要複雜、多步驟推理的題目上表現 consistently 偏低,就能指出當前演算法在這方面的不足,並為後續研究提供方向。

MMLU 的歷史背景與發展

要理解 MMLU 的出現,必須先回顧語言模型評估方法的演變,以及驅動它誕生的動機。

MMLU 由 Dan Hendrycks 與研究團隊於 2020 年在論文 〈Measuring Massive Multitask Language Understanding〉 中提出。其主要動機源於一個觀察:隨著大型語言模型(LLMs)的快速進步,既有的評測基準逐漸出現「飽和」現象。

在像 GLUESuperGLUE 這些指標上,模型已經達到接近人類,甚至超越人類的表現。然而,這樣的成績並不一定能說明模型是否真正具備廣泛且類似人類的世界理解力。

MMLU 的創建者希望設計出一個更具挑戰性且全面的測試,能夠:

  • 評估知識深度
  • 涵蓋廣泛學科領域
  • 要求推理能力
  • 難以被「投機取巧」破解

目標是打造一個能更清楚區分強大語言模型能力的評估工具,並為邁向更通用、更智慧的系統提供明確方向。

語言模型基準的演進

MMLU 在自然語言理解(NLU)基準的演變歷程中,代表了一個重要的里程碑。

早期的 NLU 評估往往專注於單一任務,例如情感分析、命名實體識別或機器翻譯,每個任務各自有獨立的資料集與評分方式。

2018 年推出的 GLUE(General Language Understanding Evaluation),首次將 9 個多樣化的 NLU 任務集合在一起,並提供單一分數來衡量模型的整體表現。它一度成為標準,但很快就被新模型超越。

2019 年,研究人員開發了 SuperGLUE,作為 GLUE 的更具挑戰性的後繼者,包含更難的任務與更完整的人類基準。然而,即便是 SuperGLUE,也很快被模型逼近甚至達到人類水準。

相比之下,MMLU 在多個關鍵面向上進一步突破:

  • 更廣的範圍:MMLU 涵蓋 57 個任務,遠超 GLUE 的 9 個與 SuperGLUE 的 8 個(另加診斷資料集)。題目涉及更多學術與專業領域,讓模型難以僅靠專門化來取勝,必須展現更廣博的知識。
  • 專業領域知識:GLUE 與 SuperGLUE 偏重語言現象,而 MMLU 直接檢驗模型在法律、醫學、倫理等專業領域的知識,要求的不僅是語言處理,更是領域理解。
  • 零樣本與少樣本測試:MMLU 強調在極少任務範例下的表現,不像 GLUE/SuperGLUE 常依賴針對任務的微調,這使得 MMLU 更能測試模型從預訓練中進行泛化的能力。
  • 高難度問題設計:MMLU 的許多題目即便對人類也具挑戰性,特別是在專業領域,這為 AI 的進展留下更長的「測試跑道」。

透過這些改進,MMLU 建立了一個更嚴格且具代表性的標準,重新定義了「理解語言與世界」對 LLM 來說意味著什麼

MMLU 的架構框架

要真正理解 MMLU 基準測試,就必須先了解它的底層結構,以及它如何評估語言模型。我們可以從 MMLU 數據集的組成、涵蓋的學科範圍,以及其特定的評估方法來看,為什麼它能成為一項嚴謹的 AI 能力檢驗

數據集組成與學科範圍

MMLU 的核心優勢在於其精心設計的數據集,既具廣度又具深度。

這個數據集並非單一任務的集合,而是由 57 個不同的任務 組成,每個任務對應一個特定的學科領域。這些學科刻意設計得相當多元,主要涵蓋以下幾大類:

  • 人文領域(Humanities)
  • 社會科學(Social Sciences)
  • STEM(科學、技術、工程與數學)
  • 其他/專業領域(Professional Subjects)

在每個任務中,題型皆為 選擇題。通常每題包含一個問題或情境,並附上四個選項,其中僅有一個正確答案。這些題目涵蓋不同難度層次,從高中程度到大學,甚至延伸至專業領域的專家級別。

舉例來說,在「專業醫學(Professional Medicine)」類別中的題目,往往需要具備醫師等級的知識才能作答,對再強大的 LLM 來說依然是個嚴峻挑戰。

題目的龐大數量與高度多樣性,確保模型無法僅靠「死記答案」來應付,而必須展現對學科內容的真正理解,才能獲得高分。

題目來源

MMLU 的題目並非隨機生成,而是來自多種真實世界的資料來源,以確保其難度與實用性。主要來源包括:

  • 教科書
  • 標準化測驗
  • Quiz Bowl(學術競賽)題庫
  • 線上教育資源

這樣的設計使得題目能夠反映出人類在學術或專業情境中常見的知識挑戰與推理需求。

MMLU 的核心目標,是評估模型是否具備類似受過教育的人類一樣,能夠理解並應用知識於真實情境的能力。

評估方法:零樣本(Zero-shot)與少樣本(Few-shot)學習

MMLU 的核心意義與評估能力,很大程度上來自於它採用的 零樣本(zero-shot)少樣本(few-shot) 學習範式。這些方法對於測試模型在缺乏大量特定任務訓練的情況下,能否有效泛化知識,至關重要。

零樣本學習(Zero-shot)

在零樣本設定中,模型會直接面對某個特定 MMLU 任務(例如「抽象代數」或「道德情境」)的問題,但在微調階段或提示中,模型從未接觸過該任務的任何範例。

模型必須完全依靠其 預訓練知識,理解問題並選出正確答案。

舉例來說,提示可能如下:

以下是關於 [學科名稱] 的多選題(含答案):

[問題]

A) [選項 A]
B) [選項 B]
C) [選項 C]
D) [選項 D]

答案:

模型需要輸出正確選項的字母。這種設計嚴格測試了模型在 全新領域和題型 上的泛化能力。

少樣本學習(Few-shot)

在少樣本設定中,模型在正式測試問題之前,會先看到來自該 MMLU 任務的一小部分範例(通常為 5 個,故稱為「5-shot」)。

這些範例包含問題、選項,以及正確答案。

例如:

以下是關於道德爭議的多選題(含答案):

問題:John Doe 是一家開發自主武器的公司的軟體工程師。他對該技術可能被濫用導致平民傷亡感到深切倫理困擾。但他也需要養家,擔心若發聲會失去工作。John 面臨的主要倫理衝突是什麼?

A) 利益衝突
B) 告密者困境
C) 專業疏失
D) 智慧財產權

答案:B

[…除此之外會再提供 4 個範例…]

問題:[正式測試題目]

A) [選項 A]
B) [選項 B]
C) [選項 C]
D) [選項 D]

答案:

模型藉由這些範例理解任務的 上下文、題型風格與推理方式,再回答新的未知問題。這測試了模型的 快速情境學習與適應能力

方法學的重要性

這些評估方法的重要性在於,它們模擬了人類處理新問題的方式:

  • 零樣本:運用現有知識解決全新問題,例如用戶向 AI 詢問從未提示過的複雜法律問題或哲學問題。
  • 少樣本:從少量範例快速學習並應用,例如用戶提供幾個醫學報告摘要範例後,讓 AI 摘要新的報告,或提供特定詩歌風格範例後,讓 AI 生成相同風格的詩歌。

透過在 零樣本與少樣本 的雙重設定下評估,MMLU 能夠更全面地呈現模型的靈活性與學習能力,這對於打造真正有用且可適應不同任務的 AI 系統至關重要。

模型在這些情境下表現良好,意味著它有潛力在各種任務中實際應用,而無需針對每個新問題進行大量昂貴的重新訓練。

性能指標與模型演進

大型語言模型在 MMLU 基準測試上的演進,凸顯了 AI 發展的快速步伐。以下會說明早期模型的表現、後續 MMLU 分數的提升,以及 AI 能力與人類專家基準的比較。

早期模型表現

MMLU 於 2020 年底推出後,很快揭示了當時最先進 LLM 的局限性。對 MMLU 數據集的早期測試十分嚴苛。大多數當代模型的初始 MMLU 分數僅約 25–30%,而最大規模的 GPT-3 則達到約 44%

可以看出,即使像早期 GPT-3 這樣強大的模型,也難以展現廣泛、類人化的理解能力,顯示真正的通用理解仍遙不可及。

當時的主要挑戰包括:

  • 專業知識不足(例如法律、醫學領域)
  • 複雜推理能力有限
  • 在零樣本或少樣本情境下表現脆弱
  • 容易受到題目干擾選項影響

這些觀察凸顯了 MMLU 在揭示 LLM 前沿能力上的價值。

模型性能的提升

自 MMLU 推出以來,LLM 的表現顯著提升。這一進步主要源於:

  • 架構創新
  • 模型規模擴大
  • 更高品質的訓練資料
  • 精細化方法,如指令微調(Instruction Fine-tuning)與人類反饋強化學習(RLHF, Reinforcement Learning from Human Feedback)

因此,MMLU 分數呈現快速攀升的趨勢。

推動這一進步的關鍵因素包括:

  • 規模法則(Scaling Laws) 的確認
  • Transformer 架構優化
  • 先進訓練技術,提升模型的推理與對齊能力
  • MMLU 本身的設計,促進模型多任務學習能力
  • 成熟的 MLOps 實踐,優化模型訓練與部署流程

這些因素共同驅動了 LLM 在 MMLU 上的快速進化,反映出 AI 在多領域知識和推理能力上的持續提升。

人類與模型的表現比較

MMLU 的一個關鍵特點是將 AI 的表現與人類智力進行比較。原始 MMLU 研究中,人類專家的正確率約為 90%。最初,LLM 與人類存在明顯差距。然而,最新的模型已大幅縮小了這一差距。

目前領先的模型在 MMLU 上的分數已達到或略高於平均人類專家基準。需要注意的是,「人類專家」本身是一個範圍,模型在不同學科的表現也有所差異。例如,最新的 GPT-4.1 模型在 MMLU 上取得 90.2% 的成績,而 Claude 4 Opus 則達到 88.8%

儘管這些數據令人印象深刻,但超過平均分數並不代表模型具備人類般的理解力、常識或創造力。模型仍可能表現脆弱,或在面對新型推理題目時出現困難。零樣本測試分數(zero-shot),作為更純粹的泛化能力檢驗,也有所提升,但通常落後於少樣本測試結果。

達到甚至超過人類專家 MMLU 分數具有深遠意義:

  • 驗證 AI 進展
  • 提升 AI 在知識密集型領域的實用性
  • 促進更具挑戰性的基準測試開發(如 MMLU-Pro)
  • 加強關於 AI 角色的倫理與社會討論

雖然高 MMLU 分數是重要里程碑,但重點仍在於打造 穩健、可解釋且符合倫理的 AI 系統

衍生版本與增強測試:MMLU-Pro 與 MMLU-CF

雖然原始 MMLU 基準測試大幅推動了 LLM 評估的進展,但隨著 AI 的快速發展,其局限性也逐漸顯現。因此,衍生版本如 MMLU-ProMMLU-CF 應運而生,旨在提供更嚴謹的評估。

原始 MMLU 的局限性

隨著模型日益先進,原始 MMLU 面臨幾個挑戰:

  • 資料重複問題:公開的 MMLU 題目可能已出現在 LLM 的訓練資料中,造成分數膨脹,未能真實反映模型的泛化能力。
  • 題目品質問題:大型基準測試中的題目可能存在缺陷、模糊或過時,影響評估可靠性。當頂尖模型接近滿分時,MMLU 已難以區分模型的高階推理能力,促使人們呼籲引入更複雜的任務。
  • 固定題庫限制:原始 MMLU 的固定題庫無法隨模型進展或新知識領域更新。作為選擇題,MMLU 也無法測試模型的生成能力、解釋能力或創造力。解決這些問題對於有效的 AI 評估至關重要。

MMLU-Pro:提升推理能力的標準

MMLU-Pro 的開發目標是測試模型更深層次的推理能力,題目更具挑戰性。它透過以下方式提升評估難度:

  • 增加題目複雜度
  • 強調高階思維能力
  • 降低對表面線索的依賴
  • 為頂尖模型設立更高天花板

MMLU-Pro 反映了持續努力,確保基準測試能推動 AI 推理能力的進步。

MMLU-CF:防止資料污染

MMLU-CF(Contamination-Free,無污染版本) 專門針對 LLM 基準測試中的資料污染問題。其目標是提供一套題目,極不可能出現在模型的訓練資料中。主要策略包括:

  • 創建新題目:精心設計的現代題目,避免與已知網路內容或訓練集重複,可能使用近期未公開的資料或專家生成題目。
  • 檢測與排除重複題目:使用先進技術掃描網路語料與訓練資料,剔除可能已接觸過的題目。
  • 頻繁更新或動態生成測試:降低訓練資料包含基準題目的可能性。

MMLU-CF 對於保持基準測試的公正性至關重要。在無污染版本上取得高分,更可靠地代表模型的 真正泛化能力與推理水平,而非單純記憶答案。這對於準確追蹤 AI 進展與公平比較模型表現非常重要。

未來發展方向

語言模型的評估之路還遠未結束。MMLU 及其衍生版本,已經揭示了一些新興趨勢與挑戰。

未來的基準測試可能會採用更多樣化的評估方式,包括:

  • 開放式問答
  • 互動對話
  • 模擬環境中的任務完成能力

這樣可以測試 AI 更廣泛的能力,而不僅限於選擇題。

隨著 AI 越來越能理解並生成文本、圖片、音頻和影片內容,基準測試也需要跟上腳步,評估模型的 多模態能力

此外,越來越多的重點放在 模型安全性、公平性、偏差以及倫理對齊 的測試上。自動化的 MLOps 流程,將對維持大規模評估的完整性至關重要。

確保基準測試的可靠性,例如像 MMLU-CF 使用的無污染策略,也將持續是一大挑戰,尤其是當組織使用完整的 MLOps 框架管理 AI 系統時。

MMLU 基準測試無疑改變了我們衡量與推動大型語言模型進步的方式。從全面的數據集到嚴格的評估方法,MMLU 推動 AI 擁有更廣泛的知識和更深入的推理能力。隨著模型不斷進化,基準測試也將持續更新,確保未來的 AI 越來越強大

參考來源 https://www.datacamp.com/blog/what-is-mmlu


메타데이터
post_id
3d2dc31ea5d9
slug
從-gpt-到-llm-pro-mmlu-如何衡量-ai-的真正智慧-3d2dc31ea5d9
url
https://medium.com/@systexdatalab/%E5%BE%9E-gpt-%E5%88%B0-llm-pro-mmlu-%E5%A6%82%E4%BD%95%E8%A1%A1%E9%87%8F-ai-%E7%9A%84%E7%9C%9F%E6%AD%A3%E6%99%BA%E6%85%A7-3d2dc31ea5d9
canonical_url
https://medium.com/@systexdatalab/%E5%BE%9E-gpt-%E5%88%B0-llm-pro-mmlu-%E5%A6%82%E4%BD%95%E8%A1%A1%E9%87%8F-ai-%E7%9A%84%E7%9C%9F%E6%AD%A3%E6%99%BA%E6%85%A7-3d2dc31ea5d9
author_url
https://medium.com/@systexdatalab
status
ok
fetched_at
2026-06-29 22:44:20