← Back to list

[統計學] 殘差

在統計學和機器學習中,「殘差」是一個核心概念,它指的是觀測到的實際值與模型預測值之間的差異。簡單來說,殘差就是模型「算錯」了多少。

Ahead Mobility 源碼行者 · 2025-07-12 10:40 · 0 claps · 1.7 min read
#統計學 #機器學習 #statistics #machine-learning
Open on Medium ↗
Wiki topics: ML · Machine Learning EDU · Education & Learning 📐 · Mathematics

[統計學] 殘差

在統計學和機器學習中,「殘差」是一個核心概念,它指的是觀測到的實際值與模型預測值之間的差異。簡單來說,殘差就是模型「算錯」了多少。

核心公式:殘差 = 實際觀測值 − 模型預測值

假設我們想用一個人的身高來預測他的體重。我們收集了 100 個人的身高和體重資料,並建立了一個線性迴歸模型。

小明的實際身高是 175 公分,實際體重是 70 公斤。

我們將小明的身高(175公分)輸入到模型中,模型預測他的體重是 68 公斤。

對於小明這個數據點,殘差 = 70公斤(實際值) − 68 公斤(預測值) = 2 公斤。 這個「2 公斤」就是殘差。它告訴我們,我們的模型對小明體重的預測,比實際情況少了 2 公斤。

—— —

計算出殘差後,真正有價值的是對所有數據點的殘差進行分析,這就是所謂的「殘差分析」。透過分析殘差的分佈和模式,我們可以診斷我們的模型是否良好、是否適用。一個好的模型,其殘差通常會呈現以下特性:

  1. 常態分佈 (Normality): 殘差應該大致呈現常態分佈。如果殘差分佈嚴重偏斜,可能表示模型有系統性的偏差。
  2. 獨立性 (Independence): 殘差之間應該是相互獨立的,不應存在相關性。例如,一個數據點的殘差不應該能預測下一個數據點的殘差。
  3. 變異數同質性 (Homoscedasticity): 殘差的變異數應該是固定的,不應隨著預測值的變化而有規律地變大或變小。如果殘差的散佈程度隨預測值改變,就稱為「異質性」,這也暗示著模型可能有問題。
  4. 隨機分佈: 將殘差與預測值作圖(稱為「殘差圖」),這些點應該隨機散佈在0線的周圍,沒有任何明顯的模式(如曲線、喇叭狀等)。如果出現了模式,就表示模型未能捕捉到數據中的某些資訊。

在統計學上,「殘差」和「誤差」是兩個相關但不同的概念:

殘差 (Residual): 是可觀測的。它是實際觀測值與樣本數據建立出的模型預測值之間的差距。

誤差 (Error): 是理論上存在但不可觀測的。它指的是實際觀測值與真實母體的真實值(或稱期望值)之間的差距。由於我們通常無法得知母體的真實情況,因此誤差也無從確知。

簡單來說,殘差是我們用來估計那看不見的「誤差」的一種方式。


메타데이터
post_id
12b43ef8bb10
slug
統計學-殘差-12b43ef8bb10
url
https://medium.com/@aheadmb/%E7%B5%B1%E8%A8%88%E5%AD%B8-%E6%AE%98%E5%B7%AE-12b43ef8bb10
canonical_url
https://medium.com/@aheadmb/%E7%B5%B1%E8%A8%88%E5%AD%B8-%E6%AE%98%E5%B7%AE-12b43ef8bb10
author_url
https://medium.com/@aheadmb
status
ok
fetched_at
2026-06-25 12:15:08