iPAS自學路
中級科目二最後更新

機率統計題怎麼判斷?從中位數、p 值到信賴區間的常見陷阱

機率統計題多半在考「這個情境該看哪個量數、結果該怎麼解讀」。本文用 10 個情境整理中級科目二的集中趨勢、分散程度、常態分布、假設檢定與信賴區間,並點出最常見的誤解。

每次新聞公布平均薪資,留言區常有人說自己「被平均」了:報導裡的平均數,比身邊多數人領的還高。這不是數字算錯,而是平均數本來就會被少數高薪拉高。數字沒錯、讀法錯了,正是機率統計題最常考的地方。

準備中級科目二的「機率統計基礎」時,平均數、標準差、p 值、信賴區間這些名詞大多在別的地方看過。真正讓人失分的,常常不是忘記定義,而是題目換了一個情境之後,不確定該用哪個量數,或把結果解讀過頭,例如把 p 值當成「假設為真的機率」。

這篇把我整理的 10 道模擬題情境,依觀念分成六組,每組說明題目在問什麼、怎麼判斷,以及最常見的陷阱。題目情境與數字為自編練習,用來說明判斷方法,不是官方試題。

這六組可以分成前後兩半。前三組在描述手上的資料:中心在哪裡、散得多開、某個數值落在什麼位置。後三組在用樣本推論母體:樣本平均會怎麼變動、看到的差異是不是巧合、估計的範圍有多可靠。前半是後半的基礎,後半的檢定和區間,都會用到前半的平均數、標準差和 Z 值。

六組都在回答同一個問題:看到一個統計數字時,它說了什麼、沒說什麼? 每一組都會先從一個生活裡常見的數字講起,例如薪資、會考 PR 值、民調,再換成考題的情境。

一、集中趨勢:先看資料有沒有被少數極端值拉走

「被平均」的感覺,換成考題就是下面這種情境。

假設一份房屋成交資料有 1,200 筆,九成落在每坪 80~160 萬元,但有 12 筆豪宅交易達到每坪 450~600 萬元。如果要回答「一般民眾普遍的成交水準」,該用哪個統計量?

平均數會把每一筆金額都加進去,所以少數豪宅會把結果明顯拉高。中位數看的是排序後的中間位置,那 12 筆豪宅只是排在最後面,幾乎不會移動中間那一筆,因此較不受極端值影響,比較能代表多數交易。全距只描述資料散得多開,不是中心位置;眾數在這種連續數值資料裡,未必有穩定的代表性。

同樣的道理延伸到分布形狀。薪資資料常見大多數人集中在中低區間,少數高階主管把分布往右拉出一條長尾,這叫右偏(正偏態)。長尾那一側的極大值會把平均數拉向右邊,所以通常會看到「眾數 ≤ 中位數 ≤ 平均數」。要注意這是右偏分布的常見情況,不是每份資料都必定成立;而且「偏態」描述的是往哪邊歪,「峰度」描述的是尾端厚不厚,兩者是不同的指標,題目若把它們混在一起,就是錯誤選項。

右偏分布的長條圖,高峰在左側,右邊拖著一條長尾。三條直線由左到右依序是眾數、中位數、平均數。下方寫著常見順序:眾數 ≤ 中位數 ≤ 平均數,右偏時通常如此,不是每份資料都成立

二、分散程度:比較穩定性時,注意單位與尺度

買零食時,兩個牌子標示的重量一樣,但一個每包都差不多,另一個有時多、有時少,你會覺得前者比較可靠。平均一樣,不代表一樣穩定;「穩不穩」要另外量。

一間工廠量測零件直徑,平均值很接近規格中心,但不同班別量出來的數值分散程度差很多。這時題目要你評估的是「分散程度」與「製程能力」,平均數與中位數都只描述中心位置,回答不了這個問題。

標準差衡量每筆量測值離平均有多遠,數值愈小代表愈集中。工廠進一步會用製程能力指數 Cp = (規格上限 − 規格下限) ÷ (6 × 標準差),比較「規格允許的寬度」和「製程實際的分散程度」。全距只看最大與最小兩個值,容易被單一異常值影響,忽略了中間的分布。

如果要比較兩款產品哪一款比較穩定,但兩者的尺度差很多,例如 A 款平均 200 公克、標準差 4 公克,B 款平均 20 公克、標準差 1 公克,直接比較標準差會被尺度誤導。這時要用變異係數(標準差 ÷ 平均數):A 款是 2%,B 款是 5%,所以 A 款的相對變異較小、較穩定。變異數的單位是公克平方,同樣會受尺度影響,不適合跨尺度比較。

三、常態分布與 Z 值:把分數換算成相對位置

國中會考的 PR 值,告訴你贏過多少百分比的考生。考 80 分算不算好,要看大家考幾分;PR 值把分數換成「在人群裡的位置」。Z 值做的是類似的事,只是換算方式不同:PR 值直接數人數,Z 值先算「比平均高幾個標準差」,再透過常態分布換成百分比,所以資料要接近常態時才換得準。

假設一次考試成績近似常態分布,平均 45 分、標準差 10 分,某位學生的 Z 值是 +1.96,他大約在什麼位置?

Z 值代表「比平均高幾個標準差」。在標準常態分布中,Z = 1.96 以下的累積機率約 0.975,也就是右邊只剩約 2.5%,所以這位學生大約在前 2.5%。這個數字也是 95% 雙尾區間的臨界值,常和信賴區間一起出現。容易混淆的對照值是:Z ≈ 1.645 對應前 5%,Z ≈ 1 對應前 16% 左右。

標準常態分布曲線。中間 -1.96 到 1.96 之間塗淺藍色,標示中間約 95%;兩側尾端各塗橘色,各標示約 2.5%。下方寫著 1.96 也是 95% 信賴區間用的臨界值

四、中央極限定理:樣本平均的分布,和母體的形狀不同

一家門市的營業額可能忽高忽低,但把 50 家門市平均起來,數字就穩定多了:特別高和特別低的會互相抵消。這個「平均起來比較穩、形狀也變得比較對稱」的現象,就是這一組要講的事。

假設要估計連鎖門市的平均單日營業額,母體明顯右偏,少數高流量門市拉高了整體平均。研究員每次隨機抽 50 家門市算一次樣本平均,重複 1,000 次,這 1,000 個樣本平均會呈現什麼形狀?

中央極限定理說的是:只要母體的變異數是有限的,樣本數夠大時,樣本平均的抽樣分布會趨近常態,不管母體本身長什麼樣子。常見的經驗法則是樣本數 30 以上,但這只是參考;母體偏得很嚴重時,可能需要更多樣本。題目最常見的錯誤選項,是說「母體右偏,所以樣本平均也一定右偏」,這是把母體分布和樣本平均的分布混為一談。

五、假設檢定:p 值、兩種錯誤與檢定力

新聞常寫「研究證實某某有效」。這一組要拆開的是:研究到底算出了什麼,「證實」這兩個字又說過頭在哪裡。

假設藥廠檢驗新的降血壓藥,虛無假設 H0 是「新藥與對照組沒有差異」,事前設定顯著水準 α = 0.05,檢定結果 p = 0.03。因為 p 小於事先設定的 α,所以拒絕 H0,表示樣本提供了「有差異」的統計證據。

這題的陷阱在解讀。p 值的意思是:假設 H0 成立時,看到目前這麼極端(或更極端)的結果的機率。它不是「新藥有效的機率」,所以不能說「p = 0.03 代表 97% 有效」。顯著水準也要在看結果之前就決定,不能看到 p = 0.03 之後才改成用 0.01 當門檻。

兩種錯誤可以用醫療影像篩檢來理解。假設 H0 是「沒有結節」:

錯誤類型 實際狀況 判斷結果 機率
型一錯誤(偽陽性) 沒有結節(H0 為真) 判成有結節(拒絕 H0) α
型二錯誤(偽陰性) 真的有結節(H0 為假) 判成正常(沒拒絕 H0) β

其中 α 就是事先設定的顯著水準,所以把 α 訂得愈嚴,型一錯誤愈少,但在其他條件不變時,型二錯誤會變多。

檢定力是 1 − β,也就是「效應真的存在時,正確拒絕 H0 的機率」。它會受樣本數、效應大小、資料變異程度與顯著水準影響:樣本數愈多、效應愈明顯,檢定力愈高。所以一項只找到 12 位受試者的研究,即使效果真的存在,也可能因為檢定力不足而檢定不出來。檢定力是設計研究時就要考慮的條件,和事後算出來的 p 值是不同的概念。

六、信賴區間:95% 指的是「方法」,不是這一個區間

選舉前的民調新聞,最後常有一行小字:「在 95% 信心水準下,抽樣誤差為正負 3 個百分點」。這就是信賴區間。

假設一份民調抽樣 1,067 人,某候選人支持率 48%,95% 信賴區間是 45%~51%。這個 95% 該怎麼解讀?

在頻率學派的解讀裡,母體的真實支持率是一個固定、但我們不知道的數字。95% 的意思是:如果用同樣的方法重複抽樣很多次,每次都建一個區間,大約 95% 的區間會涵蓋真實值。至於這一次算出來的 45%~51%,它要嘛涵蓋真值、要嘛沒有,不能說「真實支持率有 95% 的機率落在這裡」。另外兩個常見的錯誤選項是把 95% 說成「95% 的受訪者」,或把信賴區間當成選舉結果的預測。

可以把它想成撒網捕魚:魚(真實值)停在一個固定的位置,每次抽樣就是撒一次網(算出一個區間)。95% 說的是這種撒網方法,大約每 100 次有 95 次會網到魚。不過這個比喻有一點不像:真的撒網,拉起來就知道有沒有魚;信賴區間算出來以後,永遠沒辦法確認這一次有沒有涵蓋真值。

六組怎麼接起來,做題時怎麼用

回到開頭的問題:看到一個統計數字,它說了什麼、沒說什麼?前三組教你看清楚數字在描述什麼,後三組教你判斷從樣本推論出去的結論能信到哪裡。兩半是接起來的:

標準差描述資料散得多開(第二組),Z 值再用標準差把一個數值換成「離平均幾個標準差」的相對位置(第三組)。中央極限定理說明樣本平均的分布會接近常態(第四組),而且樣本愈多,樣本平均散得愈小,這個分散程度叫做標準誤。有了這兩點,檢定和信賴區間才能借用常態分布與 Z 值來計算。

所以 1.96 會同時出現在兩個地方:在第三組,它代表前 2.5% 的位置;在第六組,它是 95% 信賴區間的臨界值。以大樣本的平均數雙尾檢定來說,α = 0.05 的檢定和 95% 信賴區間用的是同一個臨界值,結論也會一致:區間沒有涵蓋 H0 主張的數值,就等於在 α = 0.05 下拒絕 H0。

做題時,可以先從題目的描述判斷它在問哪一類問題:

題目出現的描述 先判斷什麼 對應的概念
少數極端值、要描述「一般」水準 平均數會不會被拉走? 中位數
長尾往右、薪資或房價 分布往哪邊歪?三個量數的大小順序? 右偏,平均數通常最大
穩定性、分散程度 要看中心,還是看離散? 標準差、Cp
兩組資料尺度差很多 直接比標準差會不會被尺度誤導? 變異係數
樣本平均、重複抽樣 問的是母體,還是樣本平均的分布? 中央極限定理
p 值與顯著水準 p 值是在什麼前提下算出的機率? 拒絕或不拒絕 H0
偽陽性、偽陰性 H0 的實際狀況與判斷結果各是什麼? 型一錯誤、型二錯誤
樣本太少、怕檢定不出來 效應存在時,抓得到的機率有多高? 檢定力
95% 信賴區間 95% 描述的是方法,還是這一個區間? 頻率學派的解讀

做錯題時,可以對照這張表檢查自己是哪一步判斷錯:是認錯了題目在問的類型,還是知道類型、卻把結果解讀過頭。統計在中級科目二裡的位置,可以回到〈中級科目二怎麼讀?〉的學習地圖;迴歸報表裡的 p 值怎麼讀,可以接著看〈Python 題看不懂?〉的第五題。

讀完試試看

某份報告寫:「新教材的檢定結果 p = 0.20,大於 0.05,證明新教材沒有效果。」這句話哪裡有問題?

想好再往下看。參考答案:p 值大於顯著水準,只代表「沒有足夠證據拒絕 H0」,不等於證明沒有效果。也可能是樣本太少、檢定力不足,所以就算效果存在也測不出來。

本文情境與數字為自編練習題改寫,非 iPAS 官方試題或教材。正式評鑑範圍與最新規則,請以AI 應用規劃師官方專區公告為準。

大數據處理分析與應用

同樣是中級科目二的文章

看全部中級科目二的文章

回文章列表