公平六面骰的意思,是在固定且合理的投擲條件下,每一面朝上的長期機率都相同,也就是各為六分之一。它不代表短短幾次一定平均,更不代表連續出現三次六點就是作弊。要檢查骰子是否偏向某些面,需要先記錄足夠多次獨立投擲,再比較實際次數與公平模型的預期次數。卡方適合度檢定能量化這段差距有多不尋常,但結論仍受樣本量、投擲方式與顯著水準影響。

「公平」是一個機率假設

理想模型假設六個結果的機率完全一樣,而且每次投擲互相獨立。若前一次出現四點,不會讓下一次四點比較難出現。這兩項條件分別描述結果分布與試驗關係,不能混為一談。一顆骰子可能各面長期比例接近相同,卻因投擲裝置固定而使相鄰結果具有關聯;也可能每次互相獨立,但某一面本來就比較常出現。

實體骰子的質量分布、邊角形狀、點數凹孔、材質氣泡與磨損,都可能讓機率略有偏差。桌面彈性、投擲高度與初始姿態也會影響運動。統計檢定回答的不是「這顆骰子在宇宙中是否完美對稱」,而是現有資料是否與指定的公平模型相容。

少量結果不平均很正常

假設投擲十二次,平均預期每面出現兩次,但實際上幾乎不會整齊地各出現兩次。機率模型中的預期次數是大量重複實驗的平均,不是每一批資料的配額。某一面暫時完全沒出現,或另一面出現四次,都可能只是自然波動。

大數法則指出,試驗次數增加時,各面相對頻率通常會逐漸接近真實機率。不過,「接近」不表示每一面的次數差會固定縮小。投擲次數變多,絕對次數差可能反而變大,但它占總次數的比例通常變小。例如兩面相差十次,在六十次試驗中很醒目,在六千次中則未必值得注意。

這也是只看長條圖容易誤判的原因。圖表縱軸若從很高的數值起跳,小差異看起來會非常巨大;樣本極少時,一兩次結果也能造成明顯比例差。檢定的用途,就是把差距與樣本量一起考慮。

卡方適合度檢定的核心

比較觀察次數與預期次數

若總共投擲 n 次,公平六面骰的每面預期次數就是 n 除以 6。接著對每一面計算「觀察次數減預期次數」的平方,再除以預期次數,最後將六項加總。所得的卡方統計量一定不小於零;實際分布愈偏離預期,數值通常愈大。

使用平方有兩個作用。第一,正負差不會互相抵銷;第二,較大的偏差會被放大。除以預期次數則讓不同類別在合理尺度下比較。若檢查的不是六面骰,而是各結果原本就有不同理論機率的物件,每一類都應使用自己的預期次數。

自由度與參考分布

六個面次數相加必須等於總投擲數。知道前五面的次數後,第六面已被決定,因此可獨立變動的資訊只有五項,自由度為 5。在公平假設與檢定條件成立時,統計量可與自由度為 5 的卡方分布比較,得到 p 值。

p 值表示:假設骰子公平,出現目前這麼大或更大偏差的機率有多少。它不是「骰子公平的機率」,也不是「結果由運氣造成的機率」。若 p 值很小,資料對公平假設構成較強反證;若不小,只能說現有資料不足以拒絕公平模型,不能證明骰子完美公平。

一個簡化例子

假設投擲 120 次,六面的觀察次數依序為 14、18、17、20、22、29。公平模型下,每面預期都是 20 次。六點比預期多九次,一點比預期少六次,其餘差距較小。把各項差距平方後除以 20 並加總,便得到檢定統計量。

這個統計量必須放進參考分布才有意義,不能只因六點最多就直接判定有偏。若總共只有十二次,六點多出幾次並不稀奇;若是十二萬次,各面比例持續出現同方向的小偏差,就可能形成很強的統計證據。相同百分比差異,在不同樣本量下會得到不同判讀。

實作時可先畫出各面次數與預期線,再進行計算。視覺化有助於發現是哪幾面貢獻差距,但正式判讀仍應保留完整次數,不要只比較最高與最低兩面。

檢定前要滿足哪些條件

預期次數不能太小

卡方分布是近似結果。各類別預期次數太少時,近似可能不可靠。六面骰若只投十幾次,每面的預期值很低,適合繼續收集資料,或採用能直接計算離散結果的精確方法。不要為了快速得到結論,把小樣本硬套進檢定。

試驗應盡量獨立且一致

若每次都從同一姿態輕放骰子,結果可能反映操作方式,而非骰子本身。較合理的測試應讓骰子充分翻滾,使用一致表面與容器,避免結果掉出桌面後任意重擲。若由人工投擲,可在測試前定義無效投擲條件,避免看到點數後才決定是否排除。

資料也不應挑選。只保留「看起來奇怪」的一段連續結果,會放大偶然異常。最好事先決定投擲次數、記錄方式與分析方法,完整保留所有有效試驗。

顯著不一定代表影響很大

樣本非常多時,極小的偏差也可能達到統計顯著。例如某面真實機率只比六分之一高一點,長期累積後仍可被檢出,但對一般桌遊未必造成可察覺的影響。反過來說,小樣本沒有顯著結果,可能只是檢定能力不足,不能保證偏差不存在。

因此應同時報告各面比例、樣本量與偏離幅度,而不是只寫「通過」或「未通過」。如果用途涉及正式競賽、賭博設備或品質管理,還需要事先設定可接受偏差,並採用受控測試程序。一般玩家的居家實驗適合用來理解機率與發現明顯異常,不足以取代專業認證。

常見誤解

連續出現相同點數不是偏骰的直接證據。公平骰也會產生連號與群聚,人類往往把「看起來雜亂」誤認為真正隨機。另一方面,六面總次數剛好相等也不證明公平,因為結果可能受某種規律控制,或只是剛好平衡。

卡方檢定也只檢查所指定的類別比例。它不會自動發現時間順序中的相關性。若懷疑投擲之間不獨立,還要查看轉移情形、連續相同結果數或其他序列特徵。公平性是一組假設,不是單一數字能涵蓋的全部性質。

結語

判斷骰子是否公平,應從明確模型開始:每面機率相同、各次投擲近似獨立。短期不平均是隨機波動的正常表現,資料量增加後才較有能力辨認穩定偏差。卡方適合度檢定把觀察次數、預期次數與樣本量結合起來,能回答資料對公平假設有多不利;但它不能證明絕對公平,也不能彌補不一致的投擲與挑選資料。把統計證據與實際偏差大小一起看,結論才不會被一次幸運或不幸的結果帶著走。