一、納什均衡到底在說什麼
納什均衡由數學家約翰·納許(John Nash)在 1950 年提出,定義很樸素:在一組策略組合中,如果每位玩家都已經選了自己的策略,而且在其他人不變的情況下,沒有任何人能靠單方面改變策略而獲得更好的結果,這組策略組合就是納什均衡。
關鍵字是「單方面」與「其他人不變」。它描述的是穩定,不是最優,更不是公平。最經典的例子是囚徒困境:
| B 合作 | B 背叛 | |
|---|---|---|
| A 合作 | A 得 3,B 得 3 | A 得 0,B 得 5 |
| A 背叛 | A 得 5,B 得 0 | A 得 1,B 得 1 |
數字為任意設定的收益,只要滿足「單獨背叛的收益 > 雙方合作 > 雙方背叛 > 單獨合作被背叛」的順序即可。
不論對方怎麼選,背叛都對自己較好,所以「雙方背叛」(各得 1)是唯一的納什均衡。但雙方合作(各得 3)明明對兩人都更好。這給了我們第一個重要的提醒:均衡不代表好結果,只代表沒有人有單獨改變的誘因。
二、混合策略:不可預測本身就是策略
有些遊戲裡,任何「固定做法」都會被對手針對。最簡單的例子是猜拳:如果你總是出石頭,對手只要出布就能贏。納許證明了在有限遊戲中,只要允許玩家以機率選擇行動(也就是混合策略),均衡一定存在。猜拳的均衡就是三種手勢各 1/3 的機率,因為此時對手不論選哪一種,期望收益都相同,沒有任何可以利用的偏向。
這裡有一個非常實用的技巧,稱為無差異原理:在混合策略均衡中,你選擇的機率,必須讓對手在各個選項之間無差異。這個反直覺的結構,正是下一節要親手解的內容。
三、一個可親手解的模型:立直還是默聽
以下是一個教學用的簡化模型,數字為舉例,並非從實戰統計得出。設想你已聽牌,面對另一位會在你聽牌後決定「推進」或「棄牌」的對手。你可以選擇宣告立直(價值高,但對手容易察覺而棄牌),或選擇默聽(價值較低,但對手不易察覺)。為了能解,我們把它抽象成兩人零和遊戲,數字代表你的期望得分(單位:千點,對手的得分為其相反數):
| 你 \ 對手 | 推進 | 棄牌 |
|---|---|---|
| 立直 | +4 | +1 |
| 默聽 | +2 | +3 |
先看有沒有「固定做法」的均衡。若對手推進,你偏好立直(4 > 2);若對手棄牌,你偏好默聽(3 > 1)。反過來,若你立直,對手偏好棄牌(輸 1 比輸 4 好);若你默聽,對手偏好推進(輸 2 比輸 3 好)。每個「固定做法」都會被針對,形成循環,因此沒有純策略均衡,必須用混合策略。
求你的立直機率 p。要讓對手在推進與棄牌之間無差異:
推進時你的得分 = 4p + 2(1 − p) = 2 + 2p
棄牌時你的得分 = 1p + 3(1 − p) = 3 − 2p
令兩者相等:2 + 2p = 3 − 2p,得 p = 1/4
求對手的推進機率 q。要讓你在立直與默聽之間無差異:
立直時你的得分 = 4q + 1(1 − q) = 1 + 3q
默聽時你的得分 = 2q + 3(1 − q) = 3 − q
令兩者相等:1 + 3q = 3 − q,得 q = 1/2
均衡為:你以 25% 的機率立直、75% 默聽;對手以 50% 的機率推進、50% 棄牌。此時遊戲的價值為 +2.5 千點,無論哪一方偏離,都無法單方面改善。
這個模型有一個很容易被忽略的啟示:均衡中你多數時候選的是「看起來較弱」的選項。這不是因為默聽本質上較好,而是因為你需要讓對手無法根據你的行動規律調整策略。
四、從兩人到四人:均衡概念的極限
上面的模型之所以漂亮,是因為它是兩人零和遊戲,這類遊戲有馮·諾伊曼的極小化極大定理保證:你採用均衡策略,至少能拿到遊戲的價值,不管對手做什麼。但真實的四人麻將在三個地方打破了這個前提:
- 不是兩人。三人以上的遊戲,均衡可能不只一個,而且不同均衡之間不能互相搭配。即使你採用均衡策略中的一個,若別人採用的是另一個均衡,結果不保證令你滿意。
- 不是零和。點數雖然守恆,但有順位加減分、局數、莊家輪替等結構,使得「別人少輸一點」可能反而對你有利或不利。
- 資訊不完全。你看不見別人的手牌,所有「均衡」都必須在對手手牌分佈的信念上計算,使問題複雜度大幅上升。
另外,多人遊戲有一個兩人遊戲沒有的現象:漁翁得利。當 A 與 B 正在僵持,第三位玩家 C 不需要採取任何行動,就能因為 A、B 互相消耗而改善相對位置。這也是為什麼「把別人都當成對手」的簡化,在四人局會出錯。
五、實戰用法:以均衡為基準,找對手的偏離
既然四人局很難精確求均衡,納什均衡還有用嗎?有,但用法要換:把均衡當作基準,再觀察對手偏離基準的方向,並小幅度地針對性調整。這個過程可以分三步:
- 建立基準。先弄清楚「對手不犯錯時,我該怎麼做」。以上一節的模型為例,基準就是 25% 立直、75% 默聽。
- 觀察偏離。對手在面對立直時,推進的比例大約是多少?假設你觀察到他幾乎只在好牌時才推進,實際推進率遠低於 50%,那麼他就是「過度棄牌」。
- 針對性調整。回到模型:若對手的推進機率 q 低於 1/2,你立直的得分 1 + 3q 會小於默聽的 3 − q。例如 q = 0.3,立直得 1.9,默聽得 2.7,高於均衡值 2.5。也就是說,對手越愛棄牌,你就越不該立直,直接默聽收益更高。反過來,若 q > 1/2(對手愛硬推),你就該更常立直。
但這裡有一個代價:你一旦完全偏離均衡去針對對手,自己就變得可以被針對。如果對手也在觀察你,他可以調整策略反過來剝削你。所以實務上的調整幅度要小,而且要隨時留意對手是否改變了行為。
六、AI 的證據與常見誤用
均衡思路在撲克 AI 上有最清楚的實證。2017 年,卡內基美隆大學的 Libratus 在單挑無限注德州撲克中擊敗了四位頂尖職業選手,其核心就是對均衡策略的近似計算。2019 年的 Pluribus 則在六人桌擊敗了職業選手;而它的作者也坦承,多人局的均衡並沒有兩人局那樣的理論保證,它之所以有效,是經驗上的成功,而非定理的結果。麻將方面,微軟亞洲研究院的 Suphx 在天鳳平台達到十段,同樣依賴大量自我對弈,而非手寫規則。
回到人類玩家,最常見的三種誤用:
- 假設對手完全理性。真實玩家有偏誤與習慣。均衡的價值在於找出這些偏離,而不是預設它們不存在。
- 把均衡當成勝利保證。均衡策略只保證你不會被輕易針對,並不保證你一定贏,更不保證在四人局中得到正期望值。
- 用不自知的數字套模型。第三節的收益是教學用的假設值。要把模型用在實戰,必須自己累積樣本、估計對手的棄牌率與推進率,並隨牌局更新。