加入研究社
棋牌博弈論

納什均衡實戰應用:多人博弈中的策略均衡與理性決策框架

雙手正在進行桌遊對局,象徵多人博弈中的策略選擇

納什均衡常被講成一句口號:「大家都理性,就會到達均衡。」這句話既不完整,也容易讓人誤用。本文先把概念講清楚,再用一個可以親手解的小模型示範混合策略,最後誠實談它在多人遊戲裡的極限,以及更實用的用法——拿均衡當基準,去找對手偏離的地方。

一、納什均衡到底在說什麼

納什均衡由數學家約翰·納許(John Nash)在 1950 年提出,定義很樸素:在一組策略組合中,如果每位玩家都已經選了自己的策略,而且在其他人不變的情況下,沒有任何人能靠單方面改變策略而獲得更好的結果,這組策略組合就是納什均衡。

關鍵字是「單方面」與「其他人不變」。它描述的是穩定,不是最優,更不是公平。最經典的例子是囚徒困境:

B 合作B 背叛
A 合作A 得 3,B 得 3A 得 0,B 得 5
A 背叛A 得 5,B 得 0A 得 1,B 得 1

數字為任意設定的收益,只要滿足「單獨背叛的收益 > 雙方合作 > 雙方背叛 > 單獨合作被背叛」的順序即可。

不論對方怎麼選,背叛都對自己較好,所以「雙方背叛」(各得 1)是唯一的納什均衡。但雙方合作(各得 3)明明對兩人都更好。這給了我們第一個重要的提醒:均衡不代表好結果,只代表沒有人有單獨改變的誘因。

二、混合策略:不可預測本身就是策略

有些遊戲裡,任何「固定做法」都會被對手針對。最簡單的例子是猜拳:如果你總是出石頭,對手只要出布就能贏。納許證明了在有限遊戲中,只要允許玩家以機率選擇行動(也就是混合策略),均衡一定存在。猜拳的均衡就是三種手勢各 1/3 的機率,因為此時對手不論選哪一種,期望收益都相同,沒有任何可以利用的偏向。

這裡有一個非常實用的技巧,稱為無差異原理:在混合策略均衡中,你選擇的機率,必須讓對手在各個選項之間無差異。這個反直覺的結構,正是下一節要親手解的內容。

三、一個可親手解的模型:立直還是默聽

以下是一個教學用的簡化模型,數字為舉例,並非從實戰統計得出。設想你已聽牌,面對另一位會在你聽牌後決定「推進」或「棄牌」的對手。你可以選擇宣告立直(價值高,但對手容易察覺而棄牌),或選擇默聽(價值較低,但對手不易察覺)。為了能解,我們把它抽象成兩人零和遊戲,數字代表你的期望得分(單位:千點,對手的得分為其相反數):

你 \ 對手推進棄牌
立直+4+1
默聽+2+3

先看有沒有「固定做法」的均衡。若對手推進,你偏好立直(4 > 2);若對手棄牌,你偏好默聽(3 > 1)。反過來,若你立直,對手偏好棄牌(輸 1 比輸 4 好);若你默聽,對手偏好推進(輸 2 比輸 3 好)。每個「固定做法」都會被針對,形成循環,因此沒有純策略均衡,必須用混合策略。

求你的立直機率 p。要讓對手在推進與棄牌之間無差異:

推進時你的得分 = 4p + 2(1 − p) = 2 + 2p
棄牌時你的得分 = 1p + 3(1 − p) = 3 − 2p
令兩者相等:2 + 2p = 3 − 2p,得 p = 1/4

求對手的推進機率 q。要讓你在立直與默聽之間無差異:

立直時你的得分 = 4q + 1(1 − q) = 1 + 3q
默聽時你的得分 = 2q + 3(1 − q) = 3 − q
令兩者相等:1 + 3q = 3 − q,得 q = 1/2

均衡為:你以 25% 的機率立直、75% 默聽;對手以 50% 的機率推進、50% 棄牌。此時遊戲的價值為 +2.5 千點,無論哪一方偏離,都無法單方面改善。

這個模型有一個很容易被忽略的啟示:均衡中你多數時候選的是「看起來較弱」的選項。這不是因為默聽本質上較好,而是因為你需要讓對手無法根據你的行動規律調整策略。

四、從兩人到四人:均衡概念的極限

上面的模型之所以漂亮,是因為它是兩人零和遊戲,這類遊戲有馮·諾伊曼的極小化極大定理保證:你採用均衡策略,至少能拿到遊戲的價值,不管對手做什麼。但真實的四人麻將在三個地方打破了這個前提:

  • 不是兩人。三人以上的遊戲,均衡可能不只一個,而且不同均衡之間不能互相搭配。即使你採用均衡策略中的一個,若別人採用的是另一個均衡,結果不保證令你滿意。
  • 不是零和。點數雖然守恆,但有順位加減分、局數、莊家輪替等結構,使得「別人少輸一點」可能反而對你有利或不利。
  • 資訊不完全。你看不見別人的手牌,所有「均衡」都必須在對手手牌分佈的信念上計算,使問題複雜度大幅上升。

另外,多人遊戲有一個兩人遊戲沒有的現象:漁翁得利。當 A 與 B 正在僵持,第三位玩家 C 不需要採取任何行動,就能因為 A、B 互相消耗而改善相對位置。這也是為什麼「把別人都當成對手」的簡化,在四人局會出錯。

五、實戰用法:以均衡為基準,找對手的偏離

既然四人局很難精確求均衡,納什均衡還有用嗎?有,但用法要換:把均衡當作基準,再觀察對手偏離基準的方向,並小幅度地針對性調整。這個過程可以分三步:

  1. 建立基準。先弄清楚「對手不犯錯時,我該怎麼做」。以上一節的模型為例,基準就是 25% 立直、75% 默聽。
  2. 觀察偏離。對手在面對立直時,推進的比例大約是多少?假設你觀察到他幾乎只在好牌時才推進,實際推進率遠低於 50%,那麼他就是「過度棄牌」。
  3. 針對性調整。回到模型:若對手的推進機率 q 低於 1/2,你立直的得分 1 + 3q 會小於默聽的 3 − q。例如 q = 0.3,立直得 1.9,默聽得 2.7,高於均衡值 2.5。也就是說,對手越愛棄牌,你就越不該立直,直接默聽收益更高。反過來,若 q > 1/2(對手愛硬推),你就該更常立直。

但這裡有一個代價:你一旦完全偏離均衡去針對對手,自己就變得可以被針對。如果對手也在觀察你,他可以調整策略反過來剝削你。所以實務上的調整幅度要小,而且要隨時留意對手是否改變了行為。

六、AI 的證據與常見誤用

均衡思路在撲克 AI 上有最清楚的實證。2017 年,卡內基美隆大學的 Libratus 在單挑無限注德州撲克中擊敗了四位頂尖職業選手,其核心就是對均衡策略的近似計算。2019 年的 Pluribus 則在六人桌擊敗了職業選手;而它的作者也坦承,多人局的均衡並沒有兩人局那樣的理論保證,它之所以有效,是經驗上的成功,而非定理的結果。麻將方面,微軟亞洲研究院的 Suphx 在天鳳平台達到十段,同樣依賴大量自我對弈,而非手寫規則。

回到人類玩家,最常見的三種誤用:

  • 假設對手完全理性。真實玩家有偏誤與習慣。均衡的價值在於找出這些偏離,而不是預設它們不存在。
  • 把均衡當成勝利保證。均衡策略只保證你不會被輕易針對,並不保證你一定贏,更不保證在四人局中得到正期望值。
  • 用不自知的數字套模型。第三節的收益是教學用的假設值。要把模型用在實戰,必須自己累積樣本、估計對手的棄牌率與推進率,並隨牌局更新。

想看這個框架在具體牌桌情境的延伸,可以對照站內的四人局納什均衡分析、談資訊不對稱的麻將與撲克比較,以及防守策略分析。

黃
黃嘉明
麻將策略研究員

從事麻將策略與機率研究逾20年,系統化分析各地麻將規則差異對策略選擇的影響。

常見問題

納什均衡等於最佳策略嗎?

不等於。納什均衡只表示『在其他人不變的情況下,沒有人能單方面改善』,它描述的是穩定。囚徒困境的均衡(雙方背叛)就比雙方合作更差。

為什麼混合策略的機率,是由『對手無差異』來決定?

因為若對手在不同選項之間有偏好,你就會被針對。讓對手對自己的每個選項期望收益相同,你的策略才不會被利用,這就是無差異原理。

四人麻將可以直接套用納什均衡嗎?

不能直接套用。四人局不是兩人零和、有順位結構,且資訊不完全,均衡可能不只一個。更實用的做法是把均衡當基準,觀察對手的偏離後做小幅調整。

針對對手的偏離調整策略有什麼風險?

完全偏離均衡會讓自己也變得可被針對。若對手同樣在觀察你,他可以反過來調整剝削你,因此調整幅度應該小,並持續追蹤對手是否改變習慣。

資料來源與說明

  • 納許均衡定義:John F. Nash Jr.,1950 年發表於《美國國家科學院院刊》的均衡點論文。
  • 極小化極大定理:John von Neumann,1928 年提出,適用於兩人零和遊戲。
  • Libratus(2017,單挑無限注德州撲克)與 Pluribus(2019,六人桌,刊於《Science》):卡內基美隆大學與 Facebook AI 研究團隊公開論文。
  • Suphx:微軟亞洲研究院 2020 年公開論文,於天鳳平台達到十段。
  • 第三節的收益數字為教學用的假設值,均衡解(p = 1/4、q = 1/2、價值 2.5)可自行以無差異原理驗算。