加入研究社
AI對局分析

AI 棋局研究成果整理:從 AlphaGo 到 KataGo,圍棋認知如何被改寫

桌遊對局中的手部特寫,象徵棋局與人工智慧研究

2016 年 3 月,AlphaGo 在首爾以 4 比 1 擊敗李世乭,圍棋界一度認為不可能的事成了現實。但比勝負更值得整理的,是之後十年的研究成果:機器如何學會下棋、人類的下法因此改變了什麼,以及這些系統至今仍存在的盲點。本文按時間線與主題,把這些成果做一次有依據的整理。

一、關鍵里程碑時間線

時間事件意義
2015 年 10 月AlphaGo 以 5 比 0 擊敗歐洲冠軍樊麾(成果於 2016 年 1 月刊於《Nature》)首次在讓子以外的正式比賽中擊敗職業棋手
2016 年 3 月AlphaGo 在首爾以 4 比 1 擊敗李世乭擊敗當代頂尖棋手,引發全球關注
2016 年底至 2017 年初AlphaGo 的改進版 Master 在網路快棋連勝 60 場對手包含多位世界級棋手
2017 年 5 月AlphaGo 在烏鎮以 3 比 0 擊敗柯潔世界排名第一的棋手也未能取勝
2017 年 10 月AlphaGo Zero 發表:完全不使用人類棋譜、從零開始自我對弈三天訓練的版本以 100 比 0 擊敗擊敗李世乭的版本
2017 年 12 月AlphaZero 以同一套方法處理圍棋、西洋棋與將棋證明方法可跨遊戲,不依賴人類知識
2017 年至 2019 年Leela Zero 與 KataGo 相繼開源職業與業餘棋手都能在個人電腦上使用超越人類的棋力
2019 年 11 月李世乭宣布退役,並提到人工智慧是「無法被擊敗的存在」人類職業圈的心態轉折

AlphaGo Zero 的 40 天訓練版本,另在論文中報告以 89 比 11 擊敗 Master。以上數字出自 DeepMind 與研究者公開發表的論文與賽事紀錄。

二、技術骨幹:策略網路、價值網路與蒙地卡羅樹搜尋

這批系統的核心可以拆成三個部件,理解它們就能理解為什麼它們強:

  • 策略網路(policy network):輸入盤面,輸出「每個落點值得考慮的程度」。它把原本約 250 個合法落點的選擇範圍,縮小成少數幾個有意義的候選。
  • 價值網路(value network):輸入盤面,直接輸出「目前誰贏的機率」。它取代了過去必須下到終局才能評估的昂貴模擬。
  • 蒙地卡羅樹搜尋(MCTS):在策略網路的引導下展開搜尋樹,並用價值網路評估葉節點,把多次搜尋的結果匯總成最後的落點。

早期的 AlphaGo 先用人類棋譜做監督式學習,再以自我對弈強化。AlphaGo Zero 則完全跳過人類棋譜,把策略與價值合併成同一個網路,只靠規則與自我對弈就超越了前一代。這件事的重要性在於:它證明了人類的歷史棋譜不是棋力的必要條件,有時甚至是限制。想深入搜尋樹深度如何影響棋力,可以參考站內的圍棋 AI 搜尋樹深度分析。

三、對人類下法的具體影響

1. 被視為「錯誤」的下法,被重新評價

最有名的例子是 2016 年第二局中 AlphaGo 的第 37 手:一著下在五路的肩衝。傳統觀念認為這種位置偏低、效率差,當時現場的職業棋手與解說都感到意外,但後來的分析顯示它在全局布局上有深遠的作用。同一系列的第四局,李世乭下出的第 78 手挖,也被稱為「神之一手」,並使 AlphaGo 出現了判斷失誤——這也是人類在該系列中唯一的一勝。

2. 開局模式的轉變

AI 流行之後,職業棋局出現了幾個可觀察的趨勢:開局階段更常出現過去被視為偏門的下法(例如較早的三三入侵)、更積極地使用肩衝與五路作戰、對「厚薄」與「實地」的取捨標準也被重新校正。具體頻率與勝率變化,各大棋譜資料庫都有統計,讀者可以自己查證。

3. 評價標準:最大化勝率,而不是目數

這是很多業餘棋手忽略的關鍵差異。AI 追求的是「獲勝機率」,不是「贏幾目」。因此 AI 在領先時經常選擇看似保守、甚至讓出目數的下法來降低風險。人類棋手習慣用目數思考,若盲目模仿 AI 的這類落子而不理解其背後的勝率邏輯,反而會出現「學了形、沒學到意」的問題。

四、AI 並非無敵:對抗策略與可解釋性問題

2022 年至 2023 年間,研究團隊(Wang 等人,發表於 ICML 2023)找到了針對 KataGo 的對抗策略:他們訓練出的對抗模型,利用 KataGo 的判斷盲點,在具備超人類搜尋量的設定下取得超過 97% 的勝率。更值得注意的是,論文指出這套策略可以被人類專家理解並實作,不需要演算法輔助,就能擊敗超人類的圍棋 AI;而這個對抗模型本身,卻連業餘棋手都贏不了。

這個發現的意義不在「AI 其實不強」,而在於:AI 的強大是統計意義上的,不是邏輯意義上的。它在絕大多數自然出現的局面中遠超人類,但在極少數它從沒遇過的結構中,可能出現人類一眼就能看出的錯誤。

另一個長期問題是可解釋性:AI 告訴你「這手勝率高 3%」,卻不告訴你為什麼。這使得人類必須自己從勝率曲線反推原因,而這個過程本身就是學習。

五、延伸到麻將與不完全資訊遊戲

圍棋是完全資訊遊戲,雙方看得見全部盤面。麻將則是不完全資訊遊戲,看不見對手手牌,還有大量隨機性。這使得 AlphaGo 那一套搜尋方法不能直接搬用。微軟亞洲研究院在 2020 年公開的 Suphx 結合了深度強化學習與針對麻將設計的訓練方式,在天鳳平台達到十段;之後也出現了開源的麻將 AI。這些系統的出現,使得Suphx 的策略分析與麻將 AI 的演進成為研究麻將策略時不可忽略的資料來源。

六、如何有效閱讀 AI 的棋譜

  1. 看勝率的「變化量」,而不是勝率本身。某一手讓勝率下降超過數個百分點,才是值得複盤的失誤;差一兩個百分點多半是等價的選擇。
  2. 先自己想,再看 AI。在翻到 AI 推薦的下一手之前,先寫下你認為的最佳手與理由,再比對。落差大的地方,就是你的知識缺口。
  3. 分辨「AI 的選擇」與「AI 的理由」。AI 給的是選擇。理由要靠你自己,用變化圖往後推幾手去看。
  4. 不要在局面不明時盲目模仿。AI 的招法是為它自己的讀秒深度與勝率標準設計的,人類在沒有同等讀深的情況下直接模仿,風險不同。

關於 AI 對職業訓練方法的影響,可以延伸閱讀站內的AlphaGo 如何改寫圍棋訓練。

陳
陳信宏
圍棋 AI 研究員

專注圍棋AI對局研究,長期追蹤機器學習如何革新傳統棋藝的理解方式。

常見問題

AlphaGo 與 AlphaGo Zero 最大的差別是什麼?

AlphaGo 先用人類棋譜做監督式學習再自我對弈,AlphaGo Zero 完全不使用人類棋譜,只靠規則與自我對弈。論文報告 Zero 的三天版本以 100 比 0 擊敗擊敗李世乭的版本。

AI 為什麼有時會下出看起來『讓目』的棋?

因為 AI 的目標是最大化獲勝機率,而不是最大化贏的目數。領先時為了降低風險,AI 可能選擇讓出目數但更安全的下法。

頂尖圍棋 AI 還有弱點嗎?

有。2022 至 2023 年的研究發現,針對 KataGo 的對抗策略,在超人類搜尋量的設定下勝率超過 97%,論文指出人類專家也能實作這套策略。這說明 AI 的強大是統計意義上的。

業餘棋手該怎麼用 AI 學習?

先自己思考再看 AI 的推薦手,重點看勝率的變化量而不是單一手的絕對勝率,並用變化圖去理解理由,而不是照抄招法。

資料來源與說明

  • Silver 等人,《Mastering the game of Go with deep neural networks and tree search》,Nature,2016。
  • Silver 等人,《Mastering the game of Go without human knowledge》,Nature,2017(AlphaGo Zero)。
  • Silver 等人,《A general reinforcement learning algorithm that masters chess, shogi and Go through self-play》,Science,2018(AlphaZero)。
  • David J. Wu,《Accelerating Self-Play Learning in Go》,2019(KataGo)。
  • Wang 等人,《Adversarial Policies Beat Superhuman Go AIs》,ICML 2023。
  • Li 等人,《Suphx: Mastering Mahjong with Deep Reinforcement Learning》,微軟亞洲研究院,2020。
  • 賽事結果與李世乭退役消息,出自當時的公開新聞報導。