一、關鍵里程碑時間線
| 時間 | 事件 | 意義 |
|---|---|---|
| 2015 年 10 月 | AlphaGo 以 5 比 0 擊敗歐洲冠軍樊麾(成果於 2016 年 1 月刊於《Nature》) | 首次在讓子以外的正式比賽中擊敗職業棋手 |
| 2016 年 3 月 | AlphaGo 在首爾以 4 比 1 擊敗李世乭 | 擊敗當代頂尖棋手,引發全球關注 |
| 2016 年底至 2017 年初 | AlphaGo 的改進版 Master 在網路快棋連勝 60 場 | 對手包含多位世界級棋手 |
| 2017 年 5 月 | AlphaGo 在烏鎮以 3 比 0 擊敗柯潔 | 世界排名第一的棋手也未能取勝 |
| 2017 年 10 月 | AlphaGo Zero 發表:完全不使用人類棋譜、從零開始自我對弈 | 三天訓練的版本以 100 比 0 擊敗擊敗李世乭的版本 |
| 2017 年 12 月 | AlphaZero 以同一套方法處理圍棋、西洋棋與將棋 | 證明方法可跨遊戲,不依賴人類知識 |
| 2017 年至 2019 年 | Leela Zero 與 KataGo 相繼開源 | 職業與業餘棋手都能在個人電腦上使用超越人類的棋力 |
| 2019 年 11 月 | 李世乭宣布退役,並提到人工智慧是「無法被擊敗的存在」 | 人類職業圈的心態轉折 |
AlphaGo Zero 的 40 天訓練版本,另在論文中報告以 89 比 11 擊敗 Master。以上數字出自 DeepMind 與研究者公開發表的論文與賽事紀錄。
二、技術骨幹:策略網路、價值網路與蒙地卡羅樹搜尋
這批系統的核心可以拆成三個部件,理解它們就能理解為什麼它們強:
- 策略網路(policy network):輸入盤面,輸出「每個落點值得考慮的程度」。它把原本約 250 個合法落點的選擇範圍,縮小成少數幾個有意義的候選。
- 價值網路(value network):輸入盤面,直接輸出「目前誰贏的機率」。它取代了過去必須下到終局才能評估的昂貴模擬。
- 蒙地卡羅樹搜尋(MCTS):在策略網路的引導下展開搜尋樹,並用價值網路評估葉節點,把多次搜尋的結果匯總成最後的落點。
早期的 AlphaGo 先用人類棋譜做監督式學習,再以自我對弈強化。AlphaGo Zero 則完全跳過人類棋譜,把策略與價值合併成同一個網路,只靠規則與自我對弈就超越了前一代。這件事的重要性在於:它證明了人類的歷史棋譜不是棋力的必要條件,有時甚至是限制。想深入搜尋樹深度如何影響棋力,可以參考站內的圍棋 AI 搜尋樹深度分析。
三、對人類下法的具體影響
1. 被視為「錯誤」的下法,被重新評價
最有名的例子是 2016 年第二局中 AlphaGo 的第 37 手:一著下在五路的肩衝。傳統觀念認為這種位置偏低、效率差,當時現場的職業棋手與解說都感到意外,但後來的分析顯示它在全局布局上有深遠的作用。同一系列的第四局,李世乭下出的第 78 手挖,也被稱為「神之一手」,並使 AlphaGo 出現了判斷失誤——這也是人類在該系列中唯一的一勝。
2. 開局模式的轉變
AI 流行之後,職業棋局出現了幾個可觀察的趨勢:開局階段更常出現過去被視為偏門的下法(例如較早的三三入侵)、更積極地使用肩衝與五路作戰、對「厚薄」與「實地」的取捨標準也被重新校正。具體頻率與勝率變化,各大棋譜資料庫都有統計,讀者可以自己查證。
3. 評價標準:最大化勝率,而不是目數
這是很多業餘棋手忽略的關鍵差異。AI 追求的是「獲勝機率」,不是「贏幾目」。因此 AI 在領先時經常選擇看似保守、甚至讓出目數的下法來降低風險。人類棋手習慣用目數思考,若盲目模仿 AI 的這類落子而不理解其背後的勝率邏輯,反而會出現「學了形、沒學到意」的問題。
四、AI 並非無敵:對抗策略與可解釋性問題
2022 年至 2023 年間,研究團隊(Wang 等人,發表於 ICML 2023)找到了針對 KataGo 的對抗策略:他們訓練出的對抗模型,利用 KataGo 的判斷盲點,在具備超人類搜尋量的設定下取得超過 97% 的勝率。更值得注意的是,論文指出這套策略可以被人類專家理解並實作,不需要演算法輔助,就能擊敗超人類的圍棋 AI;而這個對抗模型本身,卻連業餘棋手都贏不了。
這個發現的意義不在「AI 其實不強」,而在於:AI 的強大是統計意義上的,不是邏輯意義上的。它在絕大多數自然出現的局面中遠超人類,但在極少數它從沒遇過的結構中,可能出現人類一眼就能看出的錯誤。
另一個長期問題是可解釋性:AI 告訴你「這手勝率高 3%」,卻不告訴你為什麼。這使得人類必須自己從勝率曲線反推原因,而這個過程本身就是學習。
五、延伸到麻將與不完全資訊遊戲
圍棋是完全資訊遊戲,雙方看得見全部盤面。麻將則是不完全資訊遊戲,看不見對手手牌,還有大量隨機性。這使得 AlphaGo 那一套搜尋方法不能直接搬用。微軟亞洲研究院在 2020 年公開的 Suphx 結合了深度強化學習與針對麻將設計的訓練方式,在天鳳平台達到十段;之後也出現了開源的麻將 AI。這些系統的出現,使得Suphx 的策略分析與麻將 AI 的演進成為研究麻將策略時不可忽略的資料來源。
六、如何有效閱讀 AI 的棋譜
- 看勝率的「變化量」,而不是勝率本身。某一手讓勝率下降超過數個百分點,才是值得複盤的失誤;差一兩個百分點多半是等價的選擇。
- 先自己想,再看 AI。在翻到 AI 推薦的下一手之前,先寫下你認為的最佳手與理由,再比對。落差大的地方,就是你的知識缺口。
- 分辨「AI 的選擇」與「AI 的理由」。AI 給的是選擇。理由要靠你自己,用變化圖往後推幾手去看。
- 不要在局面不明時盲目模仿。AI 的招法是為它自己的讀秒深度與勝率標準設計的,人類在沒有同等讀深的情況下直接模仿,風險不同。
關於 AI 對職業訓練方法的影響,可以延伸閱讀站內的AlphaGo 如何改寫圍棋訓練。