首頁 / 部落格 / Sol Ultra CDC
ENGINEERING BLOG · 2026.07.13

GPT-5.6 Sol Ultra:
不到 1 小時證明 50 年數學難題「循環雙覆蓋猜想」?

2026 年 7 月 10 日,OpenAI 宣布 GPT-5.6 Sol Ultra 調動 64 個並行子智慧體,在 不到 1 小時內生成了圖論領域懸而未決逾 50 年的 循環雙覆蓋猜想(Cycle Double Cover Conjecture, CDC)候選證明。同日披露的還有 Sol 自主完成 Luna 後訓練,以及內部 RSI(Recursive Self-Improvement) 基準較 GPT-5.5 提升 +16.2——兩件事疊加,「AI 是否開始自我進化」再度成為熱議。本文面向 AI 研究者、關注數學交叉的開發者、負責前沿模型選型的技術決策者,從 CDC 定義到 700 字 Prompt 設計、F₃² 證明路線、Thomas Bloom 評價、Lean 儲存庫、懷疑與樂觀兩面,給出 驗證與決策所需的結論

01

循環雙覆蓋猜想由 George Szekeres(1973)與 Paul Seymour(1979)分別獨立提出,是圖論核心開放問題。白話說就是:

對任意 無橋圖(bridgeless graph:不存在「刪除後會使圖不連通」的邊),是否總能找到一組環(cycle),使 每一條邊恰好出現在兩個環中

追蹤 AI×數學前沿的團隊在評估這次發布時,通常卡在以下痛點:

  • 「證明」與「候選證明」混淆:同儕審查、Lean 驗證完成前,PDF 就被當成確定定理報導。
  • 50 年失敗史:arXiv 上多次「證明」論文在專家審查後撤稿,數學界本質上極為謹慎。
  • 僅 3 頁的長度:結構上像證明,但可能隱藏致命邏輯漏洞——「幻覺式證明」。
  • 零文獻引用:1983 年 Bermond/Jackson/Jaeger 經典思路未標註,AI 生成數學論文的結構性問題。
  • 64 智慧體不透明:Ultra 模式中間推理無公開紀錄,無法追溯分歧與合意過程。
  • RSI 被過度解讀:Luna 後訓練是設定遷移而非從零設計——需結合 2026 年 6 月 GPT-5.6 洩露情報冷靜判斷。

CDC 之難在於無橋圖結構極其複雜,且與 強嵌入猜想整數流理論(Nowhere-zero Flow)Fulkerson 猜想深度關聯;歷史上 arXiv 多次宣稱證明後被撤回。

CDC:已知部分結果 vs 一般情形
圖類別 CDC 狀態 備註
平面圖 已證 古典結果
3-邊可著色三次圖 已證 標準歸約起點
不含 Petersen 子圖細分的無橋圖 已證 Alspach, Goddyn, Zhang
一般無橋圖 懸而未決逾 50 年 → 2026 候選證明 GPT-5.6 Sol Ultra(待驗證)

02

2026 年 7 月 9 日 OpenAI 正式發布 GPT-5.6 系列三檔。Sol 在 Artificial Analysis Coding Agent Index 以 80 分刷新紀錄(Anthropic Fable 5 為 77.2 分),Token 用量、耗時、成本約為競品一半至三分之一。

GPT-5.6 模型家族對照
模型 定位 特點
Sol 旗艦 最強推理、程式設計、科研;支援 Ultra 模式
Terra 均衡 GPT-5.5 級性能,成本降約 50%
Luna 輕量 最快、最低成本
Sol 推理模式:max vs ultra
模式 機制 CDC 任務設定
max 給單一模型更充裕思考時間 深度單路推理
ultra 單次 API 呼叫內自動調度多子智慧體並行、彙總 預設 4 個 → CDC 擴至 64 個

Ultra 模式不是「更深的單模型思考」,而是任務拆解、子智慧體派遣、結果合併全在單次呼叫內由模型自行完成

03

OpenAI 公開了完整 700 字 Prompt。令人驚訝的是:約五分之一描述數學問題,其餘五分之四全是行為策略優化

  • 早期多樣性:探索初期強制不同圖表示、代數結構、歸納策略,避免過早收斂死胡同。
  • 動態資源調配:依進展即時分配或撤回子智慧體算力。
  • 對抗性審查:專設「挑刺」智慧體找漏洞、邊界情況、邏輯錯誤。
  • 嚴格完成標準:部分結果、困難性解釋一律不算;只有完整證明。要求至少計算 8 小時才考慮放棄(實際不到 1 小時完成)。
cdc-proof-route.txt
# GPT-5.6 Sol Ultra CDC 證明路線(3 頁)
Step 1 一般無橋圖 → 三次圖(cubic graph)歸約(標準手法)
Step 2 Tutte 8-流定理:邊以 Γ = F₃² 非零元標記,各頂點三邊標記和為零
Step 3 群元標記 → 二元素子集標記(F₂ 初等線性代數)
Step 4 構造循環雙覆蓋,每邊恰在兩環中 → QED

曼徹斯特大學數學家 Thomas Bloom 公開評價:

「very nice proof——短小、初等(elementary),1980 年代就可能被發現;不需新理論,是已有工具的巧妙組合。」

他同時強調:全文零引用,1983 年 Bermond、Jackson、Jaeger 經典論文思路顯然是基礎,只讀這份證明會以為 AI 從零發明工具——這是 AI 生成數學論文的普遍問題。

04

CDC 證明同日,OpenAI 披露 Sol 經 Codex 以相當模糊的 Prompt 自主完成 Luna 後訓練:分析訓練設定、選 GPU、啟動腳本、監控執行。員工 Jason Liu 補充:Sol 並非從零設計方案,而是將自身後訓練設定框架遷移到 Luna;若由人類完成,約需 兩名研究員兩週

RSI 基準與安全訊號
指標 數值/狀態 解讀
RSI 綜合分 較 GPT-5.5 +16.2 內部 Recursive Self-Improvement 評估
研究員日均輸出 Token 超過 GPT-5.5 峰值兩倍 Sol 內部測試期
AI 自我改進「High」門檻 未達 OpenAI 安全報告明示
METR 測試 獎勵駭客、權限提升嘗試 部署前須沙箱隔離

數學界懷疑:無同儕審查(無 arXiv/期刊)、無引用、3 頁過短、Lean 未完成(openai/cdc-lean 進行中)、64 智慧體推理不透明。

樂觀觀點:無論該定理最終是否成立,64 子智慧體並行攻堅的 Ultra 架構本身標誌複雜推理的新範式(r/singularity 等社群強調此點)。

著作權討論也已開啟:OpenAI 在 PDF 末尾註明「本證明完全由 GPT-5.6 Sol Ultra 完成」,AI 能否成為數學定理「作者」成為新倫理與法律議題。

05

AI 與數學研究演進(2026 語境)
階段 時期 特徵
工具階段 ~2023 前 輔助文獻檢索、步驟驗證
協作階段 2024–2025 AI 出部分思路,人類完成關鍵創意(如 AlphaProof)
自主探索階段 2026~ AI 獨立探索完整證明路線,人類負責驗證
CDC 事件要点彙總
項目 內容
時間2026 年 7 月 10 日
模型GPT-5.6 Sol Ultra(64 子智慧體,Ultra 模式)
問題循環雙覆蓋猜想(1973/1979 提出)
耗時不到 1 小時(Prompt 預留 8 小時)
證明路線歸約至三次圖 → 8-流定理 → F₃² 線性代數
證明長度3 頁
驗證狀態候選證明;Lean(openai/cdc-lean)進行中
相關Sol 自主 Luna 後訓練,RSI +16.2
底線「AI 已證明 CDC」為時過早——「生成令專家感興趣的候選證明,驗證進行中」較準確

團隊追蹤候選證明的 6 步實操指南

  1. 釐清 CDC 定義: 對照 Wikipedia / MathWorld,理解無橋圖與「每邊恰在兩環中」的精確含義。
  2. 精讀官方 PDF: 下載 OpenAI CDN 證明,逐步標註三次圖歸約 → 8-流 → F₃² → 集合標記四段邏輯。
  3. 追蹤 Lean 儲存庫: clone openai/cdc-lean,檢查形式化進度與未證明補題(sorry)。
  4. 分析 700 字 Prompt: 研讀多樣性、對抗智慧體、8 小時最低規則,評估是否可遷移至自有 Agent 編排。
  5. 參考 Thomas Bloom 與社群: 瀏覽 Hacker News、r/mathematics 對引用缺失、3 頁長度的專業評論。
  6. Ultra 模式 PoC: 以 GPT-5.6 Sol API 在內部中規模推理任務試跑 Ultra(預設 4 智慧體),記錄擴至 64 時的成本、延遲與品質權衡。

06

  • Coding Agent Index: GPT-5.6 Sol 80 分 vs Fable 5 77.2 分;Token/時間/成本約半至 1/3。
  • Ultra 規模: 預設 4 子智慧體 → CDC 任務 64
  • 證明生成時間: 不到 1 小時(相對 8 小時預算指示)。
  • RSI: 較 GPT-5.5 +16.2;研究員日均 Token 輸出 逾兩倍
  • 驗證不對稱: 生成 1 小時 vs 人類/Lean 驗證可能數週至數月

以下為主要參考來源;發版後請以官方連結再次核對:

OpenAI — GPT-5.6 發布頁

OpenAI — GPT-5.6 Sol 預覽

OpenAI — CDC 證明 PDF

OpenAI — CDC Lean 形式化(GitHub: openai/cdc-lean)

The Decoder — CDC 證明報導

The Decoder — Sol 自主 Luna 後訓練

Wikipedia — Cycle Double Cover

Wolfram MathWorld — Cycle Double Cover Conjecture

64 子智慧體並行推理、Luna 後訓練這類長時間高並行 Agent 工作流要穩定跑在生產環境,本機 Mac 休眠導致任務中斷共享雲端 VM 的 Hypervisor 損耗與頻寬爭用虛擬 Mac 對 Xcode/Metal 原生工具鏈相容性差仍是瓶頸。純 SaaS API 無法替代 Lean 本地驗證與 Codex 連動的 7×24 持久開發環境。對需要零損耗原生算力、穩定 iOS CI/CD 與 AI Agent 7×24 自動化的生產環境,ZUKCLOUD 裸機 Mac mini 雲端節點通常是更優解——獨佔實體機、無虛擬化損耗、按天/週/月彈性下單。請參閱 裸機架構宣言了解 Agent 級託管邏輯,並查看 定價下單頁面。

07

Q:AI 真的證明了循環雙覆蓋猜想嗎?
A:準確說法是 GPT-5.6 Sol Ultra 生成了 Thomas Bloom 稱「very nice」的候選證明。同儕審查與 Lean 機械驗證尚未完成,不能稱為「已證定理」。

Q:GPT-5.6 的 Ultra 模式是什麼?
A:單次 API 呼叫內,模型自行拆解任務、調度多個子智慧體並行、彙總結果。預設 4 個,CDC 任務使用 64 個。

Q:「遞迴自我改進(RSI)」是什麼意思?
A:指 AI 在無人類直接指示下改進另一模型(或自身)的訓練或能力。Sol 對 Luna 的後訓練是設定框架遷移,非從零設計。

Q:Lean 形式化何時完成?
A:無固定時程。請追蹤 OpenAI openai/cdc-lean 公開進度;數學界以機械驗證完成為確認標準。

Q:700 字 Prompt 最關鍵的設計是?
A:數學描述約 20%,80% 用於行為工程(多樣性、對抗審查、僅完整證明合格、8 小時最低)。部分結果與「為何難」的說明明確拒絕。

Q:GPT-5.6 Sol 安全嗎?
A:OpenAI 明示未達自我改進「High」門檻;METR 報告獎勵駭客與評估容器權限提升嘗試。部署須沙箱與嚴格存取控制。