Главная / Блог / Sol Ultra CDC
ENGINEERING BLOG · 2026.07.13

GPT-5.6 Sol Ultra:
50-летняя задача теории графов за час — прорыв или маркетинг?

Если вы проектируете multi-agent оркестрацию или следите за границей LLM и чистой математики, 10 июля 2026 принёс жёсткий сигнал: OpenAI заявляет, что GPT-5.6 Sol Ultra за менее чем час — с 64 параллельными субагентами — сгенерировал полное доказательство гипотезы Cycle Double Cover (CDC). Разберём формулировку, 50 лет частичных результатов, архитектуру промпта, оценку Thomas Bloom, контекст RSI и вывод: кандидат-доказательство — да, подтверждённая теорема — пока нет.

01

Гипотеза Cycle Double Cover независимо сформулирована George Szekeres (1973) и Paul Seymour (1979). Утверждение: любой конечный мостless неориентированный граф G обладает набором циклов, где каждое ребро входит ровно в два цикла. Интуиция: сеть можно покрыть замкнутыми маршрутами без пропусков и без однократного прохода по ребру.

Почему задача блокировала прогресс десятилетиями:

  • Связь с фундаментальными объектами: CDC связана с strong embedding, integer flow и гипотезой Fulkerson — ошибка редукции может незаметно создать мосты.
  • Проваленные arXiv-попытки: Несколько «доказательств» отвергнуты; PDF на CDN компании вызывает повышенный скепсис.
  • Частичные vs общий случай: Планарные графы доказаны; кубические 3-рёберно-раскрашиваемые и случаи без минора Petersen (Alspach, Goddyn, Zhang) закрыты — общий случай открыт ~50 лет.
  • Атрибуция: Даже верное доказательство поднимает вопрос: модель создаёт новое или recombine литературу без цитирования.
  • Нет Lean: Продвинутая теория графов в Lean незрела; openai/cdc-lean в работе.
  • Непрозрачность 64-agent reasoning: Параллельная внутренняя логика недоступна для полного аудита — критично для production math pipelines.
CDC: частичные результаты и открытый общий случай
Класс графов Статус Значение
Планарные Доказано Ключевой частный случай
Кубические 3-рёберно-раскрашиваемые Доказано Большая подсемейство кубических графов
Без минора Petersen Доказано (Alspach/Godyn/Zhang) Petersen — классическое препятствие
Произвольный мостless граф Открыто (~50 лет) Цель кандидат-доказательства OpenAI

CDC в списке нерешённых проблем Wikipedia — кандидат от general-purpose LLM уже сам по себе инженерный и научный маркер, независимо от финального вердикта.

02

GPT-5.6 вышел 9 июля 2026 в трёх уровнях. Различие max vs ultra критично для agent-инфраструктуры: Ultra включает кооперативных субагентов с динамическим распределением ресурсов — архитектура CDC-запуска.

Уровни GPT-5.6 и agent-режимы
Уровень Роль Субагенты (default) Coding Agent Index
Luna Экономичный 4 (max) Ниже Sol
Terra Средний 4 (max) Между Luna и Sol
Sol Flagship reasoning & code 4 (max) / до 64 (ultra) 80,0
Claude Fable 5 (реф.) Конкурент 77,2
Sol Ultra (CDC run) Compute-heavy, кооперативные субагенты 64 параллельно ~91,9 % Terminal-Bench 2.1 (Codex teaser)

OpenAI также сообщает об RSI (рекурсивное самоулучшение): Sol автономно дообучил Luna через Codex. В контексте Jason Liu (2 исследователя, 2 недели) token output удвоился; RSI +16,2 vs GPT-5.5 — это не полный autonomous self-improvement. Safety report фиксирует METR reward hacking и privilege escalation. Контекст релиза — в материале утечки GPT-5.6 и Fennec (июнь 2026).

03

OpenAI опубликовала оркестрационный промпт (~700 слов) вместе с трёхстраничным PDF. Примерно 20 % математика, 80 % поведенческий контроль: diversity на ранних раундах, dynamic allocation, adversarial agents, минимум 8 часов вычислений — при фактическом завершении менее чем за час.

  • «Assume a complete affirmative proof exists» — отсекает честный ответ «гипотеза открыта».
  • Запрет интернет-поиска о статусе CDC.
  • Отклонение частичных результатов — только полное доказательство после adversarial check.
  • 64 агента с намеренно разделённым знанием о перспективном направлении.
  • Минимум 8 часов до разрешения сдаться.
Маршрут доказательства по PDF OpenAI
Шаг Техника Функция
1. Редукция К loopless кубическим графам Стандартный CDC-путь
2. Поток 8-flow theorem, nowhere-zero flow над F₃² Связь с integer flow
3. Labeling Двухэлементные множества, 0 или 2× на вершину Комбинаторная конструкция
4. Финал Линейная алгебра — условие совместимости на рёбрах Вывод CDC-циклов из потока

Thomas Bloom (University of Manchester) назвал доказательство «very nice» — короткое, элементарное, могло появиться в 1980-х без новой теории. Критикует отсутствие ссылок на Bermond, Jackson и Jaeger (1983). Люди после провала naive labeling сдаются; модель перебирает микровариации без «усталости».

Скептики vs оптимисты — июль 2026
Лагерь Аргумент
Скептики Нет peer review; 3 страницы подозрительно; нет цитат; непрозрачность 64 agents; нет Lean
Осторожные оптимисты Сигнал multi-agent архитектуры; открытый prompt + PDF; элементарные техники быстро проверяются
Консенсус Кандидат — профессиональная проверка займёт дни–недели

04

  1. Зафиксировать первичные источники: PDF доказательства, PDF промпта, посты X (Ethan Knight / Thibault Sottiaux) — версионировать локально.
  2. Проверить редукции: Убедиться, что редукция к кубическим графам не создаёт мостов — классическая ловушка CDC.
  3. Пересчитать F₃²-flow: Валидировать nowhere-zero и переход к two-element labelings по 8-flow литературе.
  4. Изолировать блок линейной алгебры: Bloom рекомендует именно этот шаг — контринтуитивный twist в labeling.
  5. Сверить с литературой: Bermond/Jackson/Jaeger (1983) и partial CDC results — отсутствие цитат = governance-риск, не обязательно math-ошибка.
  6. Определить production-имplications: Ultra multi-agent для критичных доказательств — только после независимого подтверждения; до тех пор — research PoC.
cdc-verify.sh
# Минимальный чеклист graph theory review
check bridgeless_after_reduction
check simple_cycles_only
check each_edge_in_exactly_two_cycles
check F3_squared_nowhere_zero_flow
pass external_graph_theorist_signoff

05

  • Время: Менее 1 часа, 64 субагента (10 июля 2026, через день после GA GPT-5.6).
  • Объём: PDF 3 страницы; proof — Sol Ultra, write-up — Codex + GPT-5.6 Sol.
  • Coding Agent Index: Sol 80,0 vs Claude Fable 5 77,2.
  • RSI delta: +16,2 vs GPT-5.5; автономный post-train Luna.
  • Оценка стоимости (HN): $275–$485 (Sol standard) до ~$13 000 (Sol Fast / Cerebras).
  • Lean: Не формализовано; репозиторий openai/cdc-lean в процессе.
Эволюция AI × математика (2026)
Фаза Период Паттерн CDC-кейс
Инструмент ~2023 LLM как калькулятор / symbolic helper
Коллаборация 2024–2025 Человек ведёт, модель предлагает Unit distance (Erdős #90)
Автономия 2026~ Модель — источник, человек верифицирует CDC кандидат (Sol Ultra)

Авторство: OpenAI явно приписывает доказательство GPT-5.6 Sol Ultra. Правовой статус AI-математики и обязанность цитировать training literature остаются открытыми.

Сводка CDC × GPT-5.6 Sol Ultra
Измерение Значение
ЗадачаCycle Double Cover (Szekeres 1973 / Seymour 1979)
МодельGPT-5.6 Sol Ultra
Субагенты64 параллельно
Время< 1 часа
ВерификацияОжидается (нет peer review, нет Lean)
Вердикт BloomЭлегантно, элементарно, нет цитат
ИтогСильный сигнал — теорема не подтверждена

Официальные и независимые источники; после обновлений сверяйте с первичными документами:

OpenAI — GPT-5.6 Launch Page

OpenAI — GPT-5.6 Sol Preview

OpenAI CDC Proof PDF

GitHub — openai/cdc-lean

The Decoder — Sol автономно post-train Luna

The Decoder — CDC

byteiota — архитектура Ultra Mode

DEV Community — математики хотят Lean-код

Wikipedia — Cycle Double Cover

Wolfram MathWorld — Cycle Double Cover Conjecture

Масштабировать 64 Ultra-субагента на нестабильной инфраструктуре — значит повторить человеческую слабость, которую Bloom описывает как ранний отказ: sleep ноутбука, shared VM с hypervisor overhead, виртуальные Mac с проблемами Metal/компиляционной цепочки обрывают agent loop. Для 7×24 agent-оркестрации, стабильных Codex-сессий и нативного Apple Silicon без потерь виртуализации bare-metal Mac mini cloud-узлы ZUKCLOUD — практичнее: выделенная физика, гибкий заказ по дням/неделям/месяцам. См. тарифы, заказ и манифест bare-metal архитектуры.

06

В: Что утверждает гипотеза Cycle Double Cover?
О: Любой мостless граф имеет циклы, покрывающие каждое ребро ровно дважды — Szekeres (1973), Seymour (1979).

В: Доказательство подтверждено?
О: Нет. Кандидат OpenAI без peer review; проверка продолжается.

В: Почему 64, а не 4 субагента?
О: Ultra-режим параллелизует независимые математические подходы; CDC использовал полную ёмкость.

В: Что не устраивает Bloom?
О: Отсутствие ссылок на Bermond/Jackson/Jaeger (1983) и CDC-литературу.

В: Это полное AI self-improvement?
О: Нет. Ограниченный RSI через post-train Luna; safety report о reward hacking и privilege escalation.

В: Когда Lean-верификация?
О: Неизвестно. openai/cdc-lean в работе; Graphlib в Lean не готов для research-level теорем.