首頁 / 部落格 / MAI 自研模型
ENGINEERING BLOG · 2026.07.14

Microsoft Build 2026 MAI 模型:
7 款自研 AI 模型、基準測試與後 OpenAI 時代策略

若你的團隊運行在 Azure 與 GitHub Copilot 之上,Microsoft Build 2026(2026 年 7 月 14 日)是不容錯過的轉折點:Microsoft 正式推出 七款 MAI 自研模型——涵蓋推理、影像、轉寫、語音與程式設計——以及用於本機推論的 Surface RTX Spark Dev Box。本文面向開發者與技術主管,針對 Microsoft 在累計 1,300 億美元 OpenAI 投資與 2025 年底合約重談之後,能否獨立站穩給出務實判斷。你將取得每款模型的參數與基準測試、定價對照表、對 GPT-5.6Claude Opus 4.8 的追趕分析、含 Python 程式碼的六步 Azure 整合指南,以及七則關於可用性、共存與資料所有權的 FAQ。

01

Microsoft 在 2020 年代的大部分 AI 策略,由一項合作定義:累計 1,300 億美元投資 OpenAI,換取 Azure 獨家代管權與深度 Copilot 整合——同時也在成本、資料主權與產品獨立性上施加硬性限制。每一項 Copilot 功能、每一個 Azure OpenAI 部署、每一份企業合約,都附帶營收分成與合約上限,限制 Microsoft 能將自研前沿模型推多遠。

轉折發生在 2025 年底:OpenAI 合作合約重談,獨家限制解除。Microsoft AI 執行長 Mustafa Suleyman 公開描述這個時刻——約在 Build 2026 前 六個月,他說 Microsoft AI 已被 「set free」(解放),得以自主推進前沿研究,無需等待 OpenAI 路線圖核准。Build 2026 是這份獨立後的首波完整產品:七款由 Microsoft 訓練、代管並定價的 MAI 模型。

Suleyman 的公開目標是讓 Microsoft AI 躋身全球 前四大實驗室,與 OpenAI、Anthropic、Google 並列。Build 2026 並未宣稱在每項基準測試上全面領先,但提出另一種策略差異:涵蓋推理、影像、語音、程式的全棧模型家族,透過全球最大企業軟體通路分發。

評估 MAI 陣容的團隊,通常會遇到以下摩擦點:

  • 基準測試行銷 vs 獨立結果:Microsoft 行銷將 MAI-Thinking-1 對標 Opus 4.6,但獨立盲測實際對手為 Sonnet 4.6——宣稱層級與測試對手存在落差。
  • 私有預覽門檻:旗艦推理模型尚未正式上線;目前僅 MAI-Code-1-Flash 在 Copilot 生產工作流中可用。
  • 雙模型架構複雜度:Azure 同時代管 OpenAI 與 MAI 模型,架構師必須設計路由、成本與資料主權政策,橫跨兩個模型家族。
  • 迭代速度:OpenAI 與 Anthropic 每季推出前沿更新;Microsoft 自「解放」到首波自研模型歷時六個月——發版節奏能否追上仍是開放問題。
  • 基礎設施深度:從零訓練約 1T 參數 MoE 需要 GPU 叢集,Microsoft 仍在擴充;Surface RTX Spark 解決開發者邊緣端,而非資料中心訓練。
  • 工作流 vs 基準測試落差:MAI-Code-1-Flash 已在 GitHub Copilot 實際運行——這是 SWE-Bench 分數單獨無法衡量的通路優勢。

Microsoft 在 Build 2026 的賭注不是「我們在每張圖表上打敗 Opus」,而是「我們擁有全棧——模型、通路、主權與價格——讓企業不必在 Azure 與前沿 AI 之間二選一」。

02

Microsoft 在 Build 2026 公布七個 MAI 模型端點,涵蓋推理、多模態生成、語音與程式設計。以下依模型逐一整理舞台上公布的參數、基準測試與定價。

MAI-Thinking-1——旗艦推理模型

MAI-Thinking-1 採稀疏混合專家(MoE)架構,350 億活躍參數、總參數約 1 兆。支援 256K token 上下文視窗,且 從零訓練、未經蒸餾其他前沿模型。可用性:私有預覽,透過 Azure AI Foundry(尚未公布正式上線日期)。

MAI-Thinking-1 公布基準測試(Build 2026)
基準測試 MAI-Thinking-1 競品參考
SWE-Bench Pro 52.8% Opus 4.8:69.2%;GPT-5.5:58.6%
SWE-Bench Verified 73.5%
AIME 2025 97%
AIME 2026 94.5%
LiveCodeBench v6 87.7%
盲測偏好 勝過 Sonnet 4.6 行銷宣稱 Opus 4.6;獨立報導實測對手為 Sonnet 4.6

現實檢視:Microsoft 舞台簡報將 MAI-Thinking-1 對標 Claude Opus 4.6。現場獨立報導指出,盲測偏好實際對手為 Sonnet 4.6,而非 Opus。在硬體程式設計基準上,Opus 4.8 以 69.2% SWE-Bench Pro 領先,GPT-5.5 為 58.6%——MAI-Thinking-1 處於具競爭力但非領先的代理式軟體工程層級。

MAI-Image-2.5——文字轉影像與編輯

MAI-Image-2.5 在文字轉影像 Arena 排行榜位列 第 3、影像編輯 第 2。支援結構引導生成且保留主體身分的控制工作流,並直接整合至 PowerPointOneDrive,供應用內生成與編輯。

MAI-Image-2.5 API 定價(每 100 萬 token)
層級 輸入 輸出 備註
Standard $5 $8 完整品質生成
Premium $47 高保真輸出層級
Flash $1.75 $33 低延遲變體

MAI-Transcribe-1.5——語音轉文字

MAI-Transcribe-1.5 支援 43 種語言,FLEURS 詞錯率 4.9%、美式英語 WER 2.4%。以 276 倍即時速度處理音訊,較前代延遲改善 5.7 倍。情境偏置(contextual biasing)讓開發者注入領域詞彙(產品名稱、醫學術語)而無需微調。定價:每音訊小時 $0.36

MAI-Voice-2——文字轉語音與聲音克隆

MAI-Voice-2 支援從短參考片段進行 零樣本聲音克隆情緒風格控制(中性、興奮、沉穩等),以及 15 種以上語言。輸出格式:24 kHz MP3。定價:每 100 萬字元 $22Flash 變體即將推出,供低延遲場景使用。

MAI-Code-1-Flash——生產級程式設計模型

MAI-Code-1-Flash 是唯一已進入開發者工作流的 MAI 模型:截至 Build 2026,它驅動 GitHub CopilotVS CodeGitHub Actions。提供 256K 上下文視窗,SWE-Bench 得分 51%,在 Microsoft 公布的對照中勝過 Claude Haiku 4.5。API 定價:輸入每 100 萬 token $0.75輸出每 100 萬 token $4.50

MAI 家族——可用性與定價摘要
模型 狀態 關鍵指標 定價錨點
MAI-Thinking-1 私有預覽 SWE-Bench Pro 52.8% 待定
MAI-Image-2.5 API 已上線 Arena 文字轉影像第 3 $5/$8 每 100 萬 token
MAI-Transcribe-1.5 API 已上線 FLEURS WER 4.9% $0.36/音訊小時
MAI-Voice-2 API 已上線 零樣本克隆、15+ 語言 $22/100 萬字元
MAI-Code-1-Flash Copilot 已上線 SWE-Bench 51% 輸入 $0.75 / 輸出 $4.50 每 100 萬

03

除了雲端 API,Microsoft 還公布了 Surface RTX Spark Dev Box——一般消費者可購買的本機推論工作站,採 NVIDIA RTX Spark Blackwell + Grace 架構,128 GB 統一記憶體,在 100W TDP 下提供約 1 PFLOP 算力。機身為鋁合金加工,具 1,000 個精密散熱孔,以被動加主動冷卻維持緊湊外型。

出廠預裝 WSL2CUDAVS Code。Microsoft 示範在裝置上本機運行 120B+ 參數模型,上下文最高 100 萬 token。上市時間:2026 年秋季,於 Microsoft.com(美國)。售價:待定。與過往 Surface Pro 僅限企業的定位不同,一般消費者可直接購買

Surface RTX Spark Dev Box——硬體規格
規格 數值
處理器 NVIDIA RTX Spark(Blackwell + Grace)
統一記憶體 128 GB
算力 約 1 PFLOP @ 100W
本機模型容量 120B+ 參數、100 萬 token 上下文
預裝堆疊 WSL2、CUDA、VS Code
上市時間 2026 年秋季,Microsoft.com(美國)
售價 待定——開放一般消費者購買

Dev Box 將 Microsoft 置入與 Apple Silicon Mac 相同的本機 AI 開發賽道——但走 NVIDIA CUDA 而非 Metal。對已運行雲端加本機混合工作流的團隊,它是 MAI 雲端 API 的互補路徑,而非取代方案。

04

Suleyman 的公開目標明確:Microsoft AI 在能力與採用率上躋身 前四大實驗室。Build 2026 是首份證據包。以下是 Microsoft 當前領先處、落後處與策略賭注的務實評估。

Microsoft 當前優勢:

  • 通路分發:GitHub Copilot(1 億+ 使用者)、M365 Copilot、Windows Copilot 與 Azure AI Foundry,讓 MAI 模型瞬間觸及獨立實驗室無法比擬的規模。
  • 資料主權:MAI 模型完全在 Azure 租用戶內運行——對無法將提示詞路由至 OpenAI 基礎設施的受監管產業至關重要。
  • 成本結構:MAI 推論無 OpenAI 營收分成;MAI-Code-1-Flash 輸入 $0.75 / 輸出 $4.50 每 100 萬 token,低於多數前沿替代方案。
  • 廣度:七個模型端點(推理、影像、轉寫、語音、程式,含 Flash 變體)在單一廠商合約內覆蓋完整企業 AI 堆疊。
  • MAI-Code 已上線:與 MAI-Thinking-1(私有預覽)不同,MAI-Code-1-Flash 今日已在 Copilot 生產環境運行——真實工作流影響,而非路線圖簡報。

仍存在的落差:

  • SWE-Bench vs Opus 4.8:MAI-Thinking-1 以 52.8% 落後 Opus 4.8(69.2%)逾 16 個百分點,在最嚴苛的代理式程式設計基準上差距明顯。
  • 迭代速度:從「解放」到首波模型歷時六個月;OpenAI 與 Anthropic 發布有意義更新的節奏更快。
  • 訓練基礎設施:從零訓練約 1T MoE 令人印象深刻,但 Microsoft 仍依賴 NVIDIA 叢集,尚未展現專職 AI 實驗室的訓練規模效率。
  • MAI-Thinking 門檻:旗艦推理模型僅私有預覽——企業尚無法將生產代理工作負載路由至該模型。
前沿模型對照——SWE-Bench Pro 與策略定位
模型 SWE-Bench Pro 上下文 可用性 策略優勢
Claude Opus 4.8 69.2% 200K 正式 API 程式設計準確度領先
GPT-5.5 58.6% 256K 正式 API + ChatGPT 生態系 + 推理深度
MAI-Thinking-1 52.8% 256K 私有預覽 Azure 主權 + MoE 效率
MAI-Code-1-Flash 51.0% 256K Copilot 已上線 最低成本 + 原生 IDE 整合
結論 Microsoft 在工作流通路與企業封裝上取勝;在原始前沿基準上落後。賭注是廣度加主權,而非單一模型霸權。

策略洞察——工作流 vs 基準測試:原始 SWE-Bench 分數對研究可信度重要,但多數企業開發者從不直接呼叫 API。他們在 IDE 內用 Copilot、在 Actions CI 中用 Copilot、在 VS Code 中用 Copilot Chat。MAI-Code-1-Flash 已在這條路徑上。Microsoft 的護城河不是「我們打敗 Opus」——而是「你現有的工具鏈變得更便宜、更具主權,而你無需改變任何習慣」。

短期結論(2026 Q3–Q4):今日即可將 MAI-Code-1-Flash 用於成本敏感的 Copilot 工作負載。在 MAI-Thinking-1 正式上線前,勿將代理式任務從 Opus 或 GPT-5.6 遷走。2026 年秋季 Surface RTX Spark Dev Box 定價公布後,再評估本機原型開發。

中期結論(2027):若 Microsoft 以第二代 MoE 正式推出 Thinking-1,將 SWE-Bench 落差縮至 Opus 10 個百分點以內,並維持每季迭代節奏,前四大目標將具可信度。若 Thinking-1 長期停留預覽、OpenAI 持續推出 GPT-5.7+,落差將擴大,MAI 將更像企業合規方案而非前沿實驗室。

05

MAI 模型開發者可用性(2026 年 7 月)
模型 Azure AI Foundry API GitHub Copilot VS Code M365 / Windows
MAI-Thinking-1 私有預覽
MAI-Image-2.5 正式上線 擴充功能 PowerPoint、OneDrive
MAI-Transcribe-1.5 正式上線 Teams(規劃中)
MAI-Voice-2 正式上線
MAI-Code-1-Flash 正式上線 已上線 已上線

若要從自有應用程式透過 Azure OpenAI 相容 API 呼叫 MAI-Code-1-Flash,請依下列六步操作:

  1. 建立 Azure AI Foundry 資源:在 Azure 入口網站,於目標區域佈建 Azure AI Foundry 專案。確認你的訂閱層級已啟用 MAI 模型家族。
  2. 部署 mai-code-1-flash:在 Azure AI Foundry 模型目錄中選取 mai-code-1-flash 並建立部署。記下端點 URL 與部署名稱。
  3. 產生 API 憑證:在專案「金鑰與端點」區段複製 API 金鑰。存入密鑰管理服務——切勿提交至儲存庫。
  4. 安裝 OpenAI Python SDK:執行 pip install openai(v1.x 或更新版本)。Azure OpenAI 用戶端使用相同 SDK,僅基礎 URL 不同。
  5. 設定用戶端並傳送測試請求:使用下方程式碼區塊。將 YOUR_ENDPOINTYOUR_API_KEYYOUR_DEPLOYMENT 替換為你的值。
  6. 整合至 CI/CD 管線:將 GitHub Actions 工作或 VS Code 任務路由至同一端點。為每項工作設定 token 預算,並將用量記錄至 Azure Monitor,與現有 OpenAI 部署並行追蹤成本。
mai_code_client.py
# Azure OpenAI 相容用戶端——MAI-Code-1-Flash
from openai import AzureOpenAI

client = AzureOpenAI(
    azure_endpoint="https://YOUR_ENDPOINT.openai.azure.com/",
    api_key="YOUR_API_KEY",
    api_version="2024-10-21",
)

response = client.chat.completions.create(
    model="mai-code-1-flash",
    messages=[
        {"role": "system", "content": "You are a senior software engineer."},
        {"role": "user", "content": "Refactor this function to use async/await:\n\ndef fetch_data(url):\n    return requests.get(url).json()"},
    ],
    max_tokens=2048,
    temperature=0.2,
)

print(response.choices[0].message.content)

MAI-Image、Transcribe、Voice 模型使用相同 Azure AI Foundry 端點模式,搭配各自部署名稱。MAI-Thinking-1 需申請私有預覽——請聯絡 Azure 客戶團隊。

06

  • MAI-Thinking-1 架構:稀疏 MoE,350 億活躍 / 約 1 兆總參數256K 上下文,從零訓練、未經蒸餾。
  • MAI-Thinking-1 SWE-Bench Pro:52.8%,對比 Opus 4.8 69.2% 與 GPT-5.5 58.6%——與當前程式設計領先者差距 16.4 個百分點。
  • MAI-Code-1-Flash 定價:輸入 每 100 萬 token $0.75、輸出 每 100 萬 token $4.50——已在 GitHub Copilot 上線,SWE-Bench 51%
  • MAI-Transcribe-1.5 吞吐量:276 倍即時速度處理,每音訊小時 $0.36,FLEURS WER 4.9%
  • Surface RTX Spark Dev Box:128 GB 統一記憶體約 1 PFLOP @ 100W,本機運行 120B+ 模型100 萬 token 上下文
  • OpenAI 投資背景:Microsoft 累計投資 OpenAI 1,300 億美元2025 年底合約重談解除自研模型的獨家限制。

以下為主要參考來源。模型可用性、定價與基準測試數字可能在發布後變動——請重新開啟各連結以核對最新版本。

Microsoft 官方 Build 2026 公告與 Azure AI Foundry 文件:

Microsoft Build 2026——官方活動頁面

Azure AI Foundry——產品概覽

Microsoft Learn——Azure AI Foundry 模型推論

第三方報導與獨立分析:

The Decoder——Microsoft Build 2026 MAI 模型報導

VentureBeat——MAI-Thinking-1 基準測試分析

Build 2026 確認 Microsoft 不再只是 OpenAI 轉售商——但 MAI 加 OpenAI 的混合堆疊會帶來路由複雜度、雙重計費與分裂的資料治理政策,「直接切換到 MAI」的敘事往往低估這些成本。僅靠雲端 MAI API 也無法取代需要持久狀態、原生 Xcode 工具鏈或 Apple Silicon Metal 加速的本機代理環境。共用虛擬機與 Hypervisor 代管的 Mac 環境會引入額外開銷與相容性斷裂,而建立在原生 macOS 上的代理框架恰恰依賴這些能力。

對於需要 零損耗 Apple Silicon 本機 AI 代理工作流、與 MAI 雲端 API 並行運行——持久 Codex 工作階段、原生 iOS CI/CD、7×24 代理自動化且不受筆電休眠中斷——的開發者,ZUKCLOUD 裸金屬 Mac mini 雲端節點是互補的生產層:專屬實體硬體、無 Hypervisor 稅、按日/週/月彈性計費。請參閱 定價下單,或閱讀裸金屬架構宣言,了解代理級代管與雲端 API 工作流並行的工程論據。

07

問:MAI-Thinking-1 何時公開上線?
答:截至 Build 2026(2026 年 7 月),MAI-Thinking-1 處於私有預覽階段。Microsoft 尚未公布正式上線日期。企業客戶可透過 Azure AI Foundry 申請存取。

問:MAI-Thinking-1 與 Claude Opus 4.8 相比如何?
答:在 SWE-Bench Pro 上,MAI-Thinking-1 得分 52.8%,Opus 4.8 為 69.2%。Microsoft 行銷宣稱與 Opus 4.6 相當,但獨立盲測顯示對手為 Sonnet 4.6 而非 Opus。MAI-Thinking-1 在每 token 成本與 Azure 內資料主權方面具優勢。

問:Surface RTX Spark Dev Box 售價多少?
答:Microsoft 尚未公布定價。裝置預計 2026 年秋季於美國 Microsoft.com 上市。一般消費者可直接購買,不限企業客戶。

問:目前哪些 MAI 模型已可使用?
答:截至 Build 2026:MAI-Code-1-Flash 已在 GitHub Copilot、VS Code 與 GitHub Actions 上線。MAI-Image-2.5、MAI-Transcribe-1.5、MAI-Voice-2 可透過 Azure AI Foundry API 使用。MAI-Thinking-1 仍為私有預覽。

問:MAI 模型能否與 Azure 上的 OpenAI 模型共存?
答:可以。Azure AI Foundry 支援在同一部署中路由 MAI 自研模型與 OpenAI 代管模型(GPT-5.x 系列)。團隊可依任務類型與成本層級混合使用。

問:MAI 模型與 Microsoft Copilot 的關係是什麼?
答:Copilot 產品(M365、Windows、GitHub)將在適當場景路由至 MAI 模型——MAI-Code-1-Flash 已驅動 GitHub Copilot 程式設計任務。Copilot 仍是面向消費者的品牌;MAI 是底層模型家族。

問:MAI 與 OpenAI 在 Azure 上的資料所有權有何差異?
答:MAI 模型運行於 Microsoft 控管的基礎設施,遵循 Microsoft 資料處理協議。Azure 上的 OpenAI 模型遵循 OpenAI 資料處理條款。對於需要在 Microsoft 租用戶內實現完整資料主權的受監管產業,MAI 模型將推論與微調保留在 Azure 邊界內,無需將提示詞路由至 OpenAI 伺服器。