ホーム / ブログ / Kimi K3
ENGINEERING BLOG · 2026.07.17

Kimi K3 徹底解説:2.8兆パラメータの
国産オープンソース大規模言語モデル

2026年7月16日深夜、中国のAIスタートアップ月之暗面(Moonshot AI)がAPIドキュメントに静かにバナーを掲出し、Kimi K3の提供を開始しました。大規模キックオフはなく、技術ブログ・料金ページ・即時呼び出し可能なモデルIDだけが公開されています。本記事はAI開発者、技術愛好家、AIプロダクト担当者を対象に、現時点で世界最大規模のオープンソースモデルである2.8兆(2.8T)パラメータのKimi K3について、概要・アーキテクチャ革新・Claude Fable 5 / GPT-5.6 Solとのベンチマーク比較・API料金・即時接続手順・7月27日の完全ウェイト公開の意義を整理します。

01

Kimi K3は、現時点で世界最大規模のオープンソースAIモデルです。総パラメータ数は2.8兆(2.8T)で、前記録保持者のDeepSeek V4 Pro(1.6T)を約75%上回り、小米のオープンソースモデル(1.02T)の2.7倍、アリババ(397B)の7倍以上に相当します。スパース混合エキスパート(MoE)構成で、推論時は896個のエキスパートから16個を活性化します。100万tokenの超長コンテキスト(『紅楼夢』全文5冊分に相当)とネイティブな視覚理解を備え、複雑なプログラミング、長文推論、ナレッジワーク向けに設計されています。

ひとことで言えば:Kimi K3は、画像・動画をネイティブに理解でき、超長記憶を持つオープンソースの「重量級コーディングAI」です。Claude Opus 4.8比で約40%安い料金設定であり、完全ウェイトは7月27日に公開される予定です。

月之暗面は過去18か月、DeepSeekの台頭でシェアを大きく失いました。K3の公開は明確な反撃ですが、開発者が直面する痛点も変わりません。

  • クローズドAPI依存のリスク:7月27日のウェイト公開までは本番環境がMoonshotクラウドに完全依存し、リージョン、クォータ、料金改定の影響を受けます。
  • 超長コンテキスト≠ゼロコスト:1M tokenウィンドウはフラット料金で使えますが、Agent長タスクではローカル永続化環境がなければ中断復旧とツールチェーン統合がボトルネックになります。
  • 自前デプロイのハードル:2.8Tパラメータの本番推論には64枚以上の加速カードを要するスーパーノードが必要で、個人や中小チームは当面API経由に限られます。
  • 自社報告ベンチマークの限界:月之暗面はKimi Code harness、ClaudeはClaude Code、GPTはCodexと異なる評価環境を用いており、独立第三者の再現は進行中です。単一ランキングだけで判断すべきではありません。

一方、今回の公開が示す戦略シグナルも明確です。

  • 過去12か月のうち9か月、Kimiシリーズがオープンソースモデルの規模上限を保持;
  • 公開タイミングは2026世界人工知能大会(WAIC)(7月17–20日)直前;
  • 2026年6月時点で月之暗面のARRは3億米ドルを突破、年内に第6ラウンド調達を完了し、投前評価額は315億米ドル
  • API収入が全体の7割超、海外有料ユーザーは400%増加。

規模だけを誇る「情熱型」の会社ではなく、商用化が加速する中で技術主権を世界に示す動きです。

02

Kimi K3は単なるパラメータ積み上げではなく、検証可能な3つの工程革新を含みます。OpenRouter 2026年6月モデルランキングで整理したDeepSeekやClaudeの路線と比べ、K3は長コンテキスト下の推論効率極端スパースMoEの安定学習を重視しています。

Kimi Delta Attention(KDA)——「注意機構」の再設計

従来のTransformer全注意機構は、長コンテキストで計算量が二乗的に増大します。100万token処理時、KVキャッシュのメモリ消費は致命的になり得ます。KDAはハイブリッド線形注意機構です。

  • 3:1の比率で線形注意層と全注意層を交互配置——3層の線形層が局所構造を低コストで処理し、1層の全注意層がグローバル情報を保持;
  • KVキャッシュメモリを最大75%削減;
  • 100万tokenコンテキストでデコード速度が最大6.3倍向上;
  • 短・長コンテキストおよび強化学習スケールの各シナリオで、純粋な全注意ベースラインを上回ると報告されています。

たとえば、全注意はすべての会話詳細を同時に記憶する方式に近く、KDAは効率的な秘書のように——普段は高速インデックスを使い、必要な瞬間だけ精密に想起します。

Attention Residuals(AttnRes)——深度による情報損失の抑制

  • 標準残差接続は深度に沿って情報を均一に蓄積し、浅層の重要表現が深層で薄まる;
  • AttnResは選択的リトリーバルを導入し、より浅い層の高価値表現を深層から直接参照可能;
  • 月之暗面は約25%の学習効率向上、追加計算コスト2%未満と報告しています。

Stable LatentMoE —— 超高スパース度の安定学習

Kimi K3は896個のエキスパートを持ち、推論ごとに16個のみ活性化(スパース度1.8%)します。主要な配套技術は次のとおりです。

Stable LatentMoE 主要配套技術
技術 役割
Quantile Balancingルーター得点の分位数からエキスパート割当を導出し、ヒューリスティック超参を排除
Per-Head Muon各注意ヘッドを独立最適化し、大規模学習をより適応的に
Sigmoid Tanh Unit(SiTU)活性化関数の制御を改善
Gated MLA注意機構の選択性を向上
総合効果Kimi K2比で全体スケール効率が約2.5倍向上

03

以下は月之暗面が公表した主要ベンチマークです。Claude Fable 5 実践ガイドで強調されているリポジトリ級バグ修正シーンと併読すると、選定判断が早まります。

Kimi K3 主要ベンチマーク比較(月之暗面自報、2026-07-16)
ベンチマーク Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8
DeepSWE67.570.073.059.0
Program Bench77.876.877.671.9
Terminal Bench 2.188.384.688.884.6
FrontierSWE81.286.671.366.7
SWE Marathon42.035.039.040.0
BrowseComp91.288.090.484.3
Automation Bench30.829.129.727.2
GPQA-Diamond93.592.694.191.0
MMMU-Pro(視覚)81.681.283.078.9
OmniDocBench(文書)91.189.885.887.9

読み解きの要点:

  • SWE Marathon(長時間コーディング):K3が42.0で大差首位。数時間規模の実コーディングに最も近い指標;
  • Program Bench:K3が77.8で僅差1位;
  • FrontierSWE:Fable 5が86.6で首位、K3(81.2)もGPT-5.6 Sol(71.3)を大きく上回る;
  • OmniDocBench:K3が91.1で1位。視覚+長コンテキストの相乗効果;
  • 総合知能:Artificial Analysis Intelligence Index v4.1でK3は57.1点、世界4位(Claude Fable 5 59.9、GPT-5.6 Sol 58.9に続く)。

注意:上記は月之暗面の自社報告です。各モデルで異なる推論harnessが使われており、独立第三者の再現は進行中です。

04

主要モデル API 料金とコンテキスト比較
モデル 入力 ($/M) 出力 ($/M) キャッシュ命中入力 コンテキスト
Kimi K3$3.00$15.00$0.301M
Claude Sonnet 5$3.00$15.00200K
Claude Opus 4.8$5.00$25.00200K
GPT-5.5$5.00$30.00400K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K2.6$0.95$4.00$0.16256K

重要な点:K3の標準料金はClaude Sonnet 5と同水準($3/$15)ですが、コンテキストウィンドウは5倍です。キャッシュ命中は$0.30/Mまで下がり、月之暗面はコーディングシーンでキャッシュ命中率90%超を報告しています。中国国内APIは入力¥20/M、出力¥100/M、キャッシュ命中¥2/M。消費者版kimi.comは無料アカウントで利用可能、プリペイドは¥199から(2026年8月11日までのキャンペーン)。

Kimi K3接続の6ステップ(開発者向け):

  1. Moonshotアカウント登録:platform.kimi.aiまたはkimi.comから登録。Googleアカウントログインに対応。
  2. API Key作成:コンソールでキーを生成し、安全に保管(一度しか表示されません)。
  3. モデルID確認:kimi-k3を使用。OpenRouterユーザーはmoonshotai/kimi-k3を選択可能(公式料金にマークアップなし)。
  4. OpenAI互換クライアント設定:base_urlhttps://api.moonshot.ai/v1に設定。
  5. 初回テストリクエスト送信:短いpromptで接続性とレイテンシを確認し、残高または無料枠を検証。
  6. キャッシュ感知ワークフロー有効化:Kimi CodeやAgentシーンでsystem promptとツール定義を再利用し、90%超のキャッシュ命中率で実入力コストを削減。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "このコードを分析してください..."}]
)
print(response.choices[0].message.content)

05

シーン別:Kimi K3か競合か
シーン 推奨モデル 理由
持続的な長時間コーディングKimi K3SWE Marathon首位、最長コンテキスト
複雑なリポジトリ級バグ修正Claude Fable 5FrontierSWE / SWE-bench Proで優位
ターミナル/ツールチェーン AgentGPT-5.6 SolTerminal BenchとCoding Agent Indexで優位
超長文書/マルチモーダル理解Kimi K3OmniDocBench首位、ネイティブ視覚+1Mコンテキスト
コスト重視DeepSeek V4 Pro出力$3.48/MとK3より大幅に安い
オープンソース自前(7/27以降)Kimi K3現時点最強の公開ウェイト

月之暗面は公式発表で、2026年7月27日にHugging Faceで完全モデルウェイトを公開すると明言しています。公開後、K3は次の位置づけになります。

  • ダウンロード可能な最大規模のオープンソースモデル;
  • 2兆パラメータ超の初のオープンウェイト;
  • オープンソースコミュニティの学習/微調整基盤の新標準——vLLM、SGLang等のフレームワークが即座に対応し、MXFP4/NVFP4量子化版も登場する見込み。

モデルはMXFP4ウェイト+MXFP8活性化で学習され、量子化を意識した設計のため、最新ハードウェアでの効率的推論が期待できます。

注目日程:7月17–20日(WAIC、追加発表予定)→ 7月27日(K3完全ウェイト公開)。

06

  • 総パラメータ数:2.8兆(2.8T)、世界最大オープンソースモデル
  • MoE構成:896エキスパート、推論ごと16個活性化(スパース度1.8%)
  • コンテキストウィンドウ:1,048,576 tokens(1M)
  • KDA効率:KVキャッシュ -75%、100万tokenデコード最大 +6.3倍
  • AttnRes:学習効率約 +25%、追加算力 <2%
  • K2比スケール効率:約2.5倍
  • API料金:$3 / $15 per 1M tokens(入力/出力);キャッシュ命中 $0.30/M
  • 国内料金:¥20 / ¥100 / ¥2(入力/出力/キャッシュ)per M tokens
  • ARR(2026-06):3億米ドル突破;投前評価額315億米ドル
  • Artificial Analysis Index v4.1:K3スコア57.1、世界4位
  • オープンソース日:2026年7月27日(Hugging Face)

以下が主要参考来源です。モデル能力、料金、公開スケジュールは更新される可能性があるため、デプロイ前にリンクを再確認してください。

公式来源:

Moonshot AI — Kimi K3 公式技術ブログ

Kimi API Platform — ドキュメントと料金

第三者報道・分析:

Artificial Analysis — Intelligence Index v4.1 ランキング

OpenRouter — moonshotai/kimi-k3 料金と利用量

Kimi K3は長時間コーディングと文書理解の主要領域で一部クローズド旗艦モデルに匹敵、あるいは上回る性能を示しつつ、完全オープンソースを約束しています。中国AIオープンソース競争は「低価格でシェア獲得」から「知能の最前線への挑戦」へ移行しています。エンジニアリングチームにとって、API呼び出しのみではネットワーク遅延、クォータ、ツールチェーン統合の隠れコストが残ります。2.8T自前デプロイは7月27日以前は不可能で、以降もスーパーノード級算力が必要です。共有仮想Mac / クラウドVMでXcode、Metal、Agentツールチェーンを動かす場合、Hypervisor損耗と互換性問題が長時間Agentの安定性を損ないます。ゼロ損耗のApple Silicon、7×24稼働、安定したiOS CI/CDとAI Agent自動化が必要な本番環境(Kimi Code / Claude Codeを永続化物理Mac上で多モデルAPIと接続するなど)では、ZUKCLOUD裸金属Mac miniクラウドノードが通常より制御しやすい選択肢です——専用物理機、仮想化オーバーヘッドなし、日/週/月の柔軟契約。料金注文をご確認いただくか、裸金属アーキテクチャ宣言でAgent級ホスティングの設計思想をお読みください。

07

Q:Kimi K3は無料で使えますか?
A:kimi.comで無料アカウントを登録すれば利用できます。K3はデフォルトで最大推論モードで動作します。API呼び出しは有料($3/$15 per 1M tokens)です。

Q:Kimi K3をローカルにデプロイできますか?
A:完全ウェイトは2026年7月27日にHugging Faceで公開予定です。本番推論には64枚以上の加速カードを要するスーパーノードが必要で、ノートPCや単一GPU環境には適しません。

Q:Kimi K3とDeepSeek V4 Proはどちらを選ぶべきですか?
A:K3はパラメータ約2倍(2.8T vs 1.6T)、コンテキスト5倍(1M vs 128K)、複数のコーディングベンチマークで優位です。DeepSeekの出力は$3.48/Mのみで、コスト重視の用途に向きます。詳細はDeepSeek算力レイアウトのエコシステム背景も参照してください。

Q:1M tokenコンテキストは実務で役立ちますか?
A:リポジトリ全体分析、長編の法律/科研文書、多段Agentの長期記憶などに非常に有用です。K3はフラット料金で長さによる追加課金がなく、高いキャッシュ命中率と組み合わせれば実コストは抑えやすいです。

Q:低/高推論モードはいつ提供されますか?
A:月之暗面はlowhighモードを今後のアップデートで提供すると述べています。現時点ではmaxモードのみ利用可能です。