2026년 7월 16일 밤, 중국 AI 스타트업 Moonshot AI(月之暗面)가 API 문서 상단에 배너를 올리며 Kimi K3 제공을 시작했습니다. 대규모 킥오프 없이 기술 블로그, 요금 페이지, 즉시 호출 가능한 모델 ID만 공개되었습니다. 본 글은 AI 개발자, 기술 애호가, AI 제품 담당자를 대상으로, 현재 세계 최대 규모의 오픈소스 모델인 2.8조(2.8T) 파라미터 Kimi K3의 개요, 아키텍처 혁신, Claude Fable 5 / GPT-5.6 Sol 벤치마크 비교, API 요금, 즉시 연동 절차, 7월 27일 전체 가중치 공개의 의미를 정리합니다.
01 Kimi K3란 무엇인가? 이번 공개가 중요한 이유
Kimi K3는 현재 세계 최대 규모의 오픈소스 AI 모델입니다. 총 파라미터는 2.8조(2.8T)로, 이전 기록 보유자 DeepSeek V4 Pro(1.6T)보다 약 75% 크고, 샤오미 오픈소스 모델(1.02T)의 2.7배, 알리바바(397B)의 7배 이상입니다. 스파스 MoE 아키텍처로 추론 시 896개 전문가 중 16개를 활성화합니다. 100만 token 초장 컨텍스트(『홍루몽』 전권 5권 분량에 해당)와 네이티브 시각 이해를 갖추고, 복잡한 프로그래밍, 장문 추론, 지식 업무에 최적화되어 있습니다.
한 줄 요약: Kimi K3는 이미지·영상을 네이티브로 이해하고 초장기 기억을 가진 오픈소스 「헤비급 코딩 AI」입니다. Claude Opus 4.8 대비 약 40% 저렴하며, 전체 가중치는 7월 27일 공개 예정입니다.
Moonshot AI는 지난 18개월 DeepSeek의 부상으로 시장 점유율을 크게 잃었습니다. K3 공개는 명확한 반격이지만, 개발자가 마주하는 페인포인트는 여전합니다.
- 폐쇄형 API 의존 리스크: 7월 27일 가중치 공개 전까지 프로덕션은 Moonshot 클라우드에 완전 의존하며, 리전·할당량·요금 변경의 영향을 받습니다.
- 초장 컨텍스트 ≠ 제로 비용: 1M token 윈도우는 flat 요금으로 사용 가능하지만, Agent 장기 작업에서 로컬 영속화 환경이 없으면 중단 복구와 툴체인 통합이 병목이 됩니다.
- 자체 배포 장벽: 2.8T 파라미터 프로덕션 추론에는 64장 이상 가속 카드가 필요한 슈퍼노드가 필요하며, 개인·중소 팀은 당분간 API만 가능합니다.
- 자체 보고 벤치마크 한계: Moonshot AI는 Kimi Code harness, Claude는 Claude Code, GPT는 Codex 등 서로 다른 평가 환경을 사용했으며, 독립 제3자 재현은 진행 중입니다. 단일 랭킹만으로 판단해서는 안 됩니다.
한편 이번 공개가 보여 주는 전략 신호도 분명합니다.
- 지난 12개월 중 9개월 Kimi 시리즈가 오픈소스 모델 규모 상한을 유지;
- 공개 시점은 2026 세계 인공지능 대회(WAIC)(7월 17–20일) 직전;
- 2026년 6월 기준 Moonshot AI ARR 3억 달러 돌파, 올해 6라운드 투자 완료, 투자 전 밸류에이션 315억 달러;
- API 매출이 전체 70% 이상, 해외 유료 사용자 400% 증가.
규모만 자랑하는 「열정형」 기업이 아니라, 상용화가 가속하는 가운데 기술 주권을 세계에 알리는 움직임입니다.
02 핵심 아키텍처: KDA, AttnRes, Stable LatentMoE
Kimi K3는 단순 파라미터 적층이 아니라 검증 가능한 3가지 공학 혁신을 포함합니다. OpenRouter 2026년 6월 모델 랭킹에서 정리한 DeepSeek·Claude 노선과 비교하면, K3는 장 컨텍스트 추론 효율과 극단적 스파스 MoE 안정 학습에 무게를 둡니다.
Kimi Delta Attention(KDA) — 「어텐션」 메커니즘 재설계
기존 Transformer 전체 어텐션은 장 컨텍스트에서 계산량이 제곱으로 증가합니다. 100만 token 처리 시 KV 캐시 메모리 소비는 치명적일 수 있습니다. KDA는 하이브리드 선형 어텐션입니다.
- 3:1 비율로 선형·전체 어텐션 레이어를 교차 배치 — 3개 선형 레이어가 국소 구조를 저비용 처리, 1개 전체 레이어가 글로벌 정보 유지;
- KV 캐시 메모리 최대 75% 절감;
- 100만 token 컨텍스트에서 디코딩 속도 최대 6.3배 향상;
- 짧·장 컨텍스트 및 강화학습 스케일 시나리오에서 순수 전체 어텐션 베이스라인을 상회한다고 보고됩니다.
비유하면, 전체 어텐션은 모든 대화 세부를 동시에 기억하는 방식에 가깝고, KDA는 효율적인 비서처럼 — 평소 빠른 인덱스를 쓰다 필요한 순간만 정밀 회상합니다.
Attention Residuals(AttnRes) — 깊이에 따른 정보 손실 완화
- 표준 잔차 연결은 깊이에 따라 정보를 균일 누적해 얕은 층의 중요 표현이 깊은 층에서 희석;
- AttnRes는 선택적 검색을 도입해 더 얕은 층의 고가치 표현을 깊은 층에서 직접 참조;
- Moonshot AI는 약 25% 학습 효율 향상, 추가 연산 2% 미만을 보고합니다.
Stable LatentMoE — 초고 스파스도 안정 학습
Kimi K3는 896개 전문가를 보유하며 추론마다 16개만 활성화(스파스도 1.8%)합니다. 주요 보조 기술은 다음과 같습니다.
| 기술 | 역할 |
|---|---|
| Quantile Balancing | 라우터 점수 분위수에서 전문가 할당을 도출해 휴리스틱 하이퍼파라미터 제거 |
| Per-Head Muon | 각 어텐션 헤드를 독립 최적화해 대규모 학습 적응성 향상 |
| Sigmoid Tanh Unit(SiTU) | 활성화 함수 제어 개선 |
| Gated MLA | 어텐션 선택성 향상 |
| 종합 효과 | Kimi K2 대비 전체 스케일 효율 약 2.5배 향상 |
03 벤치마크: Kimi K3 vs Claude Fable 5 vs GPT-5.6 Sol
아래는 Moonshot AI가 공표한 주요 벤치마크입니다. Claude Fable 5 실전 가이드에서 강조한 리포지토리급 버그 수정 시나리오와 함께 읽으면 선택이 빨라집니다.
| 벤치마크 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 |
| MMMU-Pro(시각) | 81.6 | 81.2 | 83.0 | 78.9 |
| OmniDocBench(문서) | 91.1 | 89.8 | 85.8 | 87.9 |
해석 포인트:
- SWE Marathon(장시간 코딩): K3가 42.0으로 대폭 1위. 수 시간 규모 실코딩에 가장 가까운 지표;
- Program Bench: K3가 77.8로 근소 1위;
- FrontierSWE: Fable 5가 86.6 1위, K3(81.2)도 GPT-5.6 Sol(71.3)을 크게 앞섬;
- OmniDocBench: K3가 91.1 1위. 시각+장 컨텍스트 시너지;
- 종합 지능: Artificial Analysis Intelligence Index v4.1에서 K3 57.1점, 세계 4위(Claude Fable 5 59.9, GPT-5.6 Sol 58.9).
주의: 위 수치는 Moonshot AI 자체 보고입니다. 모델마다 다른 추론 harness를 사용했으며, 독립 제3자 재현은 진행 중입니다.
04 Kimi K3 요금은? 6단계 즉시 연동 가이드
| 모델 | 입력 ($/M) | 출력 ($/M) | 캐시 적중 입력 | 컨텍스트 |
|---|---|---|---|---|
| Kimi K3 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | — | 200K |
| Claude Opus 4.8 | $5.00 | $25.00 | — | 200K |
| GPT-5.5 | $5.00 | $30.00 | — | 400K |
| DeepSeek V4 Pro | $1.74 | $3.48 | $0.145 | 128K |
| Kimi K2.6 | $0.95 | $4.00 | $0.16 | 256K |
핵심: K3 표준 요금은 Claude Sonnet 5와 동일($3/$15)하지만 컨텍스트 윈도우는 5배입니다. 캐시 적중은 $0.30/M까지 내려가며, Moonshot AI는 코딩 시나리오 캐시 적중률 90% 이상을 보고합니다. 중국 API는 입력 ¥20/M, 출력 ¥100/M, 캐시 ¥2/M. 소비자용 kimi.com은 무료 계정 이용 가능, 선불 ¥199부터(2026년 8월 11일까지 프로모션).
Kimi K3 연동 6단계(개발자 경로):
- Moonshot 계정 등록: platform.kimi.ai 또는 kimi.com에서 가입. Google 계정 로그인 지원.
- API Key 생성: 콘솔에서 키를 생성하고 안전 보관(한 번만 표시).
- 모델 ID 확인:
kimi-k3사용. OpenRouter는moonshotai/kimi-k3선택 가능(공식 요금 마크업 없음). - OpenAI 호환 클라이언트 설정:
base_url을https://api.moonshot.ai/v1로 설정. - 첫 테스트 요청: 짧은 prompt로 연결성·지연 확인, 잔액 또는 무료 할당량 검증.
- 캐시 인식 워크플로 활성화: Kimi Code·Agent에서 system prompt와 도구 정의를 재사용해 90%+ 캐시 적중으로 실제 입력 비용 절감.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "이 코드를 분석해 주세요..."}]
)
print(response.choices[0].message.content)
05 모델은 어떻게 고를까? 7월 27일 오픈소스의 의미
| 시나리오 | 추천 모델 | 이유 |
|---|---|---|
| 지속적 장시간 코딩 | Kimi K3 | SWE Marathon 1위, 최장 컨텍스트 |
| 복잡한 리포지토리급 버그 수정 | Claude Fable 5 | FrontierSWE / SWE-bench Pro 우위 |
| 터미널/툴체인 Agent | GPT-5.6 Sol | Terminal Bench·Coding Agent Index 우위 |
| 초장문·멀티모달 이해 | Kimi K3 | OmniDocBench 1위, 네이티브 시각+1M 컨텍스트 |
| 비용 민감 | DeepSeek V4 Pro | 출력 $3.48/M로 K3보다 훨씬 저렴 |
| 오픈소스 자체 배포(7/27 이후) | Kimi K3 | 현재 최강 공개 가중치 |
Moonshot AI는 공식 발표에서 2026년 7월 27일 Hugging Face에 전체 모델 가중치를 공개한다고 명시했습니다. 공개 후 K3는 다음 위치를 갖습니다.
- 다운로드 가능한 최대 규모 오픈소스 모델;
- 2조 파라미터를 넘는 최초의 오픈 가중치;
- 오픈소스 커뮤니티 학습/파인튜닝 기준의 새 벤치마크 — vLLM, SGLang 등 프레임워크 즉시 지원, MXFP4/NVFP4 양자화 버전도 예상.
모델은 MXFP4 가중치 + MXFP8 활성화로 학습되어 양자화 인식 설계이며, 최신 하드웨어에서 효율적 추론이 기대됩니다.
주목 일정: 7월 17–20일(WAIC, 추가 발표 예상) → 7월 27일(K3 전체 가중치 공개).
06 인용 가능 기술 데이터와 참고 출처
- 총 파라미터: 2.8조(2.8T), 세계 최대 오픈소스 모델
- MoE 구성: 896 전문가, 추론마다 16개 활성화(스파스도 1.8%)
- 컨텍스트 윈도우: 1,048,576 tokens(1M)
- KDA 효율: KV 캐시 -75%, 100만 token 디코딩 최대 +6.3배
- AttnRes: 학습 효율 약 +25%, 추가 연산 <2%
- K2 대비 스케일 효율: 약 2.5배
- API 요금: $3 / $15 per 1M tokens(입력/출력); 캐시 적중 $0.30/M
- 중국 요금: ¥20 / ¥100 / ¥2(입력/출력/캐시) per M tokens
- ARR(2026-06): 3억 달러 돌파; 투자 전 밸류에이션 315억 달러
- Artificial Analysis Index v4.1: K3 점수 57.1, 세계 4위
- 오픈소스 일: 2026년 7월 27일(Hugging Face)
아래가 주요 참고 출처입니다. 모델 능력, 요금, 공개 일정은 변경될 수 있으니 배포 전 링크를 다시 확인하세요.
공식 출처:
Moonshot AI — Kimi K3 공식 기술 블로그
제3자 보도·분석:
Artificial Analysis — Intelligence Index v4.1 랭킹
OpenRouter — moonshotai/kimi-k3 요금 및 사용량
Kimi K3는 장시간 코딩·문서 이해 핵심 트랙에서 일부 폐쇄형 플래그십에 필적하거나 앞서며, 완전 오픈소스를 약속합니다. 중국 AI 오픈소스 경쟁은 「저가로 점유」에서 「지능 최전선 도전」으로 이동하고 있습니다. 엔지니어링 팀에게 순수 API 호출은 네트워크 지연, 할당량, 툴체인 통합의 숨은 비용을 남깁니다. 2.8T 자체 배포는 7월 27일 이전 불가능하고, 이후에도 슈퍼노드급 연산이 필요합니다. 공유 가상 Mac/클라우드 VM에서 Xcode, Metal, Agent 툴체인을 돌리면 Hypervisor 오버헤드와 호환성 문제가 장시간 Agent 안정성을 해칩니다. 제로 손실 Apple Silicon, 7×24 가동, 안정적 iOS CI/CD와 AI Agent 자동화가 필요한 프로덕션(Kimi Code / Claude Code를 영속 물리 Mac에서 다중 모델 API와 연결 등)에서는 ZUKCLOUD 베어메탈 Mac mini 클라우드 노드가 더 통제 가능한 선택입니다 — 전용 물리 머신, 가상화 오버헤드 없음, 일/주/월 유연 계약. 요금과 주문을 확인하거나 베어메탈 아키텍처 선언에서 Agent급 호스팅 설계를 참고하세요.
07 자주 묻는 질문 FAQ
Q: Kimi K3를 무료로 사용할 수 있나요?
A: kimi.com에서 무료 계정을 등록하면 사용할 수 있습니다. K3는 기본 최대 추론 모드로 동작합니다. API 호출은 유료($3/$15 per 1M tokens)입니다.
Q: Kimi K3를 로컬에 배포할 수 있나요?
A: 전체 가중치는 2026년 7월 27일 Hugging Face에서 공개 예정입니다. 프로덕션 추론에는 64장 이상 가속 카드 슈퍼노드가 필요하며 노트북·단일 GPU에는 부적합합니다.
Q: Kimi K3와 DeepSeek V4 Pro 중 무엇을 선택해야 하나요?
A: K3는 파라미터 약 2배(2.8T vs 1.6T), 컨텍스트 5배(1M vs 128K), 여러 코딩 벤치마크 우위입니다. DeepSeek 출력은 $3.48/M만으로 비용 민감 시나리오에 유리합니다. DeepSeek 연산 레이아웃의 생태계 배경도 참고하세요.
Q: 1M token 컨텍스트가 실무에서 유용한가요?
A: 전체 리포지토리 분석, 장편 법률/연구 문서, 다단계 Agent 장기 기억 등에 매우 유용합니다. K3는 flat 요금으로 길이 추가 과금이 없고, 높은 캐시 적중률과 결합하면 실비용 통제가 쉽습니다.
Q: 낮/높은 추론 모드는 언제 제공되나요?
A: Moonshot AI는 low와 high 모드를 후속 업데이트에서 제공한다고 했습니다. 현재는 max 모드만 이용 가능합니다.