StableLearn Logo

搜索内容

News 15 min read

Kimi K3 真开源了:2.8T 模型如何只激活 104B 参数?

Kimi K3 完整权重与 47 页技术报告正式公开。本文拆解 2.8T MoE、104B 激活参数、KDA、AttnRes、Stable LatentMoE、原生多模态、1M 上下文和 Agent 强化学习,并说明部署门槛与许可证限制。

Cover image for Kimi K3 真开源了:2.8T 模型如何只激活 104B 参数?

本文发布于 52 天前,内容可能已过时,请注意甄别。

Kimi K3 的承诺已经兑现:完整模型权重、模型卡和 47 页技术报告正式公开。

真正值得看的不是“2.8 万亿参数”这个大数字,而是它如何让一个 3T 级模型还能训练、推理和做百万 token 的长周期 Agent。答案可以概括为三条线:序列上用 KDA,深度上用 AttnRes,宽度上用 Stable LatentMoE。

先说结论:Kimi K3 是目前最激进的开放权重模型之一,但“权重可下载”不等于“普通开发者可以在几张显卡上运行”,也不等于许可证毫无限制。

30 秒速览

项目Kimi K3
总参数量2.8T(技术报告精确值 2.78T)
每 token 激活参数104B(精确值 104.2B)
网络层数93 层
专家结构896 个路由专家,每 token 选择 16 个;另有 2 个共享专家
注意力组成69 层 KDA + 24 层 Gated MLA
上下文窗口1,048,576 tokens
视觉编码器MoonViT-V2,401M 参数、27 层
原生模态文本、图像与视频理解
权重量化MoE 专家权重 MXFP4、激活 MXFP8
推荐部署vLLM、SGLang、TokenSpeed;官方建议 64 张以上加速卡的超节点

这里最容易被误读的是参数量。2.8T 是模型总容量,104B 才是每个 token 实际激活的参数量。 这仍然远大于多数开源模型,所以 K3 的开放首先服务于有大规模集群的研究机构、云厂商和基础设施团队,而不是桌面端本地部署。

架构核心:同时打通序列、深度和宽度

K3 相比 K2 获得约 2.5 倍整体扩展效率提升,不是来自一个单点技巧,而是三个方向的共同作用。

1. KDA 管长序列,MLA 定期做全局交互

K3 每个基本块由 3 层 Kimi Delta Attention(KDA)+ 1 层 Gated MLA 组成,最后再补一层 Gated MLA,形成 69:24 的混合注意力结构。

KDA 属于线性注意力路线。它用固定大小的递归状态代替随序列增长的完整 KV Cache,降低百万 token 场景的内存压力;Gated MLA 则周期性保留全局注意力,弥补纯线性注意力在全局信息交互上的损失。

这是一种很现实的取舍:大多数层追求长上下文效率,少数层保留高容量全局交互。 K3 还采用 NoPE,不显式加入位置编码,依靠 KDA 的递归门控表达位置信息,因此扩展到 1M 上下文时不需要 RoPE 插值或缩放。

2. AttnRes 让深层网络不再只能逐层传话

普通 Transformer 的残差连接像接力:当前层主要接收上一层输出。K3 的 Attention Residuals(AttnRes)允许每一层从 embedding 和之前的 block 表示中选择性读取信息。

K3 使用 Block AttnRes,把 93 层划为 8 个 12 层 block 加一个不完整 block。这样既保留跨深度检索能力,又把状态开销从按层增长压到按 block 增长。

它解决的是超深网络中的信息稀释问题:关键线索不必经过几十次残差累积后再被最后几层使用。

3. Stable LatentMoE 把专家扩到 896 个

K2 有 384 个路由专家,每 token 激活 8 个;K3 扩到 896 个路由专家,每 token 激活 16 个,稀疏度为 56。路由专家先在 3584 维潜在空间中计算,再投影回 7168 维主干,避免专家数量增加时通信与权重读取成本同步失控。

但接近 1000 个专家会带来两个新问题:内部激活可能爆炸,专家负载也更难平衡。K3 为此加入三项设计:

  • Normalized LatentMoE:专家聚合后先做 RMSNorm,再投影回主干
  • SiTU-GLU:用平滑上限约束大激活值,降低低精度计算中的溢出风险
  • Quantile Balancing:根据路由分数量化分位点直接调整专家偏置,让负载更快接近目标值

Quantile Balancing 的价值很工程化:它不只防止“冷门专家”训练不足,也让大规模 Expert Parallel 训练拥有更稳定的计算形状和吞吐。

原生多模态:视觉编码器从零一起训练

K3 没有在语言模型训练完成后再接视觉塔,而是从预训练第一天开始,把文本 token 和视觉 token 放进同一个 next-token prediction 目标。

更特别的是,401M 参数的 MoonViT-V2 没有从 SigLIP 初始化,而是从零训练。报告称,预训练视觉编码器接入超大语言模型后容易出现梯度尖峰;从零训练的 MoonViT-V2 梯度更稳定,并在视觉评测中追平 SigLIP 初始化方案。

MoonViT-V2 统一处理图像与视频,使用空间注意力、时间注意力和时间池化,并通过 2×2 pixel shuffle 把视觉 token 数压缩到四分之一。最高可处理 3584×3584 图像。

这解释了 K3 的“vision in the loop”:它可以写前端或游戏代码,查看运行截图,再继续修改,而不是把视觉检查交给另一个模型。

训练:技术报告没有公开总 token 数

K3 的预训练数据覆盖 Web、代码、数学、知识四类文本,以及字幕、图文交错文档、OCR、感知、视频和视觉编程数据。视觉编程数据特别包含 SVG、3D、网页、游戏与 CAD,让代码和渲染结果在训练数据中直接配对。

报告公开了数据处理与训练方法,但没有披露预训练总 token 数、GPU 数量或总训练成本。因此目前不能用一个看似精确的训练 token 数来评价 K3。

已公开的训练流程包括:

  • 使用 Per-Head Muon 优化器,分别对每个注意力头做正交化,避免大梯度头主导更新
  • 使用 cosine 学习率衰减、1% 线性 warmup 和 0.1 weight decay
  • 上下文先从 8K 扩到 64K,再在 cooldown 阶段扩到 256K 和 1M
  • 对知识与数学数据做多风格改写,并进行来源一致性校验
  • 从 SFT 开始执行量化感知训练,最终将主要 MoE 专家权重保存为 MXFP4

长上下文训练也不是简单拼接文档。团队会构造必须跨越整段 1M 上下文才能完成的多模态子任务,防止模型只学会在超长输入里关注局部片段。

后训练:9 个专家模型,最后蒸馏成一个 K3

K3 的后训练分为三步:SFT 冷启动、分领域强化学习、Multi-Teacher On-Policy Distillation(MOPD)。

强化学习覆盖三个领域:通用任务、通用 Agent、编程 Agent;每个领域又训练 low、high、max 三种推理强度,总计得到 9 个专家策略。最后再把它们蒸馏回一个统一模型。

这比单纯训练一个“会深度思考”的模型更精细。low、high、max 的区别不是推理时随手截断 token,而是在 RL 中通过任务级预算约束分别训练,超出预算的轨迹会受到惩罚。

Agent 训练环境也比传统代码题更接近真实工作:

  • 同时模拟 Kimi Code、Claude Code、Codex、OpenClaw 等不同 Agent harness,降低对单一工具格式的过拟合
  • 在 Gmail、Notion、Slack 等模拟应用中执行跨天、跨工具任务
  • 单条轨迹最多包含数千次工具调用和数百万累计上下文 token
  • 用真实 GPU Kernel、网页开发、专业研究和可验证自主执行任务做 RL
  • 通过隐藏验证器与沙箱隔离降低 reward hacking

报告披露,训练和评测期间共创建了 51,219,741 个沙箱实例,涉及 1,505,678 个镜像。这个数字比参数量更能说明 K3 的重心:它要训练的是能在环境里持续行动的 Agent,而不只是更会答题的聊天模型。

成绩怎么看:开放模型第一梯队,但没有全面超过闭源旗舰

K3 在官方报告中的代表性成绩包括:

基准Kimi K3Claude Fable 5GPT-5.6 Sol
ProgramBench77.876.877.6
Terminal-Bench 2.188.388.088.8
FrontierSWE81.286.671.3
BrowseComp91.288.090.4
AutomationBench30.829.129.7
OmniDocBench91.189.885.8

第三方结果也支持“接近前沿但不是全面第一”的判断:截至报告统计日,K3 在 Artificial Analysis Intelligence Index v4.1 排名第 4,在 Vals Index 排名第 2,并登顶 WebDev Arena。

不过这些表格不能当成绝对排名。不同模型使用 Kimi Code、Claude Code 或 Codex 等不同 harness,Claude Fable 5 部分测试存在 fallback,GPT-5.6 Sol 也可能触发安全防护。更稳妥的结论是:K3 已进入闭源旗舰附近的能力区间,在部分编程、搜索和自动化任务上领先,但整体体验仍落后于最强闭源模型。

“开源”要看两层:权重开放,许可证并非无条件

K3 已在 Hugging Face 发布完整权重,可用于研究、部署、微调、修改和创建衍生作品。但它采用自定义 Kimi K3 License,不是 Apache 2.0 或 MIT。

最需要注意的两项商业条件是:

  • 如果企业经营 Model as a Service,且企业及关联方连续 12 个月总收入超过 2000 万美元,商业使用前需与 Moonshot AI 另签协议
  • 如果使用 K3 的商业产品月活超过 1 亿,或月收入超过 2000 万美元,产品界面必须显著展示“Kimi K3”

内部使用以及通过 Moonshot AI 官方产品或认证推理伙伴使用,不受上述两项要求约束。

因此,称 K3 为“开放权重模型”最准确。对研究者和多数中小团队,许可证相当宽松;对大型 MaaS 厂商,它存在明确商业边界。

部署现实:下载容易,跑起来很贵

官方推荐 vLLM、SGLang 和 TokenSpeed,并建议使用 64 张以上加速卡组成的超节点。原因不只是 2.8T 权重体积,还包括 896 专家的通信、KDA 状态与 MLA KV Cache 的联合管理,以及百万 token 请求的调度。

MXFP4 把主要专家权重的理论存储压到约 1.4TB 量级,但非专家模块仍保持更高精度,实际部署还要预留运行时、缓存、通信缓冲和冗余空间。所谓“104B 激活参数”,降低的是每 token 计算量,并不会让其余权重从显存中消失。

K3 的开源价值因此不在“人人本地跑”,而在于社区第一次能完整检查、适配和部署一个 3T 级前沿 Agent 模型。它会直接推动 MoE 通信、FP4 推理、混合线性注意力和超节点调度,而不只是再多一个聊天模型下载地址。

结论

Kimi K3 最重要的突破不是参数规模,而是把 2.8T 模型、1M 上下文、原生多模态和长周期 Agent RL 放进了同一个可下载权重中。

它也把现实边界写得很清楚:整体能力尚未全面超过最强闭源模型,部署至少是数据中心级工程,自定义许可证对大型商业服务有限制。

但对开放模型生态来说,K3 仍然把上限向前推了一大步。过去开源社区更多是在追赶模型能力;这一次,它终于可以直接研究一个前沿 3T 级系统是怎样被训练、量化、调度和部署的。

参考来源:

分享文章

更多文章