Kimi K3 真开源了:2.8T 模型如何只激活 104B 参数?
Kimi K3 完整权重与 47 页技术报告正式公开。本文拆解 2.8T MoE、104B 激活参数、KDA、AttnRes、Stable LatentMoE、原生多模态、1M 上下文和 Agent 强化学习,并说明部署门槛与许可证限制。
9 篇文章
了解 MoE 架构、总参数与激活参数的差异,阅读相关模型发布和部署解读。
比较 MoE 模型时区分总参数、激活参数和实际显存占用,不能仅凭激活参数估算部署成本。结合量化、专家并行和推理框架支持阅读技术报告。
Kimi K3 完整权重与 47 页技术报告正式公开。本文拆解 2.8T MoE、104B 激活参数、KDA、AttnRes、Stable LatentMoE、原生多模态、1M 上下文和 Agent 强化学习,并说明部署门槛与许可证限制。
通义千问发布 Qwen3.6-35B-A3B,专注代码智能体和前端开发。新增思维保持功能,支持跨对话上下文。基于 Qwen3.5 架构,混合专家系统 + 稀疏激活,201 种语言支持,Apache 2.0 开源。
Google 发布 Gemma 4 多模态开放模型,密集+MoE 双架构,支持 25.6 万 token 长上下文,原生推理模式,从手机到服务器全场景覆盖。
Qwen3.5-Omni 是新一代原生全模态大模型,支持文本、图像、音频、视频输入输出。采用 Thinker-Talker 架构和 Hybrid-Attention MoE,支持 256k 上下文、10 小时音频、400 万帧视频处理,在 215 个基准测试中达到 SOTA。
Qwen3.5 MoE系列(0.8B-397B)采用Gated DeltaNet混合注意力。9B超越120B模型,0.8B可在手机处理视频。百万token上下文,原生多模态,支持201种语言。
Qwen3-Omni 端到端多模态模型,支持文本/图像/音频/视频与实时语音,Thinker–Talker + MoE,多码本降延迟;覆盖 119 种语言,附评测结论、部署建议与 vLLM/Transformers 实操。
Qwen3-Next 系列发布:Gated DeltaNet × Gated Attention 混合架构,80B 总参仅激活约 3B,实现长上下文、高并发与低延迟;Instruct 与 Thinking 分工明确,覆盖从生产对话到深度推理的全场景。
阿里云通义千问Qwen3系列大语言模型全面介绍,从0.6B到235B的多规模模型,结合MoE与Dense架构,实现性能与效率的完美平衡,支持119种语言,具备卓越的编码和数学能力
"DeepSeek宣布开源其推理引擎,与vLLM社区深度协作。引擎融合多项创新技术:跨节点专家并行、 多头潜注意力(MLA)、动态负载均衡等。通过Day-0支持策略和社区协作,降低AI开发门槛, 推动基础设施标准化。开源计划展现对开放科学的承诺,为AI生态系统发展注入新动力。"