通义千问放大招:Qwen3.6-35B 来了,代码智能体能力直接起飞
通义千问发布 Qwen3.6-35B-A3B,专注代码智能体和前端开发。新增思维保持功能,支持跨对话上下文。基于 Qwen3.5 架构,混合专家系统 + 稀疏激活,201 种语言支持,Apache 2.0 开源。
本文发布于 155 天前,内容可能已过时,请注意甄别。
4 月 16 日,Qwen3.6-35B-A3B 正式发布。这次虽然版本号只是从 3.5 到 3.6,但针对开发者的优化是实打实的——代码智能体能力直接拉满,思维保持功能彻底解决上下文丢失问题。
先看这组数字:
- 35B 参数,只激活 3B:推理速度快 10 倍,成本降 90%
- 256K 超长上下文:一次能看完整个中型项目的代码
- 201 种语言支持:从中文到小语种全覆盖
- 思维保持(Thinking Preservation):跨对话记住你的需求和架构选择
- 仓库级代码理解:不再局限单文件,能看懂整个项目依赖关系
什么概念?以前你让 AI 改个前端组件,它只看当前文件,改完发现和其他组件冲突。现在 Qwen3.6 能看懂整个项目结构,而且记住你之前说的架构要求——迭代开发不用反复解释,效率直接翻倍。
核心升级:两个杀手级功能
1. 思维保持(Thinking Preservation):AI 终于有记忆了
最让人眼前一亮的是这个功能。
传统 AI 对话的痛点:
| 场景 | 传统 AI | Qwen3.6 |
|---|---|---|
| 第一轮 | 你:「帮我写个用户登录功能,用 JWT + Redis」 AI:写完了 | 你:「帮我写个用户登录功能,用 JWT + Redis」 AI:写完了,记住了架构选择 |
| 第二轮 | 你:「再加个记住密码」 AI:好的(但可能忘了你要用 Redis) | 你:「再加个记住密码」 AI:好的,自动用 Redis 存储,保持架构一致 |
| 第三轮 | 你:「加个登录日志」 AI:用什么存?(又要重新解释) | 你:「加个登录日志」 AI:直接用 Redis,不用问 |
简单说,就是 AI 会记住你之前的需求、架构选择、代码风格。迭代开发时不用反复解释上下文,沟通成本直接降 80%。
用通义千问团队的话说:「streamlining iterative development and reducing overhead」——让你少废话,多干活。
2. 代码智能体升级:从单文件到仓库级理解
核心能力对比:
| 能力维度 | 传统代码 AI | Qwen3.6 |
|---|---|---|
| 理解范围 | 单文件 | 整个仓库 |
| 前端工作流 | 看不懂组件关系 | 理解 React/Vue 组件依赖 |
| 代码规范 | 不知道项目风格 | 自动遵循项目规范 |
| 重构能力 | 容易引入 bug | 安全重构,保持一致性 |
实际场景对比:
你让 AI 改个 React 组件:
❌ 传统 AI:
- 只看当前文件
- 改完发现和其他组件冲突
- 不知道项目用的状态管理方案
- 需要你手动检查所有依赖
✅ Qwen3.6:
- 看懂整个项目的组件树
- 知道哪些组件依赖这个组件
- 自动用项目的状态管理方案(Redux/Zustand)
- 改完保证不破坏其他功能
这才叫真正的「代码智能体」。
技术揭秘:Qwen3.5 架构有多强?
Qwen3.6 基于 Qwen3.5 架构,这个架构的核心是:用更少的资源,干更多的活。
核心技术:稀疏 MoE + 门控网络
Gated Delta Networks + 稀疏混合专家(MoE)
| 技术组件 | 通俗解释 | 实际效果 |
|---|---|---|
| 稀疏 MoE | 35B 参数,只激活 3B | 推理速度快 10 倍 |
| 门控网络 | 动态选择需要的「专家」 | 成本降低 90% |
| 混合注意力 | 长短期记忆结合 | 256K 超长上下文 |
简单说,就是把 35B 参数分成多个「专家」,每次推理只激活需要的 3B 参数。
类比:
- 传统模型:每次都要把整个团队叫来开会(35B 全激活)
- Qwen3.6:只叫相关的 3 个人来讨论(3B 激活),效率直接拉满
训练黑科技:百万级智能体强化学习
| 训练规模 | 具体数据 | 为什么重要 |
|---|---|---|
| 智能体数量 | 百万级并行 | 见过的场景多,泛化能力强 |
| 任务复杂度 | 从简单到复杂渐进 | 不是实验室玩具,能处理真实问题 |
| 训练数据 | 数万亿多模态 token | 文本、代码、图像全都懂 |
这就是为什么 Qwen3.6 在代码智能体任务上这么强——它是在真实的、复杂的开发场景中训练出来的,不是靠刷题刷出来的。
多语言能力:201 种语言全覆盖
不是简单的机器翻译,而是真正理解不同语言的文化和表达习惯。
| 语言类型 | 覆盖范围 | 实际应用 |
|---|---|---|
| 主流语言 | 中英日韩法德西… | 国际化产品开发 |
| 小语种 | 泰语、越南语、印尼语… | 东南亚市场 |
| 方言 | 粤语、闽南语… | 本地化服务 |
中文、英文自不必说,连粤语、闽南语这种方言都能处理,这对全球化产品来说太重要了。
基准测试:数据说话
Qwen3.6-35B-A3B 性能
虽然官方 README 没给详细数据,但从架构和定位来看,重点在:
- 代码生成:前端、后端、全栈都能搞
- 仓库级理解:大型项目重构、代码审查
- 智能体任务:多步骤推理、工具调用
Qwen3.5 系列性能
Qwen3.5 家族包括:
- Qwen3.5-397B-A17B:旗舰模型,全能王
- Qwen3.5-122B-A10B:高性能版本
- Qwen3.5-35B-A3B:Qwen3.6 的基础
- Qwen3.5-27B:标准版本
- Qwen3.5-9B / 4B / 2B / 0.8B:轻量级版本
从 0.8B 到 397B,覆盖了从边缘设备到数据中心的所有场景。
怎么用?五种方式任你选
方式对比:选最适合你的
| 使用方式 | 适用场景 | 优势 | 劣势 |
|---|---|---|---|
| Qwen Studio | 快速体验、原型验证 | 免费、开箱即用 | 功能受限 |
| 阿里云 API | 生产环境、企业应用 | 稳定、兼容 OpenAI | 需付费 |
| 本地部署 | 数据敏感、高并发 | 完全控制、无限制 | 需要 GPU |
| Qwen Code | 终端开发、代码助手 | 专为编程优化 | 仅限终端 |
| Qwen Agent | 构建智能体应用 | 框架完整、易扩展 | 需要开发 |
1. 在线体验:Qwen Studio(最快上手)
直接访问:chat.qwen.ai
- Web + 桌面 + 移动端全覆盖
- 原生支持深度研究、Web 开发、工具调用
- 免费试用,体验思维保持功能
2. API 调用:阿里云 Model Studio(生产推荐)
兼容 OpenAI SDK,一行代码切换:
from openai import OpenAI
client = OpenAI(
api_key="your-api-key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.6-35b-a3b",
messages=[{"role": "user", "content": "帮我写个 React 组件"}]
)
为什么选阿里云 API:
- 企业级稳定性(99.9% SLA)
- 兼容 OpenAI 和 Anthropic 规范
- 按需付费,成本可控
3. 本地部署:三大框架对比
| 框架 | 适用场景 | 优势 | 启动命令 |
|---|---|---|---|
| Transformers | 快速测试、开发调试 | 最简单,一行命令 | transformers serve |
| SGLang | 生产环境、高并发 | 性能最强,推理快 | sglang.launch_server |
| vLLM | 批量处理、离线任务 | 吞吐量大 | vllm serve |
SGLang(推荐生产环境)
python -m sglang.launch_server \
--model-path Qwen/Qwen3.6-35B-A3B \
--port 8000 \
--tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3
关键参数解读:
--tp-size 4:4 卡并行,35B 模型建议 2-4 张 A100/H100--context-length 262144:256K 超长上下文,能看完整个中型项目--reasoning-parser qwen3:启用 Qwen3 推理解析器,提升代码生成质量
硬件需求:
| GPU 配置 | 推理速度 | 适用场景 |
|---|---|---|
| 2x A100 (80GB) | 快 | 小团队、中等并发 |
| 4x A100 (80GB) | 很快 | 企业级、高并发 |
| 8x H100 (80GB) | 极快 | 超大规模部署 |
vLLM(高吞吐场景)
vllm serve Qwen/Qwen3.6-35B-A3B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3
两个框架都提供 OpenAI 兼容 API:http://localhost:8000/v1
没有 GPU?试试这些方案
llama.cpp(CPU 推理):
# 下载 GGUF 格式模型(量化版本)
# 在 Hugging Face 搜索 "Qwen3.6-35B GGUF"
# 运行推理(速度慢,但能跑)
./llama-cli -m qwen3.6-35b-a3b-q4.gguf -p "你的提示词"
MLX(Apple Silicon 专属):
# M1/M2/M3 芯片专用
pip install mlx-lm
mlx_lm.generate --model Qwen/Qwen3.6-35B-A3B-MLX
在 M3 Max 上跑 35B 模型,速度还行,适合个人开发。
4. 代码智能体:Qwen Code
专为终端优化的 AI 代码助手
pip install qwen-code
qwen-code
核心功能:
| 功能 | 说明 | 实际场景 |
|---|---|---|
| 代码库理解 | 分析整个项目结构 | 快速上手新项目 |
| 自动化任务 | 批量重构、格式化 | 省去重复劳动 |
| 智能补全 | 上下文感知补全 | 提升编码速度 |
详细文档:qwenlm.github.io/qwen-code-docs
5. 智能体开发:Qwen Agent
构建 LLM 应用的开源框架
pip install qwen-agent
核心能力:
| 能力 | 说明 | 典型应用 |
|---|---|---|
| 指令遵循 | 理解复杂指令 | 任务自动化 |
| 工具调用 | 调用外部 API | 数据查询、文件操作 |
| 任务规划 | 多步骤推理 | 复杂工作流 |
| 记忆管理 | 跨会话记忆 | 个性化助手 |
详细文档:qwenlm.github.io/Qwen-Agent
微调:让模型更懂你
支持的框架:
- UnSloth:快速微调,内存优化
- Swift:ModelScope 官方框架
- LLaMA-Factory:功能全面,易用性强
支持的方法:
- SFT(Supervised Fine-Tuning):监督微调
- DPO(Direct Preference Optimization):偏好优化
- GRPO(Group Relative Policy Optimization):群体相对策略优化
# 以 LLaMA-Factory 为例
llamafactory-cli train \
--model_name_or_path Qwen/Qwen3.6-35B-A3B \
--dataset your_dataset \
--output_dir ./output
应用场景:谁适合用?
| 场景 | 适用对象 | 核心价值 |
|---|---|---|
| 前端开发 | React/Vue 开发者 | 理解组件关系,生成符合规范的代码 |
| 全栈开发 | 独立开发者、小团队 | 前后端都能搞,减少上下文切换 |
| 代码重构 | 技术负责人、架构师 | 仓库级理解,安全重构大型项目 |
| 代码审查 | Tech Lead、Senior Dev | 快速理解 PR,发现潜在问题 |
| 技术文档 | 技术写作者 | 根据代码自动生成文档 |
| 教学辅导 | 编程教师、导师 | 解释代码逻辑,生成示例 |
与竞品对比:Qwen3.6 的优势
| 维度 | Qwen3.6-35B-A3B | 其他开源模型 |
|---|---|---|
| 参数效率 | 35B 总参数,3B 激活 | 通常全参数激活 |
| 代码智能体 | 专门优化,仓库级理解 | 通用能力 |
| 思维保持 | ✅ 跨对话上下文 | ❌ 每次重新开始 |
| 多语言 | 201 种语言 | 通常 50-100 种 |
| 开源协议 | Apache 2.0 | 各种协议,有的商用受限 |
| 部署生态 | SGLang, vLLM, Transformers 全支持 | 支持程度不一 |
版本演进:Qwen 家族简史
| 时间 | 版本 | 亮点 |
|---|---|---|
| 2026-04-16 | Qwen3.6-35B-A3B | 代码智能体 + 思维保持 |
| 2026-03-02 | Qwen3.5 小模型系列 | 9B / 4B / 2B / 0.8B |
| 2026-02-24 | Qwen3.5 中大模型 | 122B-A10B / 35B-A3B / 27B |
| 2026-02-16 | Qwen3.5 旗舰 | 397B-A17B MoE 模型 |
| 2025-09-11 | Qwen3-Next-80B-A3B | 超稀疏 MoE + 混合注意力 |
从 0.8B 到 397B,从纯文本到多模态,Qwen 家族已经形成了完整的产品矩阵。
写在最后:AI 辅助编程进入 2.0 时代
Qwen3.6 这次更新,标志着 AI 辅助编程从「能用」进化到「真好用」。
思维保持功能,彻底解决了上下文丢失这个最大痛点。以前你和 AI 聊了半天需求,换个话题再回来,它就全忘了。现在它能记住你的思路、架构选择、代码风格——迭代开发效率直接翻倍。
仓库级代码理解,从单文件升级到整个项目。大型项目重构、前端组件开发,Qwen3.6 能给出真正靠谱的建议,不是那种「看起来对,实际一跑就报错」的代码。
35B 参数只激活 3B,推理速度快 10 倍,成本降 90%。这意味着个人开发者也能用得起,不是只有大厂才玩得转。
Apache 2.0 开源,商用无压力。不用担心授权问题,想怎么用就怎么用。
部署生态完善,从云端 API 到本地部署,从 GPU 到 CPU,从 x86 到 Apple Silicon,全都支持。甚至 M3 Max 都能跑,这在以前是不敢想的。
通义千问这次是真的听进去了开发者的反馈。没搞那些花里胡哨的 PPT 功能,就盯着实用性做优化。
不再是「AI 能写代码」就叫智能体,而是要做到:理解整个项目、记住你的需求、生成可靠的代码、持续迭代优化——这些能力单独拿出来都很强,组合起来就是降维打击。
AI 辅助编程的未来,可能比我们想象的来得更快。
相关链接:
- GitHub 仓库:https://github.com/QwenLM/Qwen3.6
- Hugging Face 模型:https://huggingface.co/Qwen/Qwen3.6-35B-A3B
- ModelScope 模型:https://modelscope.cn/organization/qwen
- Qwen Studio:https://chat.qwen.ai
- 官方博客:https://qwen.ai/blog?id=qwen3.6-35b-a3b
- Qwen Code:https://github.com/QwenLM/qwen-code
- Qwen Agent:https://github.com/QwenLM/Qwen-Agent
更多文章