StableLearn Logo

搜索内容

News 16 min read

Qwen3.5:9B击败120B,0.8B手机跑视频的全系MoE模型

Qwen3.5 MoE系列(0.8B-397B)采用Gated DeltaNet混合注意力。9B超越120B模型,0.8B可在手机处理视频。百万token上下文,原生多模态,支持201种语言。

Cover image for Qwen3.5:9B击败120B,0.8B手机跑视频的全系MoE模型

本文发布于 200 天前,内容可能已过时,请注意甄别。

阿里巴巴通义千问团队于 2026 年 2 月 16 日正式发布 Qwen3.5 系列模型,这是通义千问家族的最新旗舰。旗舰模型 Qwen3.5-397B-A17B 拥有 3970 亿总参数,但每次前向传播仅激活 170 亿参数,在推理、编程、多模态理解等多个维度上达到了开源模型的新高度。

3 月 2 日,Qwen3.5 小模型系列正式开源——Qwen3.5-0.8B、2B、4B、9B 四款模型全部采用 Apache 2.0 许可证发布。其中 9B 模型在 GPQA Diamond 上以 81.7 的得分击败了参数量是其 13.5 倍的 OpenAI GPT-OSS-120B(71.5),而 0.8B 模型甚至可以在手机上处理视频——这是 Qwen3.5 架构优势在小模型上的完美体现。

Qwen3.5 不是简单的版本迭代——它在架构层面进行了根本性创新。通过引入 Gated DeltaNet 混合注意力机制 和 原生多模态训练,Qwen3.5 以远低于竞争对手的激活参数量,实现了与 GPT-5.2、Claude Opus 4.5 等顶级闭源模型相当甚至超越的性能。

架构革新:为什么 Qwen3.5 与众不同

Gated DeltaNet:突破注意力瓶颈

传统 Transformer 的自注意力机制有一个致命弱点:计算复杂度随序列长度呈二次方增长。这意味着处理 100 万 token 的成本是处理 10 万 token 的 100 倍,这在实际应用中几乎不可行。

Qwen3.5 的解决方案是 Gated DeltaNet——一种融合了循环神经网络思想的线性注意力变体:

特性传统注意力Gated DeltaNet
计算复杂度O(n²) 二次方接近 O(n) 线性
百万token支持成本极高可行且高效
长距离依赖需要全量注意力通过门控状态更新
内存占用与序列长度成正比近似恒定

3:1 混合比例设计

Qwen3.5 并没有完全抛弃传统注意力,而是采用了精妙的 3:1 混合架构:

   60层 = 15 × (3 × [Gated DeltaNet → MoE] → 1 × [标准注意力 → MoE])
  • 每 4 个 Transformer 块:3 个使用 Gated DeltaNet(线性注意力),1 个使用标准全注意力
  • 线性注意力负责高效处理长距离上下文
  • 标准注意力确保关键位置的精确信息检索

这种设计首次在 Qwen3-Next(2025 年 9 月)中引入,经过 NVIDIA 工程团队的验证后,在 Qwen3.5 中全面投产。

稀疏 MoE:用 17B 做 397B 的事

参数数值
总参数量397B
激活参数量17B(仅 4.3%)
总专家数512
激活专家数10 路由 + 1 共享
专家中间维度1024
隐藏维度4096
层数60

共享专家机制是 Qwen3.5 MoE 的独特之处:一个专用的稠密 MLP 处理每个 token,捕获通用特征,提升训练稳定性和整体性能。其余 10 个路由专家则根据输入动态分配,处理特定领域的知识。

原生多模态:告别”拼装”时代

过去几年,行业的标准做法是先训练一个语言模型,再外接视觉编码器。Qwen3.5 彻底抛弃了这种模式——从零开始在文本、图像和视频上同时训练。

为什么原生多模态更好?

方面拼接式多模态原生多模态(Qwen3.5)
训练方式先训练语言,再加视觉文本+图像+视频同时训练
模态融合后期对齐,存在信息损失早期融合,无缝理解
训练效率视觉训练效率较低接近 100% 文本训练效率
模型数量需要独立的VL模型单一统一模型

这使得 Qwen3.5 在视觉基准上全面超越了前代独立的 Qwen3-VL 模型系列。

视觉-语言基准表现

基准测试Qwen3.5类别
MMMU85.0STEM/综合推理
MMMU-Pro79.0高级多模态推理
MathVision88.6数学视觉推理
MathVista (mini)90.3数学可视化
OmniDocBench90.8文档理解
OCRBench93.1OCR 识别
VideoMME (带字幕)87.5视频理解
MLVU86.7多语言视频理解

语言基准:80% 维度超越 GPT-5.2

Qwen3.5-397B-A17B 在主要评估中表现极为强劲:

数学与推理

基准测试Qwen3.5说明
AIME2691.3数学竞赛级推理
HMMT Feb 2594.8高难度数学竞赛
MMLU-Pro87.8综合知识推理
GPQA Diamond88.4研究生级别问答
C-Eval93.0中文综合评测

编程与智能体

基准测试Qwen3.5说明
SWE-bench Verified76.4真实软件工程任务
LiveCodeBench v683.6实时编程评测
IFBench76.5指令遵循
LongBench v263.2长上下文理解

据报道,Qwen3.5 在 80% 的评估类别中超越了 GPT-5.2 和 Claude Opus 4.5。

201 种语言,25 万词汇表

对比项Qwen3Qwen3.5
支持语言数119201
词汇表大小150K250K
多token预测不支持支持(推理成本降低 10-60%)

多 token 预测(Multi-Token Prediction)允许模型在单步中”猜测”多个后续 token,配合推测解码(Speculative Decoding),可以在 201 种语言中大幅降低推理成本。

上下文窗口:原生 262K,可扩展至 100 万

特性规格
原生上下文262,144 tokens
扩展上下文1,010,000 tokens(YaRN 缩放)
Qwen3.5-Plus默认 100 万 token 上下文

相比 Qwen3-Max,Qwen3.5 在不同场景下的性能提升:

场景加速倍数
256K token 长上下文19 倍
标准工作流(32K)8.6 倍
内存占用(FP8)减少 50%
运行成本降低 60%

模型家族:从 0.8B 到 397B 全覆盖

Qwen3.5 采用分批发布策略:

发布日期模型类型
2026.02.16Qwen3.5-397B-A17BMoE 旗舰
2026.02.24Qwen3.5-122B-A10BMoE 中型
2026.02.24Qwen3.5-35B-A3BMoE 中型
2026.02.24Qwen3.5-27BDense 中型
2026.03.02Qwen3.5-9B小模型旗舰
2026.03.02Qwen3.5-4B轻量级智能体
2026.03.02Qwen3.5-2B边缘设备
2026.03.02Qwen3.5-0.8B手机/IoT

值得关注的是,Qwen3.5-35B-A3B 在核心基准上击败了 Qwen3-235B-A22B——纯粹通过更好的架构、数据和 RL 训练实现,而非堆叠参数。

3月2日重磅:小模型系列全面开源

2026 年 3 月 2 日,Qwen 团队一次性开源了 Qwen3.5-0.8B、2B、4B、9B 四款小模型。这不是简单的”大模型缩小版”——每一款都继承了 Qwen3.5 完整的 Gated DeltaNet 混合架构,拥有 262K 原生上下文窗口和原生多模态能力(文本 + 图像 + 视频)。

这是 AI 历史上第一次:0.8B 的模型能处理视频,4B 的模型能当多模态智能体,9B 的模型能全面超越上一代 30B 模型。

Qwen3.5-9B:紧凑型性能怪兽

9B 是小模型系列的旗舰,它最大的看点是已经缩小了与大型模型之间的差距。

对阵 GPT-OSS-120B(参数量是其 13.5 倍):

基准测试Qwen3.5-9BGPT-OSS-120B差距
GPQA Diamond81.771.5+10.2
HMMT Feb 202583.276.7+6.5
MMLU-Pro82.580.8+1.7
MMMLU(多语言)81.2—领先

对阵 GPT-5-Nano:

基准测试Qwen3.5-9BGPT-5-Nano差距
MMMU-Pro70.157.2+12.9
MathVision78.962.2+16.7
OmniDocBench v1.587.755.9+31.8

对阵上一代 Qwen3-30B(参数量是其 3.3 倍):

基准测试Qwen3.5-9BQwen3-30B说明
GPQA Diamond81.777.2超越
指令遵循91.588.9超越
LongBench v255.248.0超越

硬件需求:BF16 精度下可在单张 RTX 3090(24GB)上运行;4-bit 量化后约 5GB 显存,RTX 3060 12GB 或 M1 Mac 即可流畅运行。

Qwen3.5-4B:轻量级智能体的惊人多模态基座

4B 模型的定位非常独特——它是目前同参数量级中最强的多模态智能体基座模型。

在仅需 8GB 显存的条件下,Qwen3.5-4B 同时支持:

能力说明
262K 上下文小模型中罕见的超长上下文
原生视觉理解图像识别、文档OCR、图表分析
视频处理原生视频理解能力
工具调用支持 Function Calling
思考模式支持 Thinking Mode 深度推理

过去,4B 参数量的模型只能做基础文本任务。Qwen3.5-4B 打破了这个认知——它在功能完整度上接近大型模型,但硬件门槛极低。对于需要在消费级 GPU 上部署轻量级 AI Agent 的场景,这可能是目前最优选择。

Qwen3.5-0.8B / 2B:小巧、快速,为边缘而生

0.8B 和 2B 是为边缘设备和端侧部署而生的:

特性Qwen3.5-0.8BQwen3.5-2B
目标设备智能手机、IoT、嵌入式边缘服务器、快速原型
多模态原生支持图像+视频原生支持图像+视频
上下文窗口262K tokens262K tokens
离线视频支持(60秒/8FPS)支持
空间推理支持支持
电池友好极低功耗低功耗

关键突破:这是首次 0.8B 参数量的模型具备原生视频处理能力。在手机上实现离线视频摘要(最长 60 秒,8 FPS)、空间推理等功能,而不会过度消耗电池。

竞争格局对比

对比维度Qwen3.5 小模型Google Gemma 3Meta Llama 3.2Microsoft Phi-4-mini
最小参数0.8B1B1B14B
原生多模态全系列支持部分支持小模型仅文本仅文本
上下文窗口262K128K128K128K
视频处理全系列支持部分支持不支持不支持
许可证Apache 2.0Apache 2.0Llama LicenseMIT

智能体能力:为 Agent 时代而生

Qwen3.5 不只是一个聊天模型,它是为智能体范式设计的:

能力说明
工具调用原生 Function Calling 支持
MCP 协议支持 Model Context Protocol
代码执行内置代码解释器能力
Agent 编排支持多智能体协作框架
自适应思考Thinking Mode 深度推理

Thinking Mode(默认开启)

Qwen3.5 默认使用思考模式,生成格式为:

   <think>
...推理过程...
</think>

最终回答

推荐将 max_tokens 设置为 32,768 以上,复杂数学和编程任务建议 81,920。

部署指南

推荐框架

框架适用场景
SGLang生产环境推荐
vLLM高吞吐服务
KTransformersCPU-GPU 异构计算
Transformers开发调试

SGLang 部署示例

   python -m sglang.launch_server \
  --model-path Qwen/Qwen3.5-397B-A17B \
  --port 8000 \
  --tp-size 8 \
  --context-length 262144 \
  --reasoning-parser qwen3

vLLM 部署示例

   vllm serve Qwen/Qwen3.5-397B-A17B \
  --port 8000 \
  --tensor-parallel-size 8 \
  --max-model-len 262144 \
  --reasoning-parser qwen3

纯文本模式(节省显存)

   vllm serve Qwen/Qwen3.5-397B-A17B \
  --port 8000 \
  --tensor-parallel-size 8 \
  --max-model-len 262144 \
  --language-model-only

API 调用示例

   from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY"
)

# 文本对话
response = client.chat.completions.create(
    model="Qwen/Qwen3.5-397B-A17B",
    messages=[{"role": "user", "content": "解释量子计算的基本原理"}],
    max_tokens=81920,
    temperature=0.6,
    top_p=0.95,
    extra_body={"top_k": 20},
)

# 图像理解
response = client.chat.completions.create(
    model="Qwen/Qwen3.5-397B-A17B",
    messages=[{
        "role": "user",
        "content": [
            {"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},
            {"type": "text", "text": "描述这张图片的内容"}
        ]
    }],
    max_tokens=81920,
)

推荐采样参数

参数Thinking 模式Non-Thinking 模式
Temperature0.60.7
Top-P0.950.8
Top-K2020
Presence Penalty0.01.5

与竞争对手的全面对比

推理与知识能力

基准测试Qwen3.5GPT-5.2Claude Opus 4.5
AIME2691.3——
MMLU-Pro87.8——
GPQA Diamond88.4——
C-Eval93.0——
SWE-bench Verified76.4—80%+
LiveCodeBench v683.6——

据官方和第三方评测报告,Qwen3.5 在 80% 的评估维度上超越了 GPT-5.2 和 Claude Opus 4.5,但在 SWE-bench 等复杂软件工程任务上,Claude 仍保持领先。

视觉能力对比

在多模态方面,Qwen3.5 在 MMMU、MathVision、OCRBench 等基准上表现顶尖,但在部分视觉特定基准上仍略逊于 Gemini 3。

技术意义:注意力机制的新战场

Qwen3.5 的发布标志着大模型架构的几个重要转折:

  1. 稀疏 MoE 成为默认策略 —— 训练和部署数千亿密集参数的时代正在终结
  2. 线性注意力进入生产级 —— Gated DeltaNet 证明了线性注意力可以在不损失质量的情况下替代大部分标准注意力层
  3. 注意力机制成为新战场 —— 一年前的问题是”MoE 还是 Dense”,现在的分歧在于如何处理注意力:Qwen 选择 Gated DeltaNet,DeepSeek 选择 MLA,两条路线正在激烈竞争
  4. 原生多模态是未来方向 —— 单独训练视觉模型再拼接的方式将逐渐被淘汰
  5. 小模型不再”小” —— Qwen3.5-9B 击败 GPT-OSS-120B 证明架构创新比参数堆叠更重要,端侧 AI 的时代已经到来

开源协议与资源


总结:Qwen3.5 通过 Gated DeltaNet 混合注意力 + 稀疏 MoE 的创新架构组合,在仅激活 17B 参数的条件下实现了接近甚至超越万亿参数模型的性能。3 月 2 日开源的小模型系列更是将这种架构优势推向极致——9B 击败 GPT-OSS-120B、4B 成为最强轻量级多模态智能体基座、0.8B 在手机上实现视频理解。从云端到边缘,Qwen3.5 是 2026 年 AI 生态中最值得关注的开源模型家族。

分享文章

更多文章