百度开源 ERNIE-Image:8B 参数打败一众大模型,文本渲染能力炸裂
百度开源文生图模型 ERNIE-Image,仅 8B 参数达到开源 SOTA 性能。配备轻量级 Prompt Enhancer,在文本渲染、指令遵循、结构化生成等方面表现优异。GenEval 总分 0.8856,LongTextBench 中英文均超 0.96,24GB 显存即可运行。同步发布 Turbo 版本,8 步推理即可生成高质量图像。
本文发布于 157 天前,内容可能已过时,请注意甄别。
百度这次真的低调做了件大事。
今天,百度 ERNIE-Image 团队正式开源了文本生成图像模型 ERNIE-Image,这个模型只有 8B 参数,但在多个权威基准测试中的表现,已经达到甚至超越了参数量更大的开源模型。
更绝的是,它在文本渲染这个公认的难题上,表现炸裂——无论是海报、信息图、UI 界面,还是长篇幅的文字排版,都能精准生成。
先看这组数字:
- GenEval 总分 0.8856,单物体生成和属性绑定表现最优
- LongTextBench 中英文均超 0.96,文本渲染能力碾压同类模型
- 24GB 显存即可运行,消费级 GPU 就能部署
- 8 步推理(Turbo 版本)即可生成高质量图像
- 已在 Hugging Face 开源,支持 Diffusers、SGLang 等主流框架
什么概念?这意味着一个紧凑的 8B 模型,在文本渲染、指令遵循、结构化生成等关键能力上,已经可以和那些动辄几十 B 参数的大模型掰手腕了。
为什么 8B 参数能打败大模型?
核心架构:单流 DiT + Prompt Enhancer
ERNIE-Image 的核心是一个单流 Diffusion Transformer (DiT) 架构,配合一个轻量级的 Prompt Enhancer(提示词增强器)。
| 组件 | 作用 | 特点 |
|---|---|---|
| 单流 DiT | 图像生成主体 | 仅 8B 参数,高效紧凑 |
| Prompt Enhancer | 提示词扩展 | 将简短输入扩展为结构化描述 |
这个设计的巧妙之处在于:用轻量级的 Prompt Enhancer 来弥补小模型在理解复杂提示词上的不足,让 8B 的 DiT 可以专注于图像生成本身。
结果就是:小模型 + 智能增强 = 大模型级别的性能。
双版本策略:质量 vs 速度
百度同时发布了两个版本,满足不同场景需求:
| 版本 | 优化方向 | 推理步数 | CFG | 适用场景 |
|---|---|---|---|---|
| ERNIE-Image | 通用能力 + 指令保真度 | 50 步 | 4.0 | 高质量生成,对细节要求高 |
| ERNIE-Image-Turbo | 速度 + 美学 | 8 步 | 1.0 | 快速生成,实时应用 |
Turbo 版本通过 DMD(Diffusion Model Distillation)和强化学习优化,将推理步数从 50 步压缩到 8 步,速度提升 6 倍以上,同时保持高质量输出。
基准测试:全面碾压
GenEval:指令遵循能力最强
GenEval 是评估文生图模型指令遵循能力的权威基准,涵盖单物体、多物体、计数、颜色、位置、属性绑定等多个维度。
| 模型 | 单物体 | 双物体 | 计数 | 颜色 | 位置 | 属性绑定 | 总分 |
|---|---|---|---|---|---|---|---|
| ERNIE-Image (w/o PE) | 1.0000 | 0.9596 | 0.7781 | 0.9282 | 0.8550 | 0.7925 | 0.8856 |
| ERNIE-Image (w/ PE) | 0.9906 | 0.9596 | 0.8187 | 0.8830 | 0.8625 | 0.7225 | 0.8728 |
| Qwen-Image | 0.9900 | 0.9200 | 0.8900 | 0.8800 | 0.7600 | 0.7700 | 0.8683 |
| FLUX.2-klein-9B | 0.9313 | 0.9571 | 0.8281 | 0.9149 | 0.7175 | 0.7400 | 0.8481 |
| Z-Image | 1.0000 | 0.9400 | 0.7800 | 0.9300 | 0.6200 | 0.7700 | 0.8400 |
关键发现:
- 单物体生成满分,说明基础生成能力扎实
- 属性绑定 0.7925,在复杂场景下的指令理解能力最强
- 总分 0.8856,全面领先同类开源模型
LongTextBench:文本渲染之王
LongTextBench 专门测试模型在长文本、密集文字场景下的渲染能力,这是文生图模型的公认难题。
| 模型 | 英文 | 中文 | 平均 |
|---|---|---|---|
| Seedream 4.5 | 0.9890 | 0.9873 | 0.9882 |
| ERNIE-Image (w/ PE) | 0.9804 | 0.9661 | 0.9733 |
| GLM-Image | 0.9524 | 0.9788 | 0.9656 |
| ERNIE-Image-Turbo (w/ PE) | 0.9675 | 0.9636 | 0.9655 |
| Qwen-Image | 0.9430 | 0.9460 | 0.9445 |
| Z-Image | 0.9350 | 0.9360 | 0.9355 |
| FLUX.2-klein-9B | 0.8642 | 0.2183 | 0.5413 |
关键发现:
- 中英文均超 0.96,文本渲染能力仅次于 Seedream 4.5
- FLUX.2 在中文场景下崩溃(0.2183),而 ERNIE-Image 保持稳定
- Turbo 版本依然保持 0.9655 的高分,速度和质量兼得
OneIG:综合能力评估
OneIG 是一个综合性基准,评估对齐、文本、推理、风格、多样性等多个维度。
OneIG-EN(英文场景)
| 模型 | 对齐 | 文本 | 推理 | 风格 | 多样性 | 总分 |
|---|---|---|---|---|---|---|
| Nano Banana 2.0 | 0.8880 | 0.9440 | 0.3340 | 0.4810 | 0.2450 | 0.5780 |
| Seedream 4.5 | 0.8910 | 0.9980 | 0.3500 | 0.4340 | 0.2070 | 0.5760 |
| ERNIE-Image (w/ PE) | 0.8678 | 0.9788 | 0.3566 | 0.4309 | 0.2411 | 0.5750 |
| ERNIE-Image-Turbo (w/ PE) | 0.8676 | 0.9666 | 0.3537 | 0.4191 | 0.2212 | 0.5656 |
OneIG-ZH(中文场景)
| 模型 | 对齐 | 文本 | 推理 | 风格 | 多样性 | 总分 |
|---|---|---|---|---|---|---|
| Nano Banana 2.0 | 0.8430 | 0.9830 | 0.3110 | 0.4610 | 0.2360 | 0.5670 |
| ERNIE-Image (w/ PE) | 0.8299 | 0.9539 | 0.3056 | 0.4342 | 0.2478 | 0.5543 |
| Qwen-Image | 0.8250 | 0.9630 | 0.2670 | 0.4050 | 0.2790 | 0.5480 |
| ERNIE-Image-Turbo (w/ PE) | 0.8258 | 0.9386 | 0.3043 | 0.4208 | 0.2281 | 0.5435 |
关键发现:
- 推理能力最强(0.3566),能理解复杂的逻辑关系
- 中英文表现均衡,没有明显短板
- Turbo 版本性能损失极小,实用性极强
五大核心优势
1. 文本渲染:海报、信息图、UI 界面的最佳选择
ERNIE-Image 在密集、长篇幅、布局敏感的文本生成任务中表现优异,特别适合:
- 海报设计:多行文字、复杂排版
- 信息图:数据可视化 + 文字说明
- UI 界面:按钮、标签、菜单等文字元素
- 漫画分镜:对话框、旁白、音效文字
2. 指令遵循:理解复杂提示词
能够准确理解包含多个物体、详细关系、知识密集型描述的提示词,例如:
- “一个穿着红色连衣裙的女孩站在蓝色汽车旁边,手里拿着黄色气球"
- "一张桌面端浏览器网页界面的截图,顶部是标准的浏览器外框区域…“
3. 结构化生成:多面板、分镜、网格布局
在结构化视觉任务中表现出色:
- 海报:标题 + 正文 + 装饰元素
- 漫画:多格分镜 + 对话框
- 表情包合集:网格布局 + 文字标注
- 信息图表:图表 + 数据 + 说明文字
4. 风格覆盖:写实、设计、风格化
支持多种视觉风格:
- 写实摄影:自然光影、真实质感
- 设计导向:扁平插画、矢量风格
- 风格化美学:二次元、手绘、复古等
5. 部署门槛低:24GB 显存即可
| 配置需求 | 说明 |
|---|---|
| 显存 | 24GB(RTX 3090 / 4090 级别) |
| 推理速度 | 标准版 50 步,Turbo 版 8 步 |
| 部署方式 | Diffusers、SGLang、ComfyUI |
消费级 GPU 就能跑,不需要昂贵的企业级硬件。
Prompt Enhancer:小模型的「外挂」
工作原理
Prompt Enhancer 是一个轻量级的语言模型,作用是将用户简短的输入扩展为更丰富的结构化描述。
| 输入 | 输出 |
|---|---|
| ”一只黑白相间的中华田园犬" | "一只黑白相间的中华田园犬,毛色分明,黑色的耳朵和背部,白色的胸部和四肢,眼神机警,站在草地上,阳光洒在身上…” |
两种部署方式
方式 1:内置 PE(简单快速)
pipe = ErnieImagePipeline.from_pretrained(
"baidu/ERNIE-Image",
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt="一只黑白相间的中华田园犬",
use_pe=True # 启用 Prompt Enhancer
).images[0]
方式 2:独立部署 PE(性能优化)
将 PE 和 DiT 分别部署,PE 使用 vLLM 加速,DiT 使用 SGLang 推理,适合高并发场景。
# 部署 PE(vLLM)
vllm serve ./ernie_image_pe --port 8888
# 部署 DiT(SGLang)
sglang serve --model-path baidu/ERNIE-Image-Turbo
性能对比
| 配置 | GenEval | OneIG-EN | LongTextBench |
|---|---|---|---|
| w/ PE | 0.8728 | 0.5750 | 0.9733 |
| w/o PE | 0.8856 | 0.5537 | 0.9636 |
关键发现:
- 有 PE 时推理能力更强(OneIG-EN: 0.5750 vs 0.5537)
- 无 PE 时基础生成能力更强(GenEval: 0.8856 vs 0.8728)
- 用户可根据场景选择是否启用 PE
开源生态:开箱即用
支持的框架和工具
| 工具 | 说明 | 链接 |
|---|---|---|
| Diffusers | Hugging Face 官方推理库 | 文档 |
| SGLang | 高性能推理服务 | 文档 |
| ComfyUI | 可视化工作流 | 模板 |
| Unsloth | GGUF 量化支持 | 文档 |
| AI-Toolkit | 微调工具 | 文档 |
快速上手
Diffusers(推荐新手)
import torch
from diffusers import ErnieImagePipeline
pipe = ErnieImagePipeline.from_pretrained(
"baidu/ERNIE-Image-Turbo", # 或 "baidu/ERNIE-Image"
torch_dtype=torch.bfloat16,
).to("cuda")
image = pipe(
prompt="一只黑白相间的中华田园犬",
height=1024,
width=1024,
num_inference_steps=8, # Turbo 版本用 8 步
guidance_scale=1.0, # Turbo 版本用 1.0
use_pe=True
).images[0]
image.save("output.png")
SGLang(推荐生产环境)
# 启动服务
sglang serve --model-path baidu/ERNIE-Image-Turbo
# 发送请求
curl -X POST http://localhost:30000/generate \
-H "Content-Type: application/json" \
-d '{
"prompt": "一只黑白相间的中华田园犬",
"height": 1024,
"width": 1024,
"num_inference_steps": 8,
"guidance_scale": 1.0
}' \
--output output.png
应用场景:谁能用?怎么用?
| 场景 | 适用对象 | 核心价值 |
|---|---|---|
| 内容创作 | 自媒体、设计师 | 快速生成海报、配图、表情包 |
| 电商设计 | 电商运营、美工 | 商品海报、促销图、详情页配图 |
| UI 设计 | 产品经理、UI 设计师 | 快速原型、界面 mockup |
| 教育出版 | 教师、出版社 | 教材插图、信息图表 |
| 游戏开发 | 独立游戏开发者 | 概念图、场景设计、角色设定 |
| 短视频制作 | 视频创作者 | 封面图、字幕卡片、转场动画 |
与竞品对比:8B 打败 9B+
| 模型 | 参数量 | GenEval | LongTextBench | 显存需求 | 开源 |
|---|---|---|---|---|---|
| ERNIE-Image | 8B | 0.8856 | 0.9733 | 24GB | ✅ |
| FLUX.2-klein | 9B | 0.8481 | 0.5413 | 24GB+ | ✅ |
| Qwen-Image | 未知 | 0.8683 | 0.9445 | 未知 | ✅ |
| Z-Image | 未知 | 0.8400 | 0.9355 | 未知 | ✅ |
| Seedream 4.5 | 未知 | 0.5760 | 0.9882 | 未知 | ❌ |
关键发现:
- 8B 参数达到 9B+ 模型的性能
- 文本渲染能力仅次于闭源的 Seedream 4.5
- 综合性能全面领先同类开源模型
写在最后:小而美的胜利
ERNIE-Image 的发布,证明了一个重要的事实:模型不是越大越好,架构设计和训练策略同样重要。
8B 参数 + 智能 Prompt Enhancer,就能达到甚至超越更大模型的性能,这对整个行业都是一个重要的启示。
更重要的是,24GB 显存的部署门槛,让更多开发者和创作者能够用上高质量的文生图模型,而不是被昂贵的硬件成本拒之门外。
百度这次真的低调做了件大事——不仅开源了模型,还提供了完整的工具链支持,从 Diffusers 到 SGLang,从 ComfyUI 到微调工具,开发者可以直接上手,不用等。
AI 文生图的「小而美」时代,已经到来了。
相关链接:
- GitHub 仓库:https://github.com/baidu/ERNIE-Image
- Hugging Face 模型:https://huggingface.co/Baidu/ERNIE-Image
- Hugging Face Turbo 模型:https://huggingface.co/Baidu/ERNIE-Image-Turbo
- 在线 Demo:https://huggingface.co/spaces/baidu/ERNIE-Image
- 官方博客:https://yiyan.baidu.com/blog/posts/ernie-image
更多文章