StableLearn Logo

搜索内容

CV 12 min read

百度开源 ERNIE-Image:8B 参数打败一众大模型,文本渲染能力炸裂

百度开源文生图模型 ERNIE-Image,仅 8B 参数达到开源 SOTA 性能。配备轻量级 Prompt Enhancer,在文本渲染、指令遵循、结构化生成等方面表现优异。GenEval 总分 0.8856,LongTextBench 中英文均超 0.96,24GB 显存即可运行。同步发布 Turbo 版本,8 步推理即可生成高质量图像。

Cover image for 百度开源 ERNIE-Image:8B 参数打败一众大模型,文本渲染能力炸裂

本文发布于 157 天前,内容可能已过时,请注意甄别。

百度这次真的低调做了件大事。

今天,百度 ERNIE-Image 团队正式开源了文本生成图像模型 ERNIE-Image,这个模型只有 8B 参数,但在多个权威基准测试中的表现,已经达到甚至超越了参数量更大的开源模型。

更绝的是,它在文本渲染这个公认的难题上,表现炸裂——无论是海报、信息图、UI 界面,还是长篇幅的文字排版,都能精准生成。

先看这组数字:

  • GenEval 总分 0.8856,单物体生成和属性绑定表现最优
  • LongTextBench 中英文均超 0.96,文本渲染能力碾压同类模型
  • 24GB 显存即可运行,消费级 GPU 就能部署
  • 8 步推理(Turbo 版本)即可生成高质量图像
  • 已在 Hugging Face 开源,支持 Diffusers、SGLang 等主流框架

什么概念?这意味着一个紧凑的 8B 模型,在文本渲染、指令遵循、结构化生成等关键能力上,已经可以和那些动辄几十 B 参数的大模型掰手腕了。

为什么 8B 参数能打败大模型?

核心架构:单流 DiT + Prompt Enhancer

ERNIE-Image 的核心是一个单流 Diffusion Transformer (DiT) 架构,配合一个轻量级的 Prompt Enhancer(提示词增强器)。

组件作用特点
单流 DiT图像生成主体仅 8B 参数,高效紧凑
Prompt Enhancer提示词扩展将简短输入扩展为结构化描述

这个设计的巧妙之处在于:用轻量级的 Prompt Enhancer 来弥补小模型在理解复杂提示词上的不足,让 8B 的 DiT 可以专注于图像生成本身。

结果就是:小模型 + 智能增强 = 大模型级别的性能。

双版本策略:质量 vs 速度

百度同时发布了两个版本,满足不同场景需求:

版本优化方向推理步数CFG适用场景
ERNIE-Image通用能力 + 指令保真度50 步4.0高质量生成,对细节要求高
ERNIE-Image-Turbo速度 + 美学8 步1.0快速生成,实时应用

Turbo 版本通过 DMD(Diffusion Model Distillation)和强化学习优化,将推理步数从 50 步压缩到 8 步,速度提升 6 倍以上,同时保持高质量输出。

基准测试:全面碾压

GenEval:指令遵循能力最强

GenEval 是评估文生图模型指令遵循能力的权威基准,涵盖单物体、多物体、计数、颜色、位置、属性绑定等多个维度。

模型单物体双物体计数颜色位置属性绑定总分
ERNIE-Image (w/o PE)1.00000.95960.77810.92820.85500.79250.8856
ERNIE-Image (w/ PE)0.99060.95960.81870.88300.86250.72250.8728
Qwen-Image0.99000.92000.89000.88000.76000.77000.8683
FLUX.2-klein-9B0.93130.95710.82810.91490.71750.74000.8481
Z-Image1.00000.94000.78000.93000.62000.77000.8400

关键发现:

  • 单物体生成满分,说明基础生成能力扎实
  • 属性绑定 0.7925,在复杂场景下的指令理解能力最强
  • 总分 0.8856,全面领先同类开源模型

LongTextBench:文本渲染之王

LongTextBench 专门测试模型在长文本、密集文字场景下的渲染能力,这是文生图模型的公认难题。

模型英文中文平均
Seedream 4.50.98900.98730.9882
ERNIE-Image (w/ PE)0.98040.96610.9733
GLM-Image0.95240.97880.9656
ERNIE-Image-Turbo (w/ PE)0.96750.96360.9655
Qwen-Image0.94300.94600.9445
Z-Image0.93500.93600.9355
FLUX.2-klein-9B0.86420.21830.5413

关键发现:

  • 中英文均超 0.96,文本渲染能力仅次于 Seedream 4.5
  • FLUX.2 在中文场景下崩溃(0.2183),而 ERNIE-Image 保持稳定
  • Turbo 版本依然保持 0.9655 的高分,速度和质量兼得

OneIG:综合能力评估

OneIG 是一个综合性基准,评估对齐、文本、推理、风格、多样性等多个维度。

OneIG-EN(英文场景)

模型对齐文本推理风格多样性总分
Nano Banana 2.00.88800.94400.33400.48100.24500.5780
Seedream 4.50.89100.99800.35000.43400.20700.5760
ERNIE-Image (w/ PE)0.86780.97880.35660.43090.24110.5750
ERNIE-Image-Turbo (w/ PE)0.86760.96660.35370.41910.22120.5656

OneIG-ZH(中文场景)

模型对齐文本推理风格多样性总分
Nano Banana 2.00.84300.98300.31100.46100.23600.5670
ERNIE-Image (w/ PE)0.82990.95390.30560.43420.24780.5543
Qwen-Image0.82500.96300.26700.40500.27900.5480
ERNIE-Image-Turbo (w/ PE)0.82580.93860.30430.42080.22810.5435

关键发现:

  • 推理能力最强(0.3566),能理解复杂的逻辑关系
  • 中英文表现均衡,没有明显短板
  • Turbo 版本性能损失极小,实用性极强

五大核心优势

1. 文本渲染:海报、信息图、UI 界面的最佳选择

ERNIE-Image 在密集、长篇幅、布局敏感的文本生成任务中表现优异,特别适合:

  • 海报设计:多行文字、复杂排版
  • 信息图:数据可视化 + 文字说明
  • UI 界面:按钮、标签、菜单等文字元素
  • 漫画分镜:对话框、旁白、音效文字

2. 指令遵循:理解复杂提示词

能够准确理解包含多个物体、详细关系、知识密集型描述的提示词,例如:

  • “一个穿着红色连衣裙的女孩站在蓝色汽车旁边,手里拿着黄色气球"
  • "一张桌面端浏览器网页界面的截图,顶部是标准的浏览器外框区域…“

3. 结构化生成:多面板、分镜、网格布局

在结构化视觉任务中表现出色:

  • 海报:标题 + 正文 + 装饰元素
  • 漫画:多格分镜 + 对话框
  • 表情包合集:网格布局 + 文字标注
  • 信息图表:图表 + 数据 + 说明文字

4. 风格覆盖:写实、设计、风格化

支持多种视觉风格:

  • 写实摄影:自然光影、真实质感
  • 设计导向:扁平插画、矢量风格
  • 风格化美学:二次元、手绘、复古等

5. 部署门槛低:24GB 显存即可

配置需求说明
显存24GB(RTX 3090 / 4090 级别)
推理速度标准版 50 步,Turbo 版 8 步
部署方式Diffusers、SGLang、ComfyUI

消费级 GPU 就能跑,不需要昂贵的企业级硬件。

Prompt Enhancer:小模型的「外挂」

工作原理

Prompt Enhancer 是一个轻量级的语言模型,作用是将用户简短的输入扩展为更丰富的结构化描述。

输入输出
”一只黑白相间的中华田园犬""一只黑白相间的中华田园犬,毛色分明,黑色的耳朵和背部,白色的胸部和四肢,眼神机警,站在草地上,阳光洒在身上…”

两种部署方式

方式 1:内置 PE(简单快速)

   pipe = ErnieImagePipeline.from_pretrained(
    "baidu/ERNIE-Image",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt="一只黑白相间的中华田园犬",
    use_pe=True  # 启用 Prompt Enhancer
).images[0]

方式 2:独立部署 PE(性能优化)

将 PE 和 DiT 分别部署,PE 使用 vLLM 加速,DiT 使用 SGLang 推理,适合高并发场景。

   # 部署 PE(vLLM)
vllm serve ./ernie_image_pe --port 8888

# 部署 DiT(SGLang)
sglang serve --model-path baidu/ERNIE-Image-Turbo

性能对比

配置GenEvalOneIG-ENLongTextBench
w/ PE0.87280.57500.9733
w/o PE0.88560.55370.9636

关键发现:

  • 有 PE 时推理能力更强(OneIG-EN: 0.5750 vs 0.5537)
  • 无 PE 时基础生成能力更强(GenEval: 0.8856 vs 0.8728)
  • 用户可根据场景选择是否启用 PE

开源生态:开箱即用

支持的框架和工具

工具说明链接
DiffusersHugging Face 官方推理库文档
SGLang高性能推理服务文档
ComfyUI可视化工作流模板
UnslothGGUF 量化支持文档
AI-Toolkit微调工具文档

快速上手

Diffusers(推荐新手)

   import torch
from diffusers import ErnieImagePipeline

pipe = ErnieImagePipeline.from_pretrained(
    "baidu/ERNIE-Image-Turbo",  # 或 "baidu/ERNIE-Image"
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt="一只黑白相间的中华田园犬",
    height=1024,
    width=1024,
    num_inference_steps=8,  # Turbo 版本用 8 步
    guidance_scale=1.0,     # Turbo 版本用 1.0
    use_pe=True
).images[0]

image.save("output.png")

SGLang(推荐生产环境)

   # 启动服务
sglang serve --model-path baidu/ERNIE-Image-Turbo

# 发送请求
curl -X POST http://localhost:30000/generate \
  -H "Content-Type: application/json" \
  -d '{
    "prompt": "一只黑白相间的中华田园犬",
    "height": 1024,
    "width": 1024,
    "num_inference_steps": 8,
    "guidance_scale": 1.0
  }' \
  --output output.png

应用场景:谁能用?怎么用?

场景适用对象核心价值
内容创作自媒体、设计师快速生成海报、配图、表情包
电商设计电商运营、美工商品海报、促销图、详情页配图
UI 设计产品经理、UI 设计师快速原型、界面 mockup
教育出版教师、出版社教材插图、信息图表
游戏开发独立游戏开发者概念图、场景设计、角色设定
短视频制作视频创作者封面图、字幕卡片、转场动画

与竞品对比:8B 打败 9B+

模型参数量GenEvalLongTextBench显存需求开源
ERNIE-Image8B0.88560.973324GB✅
FLUX.2-klein9B0.84810.541324GB+✅
Qwen-Image未知0.86830.9445未知✅
Z-Image未知0.84000.9355未知✅
Seedream 4.5未知0.57600.9882未知❌

关键发现:

  • 8B 参数达到 9B+ 模型的性能
  • 文本渲染能力仅次于闭源的 Seedream 4.5
  • 综合性能全面领先同类开源模型

写在最后:小而美的胜利

ERNIE-Image 的发布,证明了一个重要的事实:模型不是越大越好,架构设计和训练策略同样重要。

8B 参数 + 智能 Prompt Enhancer,就能达到甚至超越更大模型的性能,这对整个行业都是一个重要的启示。

更重要的是,24GB 显存的部署门槛,让更多开发者和创作者能够用上高质量的文生图模型,而不是被昂贵的硬件成本拒之门外。

百度这次真的低调做了件大事——不仅开源了模型,还提供了完整的工具链支持,从 Diffusers 到 SGLang,从 ComfyUI 到微调工具,开发者可以直接上手,不用等。

AI 文生图的「小而美」时代,已经到来了。


相关链接:

分享文章

更多文章