News 5 min read
Liquid AI LFM2.5 使用教程:1.2B 参数的边缘 AI 模型,手机也能跑
Liquid AI LFM2.5 是一款专为手机、边缘设备打造的轻量级 AI 模型,仅 1.2B 参数即可本地运行,支持文本、图像、语音多模态,附带 Ollama、vLLM 完整部署教程。
本文发布于 254 天前,内容可能已过时,请注意甄别。
LFM2.5 是什么?
如果你一直在找一个能在手机或边缘设备上流畅运行的 AI 模型,Liquid AI 的 LFM2.5 可能正是你需要的。
这是一个专门为本地部署优化的模型系列,最小只有 1.2B 参数,但能力却不弱。它基于 LFM2 架构,通过扩展预训练和强化学习做了不少优化,跑起来又快又省资源。
有哪些模型可以选?
LFM2.5 不只是一个模型,而是一整个家族,覆盖了文本、视觉、音频三大场景:
| 模型 | 参数量 | 适合干啥 |
|---|---|---|
| LFM2.5-1.2B-Instruct | 1.2B | 日常对话、指令跟随,大多数场景首选 |
| LFM2.5-1.2B-Base | 1.2B | 预训练底座,想自己微调就选它 |
| LFM2.5-1.2B-JP | 1.2B | 专门优化过的日语模型 |
| LFM2.5-VL-1.6B | 1.6B | 能看图的视觉语言模型 |
| LFM2.5-Audio-1.5B | 1.5B | 语音输入输出都支持 |
简单来说,想聊天用 Instruct,想微调用 Base,需要看图或语音就选对应的多模态版本。
部署格式很灵活
这点挺贴心的,LFM2.5 提供了好几种格式,基本上主流的推理框架都能用:
- HuggingFace 原生格式:用 Transformers 或 vLLM 的直接上手
- GGUF 量化格式:llama.cpp、LM Studio、Ollama 用户的福音,CPU 也能跑
- ONNX 格式:想部署到手机、嵌入式设备就用这个
- MLX 格式:Mac 用户专属,M 系列芯片跑起来很丝滑
怎么跑起来?
方法一:用 Transformers(最通用)
from transformers import AutoModelForCausalLM, AutoTokenizer, TextStreamer
model_id = "LiquidAI/LFM2.5-1.2B-Instruct"
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype="bfloat16",
# attn_implementation="flash_attention_2" # 有支持的 GPU 可以打开
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
streamer = TextStreamer(tokenizer, skip_prompt=True, skip_special_tokens=True)
prompt = "请解释什么是边缘计算?"
input_ids = tokenizer.apply_chat_template(
[{"role": "user", "content": prompt}],
add_generation_prompt=True,
return_tensors="pt",
tokenize=True,
).to(model.device)
output = model.generate(
input_ids,
do_sample=True,
temperature=0.3,
min_p=0.15,
repetition_penalty=1.05,
max_new_tokens=512,
streamer=streamer,
)
方法二:用 Ollama(最简单)
一行命令搞定,适合想快速体验的:
ollama run hf.co/LiquidAI/LFM2.5-1.2B-Instruct-GGUF
方法三:用 vLLM(生产环境推荐)
需要高吞吐量的话,vLLM 是更好的选择:
vllm serve LiquidAI/LFM2.5-1.2B-Instruct
想微调?也支持
LFM2.5 对微调很友好,官方提供了几种方案:
- SFT + Unsloth:用 LoRA 做监督微调,速度快
- SFT + TRL:HuggingFace 官方库,生态好
- DPO + TRL:想做偏好对齐可以试试
Base 模型特别适合这些场景:
- 训练特定语言版本(比如中文、日语)
- 垂直领域适配(医疗、法律、金融等)
- 用自己的私有数据训练
- 尝试新的训练方法
还有一堆任务专用的小模型
Liquid AI 还出了一系列叫 “Nanos” 的任务专用模型,参数更小,针对性更强:
| 模型 | 干啥用的 |
|---|---|
| LFM2-1.2B-Extract | 从文档里提取结构化信息,输出 JSON |
| LFM2-350M-ENJP-MT | 日英双向翻译,速度很快 |
| LFM2-1.2B-RAG | 专门给 RAG 系统用的问答模型 |
| LFM2-1.2B-Tool | 工具调用优化过,Function Calling 更准 |
| LFM2-350M-Math | 小而精的数学推理模型 |
| LFM2-ColBERT-350M | 做检索和重排序的 |
| LFM2-2.6B-Transcript | 会议记录总结专用 |
这些小模型虽然参数少,但在特定任务上表现不错,而且跑起来更快更省资源。
总结
LFM2.5 的定位很清晰:给那些想在本地或边缘设备跑 AI 的开发者用。1.2B 的参数量在手机上也能跑,多模态支持也比较全面。如果你在做端侧 AI 应用,或者想找个轻量级模型来微调,可以试试看。
相关链接
更多文章
ZCode 说只是做索引,可它翻开的不止当前代码
OpenClaw 2.0 发布:Agent 终于能把没做完的事接着做
“牛来”揭面:智谱 GLM-5.3-Flash 匿名期跑出 44 万亿 Token
GLM-5.3 发布:基座没换,智谱把后训练推到数十倍任务环境
DeepSeek Harness 开源:把 Agent 的整套运行底座拆开了
FFmpeg 9.0 “Lei” 发布:这个版本号,纪念一位中国音视频开发者
DeepSeek-V4-Flash 正式上线:性能超过 GLM,逼近 Opus 4.8,价格更狠
GPT-5.6 Luna 直接降价 80%:百万 Token 输出只要 1.2 美元
Kimi K3 真开源了:2.8T 模型如何只激活 104B 参数?