
把能规划步骤、调用工具并完成多轮任务的智能体塞进个人设备,正从演示项目走向可部署产品。Liquid AI于8月4日发布LFM2.5-2.6B:模型只有26.9亿参数,却提供128K上下文,并把工具调用、长程规划和本地推理放在核心位置。按官方测试,它在苹果M5 Max上可达每秒220个输出token,内存占用不足2.5GB。真正值得关注的不是又一个小模型,而是智能体开始摆脱对云端大模型的单一路径。
第一,LFM2.5-2.6B不是把聊天模型临时接上几个函数接口。它在后训练阶段围绕工具调用、指令遵循和多步执行做了专门优化,目标是让模型在设备端完成“理解任务—选择工具—读取结果—继续行动”的闭环。
第二,128K上下文把本地模型的使用范围从短对话扩展到长文档、检索增强生成和持续任务。企业可以让模型在终端侧处理会议记录、知识库片段或设备日志,减少原始数据离开本机的次数。
第三,官方同时提供原生权重、GGUF、ONNX和MLX等格式,并列出Transformers、vLLM、llama.cpp、LM Studio与SGLang等运行路径。对开发者而言,这比单一演示更接近可落地的工具箱:同一套能力可以进入笔记本、工作站和边缘设备。
模型共有30层,其中22层采用双门控短卷积模块,8层采用分组查询注意力。混合结构试图在长上下文能力与推理效率之间取得平衡:注意力层负责跨距离关联,卷积模块承担大量局部计算,从而压低参数和内存成本。模型词表规模为12.8万,覆盖16种语言,预训练数据量达到34万亿token。
它的智能体能力来自分阶段训练。Liquid AI先进行了两轮监督微调,再针对不同任务训练专门教师模型,通过多领域在线策略蒸馏合并能力,最后在常用智能体评测环境中进行强化学习。这条路线的意义在于,小模型不必平均模仿一个大而全的教师,而是先吸收不同专家在工具选择、网页操作和指令执行上的策略,再统一成一个可部署模型。
在厂商公布的结果中,LFM2.5-2.6B在ToolSandbox获得77.83分,略高于对照的Qwen3.5-9B;Multi-IF达到80.07分,优势更明显。但在BFCLv4函数调用基准上,它以56.88分低于对照模型的60.13分,在AIME 2025数学任务上也落后。这组差异说明,它的优势更集中在工具环境和复杂指令执行,而不是用更小参数全面替代更大的通用模型。
速度同样需要放回测试条件理解。除M5 Max的每秒220个输出token外,官方还给出AMD Ryzen AI Max+ 395上每秒113个token,以及H100高并发下接近每秒1.5万个输出token的结果。实际体验仍会受到量化格式、上下文长度、并发、提示词和设备散热影响,这些数字不能直接等同于每台电脑或手机的稳定速度。
LFM2.5-2.6B已经开放权重,但采用LFM Open License 1.0,而不是无条件商业许可。许可文本规定,年收入低于1000万美元的实体可以在条款范围内商业使用;超过门槛的企业不自动获得商业授权。再分发时还需要附带许可文本、保留声明,并标记修改过的文件。团队在试用前应把模型能力评估与许可审查同时纳入流程。
官方也明确提示,这一版本不适合智能体编程和知识密集型任务。128K是可接收的上下文上限,不代表所有超长输入都能保持同等质量;目前公开结果主要来自厂商测试,手机续航、热管理、离线工具稳定性和真实业务完成率仍需要第三方验证。
ATYUN认为,LFM2.5-2.6B最有价值的地方,是把本地智能体的门槛从“能否跑起来”推向“能否可靠完成任务”。对隐私敏感、网络不稳定或调用成本受限的场景,它提供了一条现实路线;但选型时不应只盯每秒token数。工具调用成功率、端到端任务完成率、峰值内存和许可适配,才是决定它能否进入生产环境的四项关键指标。
