缓存命中最高99%,小米MiMo Desktop开放邀测

2026年09月09日 由 ATYUN编辑部 发表 256 0
多种文档与媒体材料经过并行调度台转化为网页幻灯片和三维原型
原创示意图:桌面Agent把多格式材料分流处理,并交付可继续编辑的工作成果。

桌面AI正在从“帮你生成一段内容”转向“接过一包杂乱材料,最后交回可编辑成果”。9月8日,小米MiMo Desktop开放邀请测试,可直接读取文档、图片、视频、PDF、音频和压缩包,自动拆解目标、调用模型与工具,并交付表格、幻灯片、网页、3D原型甚至软件工程项目。获批用户还能限时、限额体验MiMo-X-Pro-Preview与MiMo-X-Flash-Preview两款新模型。

交付:会话中预览、操作和局部修改成果,不止返回静态文字或截图。
调度:按任务复杂度选择模型、Harness、Agent与Skill,多会话可以分工协作。
边界:当前是邀测,缓存与成本数字来自官方测试,尚无独立生产数据。

把混合材料变成交付物,而不是再开一个聊天窗口

真实工作很少从一条干净提示开始。一次方案可能同时包含PDF、表格、录音、图片和旧网页,用户通常要先整理格式,再分别交给不同工具。MiMo Desktop试图把这层准备工作并入任务:读取原始材料,梳理事实和结构,再生成可继续修改的文件。官方示例包括从混合材料制作可编辑PPT,以及通过MCP控制Figma生成设计元素。

产品内的结果预览不是一张静态截图,网页和交互组件可以直接点击,Office与HTML支持局部编辑、继续生成和版本回退。这一点决定了它更像工作台而不是答案框:用户可以检查交付物的状态与结构,只重做有问题的部分,避免每次修改都从头生成。

不过“支持很多格式”不等于每类任务都可靠。复杂表格公式、演示稿母版、视频时间线和大型代码仓库需要完全不同的验收标准。当前公告没有披露各场景任务数、一次完成率或人工返工时间,能力范围应视为邀测目标,而不是成熟度证明。

Smart调度把模型选择藏到任务背后

MiMo Desktop的Smart模式会先判断任务属于办公、编程、研究、设计还是混合场景,再估计推理深度、工具范围和交付要求。简单任务优先速度与成本,复杂任务切换更强模型;大任务还能拆给多个会话,让研究、规划、执行和复核分别推进。每个会话拥有独立记忆、工作区与任务状态,同时可以共享目标和进度。

这套设计减少用户手动挑模型的负担,也把责任转移给调度层。生产环境不能只看最终文件,还要记录每一步选了哪个模型、调用了哪些Skill、为何切换路径、失败后怎样恢复。如果调度依据不可见,成本突然增加或结果质量波动时,团队很难定位问题。

浏览器和电脑控制让它进入真实操作链

MiMo Desktop可以打开网页、检索与提取材料、填写表单,并在生成网页后自动检查结果。海外版本还提供电脑控制,可读取屏幕并操作键鼠,在不同桌面应用间搬运信息;稳定重复流程可以先录制,再通过Record & Replay复用。电脑控制没有面向国内版本开放,功能可用范围需要按地区区分。

外部操作一旦可写入,权限和回滚就比生成质量更重要。企业应从只读浏览开始,为表单提交、文件覆盖、邮件发送和应用安装设置单独审批,并保存屏幕状态、操作轨迹和产物版本。公告提到系统会在关键步骤后检查并在必要时修正或停止,但没有公布误操作率与恢复成功率。

成本侧,小米称通过模型路由、局部编辑和上下文缓存减少重复计算,同一会话缓存命中率最高可达99%,跨会话最高95%。这两个数字是特定长任务测试中的上限,没有样本分布、任务构成或独立复测。真正账单还取决于素材变化、上下文长度、模型切换、工具返回和失败重试,不能把峰值命中率直接当成普遍节省比例。

小编判断:桌面Agent的竞争转向可验收交付

MiMo Desktop最值得观察的不是一次会话能生成多少种文件,而是它把材料读取、模型路由、多Agent协作、工具操作、预览修改和成本优化放进同一个交付闭环。这与企业实施的真实难点更接近:最终需要的是能打开、能修改、能回退的成果,而不是看起来完整的一段回答。

邀测阶段应重点记录任务完成率、人工介入次数、局部修改是否破坏其他内容、跨会话交接损失、浏览器操作失败率和每个通过验收成果的总成本。两款MiMo-X模型仍是Preview,能力会继续变化。只有这些指标在真实项目中稳定,99%的缓存峰值和“全模态交付”才会从产品看点变成可复制的生产效率。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消