
桌面AI正在从“帮你生成一段内容”转向“接过一包杂乱材料,最后交回可编辑成果”。9月8日,小米MiMo Desktop开放邀请测试,可直接读取文档、图片、视频、PDF、音频和压缩包,自动拆解目标、调用模型与工具,并交付表格、幻灯片、网页、3D原型甚至软件工程项目。获批用户还能限时、限额体验MiMo-X-Pro-Preview与MiMo-X-Flash-Preview两款新模型。
真实工作很少从一条干净提示开始。一次方案可能同时包含PDF、表格、录音、图片和旧网页,用户通常要先整理格式,再分别交给不同工具。MiMo Desktop试图把这层准备工作并入任务:读取原始材料,梳理事实和结构,再生成可继续修改的文件。官方示例包括从混合材料制作可编辑PPT,以及通过MCP控制Figma生成设计元素。
产品内的结果预览不是一张静态截图,网页和交互组件可以直接点击,Office与HTML支持局部编辑、继续生成和版本回退。这一点决定了它更像工作台而不是答案框:用户可以检查交付物的状态与结构,只重做有问题的部分,避免每次修改都从头生成。
不过“支持很多格式”不等于每类任务都可靠。复杂表格公式、演示稿母版、视频时间线和大型代码仓库需要完全不同的验收标准。当前公告没有披露各场景任务数、一次完成率或人工返工时间,能力范围应视为邀测目标,而不是成熟度证明。
MiMo Desktop的Smart模式会先判断任务属于办公、编程、研究、设计还是混合场景,再估计推理深度、工具范围和交付要求。简单任务优先速度与成本,复杂任务切换更强模型;大任务还能拆给多个会话,让研究、规划、执行和复核分别推进。每个会话拥有独立记忆、工作区与任务状态,同时可以共享目标和进度。
这套设计减少用户手动挑模型的负担,也把责任转移给调度层。生产环境不能只看最终文件,还要记录每一步选了哪个模型、调用了哪些Skill、为何切换路径、失败后怎样恢复。如果调度依据不可见,成本突然增加或结果质量波动时,团队很难定位问题。
MiMo Desktop可以打开网页、检索与提取材料、填写表单,并在生成网页后自动检查结果。海外版本还提供电脑控制,可读取屏幕并操作键鼠,在不同桌面应用间搬运信息;稳定重复流程可以先录制,再通过Record & Replay复用。电脑控制没有面向国内版本开放,功能可用范围需要按地区区分。
外部操作一旦可写入,权限和回滚就比生成质量更重要。企业应从只读浏览开始,为表单提交、文件覆盖、邮件发送和应用安装设置单独审批,并保存屏幕状态、操作轨迹和产物版本。公告提到系统会在关键步骤后检查并在必要时修正或停止,但没有公布误操作率与恢复成功率。
成本侧,小米称通过模型路由、局部编辑和上下文缓存减少重复计算,同一会话缓存命中率最高可达99%,跨会话最高95%。这两个数字是特定长任务测试中的上限,没有样本分布、任务构成或独立复测。真正账单还取决于素材变化、上下文长度、模型切换、工具返回和失败重试,不能把峰值命中率直接当成普遍节省比例。
MiMo Desktop最值得观察的不是一次会话能生成多少种文件,而是它把材料读取、模型路由、多Agent协作、工具操作、预览修改和成本优化放进同一个交付闭环。这与企业实施的真实难点更接近:最终需要的是能打开、能修改、能回退的成果,而不是看起来完整的一段回答。
邀测阶段应重点记录任务完成率、人工介入次数、局部修改是否破坏其他内容、跨会话交接损失、浏览器操作失败率和每个通过验收成果的总成本。两款MiMo-X模型仍是Preview,能力会继续变化。只有这些指标在真实项目中稳定,99%的缓存峰值和“全模态交付”才会从产品看点变成可复制的生产效率。
