171次提交,小米Miloco让家庭AI开始识别宠物

2026年08月06日 由 ATYUN编辑部 发表 1027 0
家庭摄像头观察猫狗活动并由用户查看事件记录
家庭摄像头感知宠物活动、用户查看事件记录的原创示意图。

家庭智能体一直有个尴尬:它能看见客厅里有“东西在动”,却未必知道那是家里的猫,还是需要忽略的偶发画面。小米在8月5日发布Miloco v2026.8.5,经过171次提交和26个合并请求,把实验性宠物识别、画面智能裁剪与智能体操作审计放进同一版本。它试图让家庭AI从识别人,进一步走向理解人与宠物共同生活的日常。

三个变化:宠物成为可持续识别的家庭成员

第一,宠物不再只是“猫”或“狗”的一次性标签。新版本增加宠物名册、结构化身份和多图注册流程,参考裁剪图会被保存并送入融合感知提示。系统结合外观文字描述进行匹配,同时加入明确的“无法确认”机制;对于猫狗之外的动物,则尝试用身体区域完成定位。

第二,Smart Crop会在多模态推理前裁出活动区域。当完整画面被缩小时,远处宠物或人物往往只剩很少像素;现在系统先依据逐帧的人、猫、狗检测框选择主体,必要时分档放大短边,再把裁剪视频、全景参考和坐标一并写入追踪记录。该功能默认开启,宠物识别则仍是实验功能且默认关闭。

第三,家庭智能体的动作开始更可追溯。Miloco新增操作账本,持续记录设备控制、语音播报和场景触发;每个摄像头还能配置独立感知提示,并通过紧急程度阈值决定哪些建议真正交给智能体。对家庭场景而言,这比“看见了什么”更关键,因为错误识别一旦触发设备,影响会直接进入现实空间。

智能裁剪解决的,是家庭摄像头最现实的分辨率问题

Miloco以米家摄像头的视频和音频作为全模态感知入口,再由大模型理解事件、拆解家庭任务并控制设备。家庭镜头通常视野很宽,主体却可能只占一小块;把整帧直接压缩给模型,容易丢掉毛色、轮廓和动作细节。智能裁剪的价值,是把有限的视觉预算优先留给真正活动的区域,而不是单纯提高每次请求的分辨率。

版本还修复了跨网段摄像头直连字段读取错误,并把单播探测与广播分离。遇到跨子网视频停滞时,界面会给出网络调整提示,而不是只显示失败。与此同时,感知内存泄漏、解码线程重连、身份聚类缓存和异常裁剪坐标也得到修正。这些变化不够吸睛,却决定一个需要全天运行的家庭系统能否稳定工作。

从线程池到数据库,长期运行成本被摆上台面

针对单路低清视频空闲线程过多的问题,新版将视频解码线程限制为4个、OpenCV限制为4个,ONNX检测与重识别限制为2个,去重和语音活动检测的小模型则使用单线程。它没有给出统一性能增幅,因此不能据此推断每台设备都会更快;更准确的理解是,团队在压低常驻资源浪费。

数据库修复提供了一个更直观的生产案例:某个222.8MB的观测数据库中,有142.5MB属于可回收空闲页,旧清理逻辑每次实际只释放一页。新版本改为分批回收、缩短写事务,并把阻塞操作移入工作线程。对于持续写入家庭事件、视频片段和反馈的系统,存储膨胀与界面响应并不是边角问题。

能识别宠物,不代表已经可以放心托管家庭

当前宠物功能仍处于实验阶段,官方没有公布误识率、遮挡场景表现、推理延迟或每日电量与token成本。项目建议至少4GB内存和256GB存储,支持macOS、Linux及Windows下的WSL,还需要小米账号、已加入米家的设备、兼容的智能体运行时和多模态大模型密钥。其感知与决策主要依赖云端模型,持续使用会产生API费用。

宠物参考图、家庭成员身份、摄像头音视频和设备控制记录也构成高敏感数据。新版本已经加强图片类型校验、路径约束、日志注入防护和单播来源过滤,但用户仍需关注数据保存位置、账号权限、摄像头覆盖范围以及自动动作的撤销机制。尤其是提醒、语音和设备控制,不应只靠模型信心分数决定。

ATYUN认为,这次更新真正有价值的不是“AI终于认识猫狗”这句口号,而是识别、画面预算、动作审计和资源治理被放进了一条完整链路。家庭智能体要从演示走向日常,必须既理解成员,也能解释自己看到了什么、为什么行动。接下来最值得观察的,是宠物识别在夜间、遮挡和多宠家庭中的稳定性,以及用户能否用足够低的成本长期保持感知在线。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消