2.4B视觉模型直读A4文档,Cohere开放North Micro权重

2026年08月15日 由 ATYUN编辑部 发表 257 0
小型视觉模块从正上方读取包含表格、图表和地图的文档
紧凑视觉模型处理多类文档的场景示意图。

视觉语言模型不一定要以几十亿甚至上百亿参数换取文档理解能力。Cohere Labs发布North Micro Vision Instruct:总规模约2.4B,其中视觉编码器约400M、语言模型约2B,并以Apache 2.0许可开放权重。它的目标不是覆盖所有多模态任务,而是把文档、表格、图表、界面和表单读取压进更适合本地微调与边缘部署的体量。

原生分辨率路线,先保住小字与版面关系

看点一:2.4B总参数由约400M视觉编码器和2B语言模型组成,定位紧凑型文档视觉。
看点二:最高支持约1654×2339像素的A4页面,相当于200dpi级别输入。
看点三:权重采用Apache 2.0许可,并给出Transformers、MLX与微调路径。

常见视觉模型会先把图片缩放到固定尺寸,小字、表格线和相邻字段容易在压缩中丢失。North Micro采用自定义原生分辨率编码器,让页面在较高像素下进入模型,并通过投影层与DeepStack式连接把视觉特征送入语言模型。对发票、说明书、仪表截图和长表格而言,保住空间关系往往比单纯增加语言参数更重要。

官方给出的上限覆盖约1654×2339像素的A4页面,但高分辨率也会增加视觉token、显存占用和延迟。实际部署仍需根据页面密度选择缩放、裁切或分页策略;“原生分辨率”并不意味着任何超大图片都能无成本直接送入模型。

训练分成多段推进,数据量不等于真实覆盖面

训练先后使用约1000万、1300万和1000万条样本完成视觉对齐与能力扩展,随后加入约5000万条指令样本,并用约50万条偏好数据继续优化。多阶段配方让模型先学会看清,再学习按指令回答和遵循偏好,避免一开始就把所有目标混在同一阶段。

但样本数量不能直接说明数据质量、语言覆盖或企业表单适应性。真实文档常含低清扫描、旋转页、手写批注、复杂合并单元格和行业缩写。团队在采购或微调前,应单独建立这些困难样本,而不是用公开评测平均分替代业务验收。

文档和定位较强,通识与复杂OCR仍有明显短板

官方表格中,North Micro在DocVQA上得到0.921,ChartQA为0.808,RefCOCO平均为0.732,显示它在文档问答、图表理解和指代表达定位上具有竞争力。紧凑体量配合这些结果,使其适合做表单抽取、界面理解和设备端视觉助手的起点。

短板也很清楚:MMMU为0.329、OCRBench v2为0.367、MMLU为0.504,说明复杂跨学科推理、困难OCR和通识能力仍落后于更大的模型。单项领先不能被扩写成“全面超越”,尤其在长尾字体、非英语文档和高风险票据场景中,必须保留规则校验与人工复核。

一套更可靠的业务验收应拆成三层:先测字符与字段是否读对,再测字段之间的空间关系,最后才测模型能否根据页面做推理。合同、发票和医疗文档还要单列拒答、缺页和低置信度流程。这样才能判断错误来自视觉编码、语言推理,还是下游规则,而不是把所有失败都归到一个总分里。指标至少应同时记录整页成功率、字段级召回率、答案可追溯性和单页延迟,并按扫描件、截图、照片与原生PDF分别统计。对于需要持续更新模板的业务,还要观察少样本微调后是否遗忘原有能力,以及量化版本是否在小字和密集表格上出现额外退化。

开放权重降低定制门槛,部署生态仍在补齐

模型已经提供Transformers调用、MLX权重与基于Axolotl的微调路径,便于团队在服务器和Apple芯片设备上试验。官方同时表示vLLM支持仍在推进,这意味着高并发服务、批处理和生产监控不能仅凭模型卡判断成熟度。

ATYUN认为,North Micro的价值在于把文档视觉做成一个可控、可微调的紧凑底座,而不是再造一个万能聊天模型。下一步应重点观察量化后的精度损失、长页吞吐、中文与混合语言表现,以及同硬件下的每页成本。只有这些数据稳定,2.4B的小体量才会真正转化为边缘部署优势。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消