
视觉语言模型不一定要以几十亿甚至上百亿参数换取文档理解能力。Cohere Labs发布North Micro Vision Instruct:总规模约2.4B,其中视觉编码器约400M、语言模型约2B,并以Apache 2.0许可开放权重。它的目标不是覆盖所有多模态任务,而是把文档、表格、图表、界面和表单读取压进更适合本地微调与边缘部署的体量。
常见视觉模型会先把图片缩放到固定尺寸,小字、表格线和相邻字段容易在压缩中丢失。North Micro采用自定义原生分辨率编码器,让页面在较高像素下进入模型,并通过投影层与DeepStack式连接把视觉特征送入语言模型。对发票、说明书、仪表截图和长表格而言,保住空间关系往往比单纯增加语言参数更重要。
官方给出的上限覆盖约1654×2339像素的A4页面,但高分辨率也会增加视觉token、显存占用和延迟。实际部署仍需根据页面密度选择缩放、裁切或分页策略;“原生分辨率”并不意味着任何超大图片都能无成本直接送入模型。
训练先后使用约1000万、1300万和1000万条样本完成视觉对齐与能力扩展,随后加入约5000万条指令样本,并用约50万条偏好数据继续优化。多阶段配方让模型先学会看清,再学习按指令回答和遵循偏好,避免一开始就把所有目标混在同一阶段。
但样本数量不能直接说明数据质量、语言覆盖或企业表单适应性。真实文档常含低清扫描、旋转页、手写批注、复杂合并单元格和行业缩写。团队在采购或微调前,应单独建立这些困难样本,而不是用公开评测平均分替代业务验收。
官方表格中,North Micro在DocVQA上得到0.921,ChartQA为0.808,RefCOCO平均为0.732,显示它在文档问答、图表理解和指代表达定位上具有竞争力。紧凑体量配合这些结果,使其适合做表单抽取、界面理解和设备端视觉助手的起点。
短板也很清楚:MMMU为0.329、OCRBench v2为0.367、MMLU为0.504,说明复杂跨学科推理、困难OCR和通识能力仍落后于更大的模型。单项领先不能被扩写成“全面超越”,尤其在长尾字体、非英语文档和高风险票据场景中,必须保留规则校验与人工复核。
一套更可靠的业务验收应拆成三层:先测字符与字段是否读对,再测字段之间的空间关系,最后才测模型能否根据页面做推理。合同、发票和医疗文档还要单列拒答、缺页和低置信度流程。这样才能判断错误来自视觉编码、语言推理,还是下游规则,而不是把所有失败都归到一个总分里。指标至少应同时记录整页成功率、字段级召回率、答案可追溯性和单页延迟,并按扫描件、截图、照片与原生PDF分别统计。对于需要持续更新模板的业务,还要观察少样本微调后是否遗忘原有能力,以及量化版本是否在小字和密集表格上出现额外退化。
模型已经提供Transformers调用、MLX权重与基于Axolotl的微调路径,便于团队在服务器和Apple芯片设备上试验。官方同时表示vLLM支持仍在推进,这意味着高并发服务、批处理和生产监控不能仅凭模型卡判断成熟度。
ATYUN认为,North Micro的价值在于把文档视觉做成一个可控、可微调的紧凑底座,而不是再造一个万能聊天模型。下一步应重点观察量化后的精度损失、长页吞吐、中文与混合语言表现,以及同硬件下的每页成本。只有这些数据稳定,2.4B的小体量才会真正转化为边缘部署优势。
