一份十页以内的整洁PDF,可能让抽取模型看起来接近可用;把文档拉长到几十页,结论就会反转。LlamaIndex与Kaggle上线ExtractBench公共榜单,使用370份企业文档、共4869页测试schema驱动抽取。发布方披露,Gemini 3.5 Flash在短文档上的得分为87.9%,进入长文档后降至27.9%,相差整整60个百分点。

ExtractBench要求系统读取文档和用户定义的JSON Schema,返回结构有效且字段正确的JSON。重复结构必须找齐,缺失字段应写成null而不是编造,同时还要给每个值提供可追溯证据。对理赔、合规和供应链流程来说,漏掉第60页的一条记录,后果可能比单个字符识别错误更严重。
数据包含252份短文档、98份中等文档和20份长文档。长文档虽然数量最少,却有1816页,专门暴露列表截断、跨页表格、扫描退化、旋转页面和手写标注等问题。38份文件还提供干净版与退化重拍版,可对比同一内容在采集质量变化后的损失。
发布方的分项结果显示,部分商业视觉语言模型在前十页保持较高准确率,文档继续变长后却提前停止或漏掉后半段记录。Gemini 3.5 Flash从短文档87.9%降到长文档27.9%,就是典型截断信号。它可能把已经输出的字段写对,却没有完成整份清单。
LlamaIndex称自家Extract Agentic Plus在同一长文档组达到94.4%,做法是先拆分文档,再把抽取值与原页复核;编码代理的总体准确率也接近,但成本更高。由于这些产品比较由基准创建方发布,企业不应把94.4%直接当采购结论,而应使用公开代码和自己的文档重新跑一遍。
Kaggle公开榜主要比较通用模型,论文和发布稿还加入编码代理与专用抽取API。两组结果的系统边界不同:一个模型调用不等于一条带拆页、重试和核验的代理流水线。选型时若只看总分,容易把更高的编排成本隐藏在“模型能力”里。
更实用的评估表应至少分开记录字段F1、记录完整率、schema有效率、证据命中率、每页成本和处理时延。对表格密集、手写或超长文件,还要单列失败类型。这样才能判断问题来自OCR、视觉理解、上下文截断、字段映射还是后处理规则。
基准的领域分布也值得单独审视:金融145份、能源98份、政府49份、汽车27份、供应链20份、医疗15份、法律10份、房地产6份。它能覆盖多种公开记录,却不等于已经代表每家企业的版式、语言和隐私要求。真实系统还要面对加密PDF、传真噪声、混合语言、盖章遮挡、附件缺失与动态schema;这些样本若没有进入评测,公开榜单的高分仍可能在上线后快速缩水。评测还应按业务风险加权:错一个营销字段和错一个付款金额,不应被同一平均分掩盖。团队需要给关键字段更高权重,并记录模型主动拒答是否合理。否则,漂亮的总分仍无法回答一次具体业务决策是否安全。
ExtractBench最有价值的不是新增一张总榜,而是把企业文档抽取从“看起来像答案”拉回到完整性和可追责性。代理若要根据抽取结果付款、理赔或触发审批,就必须知道哪些字段缺失、证据在哪一页,以及长文档是否读到结尾。
团队可以把公开基准作为预筛,再加入真实业务中最脏、最长、最难的样本,设置字段级拒绝和人工复核阈值。总分再高,也不应允许低置信度字段直接驱动不可逆动作。真正的生产门槛不是平均准确率,而是最坏文件出现时系统能否识别失败并安全停下。
