长文档得分跌60点,ExtractBench把抽取模型拉上实战台

2026年09月03日 由 ATYUN编辑部 发表 798 0

一份十页以内的整洁PDF,可能让抽取模型看起来接近可用;把文档拉长到几十页,结论就会反转。LlamaIndex与Kaggle上线ExtractBench公共榜单,使用370份企业文档、共4869页测试schema驱动抽取。发布方披露,Gemini 3.5 Flash在短文档上的得分为87.9%,进入长文档后降至27.9%,相差整整60个百分点。

快速看点:基准覆盖8个业务领域和67种文档类型;除了字段准确率,还检查记录完整性、证据定位、表格结构与成本;数据集、代码、论文和Kaggle榜单均可公开检查,但创建方自己的产品结果仍需独立复测。
长折页企业文档在校准玻璃台上接受完整性与溯源检查
企业文档抽取的难点不仅是识别单个字段,还包括跨页完整性和证据定位。示意图。

企业抽取不是把PDF变成一段文字

ExtractBench要求系统读取文档和用户定义的JSON Schema,返回结构有效且字段正确的JSON。重复结构必须找齐,缺失字段应写成null而不是编造,同时还要给每个值提供可追溯证据。对理赔、合规和供应链流程来说,漏掉第60页的一条记录,后果可能比单个字符识别错误更严重。

数据包含252份短文档、98份中等文档和20份长文档。长文档虽然数量最少,却有1816页,专门暴露列表截断、跨页表格、扫描退化、旋转页面和手写标注等问题。38份文件还提供干净版与退化重拍版,可对比同一内容在采集质量变化后的损失。

长列表让“一次读完”路线失速

发布方的分项结果显示,部分商业视觉语言模型在前十页保持较高准确率,文档继续变长后却提前停止或漏掉后半段记录。Gemini 3.5 Flash从短文档87.9%降到长文档27.9%,就是典型截断信号。它可能把已经输出的字段写对,却没有完成整份清单。

LlamaIndex称自家Extract Agentic Plus在同一长文档组达到94.4%,做法是先拆分文档,再把抽取值与原页复核;编码代理的总体准确率也接近,但成本更高。由于这些产品比较由基准创建方发布,企业不应把94.4%直接当采购结论,而应使用公开代码和自己的文档重新跑一遍。

排行榜必须和成本、证据、失败模式一起读

Kaggle公开榜主要比较通用模型,论文和发布稿还加入编码代理与专用抽取API。两组结果的系统边界不同:一个模型调用不等于一条带拆页、重试和核验的代理流水线。选型时若只看总分,容易把更高的编排成本隐藏在“模型能力”里。

更实用的评估表应至少分开记录字段F1、记录完整率、schema有效率、证据命中率、每页成本和处理时延。对表格密集、手写或超长文件,还要单列失败类型。这样才能判断问题来自OCR、视觉理解、上下文截断、字段映射还是后处理规则。

基准的领域分布也值得单独审视:金融145份、能源98份、政府49份、汽车27份、供应链20份、医疗15份、法律10份、房地产6份。它能覆盖多种公开记录,却不等于已经代表每家企业的版式、语言和隐私要求。真实系统还要面对加密PDF、传真噪声、混合语言、盖章遮挡、附件缺失与动态schema;这些样本若没有进入评测,公开榜单的高分仍可能在上线后快速缩水。评测还应按业务风险加权:错一个营销字段和错一个付款金额,不应被同一平均分掩盖。团队需要给关键字段更高权重,并记录模型主动拒答是否合理。否则,漂亮的总分仍无法回答一次具体业务决策是否安全。

编辑判断:先测最坏文件,再决定是否让Agent行动

ExtractBench最有价值的不是新增一张总榜,而是把企业文档抽取从“看起来像答案”拉回到完整性和可追责性。代理若要根据抽取结果付款、理赔或触发审批,就必须知道哪些字段缺失、证据在哪一页,以及长文档是否读到结尾。

团队可以把公开基准作为预筛,再加入真实业务中最脏、最长、最难的样本,设置字段级拒绝和人工复核阈值。总分再高,也不应允许低置信度字段直接驱动不可逆动作。真正的生产门槛不是平均准确率,而是最坏文件出现时系统能否识别失败并安全停下。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消