
当多数企业还在比较该接入哪一家前沿模型时,Thomson Reuters决定把模型本身也变成自有资产。它推出首个专有大模型Thomson:以开放权重模型为起点,用两年时间和4000万美元的人才、算力投入,把Westlaw、Practical Law、Checkpoint与Reuters积累的专业内容,以及律师、税务专家的判断标准,写进模型训练过程。
45万美元与4000万美元看似矛盾,实际上揭示了企业自建垂直模型的成本结构。前者只是最终训练运行,后者覆盖两年的人才与计算投入。团队在项目推进中多次更换开放权重底座,当前版本建立在Imperial College London Snowdon模型之上;真正被反复建设的是内容清洗、权利确认、数据配比、专家标注、红队测试和回归评测。
这条路线并不是“企业也去复制一家基础模型公司”。Thomson Reuters只使用了不到10%的自有内容,并让数百名主题专家参与目标定义、示例制作和盲评。模型所吸收的也不只是已出版文档,还包括什么答案值得交付、引用如何成立、哪些商业问题应被优先提示。对专业服务企业而言,这些隐性的判断标准往往比再多一批文件更稀缺。
Thomson没有以独立聊天机器人出售,客户首先会在CoCounsel的Tabular Analysis中接触它。这个功能面对高容量、结构化文档审查:同一组问题批量作用于最多1万份文件,每个答案都应能回到对应材料。任务边界、正确答案和人工复核点相对清晰,适合比较完成率、引用可靠性、延迟和成本,也比泛化的“会不会像律师一样聊天”更接近生产验收。
更值得企业FDE团队关注的是,Thomson成为默认模型并不意味着第三方模型退场。管理员仍能切换其他模型,CoCounsel也会把不同任务交给更合适的能力。自有模型在这里不是新的技术宗教,而是一项可以进入路由、被替换、被审计的组件。这种设计降低了模型升级落后或单点能力不足给整套产品带来的风险。
在公开结果中,Thomson-1-Large在PrBench Legal Hard取得0.352,高于同表中的GPT-5.5、Gemini 3.1 Pro与Claude Opus 4.8;指令遵循得分0.914,长上下文得分0.753。但它在Stanford LegalBench并非第一,推理和编程也落后于部分对手。这反而符合产品定位:它要争取的是专业任务中的可核验优势,而不是覆盖所有通用能力。
这些数字仍需谨慎阅读。主要基准与53个法律研究查询由供应商团队组织,部分指标包含内部测试,评审也使用模型裁判;不同对手的推理模式设置并不完全相同。已有法律与AI学者开展早期测试,小型开放权重版本也计划用于学术验证,但大规模独立评测尚未完成。因此,“与前沿模型竞争”目前应理解为受限条件下的供应商结果,而不是行业定论。
Thomson真正值得关注的,不是法律行业又多了一个模型,而是拥有深度数据和专家队伍的企业开始把RAG之上的能力继续向模型层推进。外部模型负责提供快速演进的通用能力,自有模型沉淀组织特有的标准、工具使用方式和可控部署,两者通过路由共存。企业不必在“全租”与“全造”之间二选一。
这条路也不适合所有公司。没有可确认权利的高质量语料、能长期参与标注与验收的专家,以及足够稳定的高价值工作流,自建模型很可能只是昂贵的品牌工程。下一阶段应观察三件事:Tabular Analysis中的实际人工介入率和单位成本,模型在不同法域与税务任务上的独立表现,以及更换开放底座后能否持续复用训练管线。只有这些生产指标成立,4000万美元才不是一次发布预算,而是一项可复制的企业能力。
