路透社投入4000万美元自研垂直大模型Thomson,基于其独有的法律、税务、新闻等专业数据资产,在法律研究等特定领域达到前沿通用模型水平,标志着企业AI正从依赖外部通用模型转向依托专有数据自建垂直模型的新阶段。
撰文:小饼
8 月 24 日,Thomson Reuters 宣布推出自研大语言模型"Thomson"。这家年收入超过 70 亿美元的信息巨头称,模型基于开源底座训练,累计投入约 4,000 万美元(涵盖人才和算力),训练数据来自 Westlaw 法律数据库、Practical Law 实务指南、Checkpoint 税务研究平台和 Reuters 新闻资产。早期评估显示,Thomson 在多个任务上的表现"与最新的前沿模型相当"。
4000 万美元,对比一下:OpenAI 最新一轮融资 400 亿美元,Anthropic 累计融资超过 130 亿,xAI 单轮就拿了 60 亿。前沿实验室用数十亿美元堆算力训练通用模型,而 Thomson Reuters 用不到一个零头,在一个垂直领域做出了自称可以对标前沿的能力。
CTO Joel Hron 的原话是:AI 行业多年来把规模当答案,更大的模型、更多的算力、更多的钱。Thomson 证明存在另一条路径,从一个强大的基础出发,针对真正重要的工作做深度特化,就能构建高效且完全自主可控的智能。
垂直行业的 AI 自建时代正在开始。
Thomson 从开源底座出发(公告未指明具体是哪个模型),通过中期训练(mid-training)和后期训练(post-training)注入 Thomson Reuters 的专有数据。
公告透露,目前只使用了不到 10%的自有内容进行训练,后续将继续探索新的专业化方向。数百名学科专家从训练目标设计到最终评估全程参与。
模型的首个部署场景是 CoCounsel Legal 中的表格分析(Tabular Analysis)功能,面向律所和企业法务部门。CoCounsel 保持多模型架构,在 Thomson 具有明显优势的场景使用 Thomson,在其他场景继续使用外部前沿模型。
Thomson Reuters 还在 Hugging Face 上发布了一个"小型"开源版本,供学术和非商业用途使用,并邀请法学和 AI 学者进行独立评估。
华盛顿大学法学院教授 Jonathan Choi 用公司税课程中的高难度问题测试了 Thomson、ChatGPT和 Claude,评价是三个模型都回答正确,但他更偏好 Thomson 的回答,特别是引用法律论著的链接让回答更透明、更实用。
这个数字是理解整件事的钥匙。
训练一个通用前沿模型的成本正在指数级攀升。Meta 训练 Llama 3 用了超过 1.6 万块 H100 GPU,算力开支估计在数亿美元。OpenAI和 Google DeepMind 的训练预算更高。这些模型的目标是"什么都能做",从写诗到解微分方程,从编程到角色扮演。
Thomson Reuters 做的事情在逻辑上完全不同。它不需要一个什么都能做的模型,它需要一个在法律研究、税务合规、监管解读和专业文档分析这几个极度垂直的领域里,做到和通用前沿模型一样好甚至更好的模型。这个目标的范围窄得多,所以训练成本低得多。
但真正让 4000 万美元成为可能的,不是范围缩窄,而是数据资产。
Thomson Reuters 拥有的 Westlaw 法律数据库覆盖了超过 40,000 个案例数据库和超过 100 年的判例积累。Practical Law 包含 650 多名律师编辑持续维护的操作指南和模板。Checkpoint 是美国税务专业人士的标准工具。Reuters 新闻语料库覆盖全球,时间跨度超过 175 年。
这些数据不是从互联网上爬取的。
它们是经过专业编辑、标注、结构化和持续更新的专有资产。在这种数据上训练出来的垂直模型,在其专业领域内的准确性和引用质量,通用模型很难通过简单的 RAG(检索增强生成)或微调来匹配。通用模型可以"接入"这些数据,但接入和"在其中生长"是两回事。
Thomson Reuters 自己也点出了这个区别:领域特化的训练产生的增益,是单纯的内容接入无法替代的。
Thomson Reuters 不会是唯一一家。沿着"专有数据→垂直模型→更低推理成本→更强数据控制→更高企业毛利"这条链条看,至少有几类公司具备复制这个模式的条件。
金融数据公司。Bloomberg 已经在 2023 年训练了 BloombergGPT,基于自有的金融终端数据和新闻语料。虽然后续动作不多,但 Bloomberg Terminal 的数据壁垒和 Thomson Reuters的 Westlaw 属于同一个量级——这些是任何通用模型都无法合法获取的专有数据集。
专业服务机构。四大会计师事务所(PwC、Deloitte、EY、KPMG)、大型律所联盟(如 Baker McKenzie、Kirkland & Ellis),以及医疗信息公司(如 Epic Systems 的电子病历数据),都坐拥大量高度结构化、高度保密的专业数据。这些机构不愿意把客户数据交给通用模型处理,同时又需要 AI 提升效率。自建垂直模型对它们来说,从合规角度可能不是选择,而是必须。
行业数据垄断者。MSCI 拥有全球 ESG 评级和指数数据,Verisk 拥有保险定价和风险模型数据,Wolters Kluwer 拥有欧洲法律和合规数据,RELX 拥有 Elsevier 学术期刊和 LexisNexis 法律数据。这些公司的共同特征是:数据是核心资产,数据的独占性就是护城河,把数据喂给别人的模型会稀释自身价值。
Thomson Reuters 的公告里有一个细节容易被忽略:CoCounsel 保持多模型架构。在 Thomson 具有优势的地方用 Thomson,在其他场景继续用外部模型。
这说明即便是自建了模型的企业,也不会完全抛弃通用模型。
通用模型仍然在通用推理、代码生成、多语言处理等方面具有优势。垂直模型替代的是通用模型在特定领域中"够用但不够好"的那一层。
但长期来看,如果越来越多的高价值企业客户开始自建垂直模型,通用模型公司面临的风险是被压缩到基础设施层:提供底座模型供企业二次训练,提供推理 API 处理通用任务,但在最赚钱的垂直应用场景中失去定价权。
这类似于云计算行业的演变。
AWS、Azure和 GCP 提供基础设施,但最赚钱的 SaaS 应用层被 Salesforce、ServiceNow、Workday 这些垂直公司占据。如果 AI 行业走上同样的路径,OpenAI和 Anthropic 的角色可能更接近"AI的 AWS",而非"AI的 Salesforce"。
Thomson Reuters 花4000 万美元证明的事情是:当你拥有足够独特的数据,你可以用一个零头的成本,在你的领域里追平数十亿美元训练出来的通用模型。
这个逻辑一旦被验证,每一家坐在专有数据矿山上的公司,都会重新算一笔账:继续每年给 OpenAI或 Anthropic付 API 费用,还是花一笔相对小得多的钱,训练一个自己完全控制的垂直模型?
对于习惯了"AI 军备竞赛"叙事的市场来说,Thomson Reuters 的4000 万美元是一个反方向的信号。AI 竞争的下一阶段,赢的可能不是训练成本最高的公司,而是数据最独特、最不可替代的公司。模型是工具,数据才是壁垒。