AI模型后训练催生专业评测与数据服务新赛道,UniPat、Mercor、Surge AI等公司通过提供专家评估、动态评测基准和强化学习环境,帮助大模型公司识别缺陷并优化性能,形成高增长、高毛利的新型AI基础设施服务。
一家成立不到一年的AI公司,正在拿下20亿元融资。
据报道,阿里巴巴拟领投UniPat新一轮约3亿美元融资,腾讯、红杉中国等参与,公司估值约25亿美元,折合人民币近170亿元。
UniPat给AI出题、判卷,告诉模型哪里做错了。
这门生意已经开始赚大钱。
2024年,AI数据与评测公司Surge AI收入约12亿美元;Mercor今年披露的年化总收入已超过20亿美元;Scale AI去年收入也已逼近10亿美元。
UniPat成立于2025年末。创始人李宽是90后,本科毕业于北京航空航天大学,硕士毕业于中国科学院计算技术研究所,目前在香港科技大学计算机科学与工程系攻读博士,研究方向包括LLM Agent。创业前,他曾作为实习生在阿里通义DeepResearch参与后训练研究,重点包括数据合成和强化学习。
后训练解决的核心问题之一,是让已经完成预训练的模型继续“变聪明”。模型会做多少题并不够,训练团队还要知道:什么答案算好,错在什么地方,哪种反馈最值得拿去继续训练。
UniPat把这件事做成了产品。一位在头部大厂AI智能体项目负责人告诉铅笔道,UniPat取代智能体研发项目中,原本测试团队要做的事情,把整个评估过程,打包成产品来评估AI任务执行的完善程度,切中了刚需。
目前最直接的赚钱方式,是把专业人士的判断卖给大模型公司。
Mercor为OpenAI、Anthropic、Google DeepMind等组织程序员、律师、金融从业者和科学家,让他们出题、写答案、评价模型输出,再把数据交给客户做后训练。公司最初做AI招聘,后来发现,最舍得为高端人才付钱的是大模型实验室,于是转向AI训练。
据Forbes报道,Mercor今年6月的年化总收入超过20亿美元,比2月的10亿美元又翻了一倍。公司今年上半年总收入约6.14亿美元,其中约91%来自基础模型公司。
但20亿美元不是纯软件收入。约60%至70%的流水要付给专家。Mercor赚的是撮合差价,更重要的是快速找到合适专家、控制交付质量。
Handshake走的是同一条路。它原本是大学生招聘平台,手里有高校、学生和校友网络。2025年切入AI训练后,不到一年,这项业务的年化总收入接近10亿美元;扣除专家报酬后,年化净收入约3亿美元。
Surge AI则更像一家高毛利的数据服务商。创始人Edwin Chen曾在Google、Facebook和Twitter工作。公司2024年收入约12亿美元,客户包括Google、Meta、Microsoft和Anthropic。
Surge卖的同样是人类反馈和高质量数据,但它把业务往更高价值环节推:不只是找人做题,而是设计任务、评分标准、评测集和训练环境。相比单纯的人力撮合,这更接近一套AI后训练服务。
这几家公司赚的是同一笔钱:模型越强,越需要更专业的人告诉它哪里错了。
行业之所以从标注走向评测,原因很简单:模型已经越来越会考试。
早期训练数据的问题是“有没有答案”。今天的问题变成了“什么答案才算真正好”。让AI识别一只猫,可以用一个标签解决;让AI修改一个大型代码仓库、做一份投行分析、完成医院行政流程,很难只用“对/错”两个字评分。
这时,评分标准本身就成了数据。
UniPat今年推出的ExpertEval覆盖医疗、金融和法律三个领域,共3213个专家案例、207个场景,每个案例平均设置21.83条评分标准。它不仅看结论,还检查证据、推理过程和高风险错误。这些评分结果可以继续用于后训练。
它的Monthly-SWEBench则每月从最新关闭的GitHub任务中抽题测试模型。题库必须不断更新,因为公开Benchmark很快会被“刷题”:分数上涨,不等于真实工作能力同步提高。
它的SaaS-Bench更接近真实工作。UniPat把Agent放进23套可运行的SaaS系统,要求完成报销、关账、项目管理、医疗行政等任务。结果目前最好的模型虽然能完成不少中间步骤,但端到端完全完成任务的比例只有3.8%。
这3.8%恰恰是这类公司的生意。如果Agent已经能稳定完成99%的工作,评测公司的价值反而会下降。正因为模型频繁失败,AI实验室才需要不断找新题、找错误、设计评分规则,再把失败样本送回训练。模型每升级一次,这个循环就可能重来。
Scale AI也经历了类似升级。它从自动驾驶数据标注起家,后来进入高质量训练数据、模型评测、红队测试和政府项目。2025年,Meta斥资143亿美元取得其49%股份,公司估值升至290亿美元。
这类公司的价值是能否持续发现模型不会做的事,再把失败原因变成训练信号。模型每升级一次,新的评测和训练需求就会再来一遍。
行业正在寻找比“按人头卖数据”更好的商业模式。新的方向叫RL Environment,也就是强化学习环境。
可以把它理解成给Agent搭一间“模拟公司”。里面有邮件、CRM、代码库、财务系统、客户工单和各种工具,AI不只是回答一道题,而要连续完成几十甚至几百步操作。系统再根据结果自动打分,让模型反复练习。
这比传统标注更难,也更接近软件产品。传统模式需要不断招人、派单、验收,收入增长往往伴随人工成本增长;训练环境一旦搭好,可以被不同模型反复调用,并持续生成新的训练轨迹和反馈信号。
Surge已经成立专门团队建设这类环境。今年它发布的EnterpriseBench CoreCraft模拟了一家客户支持公司,包含2500多个实体、23种工具,让Agent处理多步骤工作。Mercor也在7月收购了专门做强化学习环境的Deeptune,并明确把编码、医疗、法律等领域的训练环境作为下一阶段业务。
Handshake则开始把另一种稀缺资源拿出来卖:企业真实运营数据。它公开向企业征集经过脱敏的业务数据,根据数据规模和价值,一份合作可支付10万至400万美元以上,再把整理后的数据提供给前沿AI实验室用于训练和评测。
这说明这门生意正在形成三层收费:第一层卖专家时间,第二层卖整理好的训练数据和评分标准,第三层卖可以持续产生训练数据的环境。越往后,越接近基础设施。
当然,这门生意还没有摆脱人力服务。Mercor约六至七成流水需要付给专家,客户又高度集中在少数头部AI实验室;Scale在Meta入股后遭遇部分客户关系变化,也说明“中立第三方”本身就是一种资产。
本文不构成任何投资建议。
本文来自微信公众号“铅笔道”(ID:pencilnews),作者:松格,编辑:黄小贵