文章以Token为切入点,论述其作为计量机器智力服务产出的新经济单位,类比蒲式耳、桶、千瓦时、比特等历史计量单位的革命性意义;强调Token使智力活动首次可精确计量、定价与交易,推动‘智力即服务’范式形成,并分析其在供需结构、价值评估、成本曲线和监管适配等方面的独特经济特征。
消耗一个 Token,意味着你购买的不是存储空间、计算次数或信息传输,而是模型对你的问题进行一次智力加工的服务。理解一句话、生成一段代码、做出一个判断,这些过去只有人类大脑才能完成的智力活动,现在第一次拥有了可精确计量的单位和可执行的价格。
经济学家有一种识别产业革命的朴素方法:看计量单位。我们回顾历次重大的经济变革,会发现一个不起眼但至关重要的变化反复出现——一种新的计量单位的诞生。计量单位定义了什么东西可以被交易、被定价、被纳入经济体系。一旦某种模糊的产出被标准化度量,围绕它的定价、交易、竞争和制度就会自然浮现。
农业社会有蒲式耳。在标准化之前,粮食只能在集市上以麻袋为单位估价,一袋小麦和另一袋小麦的“量”完全取决于袋子的大小和卖家是否诚信。蒲式耳的出现不只是让交易更方便,还让远期合约成为可能,让买家可以在芝加哥购买他从未见过的堪萨斯小麦。铁路运输降低了跨区域交易成本,但正是标准化的蒲式耳使期货交易成为可能。没有蒲式耳,即使铁路通了,你也无法为一批没有亲眼见过的小麦定价。蒲式耳让农业产出第一次变成了可以远程交易的标准商品。
能源时代有桶。1 标准油桶等于 42 加仑,这个源自宾夕法尼亚油田主的临时选择在 1866 年被标准化后,石油成为可以跨国定价、全球流动的商品。内燃机和汽车工业创造了石油的巨量需求,但“桶”作为标准化计量让石油从一种地方性矿物转变为全球金融市场上可以对冲、做空、期货化的资产。石油经济的驱动力是内燃机,而让石油市场可以全球化运转的基础设施之一则是“桶”。
电气化时代有千瓦时。1889 年,英国工程师首次提出“千瓦时” (kWh) 概念;1948 年,国际电工委员会 (I
信息社会有比特。香农在 1948 年的论文《通信的数学理论》中通过定义信息熵的数学框架,使“比特”成为信息的度量单位,让信息从一个抽象的哲学概念变成了可以精确测量、传输和存储的客观存在。在有比特之前,信息量是一种模糊的直觉;有了比特之后,电话线路的容量、硬盘的存储空间、互联网的带宽都有了可以计价的度量。比特让信息的存储、传输和交易有了统一的度量基础。
这 4 个计量单位有一个共同点:它们计量的都是某种可还原为物理过程的对象。蒲式耳计量物质,桶计量容积,千瓦时计量能量,比特计量信息的编码与传输。比特看起来脱离了物理世界,但它归根到底计量的是信号的编码长度,衡量的仍然是有多少。一个比特存了什么内容,这段内容有没有用,都不在比特概念的范畴里。
Token 计量的不是物质、能量或信息,而是机器处理智力任务的产出量——这改变了一切。

消耗一个 Token,意味着你购买的不是存储空间、计算次数或信息传输,而是模型对你的问题进行一次智力加工的服务。理解一句话、生成一段代码、做出一个判断,这些过去只有人类大脑才能完成的智力活动,现在第一次拥有了可精确计量的单位和可执行的价格。Token 由此成为人类历史上第一个用来计量类似人类智力活动产出的基本单位。在以往的经济发展中,还没有出现过对应的东西。我们第一次能够像买一桶油、一度电那样,按量购买智力服务。
这种转变的本质可以概括为:智力即服务 (intelligence as a service) 。过去购买智力,我们买的是人,是工时,是岗位,是项目。智力被绑定在某个具体的人身上,无法被单独计量;如今购买智力,我们买的是 Token,是任务,是工作流,是结果,乃至不知疲倦的数字员工。智力第一次脱离单个具体的人脑,可以被连续调用、计量和计费。Token 正是这套交易结构的计量单位,它计量的是智力服务的产出,但它本身并不是智力。打一个工业时代的比方,Token 之于智力服务,有点像原材料和能源之于工业生产——原材料的质量和数量、能源的质量和数量,就类似于 Token 的质量和数量。
换一种说法,一部分认知劳动第一次从具体人脑、岗位和工时中被拆出来,变成可以连续调用、计量、计费和组合的服务。Token 计量的是机器智力服务的产出,但它本身并不是智力。如果一定要打一个工业时代的比方,它不太像交通运输,更像工业化生产本身。交通运输解决的是“把已有东西运到哪里”,而大模型解决的是“把输入加工成什么判断、方案和结果”。蒸汽机和电动机让体力劳动第一次被大规模能源化;大模型正在做类似的事,只不过对象从体力劳动变成了认知劳动。工业生产离不开原材料、能源和工艺:原材料的质量和数量、能源的质量和数量、工艺的成熟程度,会共同决定产品能否稳定生产。机器智力生产也类似:数据、上下文、提示词、工具说明和企业知识库构成输入材料,电力、芯片和推理时间提供能源,模型架构、路由、缓存和工作流编排则构成工艺。Token 的质量和数量,正是观察这条认知生产线的一套新仪表。
但“按量购买智力服务”与按量购买石油有一个根本不同。石油、小麦、电力的价值主要由生产端决定。一蒲式耳小麦的品质在收割时就已确定,一桶原油的品级在出井时就可测量。Token则恰恰相反,它的价值完全由使用场景决定。用同一个模型审阅一份价值百万美元的并购合同,与用它闲聊天气消耗的 Token 数量可能相当,创造的经济价值却是天壤之别。而且这个差异只能在调用完成之后才知道,事前无法标注、无法分级。
更特别的是,Token 在不同用途之间切换的边际成本接近零。同一个模型、同一个 API,换一条指令就能从闲聊切换到合同审查。这就形成了 Token 一个很突出的特点:生产端可以被统一计量,消费端交付的却是高度非标准的智力成果,两者彻底脱钩。传统经济学供需分析的一个前提假设是生产端特征与消费端价值是耦合的,这个假设在 Token 时代不再成立。后面的章节会展开论证这一点。
Token 经济已经真实存在,而且它的增长速度超过了几乎所有之前商品在同一阶段的扩张速度。
全 球 头 部 人 工 智 能 公 司 OpenAI 在 2026 年 3 月 披 露, 其API 处理速率已达每分钟 150 亿 Token。要知道这个数字只是API 端口的统计,还不包括 ChatGPT 消费者端产品的消耗。而不到半年前的 2025 年 10 月,OpenAI 在开发者日上公布的数字还是每分钟 60 亿 Token。从 60 亿到 150 亿,5 个月增长了 1.5 倍。同期 Anthropic、谷歌、Meta 以及中国的数十家模型提供商各自运营着规模不等的推理基础设施。在全球范围内,截至 2026 年年初,推理已占据全部 AI 算力的约 2/3,2023 年这个比例还只是 1/3。
中国市场的增长更为惊人。根据国家数据局 2026 年 3 月在中国发展高层论坛上的披露,中国日均 Token 调用量在 2024 年年初约为 1 000 亿,2025 年年底跃升至 100 万亿,2026 年 3 月已突破 140 万亿。两年时间增长超过 1 000 倍。
从全球看,IDC (国际数据公司) 在 2026 年 4 月发布的一份报告显示,2025 年全球 AI 基础设施支出达 3 180 亿美元,比2024 年的 1 530 亿美元翻了 1 倍有余。Token 正在变成一种新型生产要素,不是未来时,而是进行时。
2026 年 3 月在英伟达 GTC (GPU1 技术大会) 大会后的一次访谈中,黄仁勋说了一句话:“一个年薪 50 万美元的工程师,如果一年消耗不到 25 万美元的 Token,我会非常担心。”他甚至还说:“如果顶尖工程师说‘我打算只用纸和笔工作’,那么这跟芯片设计师拒绝用 EDA (电子设计自动化) 工具一样荒谬。”这里的要点不在于具体金额,因为 Token 价格持续下降,数字会很快过时,而是在于它折射出一种正在形成的衡量标准:Token 消耗量正在成为衡量知识工作者生产力的一个新维度,就像上一代人用带宽和云服务的规格来衡量一家公司的数字化程度一样。
这些数字背后隐藏着一个反直觉的结构性事实:单价在暴跌,总支出反而在暴涨。以 GPT-4 级别能力为基准,2023 年年初的推理定价约每百万输出 Token 60 美元,到 2025 年,同等能力水平的市场价格已不到 1 美元,降幅接近两个数量级。6 但同期全球AI 基础设施总支出翻了一倍有余,头部厂商的收入也在同步飙升。在经济学上这叫“杰文斯悖论”
——19 世纪蒸汽机效率提高,理论上煤炭消耗应该更少,但事实是煤炭总消耗反而暴涨。Token市场正在上演同样的剧情,而且节奏更快,幅度更大。关于这个悖论的底层机制,后面的章节会展开讨论。
规模和增速只是表象,真正有意思的是,Token 经济在实际运行中不断挑战既有分析框架。
假设你是一家中等规模科技公司的战略负责人,CEO(首席执行官)要求你从零搭建企业 AI 采购体系。你很快会发现,MBA(工商管理硕士)课程教过的供应商评估、成本分析、采购谈判那一套,在 Token 市场上往往面临巨大挑战。
就供给侧来说,全球有数十家模型提供商,它们的成本结构完全不同。OpenAI 背后的累计投资已达上千亿美元,开源社区里一些团队用几百万美元就能微调出在某些任务上接近前沿水平的模型。
需求侧更让人头疼。 法 务 部 门 本月消耗 了 5 000 万 Token审合同,下月可能涨 3 倍;工程团队部署了几个智能体之后,Token 消耗量一周内暴涨 10 倍,而你事先完全无法预测哪个部门、什么时候、会产生多大的消耗量。传统采购可以汇总一个相对稳定的年度需求计划,而 Token 的需求天然是碎片化、波动剧烈且不断膨胀的。
在定价方面,最简化的竞争模型会说,在充分竞争、产品同质且企业可自由进入退出的条件下,价格会受到边际成本和长期平均成本的约束。但 Token 市场很难满足这些前提:不同厂商的单位推理成本、资本开支摊销、模型能力和服务质量差异巨大,能力价格又在快速下行。你甚至没法确定下个季度同样的预算能买到什么水平的能力。
最让人困惑的是价值评估。同样 1 000 万个 Token,律师用来审合同可能规避了价值上百万美元的法律风险,市场部门用来写周报可能只节省了半小时工时。你当然可以为单个场景计算投入产出,但很难用一个统一口径衡量所有场景的 Token 投入,但CFO (首席财务官) 偏偏要你给出一个“企业 Token ROI”。
把这些困惑归拢一下,我们发现 Token 同时在好几个维度上偏离了传统经济分析中那些最常用的简化前提,而且这些偏离恰好在同一时期发生,并相互放大。
同等数量的模型调用,在计量口径上近似相同,进入不同任务后产生的经济价值却可以差出几个数量级。传统商品当然也有使用场景差异,但很多质量差异已经在生产端被标注、分级并进入价格;Token 的难点在于,调用前只能看到模型、上下文和价格,最终价值却要在具体任务中才显现出来。这不是经济学从未见过的问题,却把“同质计量”和“异质价值”之间的张力推到了极端。
成本以每年跌幅超过 90% 的速度暴跌,但物理基础设施的扩张完全跟不上这个节奏。算法效率可以在硬件不变的情况下独立提升,而晶圆厂从动工到投产需要 3~4 年。两套速率完全不同的时钟在同时运转。
Token 的调用决策正在部分从人类手动提问,越来越转向由Agent 和工作流在既定目标下持续触发。当 Agent 开始在既定目标下决定调用什么模型、消耗多少 Token,需求对价格、延迟、失败率和任务价值的反应速度,就会和我们熟悉的消费品市场明显不同。
现有的贸易和监管框架也常常难以归类。一次 Token 消耗同时包含算力输出、数据处理和智力生成,现有框架通常分别处理这些问题,但 Token 把三者压缩进同一次服务交付。
这些问题各有成因,但它们的组合效应远大于各部分之和。单位价格下降和能力提升加速了 Agent 进入工作流,Agent 的持续执行放大了需求,需求爆发暴露了物理供给瓶颈,供给瓶颈又反过来改变价格、模型选择和应用门槛。
经济学曾经解释过电力、半导体、互联网等通用技术扩散中的价格、投资和竞争问题。每一次新技术出现,既有框架都会遇到边界,随后也会发展出新的分析工具。这一次也不会例外,但需要调整的幅度可能更大。电力让能源可以远距离交易,半导体重塑了计算成本,互联网改变了信息分发;这些变化都深刻,但它们通常没有把“同一计量单位下高度异质的智力成果”“系统作为连续调用主体”“算法效率与物理基建两套时钟”同时叠加在一起。Token 把这些变化压到了同一个市场里。
这不意味着传统经济学错了,供需平衡、边际分析、交易成本理论在各自适用的范围内依然成立。但如果不先检查它们依赖的前提条件,直接把这些工具搬过来,就容易误判 Token 经济的运行方式。当分析对象从物质商品变成了机器处理智力任务的产出,曾经稳健的前提假设不再自动成立,建立在这些假设之上的工具就需要重新校准。这本书尝试做的,就是这个校准工作。
本文为腾讯研究院新书《Token 经济》导言
本文来自微信公众号“腾讯研究院”,作者:腾讯研究院