先进开源解读“词元经济”之三:词元为什么越来越便宜
上一期我们讲到,词元工厂正在把算力变成产能。而当词元真的可以被规模化生产之后,一个更现实的问题浮出水面:词元价格的涨跌,已不再只是一项技术成本指标,而是叠加了产业竞争、商业变现焦虑与 AI 基础设施定价权的多线议题。

过去几年,这个行业发生了一件看似矛盾的事:
模型能力越来越强,词元价格却越来越便宜。
GPT-4 级别性能的词元成本,从 2022 年底约 20 美元/百万词元,下降到 2026 年约 0.40 美元/百万词元,三年左右下降约 50 倍。
但奇怪的是:词元越来越便宜,企业的 AI 支出却不降反升。
OpenAI 的推理总支出在词元单价暴跌的同时,反而增长约 2.4 倍。Uber 今年前四个月就耗尽了全年 AI 预算。
更奇怪的是,2026 年上半年还在"降价潮",下半年却突然迎来"涨价潮"——DeepSeek 在 8 月全面上调 API 价格,并引入高峰 / 空闲分时计价。
词元价格,到底遵循什么逻辑?
一、词元为什么越来越便宜?——价格背后的"降本三角"
先来看最直接的问题:
为什么今天的词元,比几年前便宜这么多?
答案并不只是"GPU 变便宜了"。
词元价格的背后,实际上存在一个由算力、能源和规模效应共同构成的"降本三角"。

第一,算力效率提高,是词元降价最直接的推动力。
Epoch AI 的研究显示,在知识、科学、推理等多个任务上,达到相同能力水平的大模型推理成本正以每年 9 到 900 倍的速度下降。2026 年发布的论文《Tiered Super-Moore's Law》系统研究了 2020 至 2026 年大模型推理市场的价格演变,发现经济型和中端模型价格分别以 1.10 年和 1.55 年的半衰期快速下降,降价速度甚至快于传统摩尔定律。
20 → 0.40 美元 / 百万词元
GPT-4 级别性能的词元成本,从 2022 年底到 2026 年,三年内下降约 50 倍。
背后发生的并不仅仅是芯片升级。量化技术可将运营成本降低 60% 至 70%;推测解码进一步提升了推理效率;MoE(混合专家)架构则让模型不必每次都激活全部参数。DeepSeek 通过 MoE 架构、多头潜在注意力、多词元预测等技术创新,将词元生产成本压缩至西方竞争对手的 1/10 到 1/100。
这些技术最终都指向一个指标:
用同样的 GPU、同样的电,生产更多词元。
第二,规模效应正在进一步摊薄成本。
一座数据中心如果只有少量用户,那么 GPU、机房、网络和运维成本都需要由有限的词元调用承担。但当调用量达到数十亿、数万亿甚至更高时,固定成本就可以被大量词元摊薄。
于是形成一个非常典型的循环:
用户越多 → 调用量越大 → GPU 利用率越高 → 单位成本越低 → 可以继续降价 → 吸引更多用户。
这也是为什么词元天然具有明显的规模经济。
第三,能源正在成为新的成本约束。
当 AI 推理规模不断扩大之后,词元生产开始越来越依赖持续、稳定、低成本的能源。
· IEA(2026 年 4 月):AI 专用数据中心电力消耗在 2025 年达到 155 TWh,占全球电力消耗的 0.49%。
· Gartner(2026 年 6 月):全球数据中心电力需求将在 2026 年增长 27%,达到 132 GW。
· Brookings Institution:数据中心电力消耗到 2026 年可能接近 1050 TWh——若将数据中心视为一个国家,其能源消耗将位居全球第五。
这意味着,词元价格的下降并不是没有底线。
芯片和算法负责把成本往下压,能源则可能成为价格的"地板"。
核心判断:词元价格快速下降的本质,是整个"智能生产系统"的效率提升;但随着算力成本持续下降,能源正在成为新的成本约束。
二、从 DeepSeek 到全球模型厂商:一场词元价格战正在打响
如果说技术进步决定了词元"可以卖多便宜",那么市场竞争决定的就是:
厂商愿意把价格降到多低。
这几年,词元市场经历了一轮非常猛烈的价格竞争。
其中最具有标志性的事件,是 DeepSeek 带来的价格冲击。
2025 年 1 月,DeepSeek R1 以每百万输入词元约 0.55 美元的价格发布,达到 OpenAI o1 约 95% 的能力,价格仅为后者的 3%——这一 97% 的价格差距在 AI 行业引发了"Sputnik 时刻"式的震动,短暂冲击了美国科技股市场。
3% 的价格,达到 95% 的能力
DeepSeek R1 vs OpenAI o1。
这一差距被形容为 AI 行业的"Sputnik 时刻"。
连锁反应随即展开:

短短几个月,全球大模型行业经历了一轮密集的价格重置。
部分国产大模型的价格已降至国外同类产品的十分之一。稀宇科技开放平台首席架构师冯雯表示:"我们现在模型输入价格是百万词元 2.1 元,输出是每百万词元 8.4 元,是国际某些模型价格的不到十分之一。"
《财经》测算发现,在典型智能体场景下,DeepSeek-V4-Pro 1 亿 Token 综合使用成本约 17 元,比 DeepSeek-R1 的 124 元低 86%。
这种竞争与传统软件市场有一个很大的区别。
传统软件通常是:功能越多 → 产品越贵。
而 AI 正在出现另一种模式:能力越来越强 → 单位词元价格越来越低。
这背后其实是一场效率革命。
如果一个模型能够用更少的计算完成同样复杂的任务,它就拥有降价空间。而一旦某家厂商降价,其他厂商就必须跟进。
于是形成:
技术进步 → 成本下降 → 降价 → 用户增长 → 调用量增长 → 规模扩大 → 成本进一步下降。
词元价格就这样不断向下。
但问题也随之出现:
如果大家都一直降价,谁来赚钱?
答案是:
价格从来都不是这场战争的最终目的。
核心判断:词元价格战表面上是在争夺"每百万词元多少钱",实际上是在争夺用户、开发者和 AI 应用的入口。
三、免费词元:真正争夺的不是收入,而是生态
今天很多 AI 产品都提供免费额度。
从表面上看,这似乎意味着:
词元已经不值钱了。
但如果从商业模式来看,恰恰相反。
免费词元可能是 AI 企业最重要的"获客工具"之一。
这其实很像互联网时代的"免费模式"。
用户免费使用产品,平台真正争夺的是:
用户规模、开发者、应用、数据和生态。
词元经济里的逻辑则更加直接:
低价词元 → 吸引用户 → 吸引开发者 → 开发应用 → 形成生态 → 提高平台依赖 → 最终实现商业变现。
因此,今天一家 AI 企业愿意把词元价格压得非常低,并不意味着它认为词元没有价值。
它可能恰恰认为:
越便宜,越应该让更多人使用。
为什么?
因为一旦企业和开发者围绕某一个模型建立起应用,迁移成本就会越来越高。
一个开发者可能已经在某个平台上积累了:
API 接口 · Prompt 体系 · 工作流 · 微调数据 · 工具调用 · 用户数据 · 应用逻辑
模型一旦成为整个应用的基础设施,换模型就不再只是"换一个 API"。
因此,词元价格战真正争夺的,是生态入口。
这就形成了一个非常典型的"剃刀与刀片"结构:

所以:
便宜的词元可能不是利润终点,而是生态入口。
这也是为什么 AI 行业愿意承受巨额基础设施投入,甚至在相当长时间内接受较低利润。
50 亿 美元 · OpenAI 2025 年推理成本
22.7 亿 美元 · 对应微软渠道收入
大规模词元生产在当前阶段仍处于"战略性亏损"状态。
核心判断:词元价格战本质上是一场以资本为弹药的生态圈地战。低价词元是"剃刀",真正的利润来源是由此建立的开发者锁定、数据飞轮和平台依赖。
四、词元越便宜,为什么 AI 账单反而越高?——"杰文斯悖论"来了
到了这里,词元经济出现了一个非常有意思的悖论:
词元越来越便宜,为什么企业的 AI 支出却未必越来越低?
因为:
大家开始用更多词元了。
2026 年 6 月 22 日,《财富》杂志中文版发表了一篇文章,标题直指核心:《顶级经济学家警告:词元成本下降,企业 AI 支出却不降反升》。
文章引用了阿波罗全球管理公司首席经济学家托斯滕·斯洛克的观点。斯洛克认为,这正是"杰文斯悖论"的又一现实例证。
1865 年,英国经济学家威廉·斯坦利·杰文斯发现:瓦特蒸汽机提高了煤炭利用效率,减少了完成同样工作的煤炭消耗量,但煤炭总消耗量反而激增。因为效率提升降低了使用成本,反而释放了更多应用场景,导致总需求爆发。
150 多年后的今天,这一幕在 AI 领域重演。
清华大学清新团队发布的《Token 经济学全景报告》揭示:过去两三年,前沿大模型单次调用成本暴跌至约原来的 1/280,但 OpenAI 的推理总支出却不降反增约 2.4 倍。
1 / 280 单次调用成本
2.4 倍 OpenAI 推理总支出
数据来源:清华大学清新团队《Token 经济学全景报告》
贝恩公司的数据印证了这一趋势:从 2024 年 12 月到 2025 年 12 月,词元成本下降了一半,但同期词元消耗量却增长了 450%。
450% 词元消耗量增长
同期词元成本下降 50%。
吃掉预算的不是涨价,而是用量。
Gartner 今年 3 月的分析显示,智能体场景下 Token 耗用量是普通对话的 5 到 30 倍。智能体每完成一项任务要触发 10 到 20 次模型调用。
美国网约车巨头 Uber 的案例最具冲击力。由于越来越多地使用 Claude Code,公司在今年前四个月就耗尽了全年 AI 预算。Uber 如今已将员工每月 AI 支出上限设定为 1500 美元。
麦肯锡 2026 年 5 月的企业 AI FinOps 调查发现,93% 的企业目前超出 AI 预算。对 127 家企业实施的调研显示,73% 超出预算,部分项目超出初始预算的 2.4 倍。五分之一的企业已因运营成本过高而被迫限制 AI 使用。
93% 的企业超出 AI 预算
麦肯锡 2026 年 5 月企业 AI FinOps 调查。
贝恩将其称为"AI 的虚假效率曲线"——每个词元更便宜,但每项任务消耗更多词元,总账单顽固地居高不下。
过去的 AI 使用方式非常简单:
一个问题 → 一次回答。
现在则完全不同。
一个智能体接到任务之后,可能需要:
理解任务 → 搜索资料 → 阅读文件 → 调用工具 → 生成方案 → 检查结果 → 再次推理 → 修改答案。
一个任务可能触发几十次甚至更多模型调用。
于是出现了一个非常重要的变化:
AI 从"回答问题"开始变成"完成任务"。
而完成任务所消耗的词元,远远超过简单聊天。

这就像高速公路越来越便宜之后,大家开车的里程反而越来越长。
最终结果可能是:每公里更便宜,但一年跑得更多。
AI 也是一样:每个词元更便宜,但每项任务消耗更多词元。
这也是为什么未来企业评价 AI 成本,不能只看:
每百万词元多少钱?
而应该进一步看:
完成一次任务需要多少词元?
以及:
这些词元最终创造了多少价值?
企业的思维也会发生变化:
过去是:"怎么少用一点词元?"
未来可能变成:"怎么用更少的词元完成更有价值的任务?"
这意味着 AI 企业竞争的核心,也会从"词元最大化"(tokenmaxxing)转向:
结果最大化(outcomemaxxing)。
核心判断:词元价格下降,不等于智能成本下降。真正需要计算的,是完成一个完整任务需要多少词元,以及这些词元最终创造多少价值。
五、词元价格最终会降到哪里?——从"商品词元"到"溢价词元"的分化
那么,最后一个问题来了:
词元会不会最终便宜到接近免费?
从技术进步来看,答案似乎是:
会越来越便宜。
从市场需求来看,答案又是:
很难真正趋近于零。
因为词元价格同时受到两股力量影响。
一边是:技术通缩。
芯片性能提升、模型架构优化、量化、推测解码、MoE、基础设施规模化,都在不断降低单位词元成本。
另一边是:成本反弹与需求膨胀。
2026 年的词元价格走势,本身就是一部浓缩的经济学教材。
一季度:词元"涨价潮"。
算力紧缺、需求爆发,多家大模型厂商接连取消优惠或涨价。清程极智联合创始人师天麾表示:"去年各大模型厂商折扣力度较大,但今年明显收紧。今年有的厂商即便买很大的量都不打折,在紧缺的时候甚至要加价去买 Token。"供需关系失衡是根本原因——Token 需求量增长很快,但算力总量的增长远不及此。
二季度:词元"降价潮"。
DeepSeek 永久降价 75%,小米降价 99%,腾讯降价 97.5%,OpenAI 跟进。摩根大通预测,未来 12 个月内 Token 单位价格还会再降 40% 以上,普通模型接近"商品化"。
三季度:词元"分化"。
2026 年 8 月 17 日,DeepSeek 新版 API 定价正式生效——全面上调价格,并引入高峰、空闲分时计价。高峰时段为北京时间 9:00-12:00、14:00-18:00;其余 17 小时为空闲时段,价格更低。
如果只看价目表,涨幅相当惊人。DeepSeek-V4-Pro 的缓存命中价格,从每百万词元 0.025 元上涨至空闲时段 0.15 元、高峰时段 0.30 元,涨幅分别为 500% 和 1100%。
1100% 高峰时段涨幅
DeepSeek-V4-Pro 缓存命中价:0.025 元 → 空闲 0.15 元(+500%)→ 高峰 0.30 元(+1100%)。
词元开始像电力一样,有了峰谷电价。
《财经》在涨价前后共跑了六次同样的测试——用开源智能体框架调用 DeepSeek API,反复执行同一个任务:从谷歌 24 个季度财报中提取 10 项财务指标,汇总成一张 Excel 表格。结果显示:DeepSeek-V4-Pro 的实际成本涨至原来的 2.9 倍到 5.8 倍。
但即便涨价后,DeepSeek-V4-Pro 依然是企业调用 API 时价格最低的主流模型。
这次涨价释放了两个信号:
第一,词元价格不会无限趋零,"赔本赚吆喝不可持续"。
第二,分时计价正在将词元从"统一定价"推向"精细化定价"——词元开始像电力一样,有了峰谷电价。
更长远来看,随着算法效率提升空间收窄、能源成本上升、高端推理芯片供应受限,词元价格通缩的速度预计将逐步放缓。
因此,未来词元价格很可能不会变成一个统一的数字,而会逐渐形成两条轨道。
第一条轨道:商品词元
文本分类、摘要、简单问答、翻译、代码补全等标准化任务,模型之间越来越容易替代。
这些词元的特点是:需求巨大、竞争激烈、价格敏感。
未来可能越来越像电力、带宽和云计算一样,成为一种基础数字商品。
第二条轨道:溢价词元
复杂科研推理、金融分析、法律审查、工业设计、医疗辅助以及重大决策支持等任务,对模型能力、数据质量和可靠性的要求更高。
这些场景真正购买的不是"词元数量",而是:
高质量的智能结果。
长江证券 2026 年 6 月的一份研究报告系统梳理了词元定价的分层逻辑:

2026 年 3 月的一篇学术论文甚至提出了"标准推理 Token"(SIT)及配套期货合约方案,模拟显示 Token 期货可将企业算力成本波动降低 62% 至 78%。Token 正在被当作大宗商品来对待。
更有甚者,Bloomberg Law 2026 年 5 月报道,多国政府正在探索对 AI 词元征税的可能性,美国国会议员提出了"词元税"概念——这一监管趋势一旦落地,将进一步影响词元价格的长期走势。
核心判断:词元经济最终不是"所有词元越来越便宜",而是"低价值词元越来越便宜,高价值词元越来越值钱"。
结语:从"词元价格战"到"智能价值战"
把前三篇连起来看,词元经济的逻辑已经逐渐清晰。
第一篇,我们讲:词元是什么?——它是 AI 处理和生成信息的基本计量单位。
第二篇,我们讲:词元从哪里来?——能源、芯片、算力、模型、数据和推理系统,共同构成了词元工厂。
第三篇,我们进一步追问:词元为什么越来越便宜?——因为技术在降低成本,模型在提高效率,规模在摊薄成本。
但价格战并不会简单地把所有词元都推向"零价格"。
因为在词元经济里,存在一个更加重要的变量:
价值。
未来可能出现这样的分化:
· 普通词元越来越像商品。
· 专业词元越来越像服务。
· 高价值词元越来越像生产资料。
所以,真正值得关注的已经不是:
"谁家的词元最便宜?"
而是:
"谁能用最低的成本,生产最高价值的智能?"
这也意味着,词元经济的竞争正在从:
比模型 → 比算力 → 比成本 → 比效率 → 比价值。
而当词元开始成为一种真正意义上的数字商品之后,一个更大的问题也随之出现:
如果词元可以被生产、定价和交易,那么,谁掌握词元的生产权、分发权和定价权?
芯片厂商?模型厂商?词元工厂?云平台?还是掌握大量数据和应用场景的企业?
下一场真正的竞争,或许不是"谁的模型最强",而是谁能够成为词元经济的基础设施。
开源观察 · 深度分析 每周一个主题,用开源信息做完整分析,本期主题:《深度解读词元:AI 时代的新计量单位》。
