当“思考”开始像电一样便宜
日期:2026-09-26 17:12:25 / 人气:2

AI的临界点,不是它什么时候足够聪明,而是我们什么时候不再需要决定“这件事值不值得让它想一下”。
2025年,让AI在GPQA Diamond上达到约75%的水平,Epoch估算每题成本约为0.30美元。不到18个月后,达到近似能力,只需要约0.0004美元。725倍。一种原本稀缺、昂贵、需要精打细算使用的“机器思考”,正在迅速逼近一种可以被大量调用、后台运行、甚至被浪费的资源。
9月22日,Epoch最新报告给出的中心估计是:自2023年以来,达到固定AI性能水平的最低推理成本,平均每季度下降约47%,折算下来约每年下降13倍。它覆盖数学、科学、棋类等五类benchmark;不同模型与统计口径会得出不同数字,因此47%更像一个合理的中心值,而不是自然常数。
真正值得注意的,并不是“AI便宜了13倍”。而是人类可能第一次开始尝试回答一个此前几乎无法严肃测量的问题:购买一个固定水平的机器认知能力,究竟要多少钱?电力有/kWh,计算有/FLOP,存储有/GB,基因测序有/genome。而现在,开始有人尝试画出:$/capability——固定能力水平的成本曲线。
01 不是token变便宜了,是固定能力正在变便宜
过去两年,模型厂商最爱讲的指标是:每百万token多少钱。但一个模型的token单价可以便宜十倍,它为了完成一道难题,可能要多花三十倍token去推理、反思、调用工具、重试。token虽然变便宜了,完成任务的成本却未必下降。
Epoch换了一个问法:达到70%的GPQA、25%的FrontierMath,或者某个棋类水平,市场上最便宜的实现方案要多少钱?这把模型从“按字收费的API”,重新变成了一种可以按结果衡量的生产工具。它为同一个模型画出“成本—性能曲线”,把许多模型的曲线叠在一起,找到某个时间点上、达到某个能力水平的最低成本——这条外包络线,就是cost frontier(成本边界)。
过去我们习惯比较“谁的模型最强”,现在开始有人比较“要买到同样强的能力,谁最便宜”。这很接近经济学真正关心的问题:不是一单位原材料的价格,而是一单位有效能力的价格。当然,Epoch测到的是固定benchmark能力的最低推理成本,不是“思考本身”的价格,更不是现实劳动的价格。但很多重要的变化,都是从一个还不完美的仪表盘开始的。
02 历史上,真正改变世界的从来不是降价本身
技术史上最容易被忽略的是:一项技术第一次能做到某件事,不代表世界已经改变。它便宜到足以被大规模重组、调用甚至浪费时,世界才会真的改变。电力就是最经典的例子。早期电动机进入工厂时,许多企业只是把蒸汽机换成电动机,工厂布局没变,机器还是围着中央传动轴排列。真正的变化发生在工厂开始围绕电来重新设计:每台机器拥有独立电机,厂房不必再服从中央动力轴,生产线、空间、搬运、协作方式都被重做。
电力带来的最大生产率,不是“把蒸汽机替换成电动机”,而是让“围绕中央传动轴组织工厂”这件事变得不再必要。AI很可能也正走进这个阶段。“ChatGPT比人工写得更快、更便宜”,很可能只是AI时代的“用电动机替换蒸汽机”。最大的事是:当认知成本持续下降,组织会不会不再沿用“人类思考很贵”这一前提,转而重新设计产品、流程、协作和决策?AI将重写“什么值得被思考”的经济学。
03 AI的特殊之处:前沿向前跑,旧前沿向下塌
电力、存储、计算机都经历过成本下降,但AI的曲线有一个奇怪的双重运动:一边是能力边界不断向前,另一边是昨天的前沿能力正在迅速变便宜。今天只有最贵模型能做到的事情,明天可能被更小的模型、更低的推理预算,或者更多竞争者做到。新能力被创造出来→形成短暂稀缺→厂商收取premium→竞争者追赶→蒸馏、量化、缓存、推理优化、算法进步→能力成本坍塌→旧前沿变成商品→新前沿继续向前。这可以叫作“滚动式商品化”。
2025年值1美元的一段能力,2027年仍然完全有用,只是可能只值1美分。模型层真正快速折旧的,不一定是capability,而是capability rent(能力租金)。前沿模型仍然可能极贵,训练集群、芯片、人才、数据、实验和研发投入都可能继续上涨,但复制昨天的智能,会越来越便宜。一个行业会同时呈现两件看似矛盾的事:制造frontier intelligence越来越昂贵,复制yesterday's intelligence越来越廉价。
04 为什么它会掉得这么快?
如果只看芯片进步,很难解释固定能力成本每年约13倍的下降。AI的成本曲线更像多条学习曲线同时叠加:芯片更快、推理工程更好、模型结构更优、训练方法更成熟;大模型可以蒸馏出更小更便宜的模型;量化、稀疏化、缓存、投机解码在不断挤压推理成本;更好的reasoning efficiency让相同的推理不再浪费在无效路径上;市场竞争又会继续压缩利润率。太阳能的学习曲线大体是“制造得更多,所以学会制造得更便宜”,AI的学习曲线则更像硬件、软件、模型、服务、竞争曲线的叠加。
05 但便宜的智能,不等于便宜的劳动
这里是整件事最重要的刹车。一个benchmark上答对问题,不等于完成真实任务;完成真实任务,不等于稳定完成;稳定完成,不等于被验证完成;被验证完成,也不等于产生商业结果。可以把它看成一条成本栈:Compute→Token→Reasoning→Capability→Task Completion→Reliable Task Completion→Verified Task Completion→Business Outcome。Epoch正在从token价格往capability成本推进,但真正决定经济结构的,是后面几层。
越靠近现实任务,曲线越可能不那么漂亮。数学题、代码题、棋类题通常有清晰输入、清晰边界、清晰评分,真实工作却往往有历史上下文、项目惯性、隐性知识、模糊目标、组织关系。METR在测量Agent任务时间跨度时也反复强调:真实工作依赖此前对话、项目背景、既有代码库、人与人的协作。因此cheap intelligence≠cheap labor。一旦基础能力开始廉价化,瓶颈就会往上移动:从模型移向上下文,从答案移向验证,从单次调用移向长期工作流,从“能不能做”移向“谁敢让它做”。真正稀缺的东西,越来越是Context、Data、Environment、Verification、Trust、Workflow、Tool Access、Real-world Execution、Feedback、Attention。
06 GPU将更加不够用
很多人仍然用线性方式理解AI降价:单位成本下降十倍,企业总账单就该下降九成。技术史很少这样发展。当效率提升让某种资源变便宜,人们通常不会只做原来的事情然后少花一点钱,他们会开始做更多以前不值得做的事——这就是Jevons Paradox。煤炭效率提升未必减少煤炭消耗,因为更便宜的能量会被用于更多机器、更多工厂、更多场景。AI也一样:单位推理成本下降,不必然意味着总推理量下降,它可能意味着cost/task↓、number of tasks↑↑、total inference↑、total compute↑。
尤其是Agent出现之后。聊天产品受人类注意力约束,一个人每天不可能发十万条prompt。Agent改变的,是这个约束:它把Human attention→inference变成Machine loop→inference。一个目标可能触发数百次推理,一次任务可能触发数千次工具调用,一个系统可能让大量Agent在后台持续检查、比对、验证、重试、监控和升级。Agent经济真正需要的,不只是“模型变聪明”,还需要单位认知便宜到可以浪费。存储便宜到人们开始保存几乎一切,带宽便宜到视频成为默认媒介,计算便宜到软件开始出现在每个物体里。AI大规模爆发的标志也是同一个:它不再是一种必须精打细算调用的服务,它开始成为一种可以被后台挥霍的资源。
07 真正会爆发的,是过去没人值得花钱思考的问题
我们今天讨论AI,仍然经常问“它能替代多少人工”,这可能严重低估了成本曲线的影响。存储价格下降十个数量级之后,人类没有只是“更便宜地保存原有文件”,而是开始保存照片、聊天记录、短视频、日志、版本历史、位置轨迹、用户行为。很多今天看起来理所当然的产品,在过去不是没有人想到,而是根本不值得做。认知成本下降也会发生同样的事:如果一次机器思考只值0.001元,我们会让它去思考哪些今天根本没人会花钱想的问题?也许是每个客户都有一份持续更新的研究,每一条销售线索都被长期跟踪,每行代码都被持续review,每篇论文都被多个Agent交叉检查,每个学生都拥有连续数年的私人tutor,每一项重要决策都有不止一个独立的第二意见。这些需求今天看起来夸张,就像几十年前“为什么要保存所有照片”一样。但当某种资源穿过成本阈值,需求的边界会自己移动。
08 真正值得争夺的,是部署前沿
理解AI不能只看一条frontier边界。第一条是Capability Frontier:AI最强能做到什么?第二条是Cost Frontier:做到同样的能力要花多少钱?第三条是Deployment Frontier:什么能力已经足够便宜、足够可靠、足够容易集成,以至于值得大规模部署?第三条才真正决定产业格局。很多能力已经足够惊艳但还不够可靠,已经足够便宜但没有上下文、工具权限、数据入口和验证机制,已经有模型但没有工作流、责任边界和用户信任。当标准化认知能力越来越接近归零,价值会越来越多地迁移到模型的互补品上。
09 思考会不会成为下一种基础设施?
Epoch这篇报告自己也承认,benchmark不等于真实工作,所谓“Price of Thought”更像一个早期价格指数。但它已经让一个过去很模糊的问题第一次出现了轮廓。也许未来真正重要的指标不会是/token,甚至不只是/capability,而会是Price of Verified Useful Work——获得一单位可验证、有用、可进入现实流程的机器工作,究竟要多少钱?如果有一天这条曲线也开始持续向下,那么AI的临界点就是:它什么时候便宜到我们不再需要决定“这件事值不值得让AI想一下”。到那时,思考或许会像今天的CPU cycle、存储和带宽一样,大量存在于后台,持续被调用,便宜到几乎不可见。而世界真正的变化,才刚刚开始。
作者:天富娱乐
新闻资讯 News
- 中国零售业,走向自营时代09-26
- 当“思考”开始像电一样便宜09-26
- 法国印花布凭什么火了260年?09-26
- 曾发生村民投毒村干部的问题村,...09-26

