AI 基础设施的"杰文斯悖论":为什么效率翻倍,算力消耗反而暴涨?
2025年,全球 AI 数据中心的总能耗相当于一个中等国家的用电量。讽刺的是,过去三年间,推理效率提升了上百倍——我们造出了更快的芯片、更优的编译器、更聪明的缓存系统,结果反而加速了能源消耗的膨胀。这不是技术失败,而是一个延续了两百年的经济学悖论在 AI 时代的全景重现。
一、效率提升反而增加消耗:历史总是惊人相似
1865年,经济学家威廉姆·斯坦利·杰文斯(William Stanley Jevens)在研究英国煤炭消费时发现了一个反直觉的现象:瓦特改良蒸汽机后,蒸汽机的热效率大幅提升,但英国的总煤炭消耗量不但没有下降,反而急剧上升。原因在于效率提升降低了单位生产成本,刺激了新的应用场景和更大的总体需求。
这就是著名的"杰文斯悖论"(Jevons Paradox):资源使用效率的提升,反而导致该资源总消耗量的增加。
两个世纪后,这一幕在 AI 基础设施领域加速上演:
- 2022年,单次 GPT-4 级别推理的成本约为 $0.06/1K tokens
- 2024年,同等质量的推理成本下降到 $0.002/1K tokens——两年降了 30 倍
- 2025年,GPT-4o-mini 和各类开源模型将成本进一步压低到 $0.0001 级别
- 然而,全球 AI 算力总消耗在过去两年增长了 超过 100 倍
每一次效率飞跃都在打开新的"需求闸门":智能体持续运行的循环推理、多模态模型的实时视频理解、代码生成 Agent 的 7×24 小时编程、个性化 AI 助手的同时在线服务——这些应用场景在两年前根本不可能存在,因为成本完全无法承受。
如今,它们消耗掉的算力总和远超当年节省的每一焦耳。
二、拆解效率引擎:五波浪潮如何重塑成本曲线
要理解杰文斯悖论在 AI 领域的运作机制,必须拆解驱动推理效率提升的五大技术浪潮及其各自的"反弹效应"。
2.1 从 Ampere 到 Blackwell:每 Token 能耗下降百倍
从 A100 到 H100 到 B200,NVIDIA 每一代 GPU 的能效比都实现了飞跃。H100 在 FP16 推理时的性能功耗比是 A100 的 2.5 倍,而 B200 又比 H100 提升了约 2 倍。
但每一代更高效 GPU 的出现,都在解锁新的应用形态:
A100 时代(2020-2022):
成本 $0.06/1K tokens →
应用形态:偶尔对话、文档摘要、内容审核(人类按需触发)
H100 时代(2022-2024):
成本 $0.006/1K tokens →
应用形态:编程助手常驻、实时多语言翻译、Agent 工具调用循环
B200 时代(2024-2026):
成本 $0.0006/1K tokens →
应用形态:多 Agent 持续协作、全栈 AI 开发团队、个性化 AI 伴侣 7×24 在线
每一级成本下降,人类"按需使用"的模式就被一种"持续在线"的模式所取代。效率提升被更多的使用频次、更长的上下文和更多 Agent 实例完全吞噬。
2.2 AI 编译器与图优化:Operator Fusion 释放硬件潜力
以 FlashAttention 为代表的一系列算法-硬件协同优化,将注意力机制的计算效率推向了新的高度:
- FlashAttention-1/2 通过 IO-Aware 的 tiling 策略将 HBM 访问复杂度从 O(N²) 降到 O(N²/M)
- FlashAttention-3 针对 Hopper 架构的 TMA 和异步屏障进一步优化
- FlashAttention-4 在 Blackwell 上支持 FP4 和新的 Tensor Core 布局
与此同时,编译器层面的优化同样关键。以 FlashInfer、vLLM、TensorRT-LLM 为代表的新一代推理引擎,通过 kernel fusion、speculative decoding、continuous batching 等技术组合,将硬件利用率从传统的 20-30% 提升到 70-90%。
这些优化本质上都在做同一件事:让相同的 GPU 算力做更多的推理工作。但如果需求价格弹性大于 1——事实上在 AI 推理领域弹性远超 1——降价带来的需求增长将超过降价本身,使得总消耗量反而上升。这正是杰文斯悖论的核心机制。
2.3 KV Cache 压缩与分层存储:记忆不再昂贵
KV Cache 是 LLM 推理时最大的内存瓶颈之一。以一个 70B 模型处理 200K token 上下文为例:
传统 KV Cache 内存需求:
2 × num_layers × hidden_dim × seq_len × sizeof(bf16)
= 2 × 80 × 8192 × 200000 × 2 bytes ≈ 490 GB
压缩后(GQA + 量化 + 滑动窗口):
剪枝 + INT8 量化 + L2 norm 淘汰 → 压缩比 8-16x
单请求 KV Cache 降至约 30-60 GB
分层 KV Cache(GPU HBM → CPU DRAM → NVMe SSD)进一步将单请求上下文窗口的物理限制从数万 token 推向数百万级。
这意味着什么?在昂贵的时代,工程师必须绞尽脑汁控制上下文长度。而现在,把整个代码库、全部文档、数年的对话历史全部塞进上下文反而成了默认操作——反正 KV Cache 已经"便宜"了。效率提升再次刺激出远超预期的使用量。
2.4 推测解码:用更短的等待换更多的能耗
Speculative Decoding 的工程设计堪称精妙:用小型 Draft 模型快速生成候选 tokens,再用大型验证模型一次性验证多步。当接受率 > 80% 时,端到端延迟降低 2-4 倍。
但问题在于:降低延迟本质上是在"购买"用户体验,而非节省能源。
以一个具体案例说明:
场景:100K token 文档摘要任务,70B 模型
无推测解码:
总计算量:100K × 70B FLOPs = 7×10¹⁵ FLOPs
总延迟:120秒
用户感受:慢 → 不愿意频繁使用
有推测解码(13B draft + 70B verify,接受率 85%):
Draft 模型计算:100K/3 × 13B = 4.3×10¹⁴ FLOPs
验证模型计算:100K × 70B / 0.85 = 8.2×10¹⁵ FLOPs
总计算量:约 8.6×10¹⁵ FLOPs(反而增加了 23%!)
总延迟:45秒
用户感受:快 → 愿意将 100K 文档也扔进去
虽然单次"单位 token"算力增加了约 15-25%,但延迟的降低让用户行为发生了质变:以前不值得做的任务现在成为可能,以前用短上下文完成的任务现在用超长上下文完成。总体能耗不降反升。
2.5 Agent 化:从单次推理到持续计算
最剧烈的杰文斯效应来 Agent 系统的兴起。传统的 AI 调用模式是"一问一答"——一个用户请求生成一个回复,计算集中在毫秒级窗口内完成。
现代 AI Agent 的运行模式是持续计算循环:
传统推理模式(2022):
用户输入 → 单次前向传播 → 输出 → 闲置
单次任务能耗:~1 kWh/1M tokens
Agent 模式(2025):
持续感知 → 规划 → 工具调用 → 观察结果 → 反思 → 重规划 → ...
一个复杂 Agent 任务:数百到数千次 LLM 调用
单次任务能耗:~10-100 kWh
Multi-Agent 协作模式(2026):
规划 Agent + 执行 Agent + 验证 Agent + 协调 Agent
数十个 Agent 并行或串行运行
单项目能耗:数百到数千 kWh
2026年 Anthropic 的使用数据显示,在 Claude.ai 的产品中,Agent 化任务的平均计算量已经是普通对话的 50-100 倍。OpenAI 的 Codex Agent 在处理一个典型的全栈开发任务时,平均消耗约 45,000 次 API 调用,相当于单个工程师一个月的算力预算。
这就是悖论的核心:让推理便宜 100 倍,但让每个任务使用 1000 倍的推理量,总消耗仍增长 10 倍。
三、数学建模:证明 AI 推理的弹性远大于 1
杰文斯悖论发生的数学条件是需求的"价格弹性"(Price Elasticity of Demand)大于 1。当弹性 E > 1 时,降价导致的总消费增长超过价格降幅,因此总支出反而增加。
3.1 AI 推理的弹性估计
我们可以建立一个简化的模型:
设 P 为单次推理价格,Q 为总推理量,弹性为 E。
关键问题是:E 在 AI 推理领域到底有多大?
保守估计(仅考虑价格效应):
P 每下降 10%,Q 增长多少?
2022→2024:P 下降约 96%(30x)
2022→2024:Q 增长约 100x+
弹性 E = ΔQ% / ΔP% = 100 / 96 ≈ 1.04
乐观估计(考虑长尾应用解锁):
实际弹性可能高达 3-5,因为:
1. 价格下降解锁了全新的长尾用例(边缘推理、嵌入式 AI)
2. Agent 化使单次任务推理量指数增长
3. 更多用户被纳入 AI 服务范围
弹性 E ≈ 3-5 意味着:推理价格每降低 1%,总推理量增长 3-5%。当 E > 1 时,总消费 P×Q 在价格下降时反而增加。
这解释了为什么 AI 芯片出货量在效率持续提升的同时持续攀升:H100 卖出了 300 万+ 颗,B200 的订单排到了 2027 年。
3.2 反弹效应的三种路径
在 AI 推理领域,杰文斯效应通过三条路径传导:
| 路径 | 机制 | 量级 |
|---|---|---|
| 直接反弹 | 单次任务变得更便宜 → 同一任务被更多次执行 | 5-10x |
| 市场扩张 | 成本下降 → 新玩家入场 → 用户基数暴增 | 10-30x |
| 范式转换 | 成本下降 → 全新应用形态出现(Agent/Multi-Agent) | 10-100x |
三条路径叠加,使得 2024-2026 年间全球 AI 推理的总算力消耗增长了至少一个数量级。
四、工程师视角:我们在优化什么?
作为一名系统工程师,我对"效率优化"的反思是:我们优化的是单位性能成本,但系统的总能耗由需求端决定,而非供给端的效率。
这让我重新审视几个核心问题。
4.1 性能优化的真正意义
FlashAttention 将注意力机制的内存占用从 O(N²) 降到 O(N),这当然是深刻的算法突破。但我们需要清醒地问:节省下来的算力被谁使用了?
优化前(2022):
你能负担的上下文长度:4K tokens
你能负担的并发请求:10 QPS/GPU
优化后(2026):
你能负担的上下文长度:1M tokens
你能负担的并发请求:1000 QPS/GPU
问题:用户是否真的需要 1M 上下文?
答案是:"既然免费,为什么不用?"
这才是杰文斯悖论在系统设计层面的体现:效率提升如果不伴随有意识的"需求管理",就会演变为无节制的需求膨胀。
4.2 数据中心的物理限制
效率的物理上限正在逼近真实的物理墙壁:
据麦肯锡 2025 年报告:
- 全球新建数据中心的功率密度需求已从 10kW/机架飙升到 50-100kW/机架
- 英伟达 GB300 NVL72 单机架功率达到 120kW
- 单个超大规模数据中心的总功率已超过 1GW(相当于一座核电厂)
- 2025 年全球 AI 数据中心总用电量预计达到 200-300 TWh
- 预计 2028 年将达到 500-800 TWh
冷却技术追赶:
- 风冷极限:~30kW/机架
- 冷板液冷:~100kW/机架
- 浸没式液冷:~200kW/机架
- 但物理极限终究会到来
当能耗增长撞上电网容量和冷却极限时,效率优化从"锦上添花"变成了"生存必需"——只是在杰文斯机制下,它短期内无法逆转总量增长的趋势。
4.3 全生命周期效率 vs. IT 设备效率
另一个被忽视的层面是:当我们讨论"AI 效率"时,往往只关注推理阶段的 FLOPs 效率。
但真正的全生命周期效率包括:
全生命周期能耗 = 制造能耗 + 运行能耗 + 冷却能耗 + 退役处理能耗
GPU 卡制造能耗:
- 一颗 H100 GPU 的碳足迹约为 15-30 kg CO2e(仅制造阶段)
- 加上 HBM 封装和 PCB,单卡碳足迹约 50-100 kg CO2e
- 一个 10000 卡集群的制造碳足迹 = 500-1000 吨 CO2e
运行能耗(三年周期):
- H100 TDP = 700W × 10000 卡 × 8760 小时 × 3 年
- = 1.84 亿 kWh
- PUE 1.2 时,总能耗 = 2.2 亿 kWh ≈ 13 万吨 CO2e
冷却附加能耗:PUE 从 1.0 → 1.5 意味着额外 50% 的能量消耗
所以真正的问题是:效率优化延长了 GPU 的有效使用周期,但也加速了新 GPU 的采购速度(因为更大的业务量需要更多的 GPU),两者之间的赛跑决定了整体可持续性。
五、应对之道:从局部优化到系统治理
面对杰文斯悖论,单纯追求技术效率是不够的。需要从制度、架构和商业模型多个维度综合应对。
5.1 碳排放感知的调度系统
与其无限制地扩张算力,不如让算力调度系统感知碳强度和能源成本:
class CarbonAwareScheduler:
"""碳感知调度器:在电力清洁时多计算,在电力化石时少计算"""
def __init__(self, regions, model_profiles):
self.regions = regions # 各区域数据中心
self.carbon_api = CarbonIntensityAPI() # 电网碳强度实时数据
def schedule_inference(self, request):
# 获取各区域当前碳强度 (gCO2/kWh)
carbon_by_region = {
region: self.carbon_api.get_current(region)
for region in self.regions
}
# 对延迟不敏感的任务,调度到最清洁的区域
if request.latency_slo > 5000: # 5秒延迟容忍
best_region = min(carbon_by_region, key=carbon_by_region.get)
return self.dispatch(request, best_region)
# 延迟敏感任务:在最近的几个区域中选择碳强度最低的
nearby = self.get_nearest_regions(request.user_location, k=3)
best = min(nearby, key=lambda r: carbon_by_region[r])
return self.dispatch(request, best)
def temporal_shift(self, batch_tasks):
"""将可延迟任务迁移到风电/光伏高峰时段"""
for task in batch_tasks:
if task.max_delay_hours > 0:
# 预测未来 24 小时碳强度曲线
forecast = self.carbon_api.get_forecast(
task.allowed_regions, hours=24
)
# 找到碳强度最低的窗口
best_window = forecast.lowest_window()
task.schedule_at(best_window.start_time)
Google 和 Microsoft 已经在实践类似的"碳感知计算"——Google 的 Carbon Information SDK 允许用户在 Excel 中查看各区域数据中心的实时碳强度。但这只是第一步,真正的系统级碳感知需要将调度决策嵌入到 AI 推理引擎的核心逻辑中。
5.2 应用层的"算力配给制"
在某些场景下,配给制可能是必要的:
- 按任务的算力预算分配:为不同类型的用户/任务设定算力预算上限
- 上下文长度的智能管理:不总是塞满最大上下文,而是动态评估真实需要
- Agent 算力配额:为长时间运行的 Agent 设定计算预算,避免无限循环
Agent 算力预算框架示例:
- 搜索Agent:每次任务最多 50 次 LLM 调用 = 约 0.5 kWh
- 编码Agent:每次任务最多 200 次 LLM 调用 = 约 2 kWh
- 分析Agent:每次任务最多 500 次 LLM 调用 = 约 5 kWh
- 超出预算需要人工审批
这种方法在金融行业的量化交易中已有成熟实践:每笔交易不仅有资金预算,还有计算资源预算(最大延迟、最大并发等)。AI Agent 同样需要类似的约束来防止算力资源的滥用。
5.3 从"更多计算"到"更好计算"
第三条出路是重新定义"效率":从"每 Token 多少 FLOPs"转向"每焦耳多少有价值输出"。
传统效率指标:
tokens/sec/Watt — 单位能耗产生的 tokens 数
问题:大量 tokens 是"思考过程"(思考链中间步骤),对用户无直接价值
新型效率指标:
有用输出 / 总能耗 — 真正解决用户问题的效率
实现路径:
1. 动态推理:根据任务难度自适应选择模型大小
2. 提前终止:Agent 尽早确认解决方案,避免过度推理
3. 输出蒸馏:将复杂的思维链压缩为简洁的关键洞察
DeepMind 的 Chinchilla Scaling Law 研究已经指明了方向:在很多场景下,同等的算力配置下,更小的模型+更多的训练数据的组合,比单纯的"堆参数"方案表现出更好的真实效率。
B 在推理侧同样如此:一个经过任务特定微调的 7B 模型配合良好的 prompt 工程,在很多领域内的表现可以逼近 70B 通用模型,而能耗仅为其 1/10。
六、展望:从"无限扩张"到"可持续智能"
如果说 2022-2025 年是 AI 算力的"狂野西部",那么 2025-2028 年正在进入"水利设施时代"——算力不再是取之不尽的资源,而是需要精细化管理和分配的基础设施。
我们可以预见几个趋势:
- 算力定价的碳附加费:类似于碳交易市场的机制,AI API 调用未来可能需要附加碳排放成本,使外部性内部化。
- 模型架构的"原生效率":下一代模型架构(如混合专家系统 Mamba、状态空间模型等)在设计时就将全生命周期能耗作为一等公民,而非通过后端优化弥补。
- 边缘推理的规模化:随着端侧芯片(如高通 X Elite、苹果 M4)的推理能力达到 GPT-3 级别,更多的推理任务将从云端卸载到本地,从根本上改变全局能耗分布。
- Agent 的"能量审计"机制:如同金融交易的审计日志,未来每个 Agent 任务的完整算力消耗和碳足迹都将被记录和披露,形成行业化的"碳排放账单"。
- 从"更多 FLOPs"到"更多产出":最终衡量 AI 系统价值的指标,将从原始的"FLOPs 利用率"转向"单位算力创造的经济价值"——这是一个系统从粗放转向集约的必然过程。
结语
杰文斯悖论不是失败的信号,而是技术革命的"成长阵痛"。蒸汽机的悖论催生了现代电力工业的监管理念,燃油发动机的高效倒逼出排放标准和碳交易市场——每一次重大效率飞跃都需要在随后的几十年里建立起配套的管理框架。
AI 推理正处于这一历史转折点上。我们这一代工程师有幸参与建造这个全新的算力基础设施,也有责任在杰文斯效应吞噬掉效率红利之前,建立相应的治理机制。
效率提升是一把双刃剑——它既能解放生产力,也能在缺乏约束的条件下透支未来。关键是:让效率的赢家不是盲目的规模扩张,而是真正的价值创造。
*参考文献:Jevons W.S. (1865) "The Coal Question"; Koomey J. et al. (2011) "Implications of Historical Trends in the Electrical Efficiency of Computing"; MIT Technology Review (2025) "AI's Energy Paradox"; Anthropic (2025) "Environmental Sustainability Report"; IEA (2025) "World Energy Outlook"*

发表评论 取消回复