文章
内存带宽瓶颈催生专用推理芯片:每瓦特token成为竞争新标尺
文章阐述AI推理正成为计算机历史上最大规模的工作负载,遵循计算领域“专业化转向“规律——当工作负载足够大且稳定时,通用GPU将被专用推理硬件取代。GPU虽因灵活性促成AI时代,但推理需持续从内存读取数百GB参数并执行简单操作,内存带宽成为瓶颈,GPU在灵活性和功耗上的浪费不可接受。文章引用Google 2026年5月每月处理3.2万亿token(两年增长300倍)、OpenAI约10亿月活用户等数据论证推理需求急剧增长。Etched由三位哈佛退学生于2022年创立,获得a16z投资,雇佣400余名来自Nvidia、Google TPU、Broadcom、Apple、SK Hynix、TSMC的工程师,首颗芯片在TSMC N4P工艺上首次流片成功(行业标准6-9个月),今年夏天开始出货,10兆瓦站点在建。其核心创新包括低电压推理(功耗降至约一半)和集群级内存(跨芯片池化内存实现超低延迟),这些突破需覆盖晶体管到数据中心层面的全栈设计。
核心要点
- 推理是AI的运营支出,随使用量线性增长,是AI的主要成本来源
- GPU灵活性造成推理能效浪费:运行每个token需读取全部模型权重并执行简单操作
- 批处理虽提升吞吐量但牺牲延迟,高增长的工作负载(编码代理、长上下文推理)无法承受
- tokens per watt是推理领域的真正核心指标,数据中心正由瓦数而非美元限制
- GPU并非推理的终点——专业化转向已发生在图形和网络领域,现在轮到AI推理
关键判断
- AI推理正成为计算机历史上最大规模的工作负载,需求急剧增长(Google 2026年5月每月处理3.2万亿token,两年增长约300倍;OpenAI约10亿月活用户)
- GPU的灵活性导致推理能效浪费,内存带宽成为瓶颈,专用推理硬件将遵循专业化转向规律取代通用GPU
- 推理是AI的主要运营支出,随使用量线性增长,tokens per watt是核心指标,数据中心正由瓦数而非美元限制
- 批处理虽提升吞吐量但牺牲延迟,高增长工作负载(如编码代理、长上下文推理)无法承受批处理的延迟代价
- Etched公司案例显示专业化推理芯片的创新方向:低电压推理功耗降至约一半、集群级内存跨芯片池化实现超低延迟,覆盖晶体管到数据中心层面的全栈设计
未来推演
判断:未来 3-9 个月,Agent 产品会更快从能力展示转向审批明确、可回滚、可观测的执行流程。
时间跨度:未来 3-9 个月
为什么是现在:文章对价值判断已经不再停留在对话体验,而是落在流程接入、执行闭环和控制能力上。
重点信号:产品是否增加审批节点、案例是否从演示转向生产流程、用户是否更重视可观测性
置信度:高