eviso's thinking

当算力的瓶颈从芯片变成电网

CONTENTS

2026 年 8 月第一周,三条关于 AI 基础设施的消息同时出现,没有一条跟芯片有关。

SpaceX 计划在 2027 年底前建立约 10 吉瓦的计算能力,其中 6 至 8 吉瓦在 2027 年上线,年化收入潜力达 3000 亿美元(来源:SemiAnalysis,经 Techmeme 转载)。Nvidia 同意向 Lancium 投资 20 亿美元,后者是德州 Stargate 校区的电力基础设施开发商,达标后追加 10 亿美元(来源:The Information)。亚马逊在加州 Gilroy 秘密谈判一个 20 亿美元的数据中心项目,全程没有公开会议或投票(来源:Wall Street Journal)。

三条新闻的共同点:钱投的不是芯片,是电。GPU 买得到,电不够用。算力竞赛的瓶颈,已经从硅晶圆转移到了电网。

10 吉瓦是什么概念

一个吉瓦等于 10 亿瓦。一个典型核反应堆的装机容量约 1 吉瓦。SpaceX 的 10 吉瓦目标,相当于 10 座核电站的功率专门跑 AI 推理。

SemiAnalysis 的测算给出了一个参照:每吉瓦每年可以处理约 1000 亿次推理操作。微软 Azure 2026 年的目标也是 10 吉瓦(来源:SemiAnalysis 分析)。

两家加起来,仅 2027 年就要消耗 20 吉瓦的电力。

这不是规划中的数字。马斯克在 36kr 的报道中直接说,要用火箭技术造数据中心(来源:36kr 快讯)。SpaceX 的制造能力(星际工厂的批量生产 + 运载火箭的供应链管理)正在被复用到数据中心建设上。不是从零开始建机房,是把航天级的快速迭代方法论搬到算力基础设施。

另一边,2027 年的存储产能已经售罄。HBM(高带宽内存)消耗的晶圆面积约为 DDR5 的三倍,制造商把产能全速转向 AI 加速器,消费级内存供应被挤压(来源:Hacker News / IGN)。芯片端的瓶颈没有消失,但电力端的瓶颈更致命:芯片可以加单生产,电网不是下单就能有的。

约束条件的转移

《底层逻辑》里有一个分粥的故事。几个和尚分粥分不公平,试了选德高望重的人分、轮流分、成立委员会分,都不行。最终的解决方案不是改流程,不是加制度,是改系统:轮流分粥,但分粥的人最后一个拿。

刘润的结论是:普通人改变结果,优秀的人改变原因,顶级优秀的人改变系统。流程是线性的步骤,制度是行为准则,系统是各部分之间的关系总和。只改流程和制度,不改系统,问题会在新的地方重新冒出来。

把这个框架放到 AI 基础设施上:过去两年,行业解决的是芯片端的约束。Nvidia 的 H100 到 B200,单卡算力翻了几倍,供应链也逐步跟上。但芯片的约束一旦松开,下一个约束立刻浮现:电力。

这就是系统思维里「约束理论」(Theory of Constraints)的典型表现。一条链的强度取决于最弱的一环。加强了芯片这一环,电力变成最弱的一环。加强了电力,散热又变成最弱的一环。每一轮解约束,都在暴露下一层瓶颈。

亚马逊在 Gilroy 的做法很有代表性:不是公开招标建数据中心,而是跟地方政府秘密谈判。为什么秘密?因为电力审批是公共流程,涉及电网扩容、环境影响评估、社区听证。

20 亿美元的投资,卡点不在资金,不在 GPU,在环评和电网接入审批。

但需要承认这个框架的边界。刘润的「系统」概念来自企业管理咨询,处理的是组织内部的流程和激励机制。AI 基础设施的约束转移涉及的是物理世界的硬约束(热力学定律、电网物理容量、土地和水资源),这些约束不能用「改变系统设计」来解决,只能用物理世界的时间表来解决。一座变电站从规划到通电,在美国平均需要 3 到 5 年(来源:美国能源部电网现代化报告)。

从小社群到大社会

邓巴在《大局观从何而来》中提出了一个核心命题:人类的大局观是在小社群中进化出来的,但现代社会的问题规模远超小社群的经验范围。

AI 算力基础设施正在经历类似的跳跃。2023 年,一个 AI 实验室需要的是一柜 GPU 和一间机房的空调。2027 年,SpaceX 和微软各自需要 10 吉瓦,相当于把一座中型城市的全部电力专用于计算。这不是「更多的服务器」,是基础设施范式的跃迁。

邓巴的「邓巴数」告诉我们:人类社交网络的认知上限大约是 150 人。超过这个规模,组织协调的方式必须改变。算力基础设施也在跨越类似的阈值:当数据中心从兆瓦级进入吉瓦级,管理的对象不再是一排排服务器,而是一个完整的能源系统。

SpaceX 的优势恰恰在这里。它不只是一个航天公司,它是一个把火箭级快速制造和系统集成能力复用到能源基础设施的公司。Nvidia 投资的不是芯片公司,是电力基础设施公司(Lancium)。亚马逊谈判的不是地产,是一个隐形的发电站。

但这个类比需要承认边界。邓巴数描述的是人脑的社交认知上限,超过 150 人,信任机制从个人关系转向制度框架。吉瓦级数据中心的挑战不是社交认知瓶颈,是工程复杂度和供应链协调。两者在「规模超出自然管理上限」这一抽象层面有结构相似性,但具体机制完全不同。数据中心的规模问题靠的是系统工程方法(模块化设计、自动化运维、供应链数字化),不是靠改变社交关系。

这意味着 AI 行业的竞争,正在从「谁的模型更强」扩展到「谁的电力更多」。模型可以开源,算力可以租用,但吉瓦级的电力供应是物理资产,没有开源这回事。

什么信号出现说明判断错了

判断一:电力取代芯片成为 AI 算力的第一约束,这一趋势在 2027 年前不可逆。

基准情景:美国新增数据中心电力需求在 2027 年达到 30 至 40 吉瓦,电网扩容速度跟不上,部分项目被迫延期 12 至 24 个月。触发条件:有两个以上州的数据中心项目因电网审批延期超过 18 个月。

上行情景:小型模块化核反应堆(SMR)和分布式能源加速部署,电力瓶颈被技术突破缓解。触发条件:至少一个 SMR 项目在 2027 年前并网供电给数据中心。

下行情景:AI 推理需求增速放缓,对电力的需求增长低于预期,电网扩容反而过剩。触发条件:头部模型公司的推理收入增速连续两个季度低于 30%。

判断二:SpaceX 将成为 AI 基础设施领域的主要玩家,而非单纯的航天公司。

基准情景:SpaceX 在 2027 年部署 6 至 8 吉瓦算力,成为北美第三大算力提供商(仅次于微软和亚马逊)。触发条件:SpaceX 公布算力服务品牌或签署首批外部客户合同。

上行情景:SpaceX 利用星链网络和地面算力构建全球分布式的 AI 推理网络,创造新的商业模式。触发条件:SpaceX 宣布算力与星链集成的产品路线图。

下行情景:SpaceX 的算力部署因监管(FCC/FAA)或技术问题大幅延迟,10 吉瓦目标缩水至 3 吉瓦以下。触发条件:2027 年实际上线算力低于 4 吉瓦。

参考资料

  • SpaceX 10 吉瓦算力目标年收入 3000 亿美元: SemiAnalysis, Techmeme, Horizon item-16, 8 月 8 日
  • Nvidia 投资 Lancium 20 亿美元: The Information, Techmeme, 8 月 7 日
  • 亚马逊 Gilroy 20 亿美元数据中心: Wall Street Journal, Techmeme, 8 月 7 日
  • 马斯克称用火箭技术造数据中心: 36kr 快讯, 8 月 8 日
  • 2027 年存储产能售罄 HBM 占晶圆三倍: IGN / Hacker News, Horizon item-28, 8 月 7 日
  • 美国电网扩容周期: 美国能源部电网现代化报告(待核实具体数据)
  • 《底层逻辑》「流程、制度与系统」: 底层逻辑 resources/14-流程、制度与系统.md
  • 《大局观从何而来》「利用小社群的经验处理大社会的问题」: 大局观从何而来 resources/28-06_利用小社群的经验处理大社会的问题.md