
AI基础设施的评价方式正在发生变化:比起单看芯片峰值性能,运营者更关心每兆瓦电力最终能稳定交付多少有效Token。
9月15日,NVIDIA在官方博客介绍了AI工厂与电网协同的新思路。其核心并不是简单地给数据中心限电,而是把算力任务分级,在电网承压时动态调整可延后的训练、批处理和后台任务,同时尽量保护对时延敏感的在线推理服务。
从“持续满载”转向“可调度负载”
NVIDIA称,DSX平台把计算、网络、供电、制冷和运营管理放在同一套设计框架中。配套的Emerald AI Conductor可以接收电网侧信号,并据此调整灵活计算负载。电力紧张时,系统降低部分低优先级任务的功率;压力缓解后,再恢复计算。
这让AI数据中心有机会从传统的固定大负荷,转变为可以参与电网协调的“柔性负荷”。对供电方而言,价值在于缓解峰值压力;对数据中心而言,则是在现有电力约束下提高基础设施利用率。
首个专用部署瞄准96兆瓦AI工厂
根据NVIDIA披露,首个专用DSX Flex商业部署计划落地美国弗吉尼亚州马纳萨斯,服务于NVIDIA AI Factory Research Center的一座96兆瓦Vera Rubin AI工厂。该项目将成为观察“算力—电力”协同能否规模化运行的重要样本。
企业真正要补的是调度能力
对准备建设或租用大规模AI算力的企业来说,柔性调度并不是安装一个控制软件就结束。首先要明确哪些任务允许暂停、降频或迁移;其次要建立检查点恢复、服务等级、能耗计量和异常回滚机制;最后还要让业务、基础设施和能源团队共享同一套指标。
因此,“Token/兆瓦”正在成为一个更贴近经营结果的指标:它把模型效率、硬件性能、机房设计和电力成本放到同一张账单里。不过,NVIDIA公布的性能与效率数据属于厂商口径,仍需等待真实商业部署中的长期运行数据验证。
图片为AIcent原创生成的实景化示意图,不含第三方新闻图片。
相关推荐
丹炉
431
0
394
0
370
0
646
0
1015
0三元桥David
我还没有写个人简介......
帖子
提问
粉丝
OpenAI发布GPT-6 Sol与Luna:企业用AI开始按任务分档
2026-09-23 12:18:28 发布NVIDIA谈智能体安全:模型之外,权限、沙箱与审计都要设边界
2026-09-22 17:08:19 发布


京公网安备:11010502051901号