全速前进:尽管有人在呼吁放慢AI,其支撑基础设施却在快车道上
作者: CBISMB
责任编辑: 邹大斌
来源: CBISMB
时间: 2026-09-20 11:19
浏览: 493
点赞: 30
收藏: 5
本周,在旧金山举行的Salesforce Dreamforce大会上,科技巨头们就"是否应当放慢AI部署节奏"展开了激烈辩论;几乎同一时间,向南约一小时车程处,另一批重量级技术专家正在开会,讲述他们如何以尽可能快的速度搭建AI基础设施。
在圣克拉拉举行的AI Infra Summit上,来自亚马逊云科技(AWS)、甲骨文、博通、高通和d-Matrix等公司的技术专家,介绍了他们如何努力优化基础设施,以满足AI不断攀升的需求。围绕这项技术的挑战正日益清晰:AI既耗电又极度消耗内存,而Token成本目前在不少企业已经失控式上涨。
"每瓦Token数已成为这场AI竞赛新的关键指标。"高通执行副总裁兼数据中心与AI业务总经理托尼·皮亚利斯在周三的演讲中表示,"我们显然不能沿着这条曲线一直走下去。基础设施这一侧必须做得更好。"
为推理需求而建
AI需求的指数级增长,在极短时间内催生了多元化的算力形态。2025年大部分时间里,训练AI模型需要大量GPU算力;而今年重心转向推理后,Token用量飙升,也带来了对更异构基础设施的需求——CPU由此被纳入其中。
对于多年前就开始自研CPU产品线的行业超大规模云厂商AWS而言,这是塑造未来AI基础设施的绝佳机会。"大部分算力都将用于服务推理,"亚马逊高级副总裁彼得·德桑蒂斯说,"推理将是一类规模巨大的工作负载。"
AWS战略的核心是Graviton——其基于64位Arm架构的CPU系列,专为云应用提供能效而开发。今年6月,AWS推出Graviton5 CPU,用于支持实时AI推理与多步骤任务编排。
"如今AWS上绝大多数工作负载在Graviton上运行得更快、成本更优,"德桑蒂斯说。他指出,AI将解锁软件层面更多的专用化。"我认为由此会催生一波全新的通用工作负载。"
突破内存墙
除了GPU与CPU之间的平衡术,内存在AI处理中的作用也日益关键。据行业分析记录,一台典型AI服务器的内存用量约为传统服务器的8倍;AI服务器内存支出预计将从2025年的350亿美元跃升至2027年的1750亿至1900亿美元,增长约五倍。
这种加速增长,让业界在"如何以最优方式满足AI庞大内存需求"上出现了分歧。过去一年,高通把重心从传统的高带宽内存(HBM)转向了一种新的专有架构——高带宽计算(HBC)。
高通估计,在大批量场景下,HBC每瓦带宽是HBM的6倍,每瓦容量是静态随机存取存储器(SRAM)方案的200倍。据皮亚利斯介绍,高通认为HBC是跨越"内存墙"的一条路径——所谓内存墙,即算力已经超出了内存与带宽所能支撑的水平。
"瓶颈在于数据搬运,而不是算术运算,"他说,"解决办法是让计算离内存更近。我们实际上把数据搬进了计算所在的同一栋楼,所有人共用同一部电梯上下。HBC带来的正是行业所需的价值。"
与英伟达合作的Raptor DRAM方案
企业技术领域还有另一批人,在为内存墙寻找不同的解法——他们走的是动态随机存取存储器(DRAM)路线。计算初创公司d-Matrix已将更高吞吐的3D DRAM集成进其下一代芯片架构Raptor。该方案将多层存储单元垂直堆叠,从而实现更高的存储密度与更强的性能。
"我们比SRAM好得多,"d-Matrix创始人兼CEO席德·谢思在其演讲中解释道,"实际上我们也比HBM好得多。我们为'无限推理'的世界已经准备了很久。"
上周,谢思的公司公布了与英伟达的合作:把Raptor纳入这家AI芯片巨头的机架参考架构NVLink Fusion。该方案面向AI实验室、超大规模云厂商和"新云"(neocloud),用于部署超低时延的高端Token服务。
"我们决定直接搭在这套基础设施上,"谢思说,"通过这种方式,我们从Vera Rubin机架走向Vera Raptor机架。"
为可扩展性而生的网络
要把数以百万计的GPU、CPU、存储系统、内存与软件组合成一台高效运转的机器,网络已成为AI基础设施故事的核心一环。
为获得更好的性能、可扩展性与成本表现,网络在企业AI的成功方程式中正变得不可或缺。甲骨文的Acceleron就是一个例子——这是为甲骨文云设计的高性能网络虚拟化架构与融合SmartNIC技术。
甲骨文与英伟达、AMD的合作,催生了名为Acceleron RoCE的网络技术,它提升了性能,并绕开了把数据经由承载GPU的服务器CPU转发的路径。
"我们必须优化技术栈的每一个部分,"甲骨文云基础设施高级副总裁卡兰·巴塔说,"网络正变得和算力本身同等重要。"
博通在塑造支撑AI部署的网络技术方面也有重要影响。颇具历史意味的是,这家公司围绕以太网构建了面向AI的网络架构——而以太网是上世纪70年代诞生的技术。
以太网以高速和低时延著称。博通利用AI集群中的以太网组网,打造了面向AI的网络产品组合。
博通去年推出的Tomahawk 6网络芯片,专为驱动数据中心的以太网交换机而优化。Tomahawk 6通过一组名为Cognitive Routing 2.0的AI特性来优化网络速度,它能够检测网络拥塞并把数据改道至其他链路,从而避开性能瓶颈。
"业界一致认为,全球最大的集群都在用以太网做纵向扩展,"博通产品副总裁哈桑·西拉杰说,"网络即计算机。"
本周硅谷AI Infra Summit上的演讲表明,业界正投入大量工作建设支撑AI的基础设施。原因其实很朴素:AI已经在企业中落地,客户需要让它变得更好。
在一场圆桌讨论中,多位嘉宾前一秒还在提Token支出账单之高,后一秒就对成本不以为意。
"我们确实让计价器一直转着,"开利全球首席数据与AI官阿伦·南迪说。该公司今年Token支出增长了8倍。"这是探索的代价。对我们来说,重要的不是每个Token的成本,而是每项任务的价值。"