
Arm 云 AI 执行副总裁 Mohamed Awad
我们已经过了仅凭演示效果来评判人工智能 (AI) 基础设施的阶段。如今,更关键的问题在于,这些能力能否以可靠、可扩展且具备成本效益的方式交付。这正是我们在设计下一代 AI 基础设施过程中,与云服务提供商、芯片合作伙伴及系统构建商共同面对的挑战。
在电力、空间和预算等现实约束下,行业需要支撑不断增长的 AI 推理工作负载,更要能够为客户提供持续创造价值的服务。这一挑战正在重塑基础设施设计:从关注单个芯片和服务器,到关注整个机架;从提升单个组件性能到优化整个系统。
我们得出一个明确的结论:AI 基础设施不会走向单一的通用设计。智能体 AI (agentic AI) 需要系统级的优化,不同工作负载将需要不同架构。我们希望为生态系统提供统一的基础,同时让合作伙伴能够在最具价值的领域实现差异化创新。原因如下:
机架成为新的计算单元
处理器插槽和单台服务器仍然是计算体系的重要基础,但在 AI 时代,仅关注这些已远远不够。
在机架层面,AI 基础设施构建者能够统筹优化整个系统中的计算、内存、网络、电力及散热资源。这些机架将成为集群、超大规模集群,以及跨多个数据中心园区 AI 部署的基础模块。随着智能体 AI 的算力需求大幅攀升,基础设施必须持续实现更高效率与资源利用率,同时控制成本。
智能体 AI 将基础设施要求推向新高度
随着 AI 从简单的提示词问答模式逐步演进至智能体工作流,这种系统级视角变得愈发重要。
AI 智能体并不会在生成答案后就停止运行。它需要整合上下文信息、选择合适的模型、调用相应的工具、存储和检索状态信息、路由请求,并持续监测和评估执行结果。
智能体 AI 让系统协同设计变得至关重要,因为最高效率并非来自对每个组件进行单独优化,而是来自让整个系统协同工作,实现整体优化。
从模型吞吐量转向实际任务完成度
这一演进也正在改变我们衡量 AI 基础设施的方式。每秒生成 Token(词元)的数量和模型时延依然十分重要,但这些指标并不能说明智能体是否真正完成了任务。
用户真正关心的是任务是否被准确完成;而基础设施运营者更关注资源利用率、可靠性、能耗以及实现这一结果所需的成本。
系统制造商如今不再只关注孤立的模型性能,而是进一步衡量任务完成时间、每项成果的成本、利用率、可靠性,以及贯穿整个工作流的能效表现。
在数据中心层面,任何细微的低效都会被放大。更优秀的系统设计能够提高资源利用率、减少空闲时间,并从有限的电力和空间资源中获得更多产出。
系统级优化离不开多样化选择
Arm 的平台涵盖 Arm IP、Arm 计算子系统 (Compute Subsystems, CSS)、合作伙伴设计的芯片与 Arm AGI CPU,并由开源智能体软件栈提供支持。这让合作伙伴可以自主选择差异化创新的方向、系统自研的程度,以及产品推出的速度。
部分合作伙伴将围绕特定工作负载或服务打造高度定制化芯片,另一些则会借助计算子系统加快集成,同时保留差异化创新能力。合作伙伴自研芯片也将持续为市场带来面向特定场景的专用能力。而 Arm AGI CPU 则为构建满足智能体 AI 需求的基础设施提供了一条加速落地的路径。
工作负载、运行环境、商业模式与部署需求差异显著,无法采用一刀切的做法来满足所有场景需求。随着 AI 基础设施向专用化发展,云服务提供商、芯片合作伙伴、系统构建商以及软件开发者都需要具备足够的灵活性,围绕实际业务需求打造最适合的基础设施。
规模化运营时代
作为整个行业的一员,我们正加速推动先进模型能力实现规模化落地,以可靠、高效且面向全球规模的方式创造实际价值。
基础设施建设者希望加快创新步伐。而实现这一目标,需要一个开放协作的生态系统,在机架级层面整合计算、网络、存储、软件、供电和散热等关键能力。这正是 Arm 与合作伙伴携手共建的未来。

