分类:科技 标签:人工智能、芯片架构、Arm、大模型


当AI正在深刻改变计算方式时,下一代计算平台应该如何被设计?当AI计算正从单一芯片性能的军备竞赛,转向多个计算单元协同工作的复杂博弈,谁又能真正组织起庞大的计算资源?

在近期举办的 Arm Everywhere China 活动上,这家传统上的 IP 授权巨头给出了自己的答案。Arm 明确表示,外界不应再用过去「CPU IP 供应商」的单一视角来理解今天的 Arm。在 AI 时代,Arm 的战略正在清晰地拆解为三个核心方向:云 AI、边缘 AI 和物理 AI

一、AI 时代的计算新范式:从单一单元到协同编排

过去几十年里,Arm 凭借开放的架构和 IP 授权模式,成功连接了整个半导体产业,底层技术驱动了超过 3500 亿颗芯片的诞生。在移动计算时代,芯片竞争的逻辑相对直观:需要更强的 CPU、更大的 GPU 以及更先进的制程工艺。

然而,进入大模型与智能体(Agent)时代,一次完整的 AI 任务早已不再由单一计算单元独立完成。它演变为连续推理、多模态交互以及自主任务执行的复杂流程。

  • 边缘 AI:算力需求从过去的「被动响应」转向「持续运行」。智能体需要理解上下文、调用本地应用并在功耗和散热的严苛约束下自主完成任务。
  • 物理 AI:从汽车延伸至机器人,两者共同的核心特征是感知与执行,极度依赖从传感器到执行链路的超低延迟。
  • 云端 AI:智能体的兴起带来了持续性负载,单个智能体甚至会触发数百次调用。在这一背景下,正如 Arm 基础设施业务负责人所言:「在智能体时代,CPU 的角色不再是加速,而是编排。」

面对不确定的未来,英伟达的路线是「我知道未来 AI 计算是什么样,所以我构建一个完整的平台(如 CUDA 范式)」;而 Arm 的路线则是**「未来 AI 计算尚未定型,所以我要构建一个允许变化的平台」**。Arm 不替客户做决定,而是把决策权交还给市场,只确保无论选择哪种路线,底层基建都有 Arm 参与搭建。

二、从计算单元到计算协同:Arm 的全面重构

为了应对这种转变,Arm 针对 CPU、GPU 以及计算子系统(CSS)进行了深度重构。

1. CSS for Mobile 2:迈向 AI 原生计算子系统

过去,客户需要获取不同的 IP 模块并自行完成繁琐的设计优化。而 Arm 推出的 CSS(Compute Subsystems)则提供了一套「半成品」芯片设计方案。升级后的 CSS for Mobile 2 被定义为首个 AI 原生移动计算子系统,不仅单线程和多线程性能显著提升,AI 模型性能更是实现了最高 1.7 倍的飞跃,有效帮助客户缩短芯片上市周期。

2. C2-Ultra CPU:重新定义 AI 时代的 CPU 位置

面对「NPU 是否会取代 CPU」的行业讨论,Arm 用数据证明了 CPU 在智能体任务中的不可替代性。全新的 C2-Ultra CPU 搭载 SME2 单元,强化了矩阵与向量计算能力。在处理如“规划旅行”等涉及理解意图、读取本地数据、调用第三方服务的复杂 AI Agent 任务时,CPU 依然是串联各个环节、降低整体链路延迟的核心基座。

3. Mali G2-Ultra NX GPU:视觉计算与 AI 的深度融合

在移动设备功耗与散热的物理限制下,Arm 推出了首款将神经网络加速器直接集成到着色器内核中的 Mali G2-Ultra NX GPU。 通过 AI 与传统图形渲染的结合,GPU 可以实现神经超级采样与插帧,大幅减少光追需要计算的光线数量,在压低功耗的同时带来了主机级的视觉体验。同时,Arm 将相关神经图形模型开源,将选择权交由开发者与合作伙伴。


总结:Token 调度成为 AI 计算的新战场

如果说过去几年 AI 产业的核心是训练参数更多的大模型,那么进入推理时代后,行业正在面对新的命题:当海量 Token 生成之后,谁来组织和调度这些计算资源?

苹果、高通、英伟达与三星等巨头纷纷给出了各自的闭环或平台化解法。而 Arm 选择的道路,是不做唯一的计算调度者,而是赋能系统所有者。通过开放的计算子系统、高效的软硬件协同以及 KleidiAI 等软件生态优化,Arm 致力于让不同的计算单元在正确的时机、通过正确的资源高效运转。

正如 Arm 在本次活动场所揭示的行业趋势:AI 时代下一阶段的竞争,早已不只是单纯计算能力的较量,而是组织与编排计算能力的较量。 在一个未来形态仍在演进的时代,建立一个能够自适应变化的底层平台,正是 Arm 给出的最优解。