一半的活已经不归 GPU 管了

平头哥算力峰会上,我接连听了两场演讲,一场聚焦 CPU,另一场围绕网卡。

回去路上我一直在想,为什么主办方要把舞台留给 CPU 和网卡?后来复盘时发现,台上两位演讲者绕了一大圈,其实在讲同一件事:GPU 之外的战场。

怎么理解呢?我试着梳理一下。

先说 CPU 那场。主讲人是平头哥半导体产品总监黄伟,他一上台就定下基调:在 agent 时代,CPU 的角色发生了根本性转变。 原因在于,要看工作负载是否变了。

过去大模型推理是一问一答的模式,这个任务基本由 GPU 承担。

但 agent 不同。为了完成一个任务,它需要不断循环:推理一步,调用一个工具,查看结果,再推理下一步,直到任务完成。

调用工具这一步,无论是跑代码、查网页还是读文件,干的都是 CPU 的活。

还有那份必须始终保留的长上下文——模型与你这一单的来龙去脉,每一轮推理都要用它作为原料,这主要由 CPU 侧的内存来维持。

他给出了三个数据。

在 agent 场景中,仅工具执行一项,就占据了整个请求响应时间的大约六成;编码 agent 场景下,容器初始化加上工具执行,在 CPU 侧要占 55% 到 60%。综合计算,CPU 已经扛起了超过一半的负载。

这些数据是他现场给的,实验条件没有展开,但结论很明确:CPU 重新回到了 AI 计算的关键路径。

他将工作负载分为两类,这是整场演讲中让我印象最深的框架。

一类是贴近 GPU 工作的,他称之为 head node,即机头。 GPU 负责重体力活,机头处理杂事,就像司机带着副驾驶。请求进来后,先由它进行预处理。

KV cache 由它管理,这是模型随手记下的草稿笔记,记录着之前计算过的内容,回答下一句时就不必从头再算一遍。笔记放在哪里、如何搬运,都是它的职责。

何时唤醒加速器开始工作,最后结果如何拼接回去,也由它调度和收尾。这个任务卡在关键路径上,机头慢一步,按小时烧钱的 GPU 就得空等一步。

因此,为机头改进 CPU,处处都冲着单核速度。

前端做宽,相当于把进料的单行道拓宽,一个节拍内能吞进更多指令。

乱序窗口放大,好比老师傅炒菜不会等一道菜出锅再准备下一道菜的原料。窗口大,就能往后看几十步,哪条指令能先算,就先算哪条。

KV cache 在 CPU 和加速器之间来回倒腾,地址翻译经常查不到门牌号,每次都像翻字典一样一页页找。解决方法是页表预取,教 CPU 提前把下一页翻好。

还有一个隐蔽的问题:两条本不相关的操作,被系统误判为占用同一个地址,明明可以并行执行,却被排成了一队。内存重命名就是拆穿这种误判,把路让开。

在软件方面,连 Python 解释器派发指令的开销都一条条地抠。

在缓存方面,将 KV cache 的元数据在三级缓存和内存之间分层摆放,常用的放在近处,别让加速器等待一份本该在手的笔记。

另一类是跟推理脱钩的,agent rack,即一排 agent 机房。

一个机柜里塞进几百个沙箱,每个沙箱里有一个 agent 在工作。它调用工具、运行代码、规划步骤、编排任务链条、管理自己的状态。

这些全都不涉及 GPU,全部在 CPU 上运行。 这个任务不求快,求多。一个机柜要尽量多塞 agent,还得让几百个实例不互相争抢资源。

解决方法是另一套。

agent 的循环中有大量不规则的跳转。CPU 工作靠预判下一步,传统预判法在 agent 身上经常猜错。于是引入神经分支预测,让 CPU 靠经验培养出直觉。

RAG 检索、图数据遍历这类任务,是顺着一条藤要挖出一串薯。数据在哪条依赖链的下一环,CPU 不能等到使用时再去找。图预取就是顺着链提前挖掘。

几百个沙箱共用缓存,相当于几百户人家抢一个储藏室。动态缓存替换根据各家的活跃度勤换货,把没人用的腾出去。

MPAM 则是给每个沙箱设定水电表配额。核的周期、带宽,各用各的,谁也不能把公共区域挤瘫痪。

他对这两类任务有一句原话,很形象:机头看内存,看能不能搬得快;机房看内存,看能不能装得多。

整场还有两个数字容易被忽略,我觉得它们才是地基。

一个是 41%。他说在机头场景的一次迭代任务中,41% 的工作无法通过并行化来分摊,尤其是调度控制面这部分。

这个数字背后是阿姆达尔定律:串行的任务加人没用。一锅水烧开了,再多人往灶里添柴也快不了。

整个系统的响应时间,下限就是这 41% 的串行段决定的。想让机器变快,只剩一条路:单核本身变快。机头对单核性能的执念,根子就在这里。

另一个是 28GB。

在机房实测中,单个 agent 实例达到峰值时,需要的内存能到这个量级。一个机柜要装几百个实例,内存不堆到天上,门都没有。

这也是为什么这颗 CPU 光有核不够,容量本身就是竞争力。

这些分析不是白做的。第二天云栖主论坛上,平头哥首次公布了倚天 CPU 路线图:2027 年推出倚天 720 和 730,之后是 750,第二代自研核,自研片间互联直连真武 AI 芯片。

黄伟在页面末尾只提了一句路标,其实他就是在给那份路标写说明书。

第二场,网卡。主讲人是阿里云智能集团高性能网络研发负责人付斌章。他一上来先算账。

他说前面好几场嘉宾都提到,现在到了推理阶段,往往是通信决定一半以上的性能。但网卡本身的成本,在集群中占不到 20%,有的甚至只有一成。

意思是,整个机房投入产出比最高的一项,是大家不太回头看第二眼的小板子。

他摆出了三件麻烦事。

第一件,混跑。 集群租出去后,租户跑什么你说了不算。训练、推理、强化学习,三种流量挤在同一张网上。训练的流量像高速上匀速行驶的大货车,推理的流量是不断变道的轿车。货车一旦被打断,整个车队跟着降速。

第二件,长距。

现在的推理流行 PD 分离。一道题拆成两段干:读懂题、打好草稿算一段,把答案一个字一个字往外蹦算一段。两段分别用不同的 GPU 跑,以节省卡。

麻烦在于,两段一旦不放在同一批机柜里,数据就得跑出机房,上广域网。机房里跑一个来回一百微秒,跨了城市是 5 到 10 毫秒,慢了两个数量级。

网络传数据本质上像车队行军:先派探路车报告路况,大部队才敢加速。探路回报慢一百倍,大部队只能降速,有效带宽断崖式下跌。

第三件,弹性。

agent 的任务说来就来,容器秒级拉起,干完就销毁。可 RDMA 这种快车道(机器绕开 CPU 直接互读内存的高速通信方式),要提前把整条通路的资源、地址都铺排好才肯干活,像包专线货运,发车前先排时刻表。

只存活几十秒的容器等不起。所以,很多人最后退回 TCP 这种随叫随到的通用方案,性能损失自己咽下。

对付这三件麻烦,他先铺开一张地图。这块信息密度高,记一句就行:分场景修路。

训练走 HPN(高性能网络),一代比一代能接入更多设备。上一代靠 51.2T 的交换芯片支撑 7.0 版本,主力 8.0 用 102.4T,在研的 9.0 上 200T。T 是万亿比特,芯片吞吐的单位。

卖点是两层网络就能挂几十万个 800G 的接入端口,相当于立交桥只修两层,却能上下几万台车。

推理走新架构 TPN(按 token 性能设计的网络),干的事一句话:把两张从没打通的网连成一张。

机房里本来有两张网:机头网络负责业务进出,机尾网络连接 GPU 之间的高速数据,互不相通。

没有配置机尾的小卡做 PD 分离时,只能挤机头那条道,机尾空着。TPN 在两堵墙中间开了门,同一个集群里各组机器(行话叫 pod)能互相喂数据。分离的两端不出机房就能对上话,长距传输直接省掉。

真要跨集群,流量走骨干网里的智算专线。阿里给它起名叫 ECORE,带宽比普通骨干高一个数量级以上,全程支持 RDMA。

超节点内部的互联另有另一张,叫 UPN(超节点网络)。光互联,机器物理上不用绑死,一层铺得下千卡。

然后,是主角:磐脉 920。他报的规格是 400G 带宽,一秒能过 4000 亿比特的数据,面向智算和存储两个场景。

他讲得最起劲的倒是另一个设计。

这张网卡里内置了一个交换机,相当于自带一块分电板。 各家 CPU 对 PCIe 这条数据通道的脾气不一样。没有这块板子,换个计算平台就可能踩一次坑。

有了它,同一张卡插到不同平台上,都能稳定输出 GPU 直接读写网卡、不绕 CPU 的那套性能。

协议它跑两套:业界标准的 RoCEv2,加上阿里自研的 SolarRDMA。

自研这套最早在存储场景里打磨,后来才用到智算。他的原话是:把存储和计算的坑都趟完了。最值钱的功能是按连接逐条自动选路:新卡碰新卡,自动走自研的快道;碰上老卡,退回标准协议。

老集群不用拆了重建,一张一张换就行,业务不停。他说这种无感的增量部署,工程上价值非常大。

四张成绩单,口径都是现场给的实测。

第一张之前,他先拆解了一个流传很广的误区。他说两年以前,你要说预训练用不上好协议,没问题。大模型训练就是单一大任务,环形算法轮着传,每张网卡只跟自己的邻居说话,带宽就是一切。

今天这话过期了。现在是训推一体的集群,推理的流量随时闯进来,预训练被搅得跟着降速。

千卡任务实测:把大传输拆成小包、多条路同时飞,哪条拥塞或哪台硬件坏了就自己绕行。数据并行的通信耗时降低 43.2%,端到端性能提升 12%。

第二张,跨集群长距。

端侧给流量打标,广域交换机照着标挑选更优的路。丢包只补丢的那几张,不用整摞重发。端到端吞吐提升 55%。

第三张,弹性。

新的虚拟化技术把资源分配挪到软件控制路径,连接密度是传统网卡虚拟化的 64 倍。容器拉起时间最少节省 35%,最多节省 93.4%。

他撂了句狠话:这个弹性不拿性能换。套了虚拟化跑通信,速度和硬件直通几乎一样。按他的说法,专线的速度和网约车的灵活,目前只有这张卡能同时给齐。

第四张,小包。 高性能计算传输的数据正文很小,包裹没封箱带厚。这张卡走「以太网+」协议,削前导码、绕开链路层开销。正儿八经的内容能占到 85.4%,他说是业界最高。

落地的交代很短:磐脉 920 已经跟着灵骏真武 M890 超节点上线,超节点配的就是这张卡。

两场演讲,单听各管一摊,放在一起看,挺有意思。

黄伟说,agent 场景里 CPU 扛起了过半的负载。付斌章说,推理阶段过半的性能由通信决定。两个「过半」,口径不一样——一个量时间,一个量性能。

但指向是同一个:请求进来之后,GPU 算完的那一段,在整条路上越来越不稀罕了。剩下的大头,落在 CPU、内存和网络上。

模型有多聪明,比的是 GPU;agent 把活干得多利索,比的是这些地基。

黄伟下台前收尾:希望倚天为 Agentic AI 时代的普惠算力,贡献一份计算底座。付斌章没说场面话,他只留了个落地,就是前面那句超节点上线。

倒是串场的主持人,给了句不错的总结。

人工智能的竞技场,已经从参数规模角逐,转向工程落地的深水区。单点的突破,撑不起智能体时代的系统级负载。

台上两个人讲了四十分钟,都在给这句话当证词。

我这趟带回来的,其实是个记账方式的变更。过去聊算力,问你有几张卡?往后可能得问:一个请求进来,你的时间花哪了,带宽堵哪了,内存够谁用。

卡多不等于活好。这个账,行业刚开始认真算。

注释:

[1]. 本文内容来自我 2026 年 9 月 23 日在平头哥算力峰会分论坛的现场记录,演讲实测数字均为现场披露口径

评论(5)

在贝博体育入口方面,贝博体育入口提供贴心周到的支持。

2015年8月25日下午5:00
围绕核心要点提炼:每篇阅读材料均归纳资源管理的关键概念。,贝博体育入口持续打磨更优质的服务。

贝博体育入口以贝博官网为核心,带来高效便捷的体验。

2015年8月25日下午5:00
贝博体育入口深耕独立游戏入门:从基础概念开始,逐步探索单机体验。领域,用心服务每一位用户。

想了解更多贝博体育直播相关内容,尽在贝博体育入口。