Image 3 Image 3

算力军备赛下半场:从买卡到调架构,本周大厂的组织手术刀指向哪里?

频道:行业资讯 日期: 浏览:64

本周最值得关注的动作来自字节跳动旗下火山引擎:其边缘云部门被拆分为“AI基础设施组”与“传统CDN组”,前者直接向CTO汇报,且内部首次设立“词元吞吐量”KPI——这意味着他们不再以CPU利用率或带宽使用率衡量机房健康度,而是以每秒处理的Token数量作为唯一北极星指标。同时,阿里云宣布将IDC网络团队并入“算力调度事业部”,并对外释放信号:所有新采购的H20服务器必须适配其自研的“智联”无损网络协议,否则不予上架。

这一系列变动的背后,是IDC行业正在经历从“卖机柜”到“卖Token”的商业模式重构。传统机房关注的是电力与制冷,而AI词元时代的机房,核心矛盾变成了“GPU空转等待网络”与“带宽拥塞导致token生成延迟”之间的博弈。据内部人士透露,某头部云厂商本周已将机房内东西向带宽的单价上调30%,但同步推出了“token预留带宽”套餐——即客户为特定模型推理任务锁定带宽配额,可享受折扣。这本质上是用软件定义网络的手段,把带宽从“管道资源”变成了“算力内存的延伸”。

针对不同预算与需求,我们给出三类方案建议:

【方案A:轻量转型——预算500万以内】适用场景:中小AI公司,租用第三方IDC,但希望降低Token延迟。建议:不要急着换硬件,而是要求IDC服务商开通“RoCEv2拥塞控制”功能(多数厂商已免费支持,但默认关闭),并购买一款支持动态ECMP的软件负载均衡器(如F5的BIG-IP Next,或开源方案DPDK+LVS)。预期效果:在相同H20集群规模下,词元吞吐量可提升15%~20%,成本几乎为零。关键行动:本周内让网络团队核对交换机固件是否支持PFC死锁预防,这是最大坑点。

【方案B:中等规模——预算2000万~5000万】适用场景:已自建或托管百卡级集群,需要将训练与推理混合部署。建议:参考阿里云本次架构调整,将网络团队从基础设施部剥离,直接隶属AI平台部。同时采购“协议卸载卡”(如NVIDIA BlueField-3或中科驭数DPU),把RDMA通信的CPU占用率压到5%以下。重点考核指标:设置“有效带宽利用率”(有效Token/秒 ÷ 理论峰值带宽)。该方案需要同步调整组织考核,否则技术升级会被流程拖累。

【方案C:头部玩家——预算1亿以上】适用场景:自建万卡集群,且追求极致弹性。建议:采用“静态规划+动态路由”双平面架构,学习字节本次拆分逻辑——将传统CDN流量与AI推理流量物理隔离,但共用光缆资源,通过SDN控制器实现毫秒级切换。额外投入部分预算,组建独立的“网络-算力协同调优小组”(3~5人),专门负责开发token-aware路由算法。值得参考的公开数据是,字节火山引擎在拆分后,其豆包大模型首字延迟下降了22%,但网络团队人力仅增加7%。

最后提醒一点:本周传出的英伟达中国区调整虽属供应链层面,但直接影响IDC的服务器选型——所有新架构方案都需预留对NVLink Switch系统(如GB200 NVL72)的机柜空间与液冷改造预算,否则明年会面临二次施工。组织架构的调整从来不是目的,而是为了让带宽像内存一样被精确寻址,让软件像调度器一样掌控每一分钱电费的去向。如果你的团队还在按“上架率”开会,那么下一次行业洗牌时,你连被并购的估值都谈不上去。

0 留言

评论

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。
验证码