本周发布的新品呈现明显分层:英伟达推出面向边缘的Jetson Thor 2(主打低功耗词元生成),谷歌Cloud TPU v7侧重高带宽域(HBD)互联,而国内某云厂商发布自研交换芯片,宣称将数据中心网络时延降低40%。这些动态意味着,企业选型不再只看GPU峰值算力,更要看Token/s(词元吞吐)与带宽/网络协同的实际表现。
轻量开发/小规模推理(预算<5万元)
适合初创团队或内部工具。推荐组合:2块消费级RTX 5090(或二手A6000)搭一台1U服务器,配合本周发布的llama.cpp 2.0(支持KV Cache量化),可本地跑7B模型,词元速度约45 Token/s。网络侧用双万兆网卡(如Intel X710),配合开源的Ray Serve做多机负载均衡——但注意,若单机仅1GbE上行,模型并行时会成为瓶颈,建议至少预留10Gbps端口。IDC托管可选低延迟机房(如Equinix IBX),月成本约3000元。
中型推理集群/垂直行业AI(预算20-80万元)
典型场景:金融风控、医疗影像或企业私有化部署。本周谷歌发布的TPU v7 Lite(价格下降40%)值得关注,但更稳妥的方案是采用英伟达L40S(48GB显存)构建4-8卡服务器。关键点在于词元吞吐优化:搭配vLLM框架并启用PagedAttention,可将单卡吞吐从350 Token/s提升至520 Token/s。网络层面,务必采用RoCEv2(RDMA over Converged Ethernet),配合支持PFC的交换机(如思科Nexus 93180YC),带宽从10G升级到25G/40G,时延可降低至5μs内。IDC机柜建议选择带独立BGP带宽(至少100Mbps),避免共享带宽波动。参考本周华为发布的CloudEngine 16800,其无损网络特性可减少长尾时延。
重载训练/千亿级大模型(预算>500万元)
面向头部科技公司或AI实验室。英伟达本周发布的GB300 NVL72(72个GPU)提供了整机柜方案,但更关键是网络架构:采用NVLink Spine-Plus架构,配合Quantum-2 InfiniBand(400Gbps),可实现900GB/s的梯度同步带宽。如果选用以太网路线,微软Azure公布的UEC(Ultra Ethernet Consortium)白皮书建议采用自适应路由+负载均衡,避免拥塞。IDC场景需自建光模块(如800G OSFP),并设计两层CLOS拓扑,带宽冗余建议按1.2:1预留。软件层面,本周发布的Megatron-LLM新版本支持序列并行+异步梯度通信,在千卡规模下能将有效算力利用率从38%提升至45%——这对词元吞吐的最终输出至关重要。
总结:小预算追求性价比,中预算平衡吞吐与带宽,大预算必须重构网络拓扑。本周所有发布都在传递一个信号:AI基础设施的瓶颈正从单卡算力转向词元传输效率与网络协同。建议企业先评估自身实际并发请求量(QPS)与模型尺寸,再按上述档位选型,避免盲目堆料。


0 留言