1. 用“词元/瓦特”代替“QPS/核”做Node打分
本周社区有开发者实测:同样的T4服务器,在vLLM连续批处理下,词元吞吐受PCIe带宽和NUMA节点影响远大于CPU主频。可执行动作:给K8s节点打上token-per-watt标签,在调度器里用自定义打分插件替代默认的LeastAllocated。只改这一个地方,某中型IDC的推理集群整体词元成本下降约12%。
2. 把“带宽突发”从裸金属网卡下沉到eBPF限速器
IDC里AI词元服务常出现“单卡打满25Gbps,整机却跑不到100Gbps”的错位。本周热点方案:用TC+eBPF在Pod的veth对侧做基于词元速率感知的令牌桶,而不是在交换机端口做静态限速。建议先在一个节点上用bpftool加载试用,观察tc -s qdisc的丢包与重传,再决定是否全集群推送。
3. 给推理服务单独划一条“无重传”VLAN给KV缓存交换
云原生社区本周有人踩坑:RoCEv2在IDC跨机架场景下PFC风暴导致词元首包延迟飙升至200ms。低成本可执行方案:利用现有服务器双网卡,一张跑业务K8s网络,一张用独立VLAN跑KV Cache传输,并在网络软件层关闭该VLAN的TCP重传,改用UDP+应用层纠错。只需改NetworkAttachmentDefinition的CNI配置,不用换交换机。
4. 用“词元压缩率”反向优化IDC出口带宽采购
不要把出口带宽当成固定成本。本周有IDC运维分享:通过在前端网关加一层基于提示词模板感知的流式压缩(如使用zstd字典),词元输出在传输层平均压缩1.7倍。建议先抓取一周的request_body与response_body做离线压缩率分析,再按压缩后峰值重新谈带宽保底,通常能砍掉20%~30%的95计费带宽。
5. 本周动手清单:30分钟验证“词元配额+带宽整形”联动
具体步骤:在测试命名空间部署一个token-aware-burst控制器,读取Prometheus里的vllm:num_requests_running与node_network_transmit_bytes_total,当词元排队长度超过阈值时,自动把该节点的tc qdisc从fq_codel切换为htb并降低非关键流优先级。本周社区已验证该思路在突发流量下可把尾延迟P99降低40%。命令片段可参考kubectl exec结合nsenter -t 1 -n tc,无需重启kubelet。
以上动作均不依赖更换现有IDC硬件或网络软件版本,适合本周内做小范围灰度。如果你只挑一个,建议从第1项“词元/瓦特调度”开始——它影响后续所有带宽优化的前提。


0 留言