本周观察:多家数据库厂商在9月第二周密集发布面向AI推理场景的补丁版本,核心卖点从“高并发连接”转向“每瓦特词元处理量”。与此同时,头部IDC服务商开始将智能网卡与可编程交换机纳入数据库服务器带宽的默认交付清单。以下五项动作,建议在本周内纳入你的技术评估表。
1. 重新计算“词元/秒/美元”而非QPS
传统数据库压测关注QPS和延迟。AI推理场景下,一次生成请求可能触发数十次向量检索和元数据写入。建议:用tokens/sec/instance替代QPS作为第一指标。本周可执行:选取你最大的三个推理业务,统计平均每个token对应的数据库读写次数。若超过0.8次,说明数据库层已成为词元生成的瓶颈。
2. 检查IDC侧带宽是否被“隐形超售”
AI词元流具有突发性——单次推理可能瞬间拉取数MB的KV缓存。很多IDC标称10Gbps独享,实际在跨机架流量上存在收敛比。本周动作:向IDC索取过去7天的95计费带宽曲线与丢包率时序。若晚高峰丢包超过0.1%,数据库复制延迟会指数上升。建议优先选择提供RoCEv2无损网络的机柜,并确认交换机支持PFC/ECN。
3. 服务器侧:把智能网卡从“可选”改为“必选”
本周某国产数据库发布的新版本明确要求:AI词元场景下,数据库节点需配备支持SR-IOV和RDMA的智能网卡。否则在跨节点向量索引同步时,CPU软中断会吃掉30%以上算力。可执行清单:核对你的服务器BOM,若仍在使用普通万兆网卡,本周内完成一轮ethtool -S中断统计,若tx_softirq占比超过15%,立即申请智能网卡替换。
4. 网络软件栈:启用eBPF做数据库流量整形
IDC带宽有限,但AI词元请求有优先级差异——用户首token延迟远比后台embedding刷新重要。本周可部署:在数据库前端服务器加载eBPF程序,按cgroup标记流量。例如,将在线推理的数据库连接标记为最高优先级,批处理向量写入标记为可延迟。这比升级带宽便宜,且当天可回滚。
5. 发布回归测试:增加“词元抖动”用例
本周多个数据库补丁声称优化了AI负载,但真实效果取决于词元到达分布的抖动。建议:在预发布环境模拟泊松分布的词元请求,峰值设为均值的5倍。观察数据库连接池是否出现too many connections或复制槽阻塞。若未通过,暂缓上线,优先调整max_connections与shared_buffers比例。
本周结论:AI词元正在重塑数据库的性能边界,而边界不在SQL解析器里,在IDC的交换机缓存和服务器网卡的DMA队列里。先做带宽审计,再换智能网卡,最后调eBPF——顺序不能反。


0 留言