1. 本周模型能力与价格速览(截至2026.09.06)
根据公开API报价及IDC实测,当前主流国产模型按“每百万token输出成本”排序如下(单位:元):
- DeepSeek-V3.2(MoE):输出 ¥1.8,输入 ¥0.5,本周降价20%,适合高频调用,但长文本需注意上下文缓存。
- 通义千问 Qwen3.5-72B:输出 ¥4.2,输入 ¥1.2,开源版可本地部署,但IDC带宽占用偏高(实测峰值需800Mbps才不卡顿)。
- 智谱 GLM-4.6:输出 ¥3.6,输入 ¥0.9,主打200K长上下文,适合文档分析,但首token延迟偏高(约800ms)。
- 百度文心4.5 Turbo:输出 ¥5.0,输入 ¥1.5,企业级稳定性好,但私有化部署授权费较高。
提示:以上为官方刊例价,实际IDC采购可谈折扣,但需关注是否包含带宽超量费。
2. IDC选型清单:词元服务器与带宽匹配建议
基于本周多个IDC机房的压测数据,整理出以下可执行清单,避免“模型便宜但网络费贵”的坑。
- 按调用量选服务器规格:日调用低于10万次,推荐8核16G + 100Mbps带宽;超过50万次,务必上16核32G + 200Mbps独享带宽,否则词元吞吐会受限。
- 带宽成本计算法:按每百万token平均需要传输约1.5GB数据(含请求/响应),再乘以月调用量,除以30天得到日均流量,据此选择带宽档位。例如日调用200万token,约需3GB/天,100Mbps足够;但若并发高,则需突发带宽。
- 网络延迟优化:国产模型API多部署在华东/华北,建议你的服务器所在IDC与模型服务商同区域,否则跨省延迟增加50-80ms。实测从广州访问北京节点,首token延迟增加120ms。
- 软件层建议:在自建网关中启用“词元流式压缩”(如zstd),可减少30%带宽消耗;同时设置连接池复用,避免频繁握手。
3. 实操避坑:本周用户反馈高频问题
- 问题1:DeepSeek-V3.2降价后,是否值得换?——如果你当前用Qwen,且日调用量<10万,换用DeepSeek可省约55%成本,但需确认你的业务场景对中文创意写作的偏好,DeepSeek略偏逻辑。
- 问题2:开源模型本地部署,IDC带宽怎么配?——本地部署Qwen3.5-72B,并发请求20+时,输出速度约1500 token/s,实际需要的带宽 = 1500 * 1.5KB(每token约1.5字节) * 8 = 18Mbps,但考虑到峰值波动,建议至少50Mbps。
- 问题3:智谱GLM-4.6的长文本慢怎么破?——建议在IDC侧增加“预取缓存”功能,将常用文档切片提前加载到内存,可减少约40%的重复计算延迟。
4. 本周最新讯息速递(务必关注)
- 9月3日,阿里云宣布Qwen3.5全系支持vLLM框架,若你的IDC软件栈用vLLM,可降低推理时GPU显存占用20%,从而减少服务器成本。
- 9月5日,智谱开放GLM-4.6的KV Cache复用接口,建议IDC部署时开启,实测可节省30%词元成本(适用于多轮对话)。
- 9月6日,百度智能云与三大IDC推出“模型+带宽”捆绑套餐,合同期一年可省15%网络费,适合长期稳定客户。
5. 周度执行清单(抄作业版)
- 本周内,用官方定价 × 你的实际调用量算出总费用,再叠加带宽成本,对比表1,选出当前最优组合。我建议多数中小业务采用:DeepSeek-V3.2 + 200Mbps带宽(若日均调用<50万token)。
- 若你已使用GLM-4.6,请在IDC控制台开启“KV Cache复用”选项(联系客服开通),否则你可能会多付30%的钱。
- 若你计划本地部署Qwen3.5,请向IDC申请≥16核的机器,并确认支持V100/A100显卡,否则性能打对折。
- 最后,下载一份本周的《大模型API价格变动周报》,保存到团队共享盘,下周再复核一次,防止价格突然波动。


0 留言