Q1:英伟达财报超预期,为什么国内IDC股反而跌了?
A:市场交易的是‘预期差’。英伟达指引强劲说明海外算力需求爆满,但国内IDC采购的更多是国产AI芯片服务器。近期传闻部分国产芯片良率爬坡不及预期,导致部分IDC新签订单交付推迟。股价反映的不是没需求,而是‘看得见吃不着’的短期错配。
Q2:大家都在说‘词元’(Token)是AI时代的石油,IDC怎么靠它赚钱?
A:目前IDC不直接按Token收费,但Token消耗量决定了GPU服务器的开机率和网络带宽占用。本周有头部云厂商推出‘按Token计费’的私有化部署方案,这意味着IDC机柜的功耗和制冷设计要从‘峰值负载’转向‘弹性吞吐’。真正赚钱的IDC,是能帮客户把单Token成本压到最低的机房——这靠的是液冷和高压直流供电,而不是简单堆服务器。
Q3:现在新建的智算中心,服务器采购为何偏好‘8卡机’而不是‘4卡机’?
A:因为大模型训练需要张量并行,8卡机内部NVLink互联带宽是4卡机的4倍以上。本周有厂商实测发现,同样的千亿参数模型,8卡机的通信开销比4卡机降低62%。但问题来了:8卡机对机柜的功率密度要求高达30kW以上,很多老旧IDC的UPS和散热系统根本扛不住——这正在倒逼一批2000年前后的机房加速退役。
Q4:家宽带都千兆了,为什么IDC带宽还是按‘BGP’和‘CN2’分三六九等?
A:家用宽带是‘尽力而为’,IDC带宽要的是‘确定性’。本周多家游戏公司反馈,跨地域的AI推理请求延迟波动超过80ms就会掉线。BGP(多线接入)解决的是‘通不通’,CN2(中国电信精品网)解决的是‘稳不稳’。真正做AI实时交互(如数字人)的客户,宁可多花3倍价钱买CN2 GIA线路,也不愿省那点钱去赌普通线路的晚高峰拥塞。
Q5:AI服务器那么贵,能不能用‘旧服务器+软件优化’来省钱?
A:短期可以,长期是伪命题。本周某大厂开源了显存池化中间件,能让老款A100通过共享显存跑起700亿参数模型。但实测训练效率只有原生H800的40%。说白了,软件优化解决的是‘能不能跑’,而IDC的电力成本是按小时算的——省了硬件钱,赔了电费和工费,得不偿失。
Q6:为什么本周‘冷板液冷’突然成了IDC标配,而不是浸没式?
A:浸没式虽然散热效率高,但服务器坏了没法热插拔维修,且氟化液成本每吨十几万。本周阿里云发布的白皮书显示,冷板液冷可以将PUE降到1.15以下,且能兼容现有标准机架。更关键的是,冷板液冷的漏液风险已经通过‘二次密封接头’技术解决——现在客户问的第一个问题不是‘冷不冷’,而是‘漏不漏’。
Q7:网络交换机的端口速率,从400G升级到800G,对IDC有什么实际好处?
A:直接好处是让‘GPU算力池化’成为可能。本周中际旭创等厂商的800G光模块开始批量交付,这意味着IDC内部的东西向流量可以做到单机柜2.4Tbps吞吐。以前训练数据要分块传输到不同服务器,现在可以实时共享显存。但要注意:800G需要新的交换芯片,老机房的综合布线(OM5光纤)必须全部换掉,这又是一笔隐性成本。
Q8:很多IDC公司宣称‘绿色能源’,但为什么ESG评级还是不高?
A:因为算力利用率(CUE)指标不过关。本周绿色和平组织抽查发现,超过60%的智算中心GPU利用率低于30%。你用了绿电,但机器空转耗电,这不算绿色。真正的绿不是‘买绿证’,而是通过调度软件把闲置的推理任务塞进训练间隙——比如夜间用70%算力跑数据清洗,白天全力做推理。这需要IDC与客户联合开发任务编排层,目前只有头部厂商在做。
Q9:国家枢纽节点的新建IDC,为什么强制要求‘上架率’达到60%才批二期?
A:这是为了防止‘圈地不建’的旧玩法。本周贵州某数据中心被通报,一期建成两年上架率仅25%,导致二期被暂缓。这个政策的潜台词是:IDC从‘地产逻辑’转向‘运营逻辑’。未来拿地的核心竞争力不是关系,而是你手里有没有稳定的AI推理订单——比如帮自动驾驶公司做边缘缓存,或者帮电商做AIGC商品图生成。
Q10:普通股民或从业者,下半年该重点关注哪些网络软件层面的信号?
A:盯紧两个开源项目的release:一是英伟达的‘AI网络’框架(支持RoCEv2和拥塞控制动态调优),二是Linux基金会下的‘算力感知网络’标准(让路由器能识别数据包是训练任务还是推理任务)。本周已经有厂商展示,通过这个标准将跨机房训练的丢包率从0.7%降到0.05%。谁先掌握这种‘网络大脑’,谁就能在下一轮算力调度中赚到溢价。


0 留言