凌晨两点,某智算中心的运维大屏上,一条刺眼的红色警报突然弹出——3号冷却塔的能效比骤降18%。值班工程师老张赶到现场时,发现是冷却水阀门因水垢卡滞,导致整个冷却系统在低效状态下“空转”了整整40分钟。
这40分钟里,约1200度电被白白浪费,足够一个普通家庭用上一年。而这样的场景,在全国数千个智算中心里每天都在上演。
智算中心的能耗黑洞,往往不在服务器本身,而在那些“看不见”的辅助系统里——冷却、供配电、环境调控。当AI算力需求以每年翻倍的速度增长,PUE(电能利用效率)每降低0.1,一个中型智算中心每年就能省下数百万电费。
但问题在于:传统的“人工巡检+经验调控”模式,已经跟不上智算中心复杂多变的负载曲线。怎么办?数字孪生技术给出了答案。
什么是数字孪生?简单说,就是在虚拟世界里1:1复刻一个物理机房——服务器的每一度发热、冷却管道的每一滴水流、空调的每一次送风,都在数字模型里实时同步。
这面“魔镜”的价值在于:它让运维人员第一次拥有了“上帝视角”。
传统模式下,你要知道3号冷却塔的效率,得爬到楼顶看仪表数据;要知道服务器进风口温度是否均匀,得拿着红外热像仪逐机柜扫描。而在数字孪生系统里,所有这些数据以每秒数十次的频率在三维模型上跳动更新,一眼就能看清整个机房的“能量脉搏”。
但仅仅“看得见”还不够,数字孪生的真正威力在于“算得准”。
智算中心的负载波动远比传统数据中心剧烈——某大模型训练任务启动,可能瞬间增加数百千瓦的IT负载,而推理任务又可能在深夜骤降。如果冷却系统按固定策略运行,就会频繁出现“供过于求”或“供不应求”的错配。
数字孪生系统通过实时采集IT负载、室外温度、冷却效率等数十个维度的数据,结合机器学习模型进行未来10-30分钟的负载和热场预测,然后自动生成最优调控策略:
这套“预判-决策-执行”的闭环,将冷却系统的响应时间从“小时级”压缩到“分钟级”,彻底告别了“先热后冷”的被动局面。
在吉之星承接的华东某大型智算中心项目中,我们综合运用自研的数字孪生智控平台与动态能效优化算法,帮助客户实现了PUE从1.45到1.18的跨越式下降。
具体来说,我们做了三件事:
第一,构建高精度热场孪生模型。 基于CFD仿真和上千个温度传感器的实时数据,我们建立了覆盖每个机柜、每台空调的三维热场模型,温度预测误差控制在±0.5℃以内。
第二,部署AI动态寻优引擎。 该引擎以“PUE最低”为目标函数,结合粒子群算法持续搜索冷却系统的最优运行组合。项目实测显示,系统每分钟进行一次全局优化计算,在保障IT设备进风温度合规的前提下,动态调整冷机台数、冷冻水流量和风机转速。
第三,建立人机协同的闭环机制。 当系统预测到即将出现能效异常时,会提前向运维人员推送预警和操作建议,并支持一键执行。上线6个月,系统累计自动优化调控超过2万次,平均每次节电约8.6千瓦时。
最终,该项目年节电约730万度,折合减少碳排放约5800吨——相当于多种植了32万棵树。
PUE从1.5降到1.3,靠设备升级就能实现;但从1.3降到1.15以下,拼的就是算法和数据的精细度。数字孪生技术正在让智算中心的每一度电都“物尽其用”。
在吉之星看来,未来的智算中心不仅是算力的容器,更应成为能源效率的示范场。我们正与客户携手,将数字孪生从单机房扩展到区域级多园区协同调度,让算力在更大范围内实现“削峰填谷”,进一步挖掘能效潜力。
当AI的“智慧”被用来管理AI自身的能耗,这或许是技术最动人的闭环。
注:PUE = 数据中心总能耗 / IT设备能耗,理想值为1.0。目前国内智算中心平均PUE约1.4-1.6。