‹ 返回列表
数字孪生平台

智算中心PUE破1.2,数字孪生是关键

2026-08-04📖 3 分钟

机房里的“隐形电费黑洞”

凌晨两点,某智算中心的运维大屏上,一条刺眼的红色警报突然弹出——3号冷却塔的能效比骤降18%。值班工程师老张赶到现场时,发现是冷却水阀门因水垢卡滞,导致整个冷却系统在低效状态下“空转”了整整40分钟。

这40分钟里,约1200度电被白白浪费,足够一个普通家庭用上一年。而这样的场景,在全国数千个智算中心里每天都在上演。

智算中心的能耗黑洞,往往不在服务器本身,而在那些“看不见”的辅助系统里——冷却、供配电、环境调控。当AI算力需求以每年翻倍的速度增长,PUE(电能利用效率)每降低0.1,一个中型智算中心每年就能省下数百万电费

但问题在于:传统的“人工巡检+经验调控”模式,已经跟不上智算中心复杂多变的负载曲线。怎么办?数字孪生技术给出了答案。

数字孪生:给机房装上一面“魔镜”

什么是数字孪生?简单说,就是在虚拟世界里1:1复刻一个物理机房——服务器的每一度发热、冷却管道的每一滴水流、空调的每一次送风,都在数字模型里实时同步。

这面“魔镜”的价值在于:它让运维人员第一次拥有了“上帝视角”

传统模式下,你要知道3号冷却塔的效率,得爬到楼顶看仪表数据;要知道服务器进风口温度是否均匀,得拿着红外热像仪逐机柜扫描。而在数字孪生系统里,所有这些数据以每秒数十次的频率在三维模型上跳动更新,一眼就能看清整个机房的“能量脉搏”。

但仅仅“看得见”还不够,数字孪生的真正威力在于“算得准”

动态调控:从“事后补救”到“提前预判”

智算中心的负载波动远比传统数据中心剧烈——某大模型训练任务启动,可能瞬间增加数百千瓦的IT负载,而推理任务又可能在深夜骤降。如果冷却系统按固定策略运行,就会频繁出现“供过于求”或“供不应求”的错配。

数字孪生系统通过实时采集IT负载、室外温度、冷却效率等数十个维度的数据,结合机器学习模型进行未来10-30分钟的负载和热场预测,然后自动生成最优调控策略:

这套“预判-决策-执行”的闭环,将冷却系统的响应时间从“小时级”压缩到“分钟级”,彻底告别了“先热后冷”的被动局面。

吉之星实践

在吉之星承接的华东某大型智算中心项目中,我们综合运用自研的数字孪生智控平台动态能效优化算法,帮助客户实现了PUE从1.45到1.18的跨越式下降。

具体来说,我们做了三件事:

第一,构建高精度热场孪生模型。 基于CFD仿真和上千个温度传感器的实时数据,我们建立了覆盖每个机柜、每台空调的三维热场模型,温度预测误差控制在±0.5℃以内

第二,部署AI动态寻优引擎。 该引擎以“PUE最低”为目标函数,结合粒子群算法持续搜索冷却系统的最优运行组合。项目实测显示,系统每分钟进行一次全局优化计算,在保障IT设备进风温度合规的前提下,动态调整冷机台数、冷冻水流量和风机转速。

第三,建立人机协同的闭环机制。 当系统预测到即将出现能效异常时,会提前向运维人员推送预警和操作建议,并支持一键执行。上线6个月,系统累计自动优化调控超过2万次,平均每次节电约8.6千瓦时。

最终,该项目年节电约730万度,折合减少碳排放约5800吨——相当于多种植了32万棵树。

未来展望:能效的“最后一公里”在算法

PUE从1.5降到1.3,靠设备升级就能实现;但从1.3降到1.15以下,拼的就是算法和数据的精细度。数字孪生技术正在让智算中心的每一度电都“物尽其用”。

在吉之星看来,未来的智算中心不仅是算力的容器,更应成为能源效率的示范场。我们正与客户携手,将数字孪生从单机房扩展到区域级多园区协同调度,让算力在更大范围内实现“削峰填谷”,进一步挖掘能效潜力。

当AI的“智慧”被用来管理AI自身的能耗,这或许是技术最动人的闭环。


注:PUE = 数据中心总能耗 / IT设备能耗,理想值为1.0。目前国内智算中心平均PUE约1.4-1.6。

🔧 您的智算中心需要降本增效?
吉之星提供智算中心能效优化、GPU集群可靠性、洁净室节能等一站式解决方案
免费咨询,出具定制化技术方案
立即咨询专家
咨询热线:4008-922-115 / 18688773371
📱 关注吉之星公众号
每日一篇工程技术深度文章,不错过行业前沿
吉之星公众号二维码
微信扫一扫关注我们 · 回复「白皮书」下载《先进制造洁净室施工技术标准》