导读:阿里云的新“算”盘
(来源:涌金楼)
作者▎棒棒
编辑 ▎百亿
图源▎受访者
8月10日,内蒙古乌兰察布最高气温31℃。
这个温度并不能代表乌兰察布。涌金君翻到的官方简介里,乌兰察布年均气温4.3℃左右,夏季平均气温18.8℃。
“凉快”,是乌兰察布的气候特点,更奠定了它在智算时代一骑绝尘的基础。包括阿里、字节等头部企业都在此建设数据中心,近期亦有传闻称,DeepSeek也在布局这片“草原”。
群雄逐鹿之时,阿里云已拨动新“算”盘。10日,涌金君走进了阿里云在这里的两座数据中心,它们分别代表2.0版和5.0版,更是技术加速迭代的见证。
打响新算盘
乌兰察布的风不小。阿里云工作人员、内蒙古人阿峰特意在自己的花名里加了“风”字。
2020年6月,阿里云乌兰察布数据中心落下第一颗棋子。当时,阿峰眼里,这还不是一门“很热的生意”。但2023年下半年,情况变了,自建数据中心“一下子满了、不够用了”。
那一年,以ChatGPT为标志的生成式人工智能技术(AIGC)爆发,掀起了一场全球性的“算力军备竞赛”。和传统的计算时代不同,AIGC时代单次任务的算力消耗呈指数级增长。
算力需求飞速增长,数据中心容量也随之扩张,需要系统性解决交付速度、成本与后续资源可持续性问题。
2024年,阿里云内部立项:要做效率能匹配智算时代的数据中心。由此,数据中心建设的模块化率被推至一个大胆而激进的目标——从30%提高到90%。
模块化,指的是把搭建工序从这道做好做下一道的串行模式变成并行模式,设备完成生产制造先“住”进集装箱,再运抵数据中心拼装。
但一下子要提高这么大比例,反对的声音也不少:会不会比现有模式成本更高?它代表的是行业的未来吗?合作伙伴能接受吗?
一场压力测试开始了。这次我们看到的CUBE 5.0,就是阿里云面向AIDC研发的新一代数据中心架构,也是测试的结果。
传统的模块化只包括供电设备,CUBE 5.0则实现了供电、冷却、安防、智能化以及消防五大系统的全模块化。
内部,一个个集装箱如“积木块”般合理分工、有序组合——
“中压模块”是插线板,将市政电引入楼内;
阿里云自研的“巴拿马模块”是变压器,可以将电网220kV高压转换为270V直流电抵达IT机柜,最终由服务器内电源变换得到芯片所需的低压;
“锂电模块”承担充电宝的角色,如果出现断电,能在柴油发电机运转之前支撑15分钟。该模块配备了热失控传感器和防爆设施,兼顾效率和安全;
“冷源配电模块”不仅有2.0版数据中心应用的风冷,还新增了液冷,两种散热方案可以自由切换。
模块化率提升,最直观的结果就是效率提升。去年初,阿里云的数据中心大机电交付工期是11个月。而CUBE 5.0将交付工期缩短至100天。
这是什么概念?传统模式下,国内数据中心相同工程内容的建设交付的周期是6至12个月,美国为12至18个月。
“交付就是生产力。”阿里云全球数据中心总经理王朝阳说,智算时代,为了达成交付,稳定、低价、绿色都是能源保障要考量的要素,但还有一件事凌驾于这些要素之上——充沛。能源保障充沛、数据中心实实在在投产了,才有后续的一切。
本质上,数据中心建设就是工程建设。在王朝阳看来,如果模块化率达不到90%,就解决不了整体的周期、交期问题。当算力成为竞争力的一部分,数据中心能快速交付,就意味着服务客户的能力提升了。
换句话说,中国AI已从单项技术走向系统效率的整体创新。谁能更快地建成、更快地通电、更快地产出Token,谁就能在算力竞赛中占得先机。
筹谋三年,阿里云的新“算”盘,打响了。
100天的逻辑
放在以前,数据中心的交期并不是个敏感问题。但算力大爆发的时代,需求端的供不应求,需要供给端加速跑起来。
100天工期,被细分为三部分:30天的工厂生产和现场准备、50天的现场安装以及20天的调试测试。
优势不仅在于速度,还在于密度。同等单位面积下,CUBE5.0可以容纳更多服务器,单位面积算力密度达到上一代的5至10倍,单位千瓦的相关建设成本却能较上一代降低10%以上。
表面上,这是项目管理提速了。深层看,新架构其实是技术迭代带来的商业模式的变化。
“可以理解为数据中心也有了OEM或ODM模式。”王朝阳说,这有点类似于苹果手机和代工厂的关系:联合开发+大规模批量生产。
一位现场工作人员跟涌金君科普,数据中心租赁厂房是按照功率来出租的。对运营方来说,算力密度更高的CUBE5.0可以用同样空间实现更大产出,这是一笔双方都更划算的买卖,也让阿里云在乌兰察布的空间竞争中更具优势。
真正跑通这套模式,阿里云用了17年。正因为对数据中心的需求点、痛点足够了解,模块化的思路才会清晰。
不过,即便模块化解决了大部分内部问题,100天交期的实现,仍面临一些不确定性。这样一个高度模块化的新事物,需要与产业链上游实现紧密协同,在试点过程中,阿里云就遭遇过原材料及配件缺货的情况,这些问题,都成为影响工期的局部变量。
比如,数据中心规划了完备的蓄电池组来确保供电安全,以防万一,还会配备柴油发电机作为备用电源。
眼下,全球AI算力基础设施投资火热,国内外主要柴油发电机厂商的订单持续处于供不应求状态,有时候发电机到货了,与之匹配的风扇却没货。
这对阿里云提出了更高的要求,但王朝阳对此并不太担心。“中国的制造链条足够全、产能足够大。”他透露,仅仅在浙江,他们想找几家企业来参与制造模块化数据中心的产品,来“揭榜”的企业就有上百家。
任何新事物,一旦规模化,成本自然下降,模式也就能推广开来。不仅是阿里云,国内外厂商都在探索数据中心模块化。“我们希望有更多企业加入到智算制造的浪潮,一起跑向新赛道,产出‘新产品’。市场‘蛋糕’做大了,供应端自会跟上。”他说。
10日,阿里云宣布:今年计划将模块化数据中心的全球产能提升两倍以上。更关键的信息也同步释放,该架构已获得基于EN标准的欧洲CE认证和基于IEC标准的东南亚产品准入。
这意味着,阿里云正在筹备模块化数据中心“出海”,欧洲和东南亚都是重点关注的市场。模式“出海”,牵动的是整条中国制造产业链。
算电协同
乌兰察布到北京,高铁不到2小时,网络延迟则被控制在4毫秒。
这里的数据中心承担了大量的AI推理任务——你和AI大模型的每次对话交互,背后或许都有草原算力的支撑。有人告诉涌金君,中国超一半汽车行业所需的算力都集中在乌兰察布。
在国家的“东数西算”战略布局中,东部是实时算力枢纽,西部是绿色算力枢纽。当Token开始流动,算力规模和密度的增大,让乌兰察布成为投资热土——电价便宜、能源富集,这里是算力靠近绿电的优选。
王朝阳透露,阿里云上一财年国内自建数据中心清洁电力占比73.6%,在乌兰察布,绿电占比达90%。
能效越高、越绿色,就更有机会实现降本增效。CUBE5.0现在可以做到风冷PUE≤1.15、液冷PUE≤1.10。比值越接近1,运营成本就越低。
押注乌兰察布,各方押注的是智算时代的“先手”。
几天前,远景科技乌兰察布远景星河基地投产,官方信息显示,基地具备百万卡并行能力与百万P算力规模。
几个月前,DeepSeek招聘数据中心高级运维工程师、数据中心高级交付经理,工作地点位于乌兰察布,这条招聘信息也引发了众多猜想。
这还只是开始。今年,“实施超大规模智算集群、算电协同等新基建工程”首次写入政府工作报告,中国加力推进包含算力网、新型电网在内的“六张网”建设,推动绿色电力与算力协同布局的关键部署密集出台。
在王朝阳看来,算电协同将是模块化数据中心未来重要的机会窗口。
“新的数据中心既有微电网的特征,也具备源网荷储的特征,还可以根据布局地的资源禀赋、负载特征实现更灵活的组合。”他认为,这套可自洽、自治、自发电的系统,在算力技术方面还有很大探索空间。
算电协同,并非算力、电力的简单相加。当Token的单位消耗成为关键指标,AI竞争将延伸至整个产业体系。电力如何进入数据中心,算力如何抵达实际场景,链条上的每个环节都关乎效率。
当算力背后的数据中心建设提速,“以电强算、以算促电”,需要的不仅是电力供给,更是整套能源系统从规划、建设、调度到变革的协同。
工业和信息化部公布的数据显示,截至今年6月底,我国智能算力规模达2185EFLOPS(FP16)。其中东部、中部、西部、东北地区智算规模占全国比例分别是55.9%、10.6%、32.6%、0.9%。
在京津冀、长三角、大湾区周边,阿里云都做了数据中心建设布局。目前算力消耗最多、最频繁的三个领域,一是用户与各类Agent的对话交互,二是“帮我生成一张骏马图”这样的多模态业务,第三就是写代码。这些主流的算力应用场景里,延迟尚不构成大问题,但“更快”仍会成为相对优势。
王朝阳眼中,CUBE5.0已经是一个非常成熟的产品,但这绝非终局。“5.0能最大化兼容主流异构芯片与计算架构,支持至少三代芯片迭代。三代芯片,几乎就是十年。”他说。
“我们看到了更多算力发展的规律。”王朝阳说,从落地电价洼地到服务全国重要经济圈,再到实现对具身智能、低空经济等新兴产业集群的覆盖。AI技术将在算电协同的调度和优化中发挥更多作用。
走出数据中心前,乌兰察布的夕阳映在蒙古包样式的天花板上。风凉起来了,算力流动起来了。
声明:市场有风险,投资需谨慎。本文基于第三方数据库发布,不代表本网观点,任何在本文出现的信息均只作为参考,不构成个人投资建议。如有出入请以实际公告为准。