GPU服务器托管要核对四件事:单机柜实际可交付功率与冗余、散热与气流、网络与带宽、现场运维响应。每项都要拿到书面确认并到现场核验。
要点速览
- GPU服务器托管要核对供电、散热、网络、现场运维四项
- 问机柜长期可交付功率并写进合同,不看标称值
- 训练看内部互联与布线,推理看对外带宽、时延和IP
- 远程协助范围、响应时限、夜间值守都要书面确认
- 按自身负责的环节多少,在三条托管路径中选择
GPU服务器能不能稳定跑起来,不取决于机房有没有空机柜,而取决于四件事:单个机柜实际能交付多少电力、热量能不能被及时带走、网络是否匹配训练或推理的流量特点、设备出问题时现场有没有人能动手处理。这四项都要拿到书面确认,并在现场核验,不能只看机柜的标称参数。下面按「向机房要什么证明、现场看什么、常见坑」三个角度逐项说明,文末附一份提问清单,可以直接带去和任何机房沟通。
为什么GPU服务器托管和普通托管不是一回事
很多企业此前托管过普通服务器,流程熟悉,就默认GPU服务器照旧处理。实际上两者在机房里的需求差别很大,主要体现在三个方面。
- 功耗密度高。一台多卡GPU服务器的功耗通常明显高于常见的业务服务器。同样一个机柜,放普通服务器可以装满,放GPU服务器可能只能放几台,电先用完了,空间还剩着。
- 发热集中。功耗几乎全部转化为热量,而且集中在一个机柜甚至一台机器上。散热跟不上时,GPU会降频,训练任务变慢,严重的会触发保护停机。
- 对网络更敏感。多机训练时节点之间要频繁交换数据;拉取数据集和模型权重需要较大的突发带宽;对外提供推理服务时,用户能直接感受到时延和抖动。
此外还有一些容易被忽略的物理条件:GPU服务器往往更重、机身更深,电源插头规格也可能不同。如果之前没有系统梳理过托管的基本选择,可以先看机柜租用与服务器托管怎么选,本文只讲AI算力场景下需要额外核对的部分。
核对一:单机柜可交付供电与冗余
这是四项里需要优先确认的一项。机房报价单上的机柜功率往往是标称值,真正要问的是:这个机柜在现有配电条件下,长期稳定运行时能交付多少功率,能不能写进合同。
向机房要什么证明
- 目标机柜的可交付功率书面说明,以及超出上限时的处理方式和计费规则。
- 供电路由说明:是否为A、B两路供电,两路分别来自哪套UPS,上级市电与柴油发电机的配置情况。
- PDU的型号、插座类型与数量,确认和你服务器电源的插头规格是否匹配。
现场看什么
- 机柜内是否真的有两条独立PDU,标签是否清楚对应A、B路。
- 同一列机柜的整体负载情况。单柜标称功率高,不代表整列配电还有余量。
- 是否有分路电流监控,你能否看到自己机柜的实时用电数据。
常见坑
- 只按机柜标称值采购设备,上架后发现实际可用功率不够,只能分散到多个机柜,网络布线和成本随之增加。
- 只给单路供电,或者两路来自同一个上级来源,名义上冗余,实际上一处故障就会全部断电。
- 没有给后续加卡、扩容预留功率,半年后想加机器时无电可加。具体数值请以机房书面确认为准。
核对二:散热与气流方案
电送得进来,热也要能及时排出去。高功率机柜如果和普通机柜混放在同一列,很容易形成局部热点,机房的平均温度看起来正常,但你的GPU已经在降频运行。
向机房要什么证明
- 目标机柜所在区域的冷热通道设计,以及是否做了通道封闭。
- 机柜进风温度的监控数据,询问能否开放给客户查看,或定期提供。
- 针对高功率机柜的摆放与散热方案。如果你的设备是液冷机型,要提前确认机房是否支持,不要等设备到货后再问。
现场看什么
- 机柜前后门是否通风,空余U位是否安装了盲板,线缆是否挡住出风。
- 你的服务器风道方向(通常前进后出)是否与机房冷热通道方向一致。
- 相邻机柜的负载情况,旁边如果也是高功率设备,热量会相互叠加。
常见坑
- 只看机房整体温湿度报表,不看机柜进风口的实际温度。
- 空U位没装盲板,热风回流到冷通道,前面装的设备吸进去的是热风。
- 上架时没人核对风道方向,设备装反了也没人发现。
核对三:网络与带宽
GPU服务器的网络需求要分场景看。训练和推理对网络的要求差别很大,混在一起询价,很容易买错。
先分清训练流量和推理流量
- 训练场景:主要是机房内部的流量,节点之间的互联通常在机柜内或相邻机柜之间完成。需要确认机房是否允许你自带交换机,跨机柜布线怎么走、谁来做、多久能完成。对外带宽主要用于拉取数据集和模型,需求是阶段性的大流量。
- 推理场景:主要是对外服务的流量。要关心线路类型和覆盖范围、带宽是独享还是共享、访问时延是否稳定、需要多少公网IP、是否有基础的攻击防护。
向机房要什么证明
- 线路类型说明,带宽是独享还是共享,带宽高峰期的保障方式。
- 可分配的公网IP数量及申请流程。
- 能否提供测试期,用你自己的业务流量实测一段时间。
常见坑
- 按普通业务的思路采购共享带宽,推理服务一到高峰就出现卡顿。
- 跨机柜布线另行收费,而且施工周期长,影响上线时间。
- 一开始只申请了少量IP,后面业务扩展时再追加,流程繁琐。
核对四:现场运维与响应
GPU服务器的故障比普通服务器更需要现场配合:掉卡、风扇异常、电源模块告警、需要重新插拔线缆或排查指示灯,远程登录往往解决不了。机房现场有没有人、多快能到位、能做到什么程度,直接决定故障持续多久。
向机房要什么证明
- 远程协助服务的范围:能否代为重启、观察指示灯、插拔线缆、更换硬盘,是否按次收费。
- 巡检的频次和内容,发现异常后怎么通知你。
- 响应时限能否写进合同,夜间和节假日是否有人值守。
- 应急预案与演练记录,例如断电、火警等情况下的处置流程。
现场看什么
- 值班人员的实际在岗情况,以及客户进出机房的登记流程是否清晰、效率如何。
- 是否有可供客户存放备件的位置,GPU、电源模块等备件就近存放可以缩短恢复时间。
常见坑
- 远程协助按次收费且响应慢,一次简单的重启要等很久。
- 夜间无人值守,出了问题只能等到第二天。
- 工程师进场审批流程繁琐,紧急情况下也要提前很久预约。
按需求选择三条路径
四项核对清楚之后,再根据自身情况选择托管方式。大致可以分为三条路径。
- 只托管自有算力。适合已经采购了GPU服务器、并且有团队负责系统和应用运维的企业,需要的是一个供电、散热、运维可靠的机柜环境。润迅的前海云数据中心位于深圳宝安,按T3+标准建设,拥有1400+机柜;田心数据中心位于深圳罗湖,拥有400+机柜。前海云规划了9个VIP模块化数据中心,建成后与田心合计机柜规模将达2000+,对于后续有扩容计划的企业,可以把未来的机柜需求一并沟通。具体可以了解润迅数据中心的机柜托管服务。
- 托管加带宽。适合要对外提供推理服务、对线路和IP有明确需求的企业。机柜托管与网络带宽一起规划,可以避免机柜和线路分属不同环节、出了问题来回扯皮。田心数据中心拥有6.8万个IPv4地址,对需要较多公网IP的业务来说,可以提前评估是否满足需求。
- 直接选用私有化硬件与配套系统。如果还没有采购硬件,或者买了GPU却一直跑不起来,问题往往不只在机房。我们在买了GPU、接了大模型,为什么企业AI还是跑不起来一文中分析过这种情况。润迅MaxDeploy采用一体化交付方式,由R30私有化硬件提供算力,XunOS作为AI操作系统,MaxModel负责模型的统一管理和调用审计,硬件、系统和模型由同一方交付和维护,企业主要关注业务应用本身。
三条路径并没有优劣之分,区别在于企业自己愿意负责多少环节。团队能力强、硬件已到位,选第一条或第二条更灵活;希望少操心底层环节,第三条更省力。
上架前带去机房的提问清单
下面这些问题可以直接整理成文档发给机房,要求逐条书面回复。回答含糊或不愿意写进合同的条目,就是需要重点追问的地方。
- 目标机柜的长期可交付功率是多少,能否写进合同,超出后如何处理和计费?
- 是否为A、B双路供电,两路分别来自哪套UPS,上级是否配有柴油发电机?
- PDU的型号、插座类型和数量是什么,是否与我们的服务器电源匹配?
- 同一列机柜的配电余量还有多少,后续加机器时能否在同列或相邻机柜扩展?
- 机柜所在区域是否做了冷热通道封闭,能否提供机柜进风温度的监控数据?
- 高功率机柜如何摆放,相邻机柜的负载情况如何?是否支持液冷设备?
- 线路类型是什么,带宽是独享还是共享,高峰期如何保障?
- 能分配多少公网IP,追加的流程和周期是怎样的?
- 是否允许自带交换机,跨机柜布线由谁施工、如何收费、需要多长时间?
- 远程协助包括哪些操作,是否按次收费,响应时限是多少?
- 夜间和节假日是否有人值守,巡检频次和异常通知方式是怎样的?
- 能否提供应急预案和演练记录,客户能否在机房内存放备件?
建议在合同签订前,带着这份清单和设备的规格参数(整机功耗、电源规格、尺寸重量、风道方向、网络接口)去现场看一次。把需求和机房的实际条件逐项对上,比上架之后再调整省事得多。如果想就前海云或田心的具体条件做一次对照,可以拨打润迅业务热线400-854-5566沟通。
常见问题
GPU服务器托管要注意什么?
重点核对四项:单机柜长期可交付功率与双路冗余、散热与气流组织、网络线路与带宽是否匹配训练或推理需求、现场运维响应能力。每项都应要求机房书面确认,并在签约前到现场核验。
高功率机柜托管时,机柜标称功率可信吗?
标称功率只能作为参考,还要看同列配电余量和机房实际配电条件。应要求机房书面说明该机柜长期稳定运行的可交付功率,以及超出上限后的处理方式,并写进合同。
算力服务器托管选独享带宽还是共享带宽?
对外提供推理服务、对时延稳定性要求高的业务,一般更适合独享带宽;以内部训练为主、对外流量只是阶段性拉取数据的场景,可以按实际需求评估。建议先申请测试期,用真实流量实测。
AI服务器机房怎么选,散热要看什么?
看高功率机柜区域是否做了冷热通道封闭、能否提供机柜进风温度数据、空U位是否安装盲板、设备风道方向与通道是否一致。液冷机型要提前确认机房是否支持。
还没买GPU服务器,先找机房还是先买硬件?
建议先明确业务场景和整机功耗、电源、网络需求,再同步评估机房条件,避免设备到货后才发现机柜供电或散热不匹配。如果不想分别处理硬件、系统和机房,也可以考虑私有化硬件与配套系统一起交付的方式。