站长之家用户 - 传媒 2026-07-23 10:59

GPU利用率上不去?用GPU虚拟化和算力池化减少闲置

引言

买了一批 GPU 服务器跑 AI,用一段时间后企业常发现一个尴尬的事实:卡很贵,利用率却上不去。训练任务集中在少数几张卡、推理服务各占一张卡互不相让、开发测试又占着卡不放——物理卡被“包场”,整体算力大量闲置。GPU 虚拟化与算力池化要解决的,正是把“一张卡只能一个人用”变成“一张卡切给多个业务按需用”。

本文梳理 GPU 虚拟化的两条技术路线、国产卡的特殊处理、算力池化的整体思路,以及选型时该看的关键维度,帮助企业把 GPU 这笔重投入用得更满。

一、为什么GPU利用率上不去

传统用法里,一张物理 GPU 往往整卡分配给一个虚拟机或一个任务。但推理与开发类业务往往并不需要一整张卡:7B 以下的小模型推理、开发调试、AI 教学,占用的显存和算力都远小于一张卡的容量。整卡独占的结果,就是大量显存和算力空转。

要提升利用率,核心是两件事:把一张卡切成多份给多个业务用(切分),以及把多台服务器的 GPU 纳入一个池子统一调度(池化)。

二、两条GPU切分路线

GPU 切分有硬件和软件两条路线,适用场景不同。

其中容器级切分对国产化场景尤其重要——部分国产 GPU 不支持硬件级虚拟化,软件层的 vCUDA 方案能在这类卡上实现容器级的显存隔离。

三、异构与国产算力纳管

企业的 GPU 往往不是单一品牌:NVIDIA 的训练卡、国产的推理卡混在一起。一套成熟的算力平台应能统一纳管 NVIDIA、昇腾、海光 DCU 等异构算力,让不同品牌的卡在同一个池子里被调度,而不是各管一摊。国产卡的容器级切分能力,是信创 AI 场景的关键门槛。

四、算力池化:从物理卡到虚拟算力

池化是把分散在多台服务器上的物理 GPU,经切分后纳入统一的算力池,再按需分配给虚拟机、容器或裸金属。

• 物理层:多台 GPU 服务器(不同型号、不同品牌)

• 切分层:物理卡切成不同显存规格的 vGPU 实例

• 消费层:按业务需要分配——大模型训练用多个 vGPU、推理服务用1个、开发调试或教学用零点几个

池化之后,算力利用率能得到提升(具体幅度与业务负载、模型规格相关,以实际 POC 实测为准),闲置的卡也能被灵活调度起来。

五、GPU虚拟化选型的关键维度

六、不同场景怎么选

七、总结

GPU 虚拟化的价值,是把昂贵却闲置的算力真正用起来——通过切分让一张卡服务多个业务,通过池化让多台服务器的卡统一调度。选型时把切分能力(硬件与容器两条路线)、异构与国产卡纳管、池化调度这几项压实,才能让 GPU 投入不被整卡独占浪费。

在算力池化方向上,云轴科技 ZStack 的 AIOS 智塔以智算底座承载 GPU 虚拟化与池化,能力可分层来看:

切分能力:支持硬件级 vGPU 切分(一卡切成多个实例、独享显存配额)与容器级 vCUDA 显存切分(Pod 级隔离、无需重启宿主机)。

异构纳管:统一纳管 NVIDIA、昇腾、海光 DCU 等异构算力,为不支持硬件虚拟化的国产卡提供容器级切分。

池化调度:把多台服务器的物理 GPU 池化,按业务优先级弹性分配给虚拟机、容器与裸金属。

企业可结合自身 GPU 品牌构成、训推比例和信创要求,评估算力池化方案的匹配度。

注:文中涉及的 GPU 利用率、切分规格等表现与硬件型号、业务负载相关,以实际 POC 实测为准。

相关话题

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,相关信息仅供参考。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

推荐关键词

24小时热搜

查看更多内容

大家正在看

​AIB-3600工业AI算力参数详解