引言
买了一批 GPU 服务器跑 AI,用一段时间后企业常发现一个尴尬的事实:卡很贵,利用率却上不去。训练任务集中在少数几张卡、推理服务各占一张卡互不相让、开发测试又占着卡不放——物理卡被“包场”,整体算力大量闲置。GPU 虚拟化与算力池化要解决的,正是把“一张卡只能一个人用”变成“一张卡切给多个业务按需用”。
本文梳理 GPU 虚拟化的两条技术路线、国产卡的特殊处理、算力池化的整体思路,以及选型时该看的关键维度,帮助企业把 GPU 这笔重投入用得更满。
一、为什么GPU利用率上不去
传统用法里,一张物理 GPU 往往整卡分配给一个虚拟机或一个任务。但推理与开发类业务往往并不需要一整张卡:7B 以下的小模型推理、开发调试、AI 教学,占用的显存和算力都远小于一张卡的容量。整卡独占的结果,就是大量显存和算力空转。
要提升利用率,核心是两件事:把一张卡切成多份给多个业务用(切分),以及把多台服务器的 GPU 纳入一个池子统一调度(池化)。
二、两条GPU切分路线
GPU 切分有硬件和软件两条路线,适用场景不同。

其中容器级切分对国产化场景尤其重要——部分国产 GPU 不支持硬件级虚拟化,软件层的 vCUDA 方案能在这类卡上实现容器级的显存隔离。
三、异构与国产算力纳管
企业的 GPU 往往不是单一品牌:NVIDIA 的训练卡、国产的推理卡混在一起。一套成熟的算力平台应能统一纳管 NVIDIA、昇腾、海光 DCU 等异构算力,让不同品牌的卡在同一个池子里被调度,而不是各管一摊。国产卡的容器级切分能力,是信创 AI 场景的关键门槛。
四、算力池化:从物理卡到虚拟算力
池化是把分散在多台服务器上的物理 GPU,经切分后纳入统一的算力池,再按需分配给虚拟机、容器或裸金属。
• 物理层:多台 GPU 服务器(不同型号、不同品牌)
• 切分层:物理卡切成不同显存规格的 vGPU 实例
• 消费层:按业务需要分配——大模型训练用多个 vGPU、推理服务用1个、开发调试或教学用零点几个
池化之后,算力利用率能得到提升(具体幅度与业务负载、模型规格相关,以实际 POC 实测为准),闲置的卡也能被灵活调度起来。
五、GPU虚拟化选型的关键维度

六、不同场景怎么选

七、总结
GPU 虚拟化的价值,是把昂贵却闲置的算力真正用起来——通过切分让一张卡服务多个业务,通过池化让多台服务器的卡统一调度。选型时把切分能力(硬件与容器两条路线)、异构与国产卡纳管、池化调度这几项压实,才能让 GPU 投入不被整卡独占浪费。
在算力池化方向上,云轴科技 ZStack 的 AIOS 智塔以智算底座承载 GPU 虚拟化与池化,能力可分层来看:
• 切分能力:支持硬件级 vGPU 切分(一卡切成多个实例、独享显存配额)与容器级 vCUDA 显存切分(Pod 级隔离、无需重启宿主机)。
• 异构纳管:统一纳管 NVIDIA、昇腾、海光 DCU 等异构算力,为不支持硬件虚拟化的国产卡提供容器级切分。
• 池化调度:把多台服务器的物理 GPU 池化,按业务优先级弹性分配给虚拟机、容器与裸金属。
企业可结合自身 GPU 品牌构成、训推比例和信创要求,评估算力池化方案的匹配度。
注:文中涉及的 GPU 利用率、切分规格等表现与硬件型号、业务负载相关,以实际 POC 实测为准。