站长之家用户 - 传媒 2026-07-20 17:47

百度智能云完成64B世界模型512卡训练验证 支撑大模型高效Scale

近日,百度百舸基于通用GPU集群完成Cosmos3-Super64B世界模型512卡训练验证,在无需NVLink、无HPN网络的环境下,实现从32卡扩展至512卡97.48%的集群扩展效率,验证了AI Infra工程优化能够有效支撑大规模世界模型训练。此次实践进一步证明,大模型训练效率不仅取决于硬件规模,更依赖训练框架、通信网络与基础设施之间的系统协同,为世界模型训练提供了新的工程实践路径。

512卡近线性扩展,验证通用GPU集群训练潜力

本次测试基于百度百舸AI计算平台hpas.lgn7ib实例完成,训练模型为64B参数规模的Cosmos3-Super。

测试过程中,集群规模从4节点32卡逐步扩展至64节点512卡。结果显示,训练吞吐由33.997samples/s提升至530.227samples/s,整体扩展效率达到97.48%,Loss曲线与小规模训练保持一致,实现训练性能与模型收敛效果同步稳定。

这一结果意味着,在无需NVLink和HPN等专用高性能互联条件下,通过训练框架、通信网络及AI Infra工程优化协同,通用GPU集群同样能够实现大规模世界模型的稳定训练,为更多企业开展大模型研发提供了可复制的工程实践。

AI Infra工程优化释放大模型训练效率

随着世界模型不断扩大,训练过程中面临显存管理、通信效率、并行策略以及系统稳定性等多重挑战,仅依赖硬件升级已难以持续提升整体训练效率。针对这些挑战,百度百舸围绕训练框架、通信网络及资源调度进行了系统性AI Infra工程优化,通过FSDP2全量分片、ERI高速网络协同、编译优化及显存管理优化等能力,实现训练效率与集群扩展能力同步提升,并有效保障大规模训练过程中的稳定性。

实践表明,AI Infra工程优化正成为释放算力价值、提升大模型训练效率的重要能力,也成为世界模型持续扩展的重要基础。

持续夯实AI计算底座,加速世界模型产业落地

近年来,世界模型正加速向机器人、自动驾驶等具身智能场景拓展,对AI基础设施提出更高要求。如何在控制成本的同时,实现更高训练效率和更大集群规模,成为产业关注的重要方向。

百度百舸持续围绕AI Infra能力建设,打造覆盖数据准备、模型训练、推理部署等全流程AI计算平台,目前已服务众多AI创新企业及科研机构,支撑世界模型、视觉语言模型(VLM)、视觉语言动作模型(VLA)等多类基础模型训练。

未来,百度智能云将持续完善AI Infra工程优化能力,不断提升训练效率、集群扩展能力和系统稳定性,为更多基础模型创新提供高效、稳定、可扩展的AI计算底座。

相关话题

特别声明:以上内容(如有图片或视频亦包括在内)均为站长传媒平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,相关信息仅供参考。任何单位或个人认为本页面内容可能涉嫌侵犯其知识产权或存在不实内容时,可及时向站长之家提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明(点击查看反馈联系地址)。本网站在收到上述法律文件后,将会依法依规核实信息,沟通删除相关内容或断开相关链接。

推荐关键词

24小时热搜

查看更多内容

大家正在看

当大模型公司开始造手机