站长之家 - 业界 2026-04-11 10:15

国产AI大模型GLM-5.1登顶开源:可独立编程8小时

4月10日,科技领域传来新动态。据悉,智谱公司于3月下旬发布的GLM-5.1模型,近期在多项专业评估中取得突出成绩。

根据国际评测平台LMArena最新公布的Code Arena专项排名显示,GLM-5.1在开源模型中位列榜首,并在全球所有模型中排名第三。该平台通过大规模盲测收集数据,具有一定参考价值。

技术报告指出,GLM-5.1在继承前代模型高效编码能力的基础上,于长程复杂任务处理方面实现显著进步。具体表现为:

  • 可在8小时内完成Linux桌面环境从零构建;
  • 通过655次迭代突破向量数据库优化瓶颈;
  • 实现1000轮工具调用以优化机器学习模型负载。

值得注意的是,在METR榜单的同等评估标准下,GLM-5.1是目前唯一能达到8小时级持续工作能力的开源模型,全球范围内仅少数技术方案具备类似水平。

GLM-5.1技术演示图示

GLM-5.1在长程任务中的表现示意图

在贴近实际开发场景的SWE-bench Pro基准测试中,该模型同样表现优异。该测试要求模型在真实GitHub代码库中定位并修复高难度缺陷,被视为评估技术方案工程实用性的关键指标之一。

SWE-bench Pro测试结果对比

专业基准测试结果对比图

业界观察人士认为,此次GLM-5.1在多项测评中的表现,反映了其在处理复杂编程任务和持续工作稳定性方面的技术进展。

推荐关键词

24小时热搜

查看更多内容

大家正在看