4月10日,科技领域传来新动态。据悉,智谱公司于3月下旬发布的GLM-5.1模型,近期在多项专业评估中取得突出成绩。
根据国际评测平台LMArena最新公布的Code Arena专项排名显示,GLM-5.1在开源模型中位列榜首,并在全球所有模型中排名第三。该平台通过大规模盲测收集数据,具有一定参考价值。
技术报告指出,GLM-5.1在继承前代模型高效编码能力的基础上,于长程复杂任务处理方面实现显著进步。具体表现为:
- 可在8小时内完成Linux桌面环境从零构建;
- 通过655次迭代突破向量数据库优化瓶颈;
- 实现1000轮工具调用以优化机器学习模型负载。
值得注意的是,在METR榜单的同等评估标准下,GLM-5.1是目前唯一能达到8小时级持续工作能力的开源模型,全球范围内仅少数技术方案具备类似水平。
GLM-5.1在长程任务中的表现示意图
在贴近实际开发场景的SWE-bench Pro基准测试中,该模型同样表现优异。该测试要求模型在真实GitHub代码库中定位并修复高难度缺陷,被视为评估技术方案工程实用性的关键指标之一。
专业基准测试结果对比图
业界观察人士认为,此次GLM-5.1在多项测评中的表现,反映了其在处理复杂编程任务和持续工作稳定性方面的技术进展。