站长之家 - 业界 2026-05-20 14:26

国产!阿里千问旗舰模型Qwen3.7-Max发布:全自主完成35小时任务

改写后新闻报道

5月20日,在2026阿里云峰会上,阿里巴巴正式推出了全新一代千问旗舰模型——Qwen3.7-Max

在第三方机构Arena全球大模型盲测总榜单中,Qwen3.7-Max的表现超过了Kimi-K2.6、DeepSeek-v4-pro、GLM-5.1等竞品,与GPT、Claude、Gemini等国际顶尖模型的差距进一步缩小,位列国产模型之首。

阿里千问旗舰模型Qwen3.7-Max发布

这是千问旗舰模型近三个月内第三次重大更新,从3.5版本到3.6版本再到如今的3.7版本,阿里在大模型领域的研发节奏明显加快。

Qwen3.7-Max专为智能体(Agent)场景进行了全新设计,在多个关键维度上实现了突破。

在编程能力方面,该模型在SWE-Pro、SWE-Multilingual等编程智能体评测中均取得领先成绩。在Terminal Bench 2.0-Terminus测试中,其得分达到69.7,超过了DeepSeek-v4-pro-Max和Claude-Opus4.6等型号。

在通用智能体方面,Qwen3.7-Max在MCP-Atlas、MCP-Mark、Skillbench等现实场景评测中表现突出,超越了GLM5.1、Kimi-K2.6等模型,创下国产模型的新纪录。

在推理能力方面,该模型在GPQA Diamond、HLE、HMMT 2026 Feb等核心推理评测中,超越了Claude-Opus4.6以及所有国产模型。

在通用能力上,Qwen3.7-Max在指令遵循评测IFBench中拿到79.1分,刷新了该项测试的纪录;同时在多语言评测WMT24、MAXIFE中也保持领先。

在一次实战任务中,模型在从未接触过的全新硬件平台——平头哥真武M890芯片上,面对没有性能分析数据、硬件文档或新架构示例内核的情况下,从空白工作空间出发,自主完成了推理内核的优化任务。

整个优化过程持续了35小时,模型独立进行了432次内核评估和1158次工具调用,全程自主完成了编写、编译、性能分析与迭代改进。最终优化后的推理内核,相比SGLang Triton官方参考实现,取得了10倍的速度提升。

测试轨迹显示,在独立运行超过30小时后,模型依然能够发现有效的优化点,甚至主动发起了一次关键的架构重新设计。

在智能体能力方面,Qwen3.7-Max展现出了跨框架的泛化能力,在Claude Code、OpenClaw、Qwen Code等不同框架下均能稳定发挥。通过MCP集成和多智能体协作,该模型在办公自动化基准测试SpreadSheetBench-v1中获得了87分,处于行业领先水平。

阿里云方面透露,Qwen3.7-Max的API即将在百炼平台上线。后续还将推出Qwen3.7-Plus等版本,覆盖从编程智能体到视觉智能体的全场景需求。

推荐关键词

24小时热搜

查看更多内容

大家正在看