8月3日,阿里巴巴正式推出新一代基础大模型Qwen3.8,参数总规模达2.4万亿,在编码与专业办公两大领域的能力大幅跃升。
同日公布的第三方基准评测Arena榜单显示,阿里Qwen系列整体表现仅次于Anthropic的Claude系列,跻身全球大模型第一梯队。
Qwen3.8的应用程序接口即日起上线千问平台,并已接入阿里同步发布的智能办公助手“千问办公”。此外,Qwen3.8-Max预计下周开源,届时还将一同开源Qwen3.8-27B版本。
从今天开始,全球开发者均可通过千问平台调用Qwen3.8的API服务。国内定价为输入每百万Tokens 12元,输出每百万Tokens 36元,隐式缓存命中仅需1.5元。国际市场方面,其输入与输出价格分别仅为Opus5的40%与24%,在提供相近智能水准的同时带来更高性价比。

此次发布的旗舰型号Qwen3.8-Max,是千问系列中参数规模最大、性能最强的版本,支持视觉理解,上下文窗口长达100万Tokens。在架构上,Qwen3.8首次将千问的总体参数推升至2.4万亿,激活参数950亿,由此获得更高的推理效率和更快的响应速度,综合性能亦迎来全新突破。
评测数据方面,Qwen3.8-Max在论文复现基准PaperBench等编程智能体测试中,较上一代大幅提升28.2分,取得93.0分,创下评测新高;在WideSearch、Agents Last Exam等通用智能体评测中分别获得81.9分和52.4分,处于前沿水平。在视觉推理BabyVision测试中,不借助外部工具即获82.0分,超出部分主流模型近一倍;在衡量智能体操作电脑能力的OSWorld-Verified评测中,以86.1分位居主流模型首位。
自主编程方面,Qwen3.8同样实现新跨越,在CodeArena榜单中排名全球第四。它能够从空白文件夹开始,独立完成真实项目的交付,全程无需人工干预。用户只需一句“创建一个自进化的智能体Harness”,Qwen3.8便如同经验丰富的工程师,从零搭建循环工程框架,编排智能体自动领取与执行任务,人类工程师还可通过钉钉直接提出新需求。独立编程运行约16天后,Qwen3.8开发出一个达到Hermes Agent级别、真实可用的自进化智能体框架“oh-my-cli”。该项目目前完全开源,完整开发过程公开保存在GitHub仓库内,供所有开发者查阅。
在专业工作任务方面,Qwen3.8可胜任广泛的实际办公场景。面对长周期任务,它还涌现出系统级自主规划与全栈闭环自适应学习能力。
视觉理解能力上,Qwen3.8-Max在Vision Arena榜单中位列全球第二。它不仅能阅读200页的财报PDF、看懂超过100小时的长视频,更能将所“看到”的知识与信息反馈至工作全流程,帮助模型思考得更加周全。在千问团队构建的应用复刻基准RecreationBench长程任务中,模型在无源代码、无法联网的条件下,仅凭交互与反馈理解应用,便能从零复刻出完整应用。这显示出其前沿的混合多模态智能体实力,通过“迭代编程与交互反馈”的循环,将视觉编程推向新的高度。
另据了解,阿里真武M890超节点已成功适配Qwen3.8,通过芯片、云平台与大模型的全链路协同优化,显著提升推理效率并降低推理成本,在智能体推理场景中最高可带来1.5倍的性能提升。