快科技4月22日消息,蚂蚁百灵今日正式发布Ling-2.6-flash模型。该模型总参数量达104B,激活参数为7.4B,属于Instruct类型模型。其核心特色在于“Token效率”(Token Efficiency),即在保持较高智能水平的同时,实现更快速、更经济的运算,从而更适配大规模的真实应用场景。
根据第三方评测机构Artificial Analysis的数据,Ling-2.6-flash在Token效率方面表现突出。该模型仅消耗15M的输出Token,便获得了26分的智能指数(Intelligence Index)。这意味着,它在维持较强智能能力的基础上,将输出成本控制在了一个相对较低的水平。

据介绍,Ling-2.6-flash沿用了Ling 2.5版本的混合线性架构设计。这种高度稀疏化的MoE架构,在硬件运行中展现出明显的性能优势。在4卡H20的硬件环境下,其推理速度最高可达每秒340个Token,其Prefill吞吐量更是达到了Nemotron-3-Super模型的2.2倍。
在输出速度测试中,Ling-2.6-flash以每秒215个Token的稳定输出速率,在同参数级别的模型中稳居第一梯队。从Token消耗来看,该模型的“智效比”(即智能水平与成本之比)得到了显著提升。在Artificial Analysis的完整评测中,Ling-2.6-flash的总消耗为15M Token,而Nemotron-3-Super等同类模型的消耗则超过110M Token。这意味着,Ling-2.6-flash仅需约十分之一的Token消耗,即可完成相同的评测任务。


Ling-2.6-flash针对Agent应用场景进行了定向优化。在严格控制Token消耗的前提下,它依然保持了强大的任务执行能力。在BFCL-V4、TAU2-bench、SWE-bench Verified、Claw-Eval、PinchBench等多项Agent相关基准测试中,该模型均达到了同尺寸模型的顶尖水平。与此同时,在通用知识、数学推理、指令遵循以及长文本解析等维度,Ling-2.6-flash也展现出了优秀的水准。

在API定价方面,Ling-2.6-flash的输入价格为每百万Token 0.1美元,输出价格为每百万Token 0.3美元。目前,该模型的API已正式向用户开放,并同步推出为期一周的限时免费试用活动。用户可通过OpenRouter或百灵大模型tbox平台获取服务。据悉,该模型后续还将通过蚂蚁数科发布商业版本LingDT,旨在服务全球范围内的开发者及中小企业。