简体
  • 简体中文
  • 繁体中文

热门资讯> 正文

蚂蚁百灵Ling-3.0-flash正式开源

2026-08-07 20:20

智通财经APP获悉,蚂蚁百灵新一代原生混合推理模型Ling-3.0-flash已正式开源。Ling-3.0-flash采用124B总参数、5.1B激活参数的MoE架构。它保留了千亿参数模型的知识与能力容量,但在生成每个Token时,只激活其中约5.1B参数,从而降低单次推理的计算开销。

开发者既可以直接调用模型,也可以自由验证、部署和定制模型能力,将Ling-3.0-flash接入自己的业务系统、开发工具链和Agent工作流。据悉,Ling-3.0-flash提供三种不同的落地选择:

API调用,让Agent应用快速上线:面向希望快速接入、无需自建推理服务的开发者,Ling-3.0-flash可通过云端API直接调用;

单机私有化,让数据留在本地:面向数据不能出域的企业和团队,MXFP4与INT4版本可在单台NVIDIA DGX Spark上完成端到端推理;

高性能部署,释放极致单请求速度:面向单请求时延敏感的高性能服务,在指定GPU测试配置下,平均输出速率突破1100 tokens/s。

在AA Intelligence Index 榜单中,Ling-3.0-flash每项任务的加权平均调用成本约为0.04美元,加权平均解码时间约为1.4分钟,同时进入“智能水平—任务成本”和“智能水平—任务耗时”的优势区域。

Ling-3.0-flash 通过单机部署降低了私有化应用的起步门槛;而对于单请求时延更加敏感的实时业务,Ling-3.0-flash通过高性能GPU与推理栈的深度协同,进一步压缩生成等待,为实时Agent、多轮工具调用和连续任务执行提供更低延迟的运行体验。

风险及免责提示:以上内容仅代表作者的个人立场和观点,不代表华盛的任何立场,华盛亦无法证实上述内容的真实性、准确性和原创性。投资者在做出任何投资决定前,应结合自身情况,考虑投资产品的风险。必要时,请咨询专业投资顾问的意见。华盛不提供任何投资建议,对此亦不做任何承诺和保证。