蚂蚁集团百灵大模型重磅更新:Ling-2.6-flash 全球开源,104B 混合架构实现极致推理效率

国内 2026年04月29日 💬 0
北京时间 2026 年 4 月 29 日,蚂蚁集团旗下百灵大模型系列迎来里程碑式升级,Ling-2.6-flash正式向全球开发者全面开放。为适配多样化硬件环境并大幅降低部署门槛,该模型同步推出BF16、FP8、INT4三大精度版本,为不同算力条件下的应用开发提供了极具弹性的推理选择。

模型概况:匿名测试验证,针对性优化打磨

Ling-2.6-flash 是一款总参数量达104B、激活参数量仅7.4B的 Instruct 模型。在正式发布前,它曾以 “Elephant Alpha” 的匿名身份在 OpenRouter 平台进行了为期两周的公开测试。
研发团队深度吸收了海量真实用户反馈,对模型进行了多轮针对性优化,重点提升了两大核心体验:
  • 中英文双语能力:显著增强了中英文自然切换的流畅度与表达准确性
  • 开发适配性:全面优化了在主流编程框架中的兼容表现,降低了集成难度

核心技术亮点:混合架构驱动,智效比行业领先

Ling-2.6-flash 的核心竞争力源于其创新的架构设计与极致的运行效率,实现了性能与成本的完美平衡。

1. 混合线性架构:刷新推理速度纪录

通过底层计算架构的深度优化,Ling-2.6-flash 展现出惊人的推理性能:
  • 4 卡 H20环境下,推理速度最高可达340 tokens/s
  • Prefill(预填充)吞吐能力达到 Nemotron-3-Super 的2.2 倍
  • 大幅缩短了用户请求的响应延迟,显著提升了交互体验

2. 卓越 “智效比”:商用成本降低 90%

研发团队在训练过程中对 Token 效率进行了精细化校准。权威评测数据显示,完成同等质量的复杂任务,Ling-2.6-flash 仅需消耗约15M tokens,这一数值仅为同类竞品的十分之一,极大地降低了企业级应用的商用成本。

场景深耕:智能体能力专项强化,比肩 SOTA 水平

针对当前大模型应用最广泛的 Agent(智能体)场景,Ling-2.6-flash 进行了全链路专项增强。在复杂工具调用、多步逻辑规划以及最终任务执行等核心环节,模型均表现出极高的稳定性与准确性。
BFCL-V4、SWE-bench等多项行业主流评测中,Ling-2.6-flash 即便面对激活参数规模更大的竞品模型,依然能够维持相近甚至达到行业顶尖(SOTA)的水平,展现出了极高的参数利用效率。

开源与获取方式

目前,全球开发者已可通过以下两大平台免费获取 Ling-2.6-flash 的完整开源资源:
  • Hugging Face:国际主流大模型开源社区
  • ModelScope(魔搭社区):国内领先的 AI 模型开源平台
蚂蚁集团表示,未来将持续迭代百灵大模型系列,不断优化模型性能与开发体验,携手全球开发者共同探索大模型在各行各业的创新应用,推动人工智能技术的普惠化发展。