AB
AiBoss站
project

Ling-3.0-flash-VL - 蚂蚁开源的原生多模态大模型

Ling-3.0-flash-VL 是蚂蚁 InclusionAI 百灵系列首个开源的原生多模态大模型,基于 Ling-3.0-flash 的 MoE 架构拓展,总参数 124B、单次推理仅激活 5.5B,原...

Ling-3.0-flash-VL是什么

Ling-3.0-flash-VL 是蚂蚁 InclusionAI 百灵系列首个开源的原生多模态大模型,基于 Ling-3.0-flash 的 MoE 架构拓展,总参数 124B、单次推理仅激活 5.5B,原生支持图文与视频输入,上下文窗口达 256K Token。Ling-3.0-flash-VL 能让模型像人一样边观察、边行动、边验证修正,把任务从一次性生成变成可靠的持续交付。

Ling-3.0-flash-VL的主要功能

  • 实时视觉交互:打开摄像头边看边聊,可识别动植物、地标、车型并实时翻译外语标识。
  • 视觉反馈编程:根据网页截图生成前端代码,并对照渲染结果自我修正,实现网页复刻。
  • GUI Agent:识别界面结构与操作状态,跨工具完成任务,如查网页数据、整理 Excel、生成图表。
  • 医疗报告解读:提取血常规、生化、影像等跨页跨期指标,以红黄绿灯展示健康风险。
  • 实时学习伙伴:在课程视频中结合画面识别公式板书,即时答疑并生成练习。
  • 长视频高光剪辑:对小时级球赛视频执行”定位→截取→验证→修正”,自动合成高光集锦。

Ling-3.0-flash-VL的技术原理

  • MoE 高效稀疏架构:模型基于 Ling-3.0-flash 拓展,总参数 124B,每次推理仅激活 5.5B 参数,在保证能力的同时大幅压缩算力开销,适合作为 Agent 工作流中的高频执行节点。
  • 原生多模态联合训练:图像、文本、视频在同一训练中共同优化,非先训文本再外挂视觉模块。实践证明视觉信息的引入不仅没拉低文本能力,反而在 Artificial Analysis Intelligence Index 上带来 4 分提升。
  • 任意分辨率视觉编码与 VideoRoPE:引入任意分辨率视觉编码器处理不同尺寸的图文输入,配合 VideoRoPE 位置编码实现对原生视频的理解,无需将视频拆帧降级为图像序列。
  • KDA 与 Gated MLA 混合语言主干:语言部分沿用 42 层混合架构,用 5:1 的比例交替排列线性注意力机制 KDA 与门控版 MLA,兼顾长上下文效率与建模精度,支撑 256K Token 的上下文窗口。
  • 视觉反馈闭环机制:模型引入”观察→行动→验证→修正”的循环执行模式,将任务从一次性生成转变为多轮迭代:先理解视觉信息并行动,再观察执行结果与目标比对,发现偏差后修正策略,保证交付结果的可靠性与可验证性。

微信关注回复“开源”,加入AI开源项目交流群

如何使用Ling-3.0-flash-VL

  • 在线体验:
    • 打开官网:访问 Ling Studio官网 https://chat.ant-ling.com/chat。
    • 免费使用:当前处于免费体验期,登录后可直接对话。
    • 上传素材:输入文字提示,同时可上传图片或视频进行多模态交互。
    • 尝试场景:可测试网页截图复刻、视频提问、拍照识别等典型能力。
  • 本地部署:
    • 下载模型:从 Hugging Face 或 ModelScope 获取开源权重,BF16 与 FP8 版本已可用,FP4/INT4 版本即将推出。
    • 准备环境:配置支持该参数规模的推理环境。
    • 加载推理:使用主流推理框架加载模型,原生支持图文与视频输入,上下文可扩展至 256K Token。
    • 接入工作流:通过 API 将其作为视觉 Agent 的执行节点,嵌入”观察→行动→验证→修正”的多轮任务流程中。

Ling-3.0-flash-VL的核心优势

  • 多模态反哺文本:原生多模态联合训练不仅没有削弱文本能力,反而在 Artificial Analysis Intelligence Index 上较纯文本版提升 4 分。
  • 视觉反馈闭环:通过”观察→行动→验证→修正”的迭代机制,把任务从一次性生成升级为可靠、可验证的持续交付。
  • 极致推理效率:124B 总参数下单次推理仅激活 5.5B,大幅降低算力与 Token 开销,适合高频多轮调用。
  • 超长上下文:原生支持 256K Token,可轻松应对长文档解析、长视频分析与多步骤 Agent 的历史记忆。
  • 全模态原生输入:引入任意分辨率视觉编码器与 VideoRoPE,原生处理图像、文本与视频,无需拆帧降级。
  • 实测成绩亮眼:在 Image-to-WebDev Arena 评测中,以 5.5B 激活参数的规模得分超过 GPT-5.4。

Ling-3.0-flash-VL的项目地址

  • HuggingFace模型库
    • https://huggingface.co/inclusionAI/Ling-3.0-flash-VL
    • https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp8

Ling-3.0-flash-VL的同类竞品对比

维度 Ling-3.0-flash-VL Qwen2.5-VL-72B
模型架构 MoE 稀疏架构 Dense 稠密架构
参数规模 总参数 124B,单次推理仅激活 5.5B 72B,每次推理需激活全部参数
推理成本 激活量小,算力与 Token 开销显著更低 推理算力开销较高
上下文窗口 256K Token 最高约 128K Token
视觉机制 视觉反馈闭环(观察→行动→验证→修正) 以单轮视觉理解为主
视频能力 原生视频理解(VideoRoPE),支持小时级长视频 支持视频输入理解
文本能力 多模态训练反哺文本,Intelligence Index 较纯文本版 +4 视觉训练对文本影响中性

Ling-3.0-flash-VL的应用场景

  • 前端开发与网页复刻:根据设计稿截图生成可运行网页代码,并通过渲染比对持续自我修正。
  • GUI 自动化办公:跨软件执行任务,如抓取网页数据、整理进 Excel、自动生成图表。
  • 医疗报告辅助解读:整合血常规、生化、影像等多类报告,提取异常指标并以红黄绿灯分级展示健康风险。
  • 在线教育学习伙伴:观看课程视频时结合画面讲解公式与板书,即时答疑并围绕知识点生成练习。
  • 体育赛事高光剪辑:对小时级比赛长视频执行”定位→截取→验证→修正”,自动合成流畅的精彩集锦。