蚂蚁百灵发布原生多模态模型Ling-3.0-flash-VL并开源
蚂蚁集团百灵系列首个原生多模态模型Ling-3.0-flash-VL正式发布并开源,引入视觉反馈闭环机制,提升多模态理解与生成能力。
驱动中国9月9日消息,蚂蚁集团旗下百灵大模型系列迎来重要进展,其首个原生多模态模型Ling-3.0-flash-VL正式对外发布并同步开源。该模型的最大亮点在于引入视觉反馈闭环机制,标志着蚂蚁在端侧与云端协同的多模态推理路径上迈出关键一步。
Ling-3.0-flash-VL并非在既有文本模型基础上简单叠加视觉编码器,而是从架构层面直接以多模态输入输出为设计目标。据官方技术说明,模型在训练阶段即采用图文交错数据,使视觉与语言表征在共享空间中对齐,从而在图像描述、视觉问答、文档理解等任务上表现出更强的语义一致性。相较此前百灵系列依赖外部视觉模块的方案,原生多模态设计显著降低了推理延迟与参数冗余。
视觉反馈闭环机制是本次开源的核心创新点。该机制允许模型在生成文本或回答问题时,将中间视觉特征重新注入解码过程,形成“看—想—再看—再答”的迭代链路。这一设计使模型在面对复杂图表、模糊图像或多物体场景时,能够主动修正早期视觉理解的偏差,提升最终输出的准确率。蚂蚁方面表示,该机制在多项公开基准测试中,将细粒度视觉问答的准确率提升了约8%至12%,具体数值因任务类型而异。
从参数规模看,Ling-3.0-flash-VL定位为轻量高效模型,适配手机、智能终端等资源受限场景。蚂蚁强调,模型在保持低显存占用的同时,支持高分辨率图像输入与流式输出,可满足实时交互需求。开源版本涵盖模型权重、推理代码及微调脚本,开发者可基于自有数据快速适配行业应用,如电商商品识别、医疗影像初筛、教育场景图文解析等。
此次开源延续了蚂蚁在AI基础设施上的开放策略。此前百灵系列已开源多个文本模型,累计下载量在主流模型社区位居前列。Ling-3.0-flash-VL的发布,进一步补齐了蚂蚁在多模态方向的开源版图。行业分析人士指出,视觉反馈闭环机制为多模态模型提供了一种低成本纠错路径,或将对具身智能、自动驾驶等需要实时视觉理解的领域产生示范效应。
值得注意的是,该模型采用Apache 2.0协议开源,允许商用与二次开发。蚂蚁在技术博客中同时公布了模型在OCR、图表推理、多轮视觉对话等场景的评测样例,显示其在中文场景下的表现优于同量级国际开源模型。不过,官方也坦承模型在极端光照、遮挡严重的图像上仍有局限,后续将通过数据增强与强化学习持续迭代。
随着Ling-3.0-flash-VL的落地,蚂蚁百灵系列已形成覆盖文本、多模态、端侧推理的完整产品矩阵。业界普遍认为,开源生态的竞争正从单一模型性能转向工具链与场景适配能力,蚂蚁此次选择在轻量级多模态赛道发力,既避开了与超大参数模型的正面交锋,又精准卡位了AI应用落地的关键环节。未来,该模型能否在开发者社区形成规模效应,将取决于其与蚂蚁云、支付宝等业务场景的协同深度。