5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用

智东西 2026-09-09 11:06

5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图1

视觉编程成绩超GPT-5.4
作者 |  江宇
编辑 |  李水青
智东西9月9日报道,今日,蚂蚁百灵正式开源其首个原生多模态大模型Ling-3.0-flash-VL。Ling-3.0-flash-VL是一款1240亿总参数的MoE模型,单次推理激活5.5亿参数,原生支持图像、文本和视频输入,上下文窗口达到256K Tokens。
此次蚂蚁同步开放了模型的BF16和FP8版本,开发者已经可以在Hugging Face和ModelScope下载模型权重,FP4和INT4版本也将在近期上线
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图2

▲Ling-3.0-flash-VL开源主页(图源:Hugging Face)

这款模型基于此前的Ling-3.0-flash拓展而来。相比纯文本版本,新模型加入视觉编码器,并把视觉能力进一步用于网页编程、GUI操作、长视频处理和医疗报告理解等任务。
值得注意的是,Ling-3.0-flash-VL此前已经在海外提前亮相。9月5日,Ant Ling在X上公布了这款模型,并展示了视觉感知、STEM推理、文档理解、多模态Agent、前端编程等测试成绩。
权重开放后,海外开发者也很快跟进。
海外本地AI推理开源项目Atomic Chat已经放出Ling-3.0-flash-VL的运行演示,其给模型输入了一张Flappy Bird游戏截图,让模型根据图片重新创建游戏。从演示来看,模型生成速度较快,短时间内就完成了游戏页面和基础交互的复刻。
对于此次开源,也有海外开发者评价称,又一家中国实验室开放模型权重,在更低精度量化版本到来前直接提供BF16和FP8,“是一次相当扎实的开放”。
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图3
同时,有开发者把关注点放到了FP8版本的实际效果上,追问FP8量化究竟覆盖完整视觉编码器,还是主要集中在语言模型部分。相比文字任务,图表、UI截图等视觉场景通常也更容易暴露低精度量化造成的能力损失。
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图4
从官方和第三方测试来看,Ling-3.0-flash-VL在文档理解、网页操作等视觉任务上已经取得较高成绩。
在Artificial Analysis Intelligence Index v4.1.1中,新模型获得42分,比纯文本版Ling-3.0-flash高4分。
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图5
在Image-to-WebDev Arena中,Ling-3.0-flash-VL以匿名代号“linthium-931h”参测,成绩为1441分,略高于GPT-5.4的1440分。
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图6

开源地址:
Hugging Face BF16:
https://huggingface.co/inclusionAI/Ling-3.0-flash-VL
Hugging Face FP8:
https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp8
ModelScope BF16:
https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-VL
ModelScope FP8:
https://www.modelscope.cn/models/inclusionAI/Ling-3.0-flash-VL-fp8
目前,Ling-3.0-flash-VL也已经上线Ling Studio,用户可以直接免费体验模型。

01.
1240亿总参数仅激活55亿
原生支持图像和视频


Ling-3.0-flash-VL延续Ling-3.0-flash的MoE技术路线,总参数量达到1240亿,单次推理只激活55亿参数。
模型语言主干采用42层混合架构,KDA与Gated MLA以5:1的比例交替排列;视觉部分加入任意分辨率视觉编码器和VideoRoPE,可以直接处理不同尺寸的图片和视频内容。
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图7
上下文方面,Ling-3.0-flash-VL原生支持256K Tokens,可以覆盖长文档、长视频以及需要保留较长操作历史的Agent任务
在引入视觉能力后,Ling-3.0-flash-VL的综合能力也有所提升。在Artificial Analysis Intelligence Index v4.1.1中,其获得42分,相比纯文本版Ling-3.0-flash的38分提高4分。
蚂蚁称,通过原生多模态联合训练,视觉信息的引入对模型的文本能力带来了正向提升。
不过,从Artificial Analysis整体榜单来看,Ling-3.0-flash-VL与目前的前沿闭源模型仍有差距。Claude Fable 5.1为66分,Claude Opus 5为63分,GPT-5.6 Sol等模型也排在其前面。
具体到多模态专项测试,Ling-3.0-flash-VL在CountBench视觉感知测试中取得97.33分,MMMU-Pro为79.00分,OmniDocBench1.5文档理解测试达到91.35分,WebVoyager网页操作测试达到90.83分
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图8
在医疗报告理解测试AntBench-Medical中,其两项指标分别达到0.96和0.93的高分。
部分测试中,它与同类模型仍存在差距。例如MathVision测试中,Ling-3.0-flash-VL为84.87分,低于Qwen3.8-27B的87.40分;复杂图表理解CharXiv_RQ中,其81.30分也低于Qwen3.8-27B的83.70分。
总体而言,从目前公布的测试结果来看,Ling-3.0-flash-VL在文档理解、网页操作和部分视觉Agent任务上的表现相对突出。

02.
能看网页再改代码
视觉Agent自己检查执行结果


相比单纯增加“看图”能力,Ling-3.0-flash-VL此次更明显的变化,在于视觉信息进入了Agent执行过程。模型在执行任务后,可以重新读取页面或环境状态,再根据结果继续修改方案。
例如在前端开发场景中,用户输入一张网页截图后,Ling-3.0-flash-VL可以识别页面布局、字体、颜色和组件关系,并生成对应的前端代码。
代码运行后,模型还会查看浏览器中的实际渲染效果,把生成页面与参考图进行比较,然后继续修改代码。整个过程可以反复进行,蚂蚁称之为“视觉反馈”机制:视觉理解→代码实现→浏览器渲染→查看结果→继续修改。
在第三方Image-to-WebDev Arena中,Ling-3.0-flash-VL以“linthium-931h”的匿名名称参测。该模型获得1441分,排名第34,得分略高于GPT-5.4的1440分。
近期,蚂蚁还计划开放与前端复刻配套的Design Skill
类似的视觉反馈机制也被用于GUI Agent。面对“网页查找数据—整理到Excel—生成图表”这样的跨应用任务,模型可以观察当前界面,识别页面和应用状态,再执行点击、输入、滚动以及应用切换。
一次操作完成后,它会重新读取页面,根据执行结果决定下一步动作。如果实际页面与预期不符,也可以重新调整操作策略。
这种能力对于Computer Use类Agent尤其重要,因为真实软件环境中的弹窗、加载时间、页面结构变化,很难提前通过一套固定操作序列完全预测。

03.
256K上下文处理长视频
医疗报告也加入视觉反馈


除了网页编程和GUI操作,Ling-3.0-flash-VL还把视觉能力用到了长视频和医疗报告等专业任务中。
在长视频场景中,模型可以利用256K上下文持续保留视频内容以及此前的操作信息。官方案例展示了一个体育比赛高光剪辑案例。
模型先在完整比赛中定位可能出现进球的时间段,再截取对应片段并检查前后画面。如果发现片段起点过晚、庆祝镜头被截断等问题,就重新调整时间范围,最终组合成完整高光视频。
实时视觉能力则已经被用于灵光App。用户打开手机摄像头后,可以让模型识别动植物、食材、建筑、汽车以及外语标识,并围绕当前画面连续追问。
医疗场景中,Ling-3.0-flash-VL可以读取多页、多份医疗报告,提取指标和参考区间,并关联不同时期的血常规、生化、影像等资料。模型还会重新核对已经提取的数据,检查遗漏或数值错误,再输出结构化结果。
蚂蚁强调,该功能仅用于辅助用户理解医疗信息,不能代替专业医生诊断。
目前,Ling-3.0-flash-VL目前在长尾场景感知推理、长链路Agent执行以及长程全栈编程等任务上,与最佳模型仍然存在差距;真实环境下的异常恢复和结果稳定性也需要继续提高。

04.
结语:又一国产多模态模型开源


近一个月,国产大模型厂商接连开放多模态模型权重。
8月14日,阿里千问开源Qwen3.8-27B;8月31日,DeepSeek开源DeepSeek-V4-Flash-Vision-Exp。如今,蚂蚁百灵也开放了Ling-3.0-flash-VL的BF16和FP8权重,并计划继续推出FP4和INT4版本。
相比单纯提供视觉理解能力,Ling-3.0-flash-VL这次还把重点放在网页编程、GUI操作、长视频处理等需要持续读取视觉反馈的任务上。
随着权重正式开放,这些能力也将从官方测试和Demo进入开发者实际验证阶段。
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图9
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图10
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图11
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图12
5.5B激活参数!又一国产多模态模型开源,能自己看网页改代码,免费可用图13

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
开源
more
399美元开源鸭Microduck:软件全白嫖,硬件零图纸!扒完代码我才发现复刻没那么简单
刚刚,黄仁勋发文!877亿收购全球最大AI开源平台
IJRR 2026 港科大重磅开源:退化LiDAR配准新范式,精度提升50%、加速高达116倍
Meta新模型逼平Fable 5,小扎:开源且便宜到你懒得算账
罗永浩炮轰车企AI体验:自研模型“挺垃圾”,呼吁接入顶尖开源方案
RISC‑V × OpenHarmony 双向奔赴,共绘国产开源产业新蓝图
说话就能生成芯片时序图的开源 Skill,效率提高1000%
刚刚,国产2B小钢炮开源!逼近人类水平,跑出端侧通用Agent雏形
从监管“拉闸”到开源迁徙:全球AI底层权力的隐秘重构
RVEI人才培养工作部邀你参加开源之夏2026活动
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号