【区角快讯】就在上周V4 Pro-0813大模型亮相之际,DeepSeek Harness也开启了高频迭代模式,短短两日内接连升级。这一次,那只“小鲸鱼”终于装上了“眼睛”。截至发稿,该工具已更新至0.1.1-rc.1版本,在既有的V4 Flash及V4 Pro阵容外,新增了一位成员——V4 Flash Vision-Exp,即视觉模型的体验版。对于热衷尝鲜的开发者而言,只需执行npm i -g@deepseek-ai/dsh@next指令,即可抢先上手。
其实,此次多模态能力的整合并非毫无征兆。回顾昨日发布的v0.1.0-rc.8版本,DeepSeek已初步打通多模态链路,其适配器支持配置原生图片请求,诸如/goal、/plan等命令均能接收图文混合输入。用户只需将截图与需求一并提交,Agent便能直接“读图干活”。尽管此前DeepSeek并非原生多模态架构,但其网页端提供的识图功能凭借快准的体验积累了不少口碑,而此次将其深度集成至Harness中,无疑补全了关键一环,极大便利了开发者的日常调试。
官方随后证实了V4 Flash Vision-Exp的存在,并指出该实验性模型在文本处理层面——涵盖代理执行、逻辑推理及世界知识储备——与DeepSeek-V4-Flash保持同等水准。更令人瞩目的是,在多模态代理基准测试中,新版模型相较旧款实现了质的飞跃,其综合表现已无限接近Opus-4.8的水平。从单纯的文字交互到真正的视听理解,这一步跨越,或许正是具身智能走向成熟的前奏。
DeepSeek Harness补齐视觉短板,新模型多模态性能逼近Opus-4.8
科技区角
2026-08-21 18:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。