【区角快讯】在AI领域,梁文锋及其创立的DeepSeek始终占据着话题中心。从V4预览版的惊艳亮相,到融资与IPO的种种传闻,再到那份广为流传的四小时深度对谈,DeepSeek的每一步动向都牵动着行业的神经。7月31日下午,这家备受瞩目的公司再次更新动态,不过这次并非高调发布新产品,而是在API文档的更新日志中低调宣布:V4-Flash正式版API开启公测。
值得注意的是,“正式版”与“公测”这两个看似矛盾的词汇同时出现,暗示这并非V4系列的最终形态。DeepSeek特别澄清,此次更新仅针对V4-Flash的API接口,V4-Pro以及App、Web端的模型版本均维持原状,V4-Pro的正式版仍需等待。尽管范围有限,但这次调整背后的战略意图却不容忽视。
从技术细节来看,最新发布的V4-Flash-0731并未改动底层架构或参数规模,而是进行了一轮深度的后训练。DeepSeek将宣传重点几乎全部倾斜于Agent能力,尤其是代码智能体(Code Agent)的表现提升。这折射出一个核心问题:在Agent时代,企业究竟需要的是一个各项指标顶尖的“全能冠军”,还是一个足够强、足够快且成本可控的“实用主义者”?
回顾今年4月24日,DeepSeek首次推出V4系列时,便确立了双轨策略。同为MoE架构,V4-Pro拥有1.6万亿总参数,推理时激活49B参数,旨在突破能力上限;而V4-Flash总参数为284B,仅激活13B参数,主打高效低成本。两者均支持百万级Token上下文。简言之,Pro负责展示智力高度,Flash则通过牺牲部分知识容量,换取更快的响应速度和更低的调用成本。
此次7月31日的更新,正是在保持这一架构不变的前提下,通过后训练显著提升了Flash的Agent执行力。据官方数据,V4-Flash-0731在Terminal Bench 2.1上得分82.7,NL2Repo得分为54.2,DeepSWE为54.4,Toolathlon Verified达到70.3。DeepSeek声称,这些成绩已大幅超越V4-Pro的预览版表现。
这一现象揭示了一个行业趋势:大模型的竞争焦点正从预训练阶段的算力与数据堆积,转向后训练、强化学习及外部执行框架的优化。模型能否熟练使用终端、在长链条交互中保持状态稳定、及时修正错误并精准调用工具,已成为衡量其实际价值的关键。为此,DeepSeek不仅更新了模型,还原生支持了Responses API,并专门适配Codex,甚至在测试中使用了尚未公开的DeepSeek Harness minimal mode。这意味着,优异的Agent成绩是“模型+推理预算+Harness系统”共同作用的结果。
当然,外界对此需保持审慎。由于部分测试基于内部数据集,且Harness环境未公开,独立复现尚存困难。V4-Flash的实际进步幅度,仍有待真实开发场景的验证。但这表明,DeepSeek正从单纯的模型提供商,向构建Agent所需执行环境的生态角色迈进,这是一种克制而务实的产品化路径。
为何优先更新Flash而非Pro?根本原因在于Agent任务的特性。不同于单次问答,复杂Agent任务涉及数十甚至数百次模型调用。若每次调用都使用昂贵且缓慢的Pro模型,累积的成本和延迟将是巨大的。因此,绝大多数步骤更需要的是性价比高、响应迅速的Flash。数据显示,在百万Token上下文下,V4-Flash的单Token计算量约为V3.2的10%,KV Cache约为7%。其API定价也极具竞争力:输入1元/百万Token,输出2元/百万Token,远低于Pro的3元和6元。此外,Flash的并发限制高达2500,而Pro仅为500。
梁文锋曾在内部强调:“模型应在相同成本下比较;现阶段Coding Agent优先级高于其他垂直Agent。”V4-Flash的此次迭代,正是对这一理念的践行。它没有盲目追求参数规模的扩张,而是致力于提升完成真实任务的效率。然而,挑战依然存在。如果Flash需要消耗更多Token才能达到接近Pro的效果,其单价优势可能被抵消。真正的考验在于,在完成同一项复杂任务时,Flash相较于Pro及其他竞品,在总耗时、总Token消耗及成功率上的综合表现。目前,DeepSeek尚未给出这份终极答案,市场仍在期待更透明的对比数据。
DeepSeek V4-Flash公测上线:不堆参数,主攻Agent实战效率
科技区角
2026-07-31 20:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。