怎么全世界都开始吻上 Flash 模型了?就在刚刚,DeepSeek 正式发布 DeepSeek V4.1 Flash 模型,并已全面上线官网、App 和 API 端。作为 DeepSeek 新一代模型结构系列中的最小尺寸版本,V4.1 Flash 并没有简单延续扩大模型规模的路线,而是从架构设计、缓存管理和推理流程多个方面重新优化大模型运行方式,且具备原生多模态视觉理解能力。官方表示,DeepSeek V4.1 Flash 的目标是同时提升模型能力上限、推理速度、吞吐能力,并为未来扩展到更大规模模型提供新的技术基础。其中最受关注的是,DeepSeek V4.1 Flash 是一个拥有 552B 参数的 MoE 模型,但通过新的计算架构,让实际推理成本大幅降低。APPSO 此前也曾简单体验过这款新模型,欢迎点击下文回看:更快更便宜更智能的秘密,藏在这些黑科技里APPSO 查阅 DeepSeek V4.1 Flash 的技术报告,发现其最大的变化,是采用了一套全新的 Causal Encoder Decoder(CED)架构。传统 Transformer 模型在处理输入和生成输出时,通常采用相对接近的计算方式。但实际上,用户输入内容的理解过程和模型生成内容的过程,对计算资源的需求并不完全相同。DeepSeek V4.1 Flash 通过非对称设计,让模型在不同阶段采用不同规模的激活参数。官方数据显示,V4.1 Flash 总参数规模达到 552B,但输入阶段激活参数约为 8B,输出阶段激活参数约为 16B。这意味着,模型拥有大规模参数带来的能力上限,同时在实际推理过程中只需要调用部分计算资源,从而降低运行成本。论文链接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf这种设计主要解决的是大模型进入长上下文时代后的效率问题。过去,模型处理几千字内容时,计算压力并不明显。但随着 AI Agent 兴起,一个任务可能需要模型连续读取网页、分析文件、调用工具,再根据新信息继续推理。在这样的场景中,模型不仅需要具备理解能力,还需要长期保存和调用大量上下文信息。其中影响效率最大的部分之一,就是 KV Cache——可简单理解为模型保存历史上下文的缓存机制。根据 DeepSeek 技术报告,CED 设计能够降低长上下文输入阶段的计算压力,让模型面对大量文本时拥有更高效率。其次是 Compressed Sparse Attention 2(CSA2)。在普通注意力机制中,模型生成一个新 token 时,需要关注此前所有 token 信息。例如面对百万 token 的上下文,理论上模型每生成一个新 token,都需要处理此前的大量内容。CSA2 则通过跨层复用 KV Cache,并结合 Top-K 索引,让模型优先关注更加重要的信息。DeepSeek 介绍,CSA2 包含 Full、Reindex 和 Reuse 三种模式。Full 模式会重新计算 KV 和索引;Reindex 模式会复用 KV,但重新选择关注位置;Reuse 模式则直接复用 KV 和 Top-K 索引。通过这种方式,不同网络层无需反复保存和计算相同信息,从而降低生成过程中的计算量。除了架构优化,DeepSeek V4.1 Flash 还进一步压缩了 KV Cache 存储需求。新模型采用 FP4 KV Cache,相比上一代 DeepSeek V4 使用的 FP8 Main KV Cache,进一步降低缓存占用。官方数据显示,与上一代模型相比,DeepSeek V4.1 Flash 对 HBM 的需求降低至原来的四分之一,对 SSD 的需求降低至原来的八分之一。如果与初代模型相比,DeepSeek 表示,目前 KV Cache 规模已经缩小约 437 倍。对于企业部署而言,更小的缓存意味着同样硬件资源可以支持更多并发请求;对于普通用户而言,则意味着更快的响应速度和更低的调用成本。生成阶段,DeepSeek V4.1 Flash 还加入了 DSpark 技术。该技术通过轻量模块提前预测部分 token,再由主模型确认结果,提高 Decode 阶段生成效率。最终效果会直接体现在用户感知上,也就是模型每秒能够生成多少 token。综合这些优化以及大规模的强化学习后训练,DeepSeek V4.1 Flash 在多个 Agent 能力测试中超过包括 DeepSeek V4 Pro 在内的一系列旗舰模型。这也让 Flash 系列的定位发生变化。过去,Flash 更多意味着更轻量、更低成本的版本。而在 V4.1 Flash 中,DeepSeek 正尝试让 Flash 成为兼顾性能和效率的新一代主力模型。从一个模型,到一套 AI 工作环境随着 DeepSeek V4.1 Flash 发布,DeepSeek 同步调整了 API 服务。目前,V4.1 Flash 已正式接入 DeepSeek API,用户只需要调用 deepseek-flash 模型名称即可使用最新版本。此前的 DeepSeek V4 Flash 和 V4 Flash Vision Exp 已停止服务。为了保证已有应用兼容,原模型名称 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 会暂时自动路由至 V4.1 Flash。与此同时,DeepSeek 计划逐步下线 V4 Pro。官方表示,经过多项测试,V4.1 Flash 在性能、费用、速度以及整体任务耗时方面已经超过 V4 Pro。北京时间 9 月 14 日 12 点之后,至未来 V4.1 Pro 上线之前,用户继续访问 deepseek-v4-pro 时,请求将自动转向 V4.1 Flash,并按照 V4.1 Flash 的价格计费。价格方面,DeepSeek 也同步下调 V4.1 Flash API 费用。得益于新架构带来的成本优化,DeepSeek 希望进一步降低模型使用门槛。同时,API 仍然采用峰谷价格机制,闲时时段价格为高峰时段的一半。目前,腾讯 WorkBuddy、CodeBuddy 以及 OpenCode 已经接入 DeepSeek V4.1 Flash。除了模型本身,DeepSeek 也在同步升级围绕模型运行的 Agent 环境。此次发布的 DeepSeek Harness v0.1.5,就是其中的重要更新。新版 Harness 针对 DeepSeek V4.1 Flash 进行了专项训练和优化,覆盖标准模式、程序化工具调用(PTC)模式以及极简模式。其中一个重要变化,是支持在保留已有 KV Cache 的情况下更新系统提示词。对于连续运行的 Agent 任务而言,这意味着用户可以调整任务方向,而无需重新开始整个上下文计算过程。Harness 的文件处理能力也进一步增强。新版 Web 界面支持上传图片、PDF 等多种类型文件,模型可以通过文件工具读取内容。右侧 Sidebar 新增工作区文件管理,可浏览文件树并预览 Markdown、HTML、PDF、代码和图片。模型生成的文件也能直接查看,或用系统默认应用打开。新版 Harness 扩展了插件生态,在左右两侧提供标准化插件入口,支持将工具接入侧边栏和内容面板,并以多标签、分栏或全屏方式展示。Harness 正从模型调用工具,逐渐转向可扩展的 Agent 工作环境。多 Agent 协作也得到增强。父子 Agent 支持双向通信,用户可在任务执行中补充信息、调整方向,并排队发送、编辑、删除消息,插入指令或停止任务。主 Agent 还可为子 Agent 选择模型和推理强度。此外,DeepSeek 推出实验性功能 Agent Teams。主 Agent 可创建团队成员,通过共享任务列表分配和跟踪工作;不同 Agent 可互发消息,主 Agent 能查看进度、等待结果并统一汇总。目前该功能以插件形式提供,默认关闭,需手动开启。插个题外话,DeepSeek 目前已经调整了界面设计,将快速、专家和识图功能整合到了一起,不再单独提供专家模式。从 DeepSeek V4.1 Flash 到 Harness v0.1.5,DeepSeek 正在尝试构建的不只是一个更强模型,而是一套围绕 Agent 工作流展开的技术体系。模型能力决定 AI 能做什么,而推理效率、工具生态和运行环境决定 AI 能否真正进入日常工作。DeepSeek V4.1 Flash 的发布,正是在这一方向上的一次有力的探索。我们正在招募伙伴📮 简历投递邮箱hr@ifanr.com✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)