
DeepSeek 在 2026 年 9 月 10 日发布了 V4.1-Flash,话术非常直接:旗舰级的 Agent 能力、原生图像理解,外加一份让所有旗舰模型显得像奢侈品的价目表。新模型已以 deepseek-flash 之名上线 DeepSeek API,开源权重和技术报告同步挂在 Hugging Face,而且它正在顶替自家旗舰——从 9 月 14 日开始,所有 V4-Pro 请求都会被直接路由到 V4.1-Flash。
V4.1-Flash 不是 V4 系列的又一个小版本,而是一个全新架构家族中最小的成员:552B 参数的 MoE,采用 DeepSeek 称为 Causal Encoder–Decoder 的设计,并且做了少见的非对称切分——输入处理约 8B 激活参数,输出生成约 16B。
两个点让这次发布超出了常规参数升级:

图:DeepSeek 官方 Agent 基准成绩,2026 年 9 月 10 日。
在 DeepSeek 公布的对比表里,V4.1-Flash 不只是打赢了自家 Pro,还在 Agent 真正干活的任务上压过了几个旗舰:
| 基准 | V4.1-Flash | V4-Pro (0813) | Claude Opus 5 | GPT5.6-Sol |
|---|---|---|---|---|
| DeepSWE v1.1 | 74.2 | 62.7 | 74.0 | 73.0 |
| CyberGym | 88.1 | 83.3 | – | 84.5 |
| Automation-Bench | 54.8 | 43.2 | 50.3 | 45.8 |
| Terminal-Bench 3.0 | 30.0 | 11.8 | 43.3 | 34.4 |
| Codeforces (Rating) | 3471 | 3348 | – | – |
诚实的提醒也在:纯知识类基准仍然是老牌旗舰的地盘。GPQA Diamond 是 90.9(GPT5.6-Sol 为 94.1),HLE 是 36.8,对比 Opus 5 的 56.3。V4.1-Flash 的主场在代码、终端和多步 Agent 任务——而它基本都赢了。

图:DeepSeek 官方完整基准对比表。

图:DeepSeek-V4.1-Flash API 定价,2026 年 9 月 10 日 04:00 UTC 生效。
Off-peak 时段,输入每百万 token $0.15、输出 $0.60——而"off-peak"覆盖了除工作日 01:00–04:00 和 06:00–10:00 UTC 之外的全部时间,周末和法定节假日全天 off-peak。缓存命中时输入成本塌缩到每百万 token $0.003,对于整天反复读同一段上下文的 Agent 工作负载,这才是关键数字。
社区已经自己算过账:r/singularity 上的热帖显示,V4.1-Flash 在 OpenDesign Arena 上拿到了 GPT-6 "Astra" 98% 的分数,只花了 1.4% 的成本。

图:DeepSeek 四代模型的 KV Cache 对比。
服务成本才是这里安静的护城河。DeepSeek 把每 token 的 KV Cache 从 389,120 字节(2023 年的 V1)压到了 890 字节,V4.1-Flash 的架构又把 HBM 降到上代 1/4、SSD 降到 1/8。便宜的缓存,才是 $0.003 缓存命中价在经济上成立、而不是促销噱头的前提。
整个发布里最大胆的一句话只占了一小段:从 9 月 14 日 04:00 UTC 起,所有 V4-Pro 请求按 V4.1-Flash 的价格路由到 V4.1-Flash,直到 V4.1-Pro 发布。旧的 V4-Flash 和 V4-Flash-Vision-Exp 模型名已经开始重定向。DeepSeek 没有出于情怀保留高价档——Flash 档就是战略本身。
Hacker News 上 V4-Flash 系列的讨论很典型。粉方说"DSV4 模型的服务成本极低,提升它们的能力有很多下游效应";质疑方则反驳便宜的 token 不等于高效的 token——"你可以让 DeepSeek 猛跑 1 小时解一道难题,或者让 Opus 5 分钟搞定"——另外 V4 系列那 1M 上下文窗口在大仓库上的长文压测也确实有质量衰减。两边都对:V4.1-Flash 的每 token 性价比是惊人的,但你的 Agent 预算能不能兑现这个性价比,取决于 token 花法。
模型在 DeepSeek API 上以 deepseek-flash 提供(过渡期旧模型名会自动重定向)。开源权重和技术报告已上 Hugging Face,合作方 CodeBuddy(via WorkBuddy)和 OpenCode 首日完成接入。
精心选择的AI工具来改善您的工作,学习和生活效率。
2025年11月14日,OpenAI正式开启ChatGPT群聊功能试点,标志着AI从个人助手迈向团队协作伙伴的重大转折
Cursor正式迈入2.0时代!其首个自研编程智能体模型Composer将响应速度提升4倍,更颠覆性地支持最多8个AI智能体并行协作。从此,你不再是代码的“打字员”,而是项目的“总指挥”。
Sponsored byImage to Image AI