DeepSeek API 更新日志:V4-Flash 公测及历代模型升级
DeepSeek 发布 V4-Flash 公测,性能大幅提升,并宣布 legacy 模型名称即将停用,同时回顾了从 V2.5 到 V4 的系列升级。
变更日志日期:2026-07-31DeepSeek-V4-Flash 更新DeepSeek-V4-Flash API 的正式发布现已进入公开测试阶段。API 调用方式保持不变——只需将模型名称设置为 deepseek-v4-flash 即可使用最新版本。
- Terminal Bench 2.1:82.7- NL2Repo:54.2- Cybergym:76.7- DeepSWE:54.4- Toolathlon verified:70.3- Agent Last Exam:
25.2- Automation Bench (Public):
25.1- DSBench-FullStack:68.7- DSBench-Hard:59.6注 1:对于公开基准测试集中的代码智能体任务,官方 DeepSeek-V4-Flash 使用 DeepSeek Harness 最小模式(即将发布)作为框架进行测试,
采用最大努力级别,top_p=0.95,temperature=1.0。注 2:DSBench-FullStack 是内部全栈开发测试集,DSBench-Hard 是内部编码智能体难题测试集。
DeepSeek-V4-Flash-0731 保持与 DeepSeek-V4-Flash-Preview 相同的模型架构和大小,仅进行了重新后训练。注意:本次更新仅升级 DeepSeek-V4-Flash API。
DeepSeek-V4-Pro API 以及 APP/WEB 模型保持不变。DeepSeek-V4-Pro 的正式发布即将推出。
日期:2026-04-24DeepSeek-V4DeepSeek API 现已支持 V4-Pro 和 V4-Flash,可通过 OpenAI ChatCompletions 接口和 Anthropic 接口使用。
要访问新模型,base_url 保持不变,模型参数应设置为 deepseek-v4-pro 或 deepseek-v4-flash。
两个遗留 API 模型名称 deepseek-chat 和 deepseek-reasoner 将在三个月后(2026-07-24)停止使用。在此期间,这两个模型名称分别指向 deepseek-v4-flash 的非思考模式和思考模式。
更多详情请参阅相关文档。日期:2025-12-01DeepSeek-V3.2deepseek-chat 和 deepseek-reasoner 均已升级至 DeepSeek-V3.2。
deepseek-chat 对应 DeepSeek-V3.2 的非思考模式,deepseek-reasoner 对应其思考模式。
DeepSeek-V3.2-SpecialeDeepSeek-V3.2-Speciale 通过临时端点提供服务:base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215"。
定价与 V3.2 相同,不支持工具调用,有效期至 2025 年 12 月 15 日 15:59(UTC 时间)。更多详情请参阅相关文档。
日期:2025-09-29DeepSeek-V3.2-Expdeepseek-chat 和 deepseek-reasoner 均已升级至 DeepSeek-V3.2-Exp。
deepseek-chat 对应 DeepSeek-V3.2-Exp 的非思考模式,deepseek-reasoner 对应其思考模式。更多详情请参阅相关文档。
日期:2025-09-22DeepSeek-V3.1-Terminusdeepseek-chat 和 deepseek-reasoner 均已升级至 DeepSeek-V3.1-Terminus。
deepseek-chat 对应 DeepSeek-V3.1-Terminus 的非思考模式,而 deepseek-reasoner 对应其思考模式。
本次更新保持了模型的原有能力,同时解决了用户报告的问题,包括:- 语言一致性:减少了中英混合和偶尔出现的异常字符;- 智能体能力:进一步优化了代码智能体和搜索智能体的性能。
日期:2025-08-21DeepSeek-V3.1deepseek-chat 和 deepseek-reasoner 均已升级至 DeepSeek-V3.1。
deepseek-chat 对应 DeepSeek-V3.1 的非思考模式,而 deepseek-reasoner 对应其思考模式。
- DeepSeek-V3.1 的主要更新:- 混合推理架构:单一模型同时支持思考模式和非思考模式- 推理效率提升:与 DeepSeek-R1-0528 相比,DeepSeek-V3.1-Think 在更短时间内提供答案- 智能体能力增强:通过后训练优化,
新模型在工具使用和智能体任务上取得重大改进- SWE-bench Verified:
66.0- SWE-bench Multilingual:54.5- Terminal-bench:31.3日期:2025-05-28deepseek-reasonerdeepseek-reasoner 模型升级至 DeepSeek-R1-0528:
- 推理能力增强- 基准测试显著提升(Pass@1)- AIME 2025:
70.0 → 87.5(+17.5)- GPQA:71.5 → 81.0(+9.5)- LCB_v6:63.5 → 73.3(+9.8)- Aider:57.0 → 71.6(+14.6)- 注意:与旧版 R1 相比,复杂推理任务可能消耗更多 token。
- 基准测试显著提升(Pass@1)- 优化前端开发- 生成的网页和游戏现在具有更好的美观性。- 减少幻觉- 显著抑制了旧版 R1 中存在的幻觉问题。
- JSON 输出与函数调用支持- 函数调用性能:- Tau-bench 得分:53.5(航空)/ 63.9(零售)- 函数调用性能:日期:2025-03-24deepseek-chatdeepseek-chat 模型升级至 DeepSeek-V3-0324:
- 推理能力增强- 基准测试性能显著提升:- MMLU-Pro:75.9 → 81.2(+5.3)- GPQA:59.1 → 68.4(+9.3)- AIME:39.6 → 59.4(+19.8)- LiveCodeBench:39.2 → 49.2(+10.0)
0)- 基准测试性能显著提升:- 优化前端 Web 开发- 提高代码生成准确性- 更美观的网页和游戏前端- 升级中文写作能力- 增强风格和内容质量:- 与 R1 写作风格对齐- 中长篇写作质量更好- 增强风格和内容质量:
- 功能增强- 改进多轮交互式改写- 优化翻译质量和信件写作- 改进中文搜索能力- 增强报告分析请求,
输出更详细- 函数调用改进- 提高函数调用准确性,修复了之前 V3 版本的问题日期:2025-01-20deepseek-reasonerdeepseek-reasoner 是我们的新模型 DeepSeek-R1。
您可以通过指定 model='deepseek-reasoner' 来调用 DeepSeek-V3。
- 详情请参阅:DeepSeek-R1 发布- 指南请参阅:思考模式日期:2024-12-26deepseek-chat- deepseek-chat 模型已升级至 DeepSeek-V3。API 保持不变。
您可以通过指定 model='deepseek-chat' 来调用 DeepSeek-V3。
- 详情请参阅:DeepSeek-V3 介绍日期:2024-12-10deepseek-chatdeepseek-chat 模型已升级至 DeepSeek-V2.5-1210,各项能力均有改进。
相关基准测试结果包括:- 数学:MATH-500 基准测试性能从 74.8% 提升至 82.8%。
- 编码:LiveCodebench(08.01 - 12.01)基准测试准确率从 29.2% 提升至 34.38%。- 写作与推理:内部测试数据集也观察到相应改进。此外,新版本模型优化了文件上传和网页摘要功能的用户体验。
日期:2024-09-05deepseek-coder 和 deepseek-chat 升级至 DeepSeek V2.5 模型DeepSeek V2 Chat 和 DeepSeek Coder V2 模型已合并升级为新模型 DeepSeek V2.5。
为向后兼容,API 用户可通过 deepseek-coder 或 deepseek-chat 访问新模型。新模型在通用能力和代码能力上均显著超越之前的版本。新模型更好地符合人类偏好,并在写作任务和指令遵循等方面进行了优化:
- ArenaHard 胜率从 68.3% 提升至 76.3%- AlpacaEval 2.0 LC 胜率从 46.61% 提升至 50.52%- MT-Bench 得分从 8.84 提升至 9.02- AlignBench 得分从 7.88 提升至 8.04
新模型在原有 Coder 模型的基础上进一步增强了代码生成能力,针对常见编程应用场景进行了优化,并在标准测试集上取得了以下结果:- HumanEval:89%- LiveCodeBench(1 月至 9 月):41%日期:
2024-08-02API 推出磁盘上下文缓存技术DeepSeek API 创新性地采用了硬盘缓存,将价格降低了一个数量级。有关更新的更多详细信息,请参阅相关文档。