今天,我们正式发布 DeepSeek V4.1 Flash 模型。这是全新模型结构系列中的最小尺寸模型,具备原生多模态视觉理解能力。新模型设计旨在提升能力上限、加快推理速度、增加吞吐量,并可扩展到更大参数的模型。
DeepSeek V4.1 Flash 是一个552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder结构,输入和输出不对称,输入激活只有8B,输出激活16B,成本显著低于已知的同尺寸模型。V4.1 Flash还采用了新的预训练方式和大规模强化学习后训练,在基准测试中超越了包括DeepSeek V4 Pro在内的一众旗舰模型的智能水平。
新一代模型大幅减少了KV Cache缓存的大小,与上一代相比,对HBM的需求减少到1/4,对SSD的需求减少到1/8。在Agent使用场景中,缓存命中的费用往往占比较高,对KV Cache的压缩大幅降低了Agent类任务的使用成本。相对于初代模型,KV Cache已经缩小了437倍。
DeepSeek V4.1 Flash已同步上线DeepSeek API,支持多模态,将模型名称更改为deepseek-flash即可调用最新版本。旧版本模型V4 Flash与V4 Flash Vision Exp现已下线,出于兼容考虑,模型名deepseek-v4-flash、deepseek-v4-flash-vision-exp将暂时路由到V4.1 Flash。经多方测试,V4.1 Flash在性能、费用、速度、总用时等各项指标上全面超越V4 Pro,因此计划有序下线 Pro模型。北京时间2026年9月14日12:00之后,用户访问deepseek-v4-pro的请求将全部路由到V4.1 Flash,并按V4.1 Flash单价计费。
腾讯(WorkBuddy、CodeBuddy)和OpenCode作为官方合作伙伴,现已全量接入DeepSeek V4.1 Flash,欢迎使用。得益于模型架构的创新,DeepSeek V4.1 Flash能够以更低的成本服务更多用户,因此相应下调了定价。同时,为了合理调配资源,仍然采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格于2026年9月10日12:00开始生效。
发表回复
要发表评论,您必须先登录。