DeepSeek新模型发布:AI智能体缓存成本降到新低

导读部分 返回列表

⚡ 先把结论放前面:DeepSeek 在北京时间 9 月 10 日晚间上线了 V4.1-Flash,把“缓存命中”这条输入通道的价格压到每百万 token 0.003 美元(低峰时段)。这个数字不大,...

正文内容

⚡ 先把结论放前面:DeepSeek 在北京时间 9 月 10 日晚间上线了 V4.1-Flash,把“缓存命中”这条输入通道的价格压到每百万 token 0.003 美元(低峰时段)。这个数字不大,但它改变了一件事——AI 智能体跑一个任务到底要花多少钱,第一次可以算得清清楚楚,而不是靠感觉估。

很多人看到这里会直接下判断:又一个打价格战的模型。这个判断方向错了。真正值得研究的是它的定价结构:低峰时段,缓存命中的输入每百万 token 0.003 美元,缓存未命中的输入 0.15 美元,输出 0.60 美元;高峰时段以上三项全部翻倍。也就是说,同一个模型、同一个任务,只要把“重复读取的上下文”和“新读入的上下文”分开付费,成本差距可以拉到几十倍。

📌 为什么这对智能体特别重要:写代码的智能体、做数据分析的智能体,几乎都在反复读同一批东西——仓库文件、工具定义、系统提示词、历史对话。一个连续工作几小时的智能体,读到的缓存内容往往远多于新内容。DeepSeek 自己也在文档里承认,缓存命中费用会占据智能体总成本的相当一部分。

💡 给一个可以立刻复算的例子。假设某个智能体保留了一段 50 万 token 的可复用前缀,并在 100 次请求中一直命中这段缓存。这相当于 5000 万缓存输入 token。忽略缓存写入、新上下文和输出的费用,单看这部分读取:V4.1-Flash 低峰时段约 0.15 美元。换到 Kimi K3 按已公开的缓存价算约 15 美元,GPT-5.6 Sol 约 20 美元,Claude Opus 5 约 25 美元。同一个任务,账单差出两个数量级。✅ 这就是为什么不能只比较“未缓存输入单价”。

DeepSeek V4.1-Flash 缓存定价与 AI 智能体成本对比示意图

❌ 常见的错误做法,是拿各家官网的“标准输入价”直接横比。V4.1-Flash 的低价依赖低峰时段,本身不是完全对等的比较。但即使在高峰时段,它的缓存命中输入也只涨到每百万 token 0.006 美元,未命中 0.30 美元、输出 1.20 美元,仍然和中端价位的模型站在一起,离 Claude Fable、GPT-6 Astra 这一档的差距非常大。

📌 更值得警惕的是“看不见成本”。在一份覆盖 170 家百人以上企业的调研里,只有 47% 的企业表示会严格追踪 AI 算力成本与投资回报,也就是超过一半的企业根本不追踪;12% 的企业尚未处理推理内存限制(比如 KV 缓存容量),另有 7% 甚至不知道存在这个约束。即便已经在大规模生产环境运行 AI 的组织,严格做成本追踪的比例也只有 56%。当模型侧已经把定价拆得这么细,需求侧还没有对应的计量工具,钱就是在这一步悄悄漏掉的。

⚡ 架构层面也有新东西。V4.1-Flash 采用了因果编码器-解码器结构,把 40 层 Transformer 拆成 20 层编码器和 20 层解码器:读取输入(prefill)阶段激活 80 亿参数,生成输出(decode)阶段激活 160 亿参数。这里有个容易传错的细节——它不是全程“80 亿激活”的模型,两个阶段不一样。配合压缩稀疏注意力 2、层级稀疏索引和 FP4 KV 缓存,官方称全局 KV 缓存降到每 token 890 字节,大约是上一代 V4-Flash 的四分之一,持久化缓存占用约为八分之一。

对以读为主的工作负载,这些数字会直接体现在账单上。反复读取同一仓库的编程智能体,正是 prefill 与 KV 缓存效率决定成本的典型场景。顺带一个规模上的变化:“Flash”已经不代表小。上一代 V4-Flash 是 284B 骨干、130 亿激活参数,V4.1-Flash 的骨干涨到 552B,增幅约 94%。

💡 落地建议:高峰窗口是周一至周五 01:00–04:00 与 06:00–10:00 UTC,其余时间都是低峰。➡️ 对于可以调度的智能体任务,把批处理作业挪到低峰时段,本身就是一根现成的成本杠杆。➡️ 评估模型时,别再拿总 prompt token 乘以官网输入单价,改成测两个指标:缓存命中率、每个成功任务的成本。关于模型路由降本,可以对照本站此前整理的 GitHub HydraFusion 模型路由方案 一起看;而多智能体协作的极限案例,可以参考 OpenAI 万级智能体集群攻克数学难题 那篇。

回到最开始那句话:这次发布真正的看点不是“便宜”,而是低峰缓存价把长期运行智能体的成本模型重新排了一遍。谁先把计量做起来,谁就能真正吃到这波降价;谁还在拿未缓存单价做选型,账面上的省钱最终都省不到自己身上。

本文出自 AI一族,原文链接:https://www.aiyizu.cn/?p=5220

转发请注明出处,禁止未经允许用于任何商业用途。

文章评分

这篇文章对您有帮助吗?

🤖 随时召唤ZUZU陪你一起探索AI世界
ZUZU 伴学
登录享无限次提问 · 答案仅供参考
ZUZU答:
亲爱的小伙伴您好,我是ZUZU,有什么可以帮您的?😃

分享到

微信
朋友圈
QQ
QQ空间
微博
抖音
小红书
复制
二维码

实用功能

夜间模式
小字
大字
收藏
目录
笔记
朗读
相关
搜索
我的笔记
文章内搜索
相关文章推荐
正在加载相关文章...

反馈建议

您需要登录后才能填写意见反馈信息

分享二维码

使用手机扫描二维码

操作成功