DeepSeek把token做到这么便宜的秘密究竟是什么
作者:硅谷Alan Walker;来源:嘉妍Kea
加州大道的 Zombie Café,早上七点半。昨晚 DeepSeek 那份"预计涨幅较大"的公告出来之后,几个开发者群直接炸了——有人连夜在写多模型路由,有人在算涨三倍之后还划不划算。而硅谷Alan Walker 想借这个时点,把一个被讨论了两年、但始终没被讲透的问题彻底讲透:这个价格,当初到底是怎么做出来的。
先看价格,这是全部讨论的起点。
今天(2026 年 8 月 7 日),DeepSeek 开放平台的牌价是:V4-Flash 每百万 token,输入 0.14 美元、缓存命中输入 0.0028 美元、输出 0.28 美元;V4-Pro 对应是 0.435、0.003625 和 0.87 美元。国内开发者看到的人民币口径是 Flash 平峰期 1 元 / 0.02 元 / 2 元,Pro 是 3 元 / 0.025 元 / 6 元。
同一天,美国这边的牌价:GPT-5.6 Sol 输入 5 美元、输出 30 美元;Claude Opus 5 输入 5 美元、输出 25 美元;Claude Fable 5 输入 10 美元、输出 50 美元;Gemini 3.1 Pro 输入 2 美元、输出 12 美元。
表 1:主流模型 API 牌价(美元 / 百万 token,2026 年 8 月 7 日,各家官方定价页)
注:Gemini 3.1 Pro 与 GPT-5.6 系列对超过 20 万 token 的长上下文另设更高计价档(Gemini 涨至 4/18,GPT-5.6 Sol 涨至 10/45);DeepSeek 100 万 token 上下文不加价。DeepSeek 人民币价为平峰价,工作日高峰时段(9:00–12:00、14:00–18:00)计费翻倍。
做几个除法。V4-Flash 的输出价对 GPT-5.6 Sol 是 1/107,对 Claude Fable 5 是 1/179。缓存命中输入那一列更夸张:V4-Pro 的 0.003625 美元对 Claude Opus 5 的 0.50 美元,是 1/138。对标旗舰的 V4-Pro,输出价对 GPT-5.6 Sol 也有 1/34。
还有一个背景必须先交代:就在昨天,8 月 6 日,DeepSeek 发公告说计划近期整体上调 API 定价,"预计涨幅较大"。也就是说,你现在看到的这张表,是这个价格体系存在的最后一段时间。这反而是把这个问题讲清楚的最好时机——因为连它自己都承认,这个价格不可持续了。那它当初是怎么做到的?
市面上的解释停留在两个字:MoE。这个解释不能算错,但它解释不了数量级。MoE 大家都在用,OpenAI 和 Google 的旗舰几乎可以确定也是 MoE,凭什么别人用 MoE 卖 30 美元,它用 MoE 卖 0.28 美元?
真正的答案分两半。技术上的极致优化,最多解释十倍;剩下那十倍,藏在商业结构里。两个十倍相乘,才是一百倍。下面先讲技术的十倍,再讲那个几乎没人认真讲过的、商业的十倍。
1技术的十倍:所有功夫都下在同一个地方——显存
把 DeepSeek-V4 技术报告里所有降本手段列出来,你会发现它们表面上五花八门,落点其实只有一个:显存。为什么偏偏是显存,第二节揭晓。先看这四处。
第一处:激活率压到 3%。V4-Pro 总参数 1.6 万亿,每个 token 只激活 490 亿,激活率 3.06%;V4-Flash 总参数 2840 亿,激活 130 亿。推理算力跟激活参数走,不跟总参数走——所以一个 1.6 万亿参数的模型,算力开销只相当于一个 490 亿的模型。3% 的激活率在公开可查的前沿模型里是最低一档。
第二处:注意力压缩九成。V4 放弃原生注意力,改用 CSA(压缩稀疏注意力)与 HCA(重度压缩注意力)交错。官方技术报告的数据:100 万 token 场景下,V4-Pro 单 token 推理 FLOPs 只有上一代 V3.2 的 27%,KV 缓存只有 10%;V4-Flash 压得更低,FLOPs 10%,KV 缓存 7%。KV 缓存是长上下文场景吃显存的第一大户,压掉九成,意味着同一张卡能塞进去的并发请求变成十倍以上——硬件没变,单位时间能卖的 token 变成了十几倍。
第三处:FP4 量化感知训练。MoE 专家权重用 FP4 精度存储,其余大部分用 FP8。从 FP16 到 FP4,同样的显存装四倍的权重。而且这是训练阶段就按低精度来(QAT),不是训完再压,精度损失被训练本身吸收。为了在这么低的精度下训得稳,配了一整套补丁:mHC 流形约束超连接、Muon 优化器、预期路由、SwiGLU 钳位——团队自己承认这些技巧为什么有效,底层机理仍是开放问题。
第四处:缓存放到硬盘上。V4 引入异构 KV Cache 与磁盘缓存机制,压缩后的注意力条目直接落盘存储。这件事直接体现在价格表上,而且是整张表里最被忽略的一格:
表 2:缓存命中折扣力度(各家官方定价页,2026 年 8 月 7 日;折扣比例为作者计算)
看见没有:OpenAI、Anthropic、Google 三家的缓存折扣整整齐齐都是一折。DeepSeek-V4-Pro 打的是 0.83 折。为什么它敢?因为别人的 prompt cache 存在显存或高速内存里,成本按每 GB 几十美元的 HBM 算;它把缓存压缩后扔到固态盘上,成本按每 GB 几毛钱的 SSD 算。介质差了两三个数量级,折扣自然能再差一个数量级。
为 什 么 这 一 格 最 重 要 Agent 时代的账单结构变了。一个 coding agent 每次调用,都要把整个代码库、系统提示词、历史轨迹原样重发一遍,这部分内容的缓存命中率能到 80% 以上。也就是说,Agent 账单的大头不在"输出",在"重复输入"。同样一百万 token 的重复上下文,Claude Opus 5 收 0.50 美元,V4-Pro 收 0.003625 美元。硅谷不少公司把主力模型切过去之后账单掉了两个数量级,主要就掉在这一格,而不是掉在输出价上。
这四处之外,训练侧还有一手:V4 的后训练用了全词表同策略知识蒸馏(OPD),让 Pro 逐 token 地教 Flash。这解释了 Flash 为什么只用 130 亿激活参数还能打——它压根就没打算自己从头学,它是被大模型喂大的。经济含义比技术含义更重要:训练一次 Pro 的成本,摊到了 Flash 的每一次调用上。今天全球调用量登顶的是卖 0.28 美元的 Flash,而撑起它能力的那笔训练开销,记在 Pro 的账上。
把这几项的倍数连乘:MoE 相对稠密省 3–10 倍,注意力压缩再省 4–10 倍(长上下文场景),FP4 让同样的卡装下四倍权重,磁盘缓存让重复输入的成本几乎归零,蒸馏让小模型白拿大模型的能力。这就是技术的十倍——严格说,在长上下文和 Agent 场景里不止十倍。但注意,这些方法全部写在公开论文里,权重全部放在 Hugging Face 上。技术上没有秘密。真正的问题是下一个:为什么美国公司不照着做? 2被制裁逼出来的路线:它优化的东西,美国公司不缺
要理解为什么所有功夫都下在显存上,得回到一个不太舒服的事实:出口管制。
DeepSeek 早期能合法买到的最好的卡是 H800——H100 的中国特供版,算力大体保留,互联带宽被砍。2025 年那份 545% 利润率的账单(第三节细讲),整个推理系统就跑在 H800 上。后来连 H800 也进不来了。这意味着它面对的约束条件和美国实验室完全不同:美国实验室缺的是电力和机柜,它缺的是每一 GB 的显存和每一条互联带宽。
约束条件决定优化方向。当你的卡互联被砍,你就被迫把专家并行的通信延迟藏进计算里,被迫用 TileLang 手写融合算子把每一分带宽榨干;当你的显存总量被物理封锁,你就被迫发明 MLA、被迫走到 CSA/HCA、被迫上 FP4、被迫把缓存扔到硬盘上。从 V2 的 MLA 到 V4 的混合压缩注意力,这条技术路线一脉相承,而它的起点不是某个天才的灵感,是采购清单上买不到的那几行。
反过来看美国实验室。手里有几十万张 H100/B200 的时候,工程师的稀缺资源不是显存,是研究员的时间。优化目标自然是"每个研究员每个月能推进多少能力",而不是"每一美元能吐多少 token"。不是他们蠢,是他们的约束条件根本不产生这个方向的进化压力。
省钱是一种能力,而这种能力只在缺钱的地方进化。显存受限逼出了压缩技术,带宽受限逼出了通信调度,采购受限逼出了国产卡适配。制裁没有卡死这家公司,制裁定义了这家公司。
国产卡这条线还在继续压成本。V4 发布当天,细粒度专家并行方案同时在英伟达 GPU 和华为昇腾 NPU 上完成验证,寒武纪、天数智芯做了 Day 0 适配。DeepSeek 在定价页上写了一句极少有厂商会写的话:受限于高端算力,目前 Pro 的服务吞吐十分有限,预计下半年昇腾 950 超节点批量上市后,Pro 的价格会大幅下调。把降价预期直接挂钩国产芯片量产节奏——这句话的潜台词是,它连英伟达那 70% 以上的硬件毛利率,都当成一项可以省掉的成本在管理。美国实验室没有这个选项:它们买英伟达的卡,是在给自己的算力付一道奢侈品税,而且这道税没有替代税率。
3一份被遗忘的账单:它早就证明了这价格能赚钱
有人会说:价格低说明在烧钱。这个判断有一份公开材料可以直接反驳,而且这份材料奇怪地被大多数人遗忘了。
2025 年 3 月 1 日,DeepSeek 在开源周最后一天公开了《DeepSeek-V3/R1 推理系统概览》,把自己的运行账单摊开了:
2025 年 2 月 27 日 12:00 — 28 日 12:00,真实运行 24 小时 推理服务峰值占用 278 个节点,平均 226.75 个节点(每节点 8 张 H800)。按 GPU 租赁 2 美元 / 小时估算,总成本 87,072 美元 / 天。当日输出 token 总数 1680 亿。若全部按 R1 定价计费,理论日收入 562,027 美元,理论成本利润率 545%。 官方同时说明:实际收入远低于此,因为网页和 App 免费、夜间打折、V3 定价更低。 来源:DeepSeek 官方知乎账号,2025 年 3 月 1 日;GitHub open-infra-index 仓库同步发布。
把 87,072 美元全部摊到 1680 亿输出 token 上(上限估算,这笔钱其实还同时服务了输入),每百万输出 token 的成本上限约 0.52 美元。这是一年半前、上上代模型、纯英伟达卡的成本。之后架构换代(FLOPs 降到 27%)、精度减半(FP8 到 FP4)、缓存落盘、国产卡引入,四条线同时往下压——今天 V4-Flash 卖 0.28 美元,完全落在成本曲线的延长线上。
这份账单里还有一句被跳过的话,价值不亚于那个 545%:白天用所有节点跑推理,晚上负荷低时减少推理节点,腾出来做研究和训练。这是把 GPU 集群当潮汐电站用。训练任务可以随时暂停恢复,推理请求不能,用训练填推理的谷,集群利用率逼近满载。注意这件事的门槛:纯 API 服务商没有训练任务可填谷,纯研究机构没有推理流量可言——必须两头都有、两头都大,这个招才成立。
"烧钱换份额"这个指控,从 2025 年 3 月起就不成立了。它的低价不是补贴出来的,是算出来的。真正的问题从来不是"它是不是在亏",而是"为什么只有它把价格定在成本线上"。这就要讲商业的十倍了。 4商业的十倍:token 价里,一大半不是 token 的钱
现在把一家美国头部实验室的 token 定价拆开。你付的 30 美元里,推理的电费和折旧只是零头,剩下的钱在养这些东西:
下一次训练。前沿实验室的 API 毛利,本质上是下一代模型的融资工具。训练开支以百亿美元计年年翻倍,投资人的钱填不满,API 毛利必须补位。token 定价的第一约束不是成本,是资本开支计划。
人才军备。2025 年以来硅谷顶级研究员的挖角报价屡屡见诸报端,单个人的组合薪酬包上亿美元的案例已不新鲜。几千人的实验室,这笔钱最终都在 token 价里。
几亿免费用户。ChatGPT、Claude、Gemini 都背着庞大的免费和订阅用户群,订阅费包月、消耗不封顶,重度用户吃掉的算力远超月费。这个窟窿要用 API 毛利填。
企业销售、合规、安全。SLA、数据驻留、审计、红队、销售团队、客户成功——这套组织卖的是确定性,也全是成本。
DeepSeek 的成本表上,这几行几乎是空的。母公司幻方量化的自有资金养研发,不需要 API 毛利去给下一次训练融资;没有全球销售体系;没有付费订阅要补贴;开源社区还免费替它做了大量适配和优化工程——袁进辉当年就说过,V3/R1 的架构和主流模型差别太大,第三方必须照它的报告重写系统才能跑出效率,而开源把这个门槛降了下来,社区替它完成了闭源公司要发工资才能完成的工作。
解 读 同样一个 token,两家公司定价时看的锚完全不同。美国实验室的锚是"这个 token 替代了多少人类劳动"——一小时 150 美元的工程师被替代,token 卖 30 美元一百万个依然显得便宜,所以定价往价值那头靠。DeepSeek 的锚是"这个 token 消耗了多少电和折旧"——定价往成本那头靠。价值定价和成本定价,两个锚之间隔着的,本来就是两个数量级。一百倍的价差里,有一半根本不是效率差距,是定价哲学的差距。 5捅破窗户纸:美国公司不是做不到,是不能做
把上面的逻辑推到底,会碰到一个大多数分析绕开的结论。
假设 OpenAI 明天宣布:GPT-5.6 Sol 降价到 0.30 美元每百万输出 token。技术上完全做得到——该有的压缩技术都是公开论文,该有的工程人才它比谁都多。但它不能这么做,原因有三层,一层比一层硬。
第一层,收入会当场蒸发。OpenAI 的年化收入已在数百亿美元量级,其中 API 是重要一极。价格降到 1/100,现有需求贡献的收入立刻变成 1/100,而需求弹性再大,也不可能在一个季度里放大一百倍来填坑。DeepSeek 做地板价的时候几乎没有存量收入可损失——敢把价格打穿的前提,是你没有什么可以被打穿的。这是最标准的创新者窘境:不是看不见,是转不了身。
第二层,估值会塌方。头部实验室数千亿美元的估值,建立在一个共同叙事上:智能是稀缺的高价商品,毛利会随规模改善。旗舰模型按成本定价,等于亲口承认 token 是大宗商品——那估值模型就得从"软件公司"切换到"电力公司",市销率差着一个数量级。对上市在即或持续融资中的公司,这不是定价决策,这是自毁决策。
第三层,组织不会执行。为成本定价而生的公司,从芯片采购、集群调度到精度选择,每个环节都在为"每美元 token 数"优化;为能力溢价而生的公司,每个环节都在为"下一次发布会"优化。让后者转向前者,等于让整个组织换一套本能。历史上没有几家公司完成过这种转身,而且没有一家是在自己最赚钱的时候转的。
这套逻辑有一个天然的对照实验,恰好能验证它:Gemini。看表 1,美国旗舰里最便宜的是谁?Gemini 3.1 Pro,2 美元 / 12 美元,比 GPT-5.6 Sol 和 Claude Opus 5 便宜一半以上。为什么偏偏是 Google?因为三个约束它各松了一格:它用自研 TPU,英伟达那道硬件税它不交;它的估值不靠 AI 叙事单独支撑,广告和云才是地基,token 按成本定价不会动摇市值逻辑;它的推理基础设施本来就是按搜索的规模经济建的。三个约束松一格,价格就低一半;DeepSeek 三个约束全部为零,价格就低两个数量级。价格和约束的对应关系,在这三家公司身上排得整整齐齐——这个排列不是巧合,是定价的物理学。
真正的秘密是不对称:DeepSeek 需要 token 便宜——便宜是它换取影响力、生态和战略位置的唯一筹码;美国实验室需要 token 贵——贵是它们的收入、估值和整个叙事的地基。同一个市场里,一方的最优解是把价格打到成本,另一方的最优解是把价格钉在价值。你看到的 1/100,就是这两个最优解之间的距离。 6更深一层:为什么它比国内同行还便宜
讲到这里还剩最后一个漏洞。前面的商业分析——不用给下一次训练融资、没有英伟达的硬件税、没有免费用户的补贴窟窿——听起来像是"中国公司对美国公司"的普遍优势。如果只是这样,那国产模型应该都便宜。但事实不是这样:
表 3:国产旗舰模型 API 牌价对比(人民币 / 百万 token,各家官方定价页,2026 年 8 月)
来源:月之暗面开放平台、阿里云百炼、智谱官方定价页。GLM-5.2 官方以美元报价(1.40/4.40 美元),按 7 折算为人民币约值。高盛研报(经媒体转述)给出的混合口径单价:K3 约 2.3 美元、Qwen3.7-Max 约 1.4 美元、GLM-5.2 约 0.9 美元、DeepSeek V4-Pro 约 0.18 美元 / 百万 token。
看清楚这张表的含义:同样在中国,同样面对芯片管制,同样的电价、同样的工程师薪酬水平,Kimi K3 的输出价是 V4-Pro 的 17 倍,Qwen3.7-Max 是 6 倍,GLM-5.2 是 5 倍。"中国成本优势"解释不了这个差距——大家的成本环境是一样的。那差距从哪来?三个地方,一个比一个深。
第一,别人租算力,它有自己的机房。DeepSeek 脱胎于幻方量化,而幻方在管制落地之前就自建了万卡级的萤火集群——这批卡是自有资产,推理成本按折旧和电费算。多数同行的推理跑在云上,云厂商的毛利就叠在它们的成本里;即便是字节、阿里这种自己有云的,模型团队用集团的卡也要走内部结算,价格里同样含着一道内部毛利。一边按折旧算账,一边按租金算账,起跑线就不在一处。
第二,专家并行的经济学:架构可以抄,流量抄不走。这一点最容易被忽略。V4 的核心降本手段是大规模跨节点专家并行——把几百个专家摊到大量 GPU 上,靠巨大的 batch size 把矩阵乘法的效率打满。注意这套打法成立的前提:请求量必须大到随时能把 batch 填满。批次填不满,专家摊得越开,通信开销越亏,稀疏架构反而比稠密更贵。DeepSeek 的调用量是全球第一(V4-Flash 单周 7.22 万亿 token),批次永远是满的,单位成本被摊到理论下限;同行就算把开源代码原样搬走,没有这个量级的流量,跑出来的单位成本也是另一个数字。换句话说,它的成本优势有一半写在论文里,另一半写在流量榜上——前者人人可抄,后者抄不动。而低价带来流量、流量摊薄成本、成本支撑更低价,这个循环一旦转起来,后进者从任何一点都切不进去。
第三,也是最根本的:同行的 API 是收入,它的 API 是支出。看看各家的处境。月之暗面融资多轮、估值高企,K3 定价明说要"价值变现",对标的是 Claude 而不是成本线;智谱在上市通道里,一季度把 API 定价提了 83%,因为招股书需要毛利率;阿里的通义要给云业务导流和创收,定价里含着云的商业目标。它们的 API 报表上都是收入项,收入项就要背毛利指标。DeepSeek 的 API 在幻方体系里更接近一个支出项——花一笔可控的钱,换取生态、标准和话语权。一个要向投资人证明"我能把 token 卖出利润",一个要向行业证明"token 本来就不值钱"——两句话对应两张定价表。
它比美国公司便宜和比中国同行便宜,是同一个原因的两次显形:定价表上写的不是成本,是这家公司靠什么活着。靠融资活的,价格里含着估值;靠云活的,价格里含着云的指标;只有既不缺钱、又不指望 token 挣钱的,价格里才只剩下电费和折旧。全世界符合这个条件的大模型公司,目前只有一家。 7泼盆冷水:便宜的账单之外,还有三笔账
讲完秘密,必须把代价也摆出来,不然这篇文章就成了软文。
第一笔账:知识密度。按 DeepSeek 官方技术报告的对比表,V4-Pro-Max 在 SimpleQA-Verified(纯事实性知识召回)上得分 57.9,对 Gemini 3.1 Pro 的 75.6,差了近 18 个点;HLE 上 37.7 对 44.4。编码和数学是它的强项——LiveCodeBench 93.5 超过 GPT-5.4 的 91.7,Codeforces 评分 3206 排进人类选手前 23 位,SWE-bench Verified 80.6 与 Gemini 打平——但 DeepSeek 自己承认在通用世界知识上落后前沿 3 到 6 个月。注意:这些分数全部来自厂商自评,第三方独立复现尚未完成。如果你的场景是法律检索、医疗问答、金融尽调,那 18 个点会变成实打实的幻觉率,省下的 token 钱可能不够赔一次错。
第二笔账:稳定性。8 月 4 日,V4-Flash 因前所未有的访问量出现容量不足。偶发事故的说法站不住——它是低价高负载的结构性结果。OpenRouter 周榜(7 月 27 日至 8 月 2 日)显示 V4-Flash 以 7.22 万亿 token 的调用量登顶全球第一;V4-Pro 的并发上限只有 500。峰谷定价想削峰,但 coding agent 可以批式、异步、跨时区地跑,而且用户横跨中美——这边的谷正好是那边的峰,二十四小时全是高峰。闭源厂商贵出来的那部分钱里,有一块买的就是确定性——这块钱 DeepSeek 没收,你也确实没得到。
第三笔账:时间。这是最大的一笔。8 月 6 日的涨价公告说明,把价格钉在成本线上这件事,连它自己也只能维持在算力供给宽松的窗口里。现价已经是 5 月 31 日"永久降价"到原价 1/4 之后的价格,如果只是恢复原价,涨幅就是 300%。而且这不是孤例:智谱一季度 API 定价提升 83%(调用量仍增长 400%),Kimi K3 输入价较前代涨超 3 倍、发布三天就因请求量超载暂停新用户订阅。整个行业正在从"拼低价抢用户"转向"算力账单面前人人平等"。
给 决 策 者 的 三 行 结 论 写代码、跑 Agent、批量处理长文档——切过去,性价比差距大到不需要开会讨论,但立刻把多模型路由写好,涨价方案随时落地。 事实召回敏感的场景(法律、医疗、尽调)——那 18 个点的知识差距是真实的幻觉率,别为省 token 钱冒这个险。 生产级流量——先看清 Pro 只有 500 并发这个硬约束,再决定要不要把身家押在一个刚宕过机、正要涨价的服务上。 8结语:秘密的全文
回到标题的问题。DeepSeek 把 token 做到这么便宜的秘密,完整版本是这样的:
技术上,它被制裁逼着把全部功夫下在显存上——3% 的激活率、压掉九成的注意力、FP4 的权重、落盘的缓存——省出了十倍。商业上,它的成本表里没有下一次训练的融资压力、没有亿级免费用户的补贴窟窿、没有销售合规的组织包袱、没有估值叙事的枷锁——又是十倍。两个十倍相乘,一百倍。
而别人学不来的原因,与技术无关。压缩注意力的论文是公开的,FP4 的方法是公开的,连 545% 利润率的账单都是公开的。缺的从来不是论文,是 允许自己便宜的资产负债表。OpenAI 的 token 价格里含着它的估值,Anthropic 的价格里含着下一次训练的融资,Kimi 的价格里含着投资人要的回报,通义的价格里含着云的指标。只有 DeepSeek 的价格里,几乎只剩电费和折旧——因为它是唯一一家不靠 token 活着的公司。
所以这个价格从来不只是价格。这是一家不需要靠 token 赚钱的公司,和一群必须靠 token 赚钱的公司之间,一场不对等的较量。前者把 token 当弹药,后者把 token 当粮食——弹药可以按成本撒出去,粮食必须卖出利润。
然后是 8 月 6 日。价格屠夫发公告说要大幅涨价。很多人把这读成"扛不住了",我读到的是另一层:当调用量做到全球第一、当生态咬钩、当昇腾的产能表开始决定它的定价表——它手里终于有了成本曲线之外的东西。便宜从来不是它的目的,便宜是它买入场券的价格。现在票买到了。
token 可以卖到别人的百分之一,这件事它已经证明了。
接下来它要证明的是另一件事:涨价之后,还有多少人走得掉。
· · ·
核 实 说 明 可直接查证的一手事实:表 1、表 2 的全部价格来自 DeepSeek API 文档定价页、Anthropic、OpenAI、Google Gemini 官方定价页,2026 年 8 月 7 日逐条核对;倍数与折扣比例为作者据牌价计算。表 3 的 Kimi K3 价格(输入 20 元 / 缓存命中 2 元 / 输出 100 元)来自月之暗面开放平台官方公示;Qwen3.7-Max(输入 12 元 / 输出 36 元)来自阿里云百炼官方价格页;GLM-5.2(1.40 / 4.40 美元)为智谱官方美元报价,人民币约值系作者按 7 汇率折算。V4 参数量(Pro 1.6T/激活 49B,Flash 284B/激活 13B)、FLOPs 与 KV 缓存对比(27%/10%、10%/7%)、FP4 QAT、磁盘 KV 缓存机制、并发上限(Pro 500 / Flash 2500)来自 DeepSeek-V4 技术报告(arXiv:2606.19348)与官方 API 文档。545% 利润率账单来自 DeepSeek 官方知乎《DeepSeek-V3/R1 推理系统概览》(2025 年 3 月 1 日)及 GitHub open-infra-index。8 月 6 日涨价公告、8 月 4 日容量事故、峰谷计费规则,经 IT之家、界面新闻、观察者网、21 财经多家独立报道确认。OpenRouter 周榜 7.22 万亿 token 数据经 21 财经等转述。昇腾/寒武纪/天数智芯适配信息来自财联社与各厂商公开发布。智谱定价提升 83% 出自其 CEO 张鹏业绩说明会公开表述;Kimi K3 涨价与暂停订阅出自月之暗面官方公告。 作者估算与推断(非官方数据):"每百万输出 token 成本上限约 0.52 美元"系将当日总成本单独摊到输出 token 的上限估算,实际该成本同时服务输入,仅用于量级判断。"技术十倍、商业十倍"是作者的分析框架,不是可精确核算的分解。第五节关于 OpenAI/Anthropic 定价约束的三层分析(收入蒸发、估值切换、组织惯性)为作者推断,两家公司均未就定价逻辑做过此类公开表述;其中 OpenAI 年化收入"数百亿美元量级"、头部实验室估值"数千亿美元"为据公开报道的量级表述,非精确数字。"研究员组合薪酬包上亿美元"指 2025 年以来多家媒体报道的头部挖角案例,为量级表述。第六节的三点归因(自有算力、专家并行的规模经济、API 的报表属性)同为作者分析框架:"批次填不满则稀疏架构反而更贵"是专家并行的一般工程规律,各家实际集群利用率均无公开数据;"字节、阿里模型团队内部结算含内部毛利"为按大型集团通行做法的推断,非公开披露;幻方萤火集群的自建事实有公开报道,但当前集群规模与折旧口径无公开数据。高盛研报的混合口径单价(K3 约 2.3 美元、DeepSeek V4-Pro 约 0.18 美元等)经财经媒体转述引用,未见研报原文,仅作参照,正文结论不依赖该组数字。 需打折扣看待的信息:第七节全部评测分数(SimpleQA 57.9/75.6、HLE、LiveCodeBench、Codeforces、SWE-bench)来自 DeepSeek 官方技术报告自评,含对比方 Gemini/GPT/Claude 的分数亦出自该报告,第三方独立复现尚未完成,Macaron 等机构明确将其标注为"厂商自述"。 存在冲突、本文未采信的信息:其一,"V4 已彻底脱离 CUDA"的流传说法与官方开源库(MegaMoE、DeepGEMM)仍深度绑定 CUDA 工具链的事实矛盾,本文只采用"在昇腾 NPU 上完成推理验证"的官方口径。其二,高盛报告转述的"腾讯阿里拟以逾 200 亿美元估值投资 DeepSeek"与同文给出的智谱约 530 亿美元估值存在明显逻辑冲突,未见一手证实,不予采用。其三,幻方量化对 DeepSeek 的具体注资规模无公开一手披露,本文只使用"自有资金支持研发"这一双方公开确认过的表述,不引用任何具体金额。 未涉及:DeepSeek 训练总成本(自 V3 以来无可核实一手披露);本次涨价的具体幅度(官方未公布,文中"恢复原价即 300%"仅为参照系而非预测)。 本文所有价格与数据截至 2026 年 8 月 7 日,模型定价变动频繁,实际以各厂商官方页面为准。 本文不构成投资建议。文中评测分数多为厂商自评,第三方复现结果可能不同。
| 感动 | 同情 | 无聊 | 愤怒 | 搞笑 | 难过 | 高兴 | 路过 |
相关文章
-
没有相关内容

会员登录