涌现资本产业研究部 · 2026 年 8 月 6 日 模型与价格数据为 2026-08-06 对各厂商官方页面的直接核验;行情为交易所日线(美股至 08-05 收盘)。方向评级 🟢 受益 / 🟡 中性 / 🔴 承压。本报告为信息聚合与研究判断,非投资建议,绝不构成跟单。
框架:一个事件、三层传导——价格锚(模型层毛利)、ROI 结构(超大厂分子分母)、硬件斜率(英伟达与 HBM);每层分开裁决,不许一句"利空 AI"一锅端。
| # | 核心判断 | 方向 |
|---|---|---|
| 1 | 后训练成为新战场:不改架构、不加参数,仅后训练就把 Agent 能力抬上一个台阶(第三方复测 +10 分、Pareto 前沿垂直跃升)——前沿竞争从预训练规模转向"底座 + Agent 强化学习 + 工具环境 + 推理系统"的组合优化 | 🟢 范式确认 |
| 2 | 但"预训练与算力不重要了"不成立:V4 系列仍以超过 32 万亿 Token 预训练;Agent 强化学习需要数十万并发沙箱(GPU+CPU/微虚拟机+存储+网络)——资本开支 从纯预训练 GPU 向推理工厂与后训练基础设施迁移,不是消失 | 🟡 结构迁移 |
| 3 | 对闭源模型 API 明确负面:文本、代码、子代理推理的公开价格锚被系统性压低,OpenAI 已抢先降价 80% 应对;闭源厂商必须用多模态、托管工具、企业治理与分发解释剩余溢价 | 🔴 模型层毛利 |
| 4 | 对超大规模云厂商不是单向利空:Token 售价降压低单位收入,但效率提升同步降低单位成本(微软披露常用模型推理吞吐 +40%、谷歌 Gemini 服务成本一年降 78%);真正的考题是 资本开支 增速能否持续被收入与现金流覆盖 | 🟡 双向 |
| 5 | 对英伟达,被侵蚀的是稀缺性租金而非总需求:数据中心收入最新季度 752 亿美元(+92%)、下季指引约 910 亿——订单尚未体现任何坍塌;长期看每 Token 算力强度与 CUDA 稀缺溢价承压,总收入取决于 Agent 调用量与系统级价值 | 🟡 斜率之争 |
| 6 | 对 HBM,KV Cache 利空真实但被夹在更大的算术里:KV Cache 降至上代 7% 只压缩了内存占用五项中的一项,284B 权重驻留(4bit 理论下限约 142GB)与并发、训练状态不受影响;海力士约 10 家长约与 HBM4 量产、美光 HBM4 高量出货显示订单侧未转弱 | 🟡 看弹性 |
| 7 | 市场行为已切换:从"DeepSeek 时刻"(R1:英伟达 −17%、蒸发 $5,890 亿)到"效率常态"(V4-Flash:英伟达五连涨、主流卖方无一作为交易触发器、覆盖逻辑从事件驱动转业绩驱动)——这本身是本轮周期成熟度的标志 | 🟢 脱敏确认 |
| 时点 | 事件 |
|---|---|
| 7-30 | OpenAI 将 GPT-5.6 Luna 降价 80%($1/$6 → $0.20/$1.20)、Terra 降 20%,应对成本敏感客户与中国厂商竞争 |
| 7-31 | DeepSeek 发布 V4-Flash-0731:架构与参数不变、仅重做后训练;API 定价维持 $0.14/$0.28(缓存命中输入 $0.0028);权重 MIT 开源;API 处于 public beta |
| 8-01~03 | 生态快速接入:OpenCode 用量日增 30%;国家超算互联网平台 8-02 上线 0731 API;OpenRouter 周榜(7/27-8/2)V4 Flash 以 7.22 万亿 Token 登顶全球第一 |
| 8-03~05 | 第三方复测落地:Artificial Analysis 智能指数 50(4 月版 40),反超 V4-Pro-Preview 6 分、距 GPT-5.6 Luna(51)1 分;高盛上调中国大模型厂商 ARR 预期(2026 年 $13B、2030 年看 $125B);大摩定性"需求结构明显向低成本模型倾斜" |
| 8-06 现状 | V4-Pro 正式版仍未发布(API 仍为 4 月 Preview 权重,官方口径 soon);峰谷计费(北京时间峰时 2 倍)已公告未生效;官方定价页新增"近期整体显著涨价"预告 |
技术本体的三个关键读数:① 284B 总参数、13B 激活参数、超过 32 万亿 Token 预训练的底座不变,0731 的全部增益来自新后训练管线(工具使用/编码/推理链/自主 Agent 工作流),后训练计算量未披露;② 100 万 Token 长上下文场景下,单 Token 计算量为上代 V3.2 的 10%、KV Cache 为 7%——长上下文的边际成本曲线被实质性压平;③ 13B 激活参数压缩的是计算量,不是模型驻留内存——284B 权重即使全按 4bit 存储、理论下限也约 142GB,生产级部署仍需多卡高带宽互联,消费级单卡承载不成立。
基准数字的采信纪律:官方九项 Agent 基准部分跑在内部 harness、两项为内部数据集,本报告以第三方复测为准(AA 复测 Terminal-Bench 2.1 为 79%,官方自报 82.7,差异属正常 harness 口径)。
| 模型 | 普通输入 | 缓存输入 | 输出 | 对 Flash 倍数(输入/输出) |
|---|---|---|---|---|
| DeepSeek V4-Flash-0731 | 0.14 | 0.0028 | 0.28 | — |
| OpenAI GPT-5.6 Luna(7-30 降价后) | 0.20 | 0.02 | 1.20 | 1.4x / 4.3x |
| OpenAI GPT-5.6 Terra | 2.00 | 0.20 | 12.00 | 14x / 43x |
| Google Gemini 3.6 Flash | 1.50 | — | 7.50 | 11x / 27x |
| Anthropic Claude Opus 4.8 | 5.00 | 0.50 | 25.00 | 36x / 89x |
OpenAI 的抢先降价把入门级旗舰与 Flash 的目录价差压缩到一个量级以内——价格战第一回合已经打完,闭源阵营选择跟牌而非死守。但两个纵深仍在:缓存命中价 Flash($0.0028)仍为 Luna($0.02)的约七分之一,而 DeepSeek 的缓存折扣深度(约 98%)远超行业通行的 90%;叠加任务完成效率,第三方测算的单任务成本约 $0.03,对旗舰闭源模型约 $3 量级仍差约百倍。
缓存命中率为 h 时,Flash 每百万输入 Token 混合价 = 0.14×(1−h) + 0.0028×h:命中 50% 为 $0.071、90% 为 $0.017、99% 为 $0.004。按日耗 1 亿输入 Token + 100 万输出 Token 计,模型账单在 $0.70-7.42 之间——"一整天 Agent 不到一杯奶茶钱"可以发生但不是普遍事实,它依赖极高重复前缀、低输出比例与低重试率,且未计入沙箱、检索、存储、工具与观测系统成本。真正的竞争指标是:
每个成功完成任务的总成本 = 模型 Token + 重试 + 工具调用 + 沙箱执行 + 延迟损失 + 人工接管
闭源厂商的溢价辩护必须落在这个公式的后半段——更完整的多模态、托管工具、状态管理、企业治理与分发(DeepSeek 的兼容层对 MCP、图像、文档等仍非全面支持)。若任务只是文本、代码与工具调用,10-30 倍的目录溢价已经无法自圆。
两次发布,两种世界:
| R1(2025-01) | V4-Flash-0731(2026-07-31) | |
|---|---|---|
| 英伟达 | 单日 −17%、蒸发 $5,890 亿 | 发布后五连涨、累计 +15.4% 收 $219.22 |
| 板块 | 全球算力链恐慌 | 大涨(主因是微软/亚马逊财报:MSFT 单日 +15.5%、AMZN +15.3%、AWS +37%) |
| 机构行为 | 紧急下修与对冲 | 无一家以发布为交易触发器;覆盖从事件驱动转业绩驱动 |
| 叙事 | "算力需求要崩" | "效率常态":天风"大超预期"看多国产应用链、高盛上调中国 LLM ARR、大摩转向 ROIC 结构分析 |
这不是市场麻木,是市场学会了正确的算术:Kimi K3 事件(7 月中旬)已经完成了一轮教育——效率跃迁后没有任何一家机构下修数据中心用电与算力预测,BNEF 反而上修。V4-Flash 是同一逻辑的第二发:效率改写 资本开支 的构成表(预训练 GPU → 推理工厂、沙箱、缓存与调度系统),不改写总量表(详见 kimi-k3-efficiency-shock-资本开支-composition-2026-07-27 与 AIDC v2 的效率账)。大摩给出了结构分析的正确形状:GPU 出租、自有算力跑 API、租赁算力跑 API 三种商业模式的 ROIC 约 31%/46%/25%——价格战淘汰的是低利用率的转售层,不是高利用率的推理工厂。
ROI ≈(模型/API 收入 + 云与软件增量 + 广告/订阅增量 + 内部降本)÷(芯片 + 数据中心 + 电力 + 网络 + 折旧 + 运维)
V4-Flash 同时压低分子(Token 单价、闭源溢价)与分母(单任务 FLOPs、KV Cache、推理成本),裁决变量是量——调用量弹性能否超过单位效率提升。最新一轮财报给出的是"收入证明增强、现金流压力也增强"的双升:
结构迁移的方向同样清晰:后训练与 Agent 强化学习需要数十万并发沙箱(GPU 推理 + CPU/微虚拟机 + 分布式存储 + 调度),资本开支从纯预训练集群向这套"推理工厂"体系迁移。ROI 证明题一季比一季严格,但云收入、AI ARR、积压与 Token 用量仍在加速——回报恶化的结论下不出来。
英伟达——稀缺性租金 vs 总需求。负面传导有三:长上下文单 Token 算力降至上代 10%、13B 激活让推理更易分配到国产加速器与定制 ASIC、开源权重压低云端 GPU 转售溢价。对冲同样有三:284B 权重的生产级部署仍需多卡高带宽互联;Agent 是多轮规划-调用-验证-重试的循环,任务数与步骤数的增速可能远超单步算力降幅;英伟达卖的是整套系统(网络+CPU+存储+调度),不只卖 Token 计算。订单现实:数据中心收入 $752 亿(+92%)、下季指引约 $910 亿。长期承压的是"每任务算力线性增长"的估值假设,不是近两个季度的收入。
HBM——KV Cache 只是五项之一。推理系统的 HBM 占用 = 权重驻留 + KV Cache×并发 + 激活值 + 并行冗余 + 训练状态;V4-Flash 把第二项压到上代的 7%,其余四项不动。产业数据也未见转弱:海力士约 10 家长约 + HBM4 量产出货、美光 HBM4 高量出货且 2027 年量产 HBM4E(格局详见 hbm-landscape-share-lta-zhbm-cxmt-2026-08-06)。对存储仓位的正确姿势不是"利空/利多"二选一,而是盯四个量:每 Agent 任务的平均上下文与步骤数、云厂商 Token 总量增速 vs 每 Token 内存降速、HBM4/4E 长约与 ASP、推理服务器内权重/KV Cache/SOCAMM/SSD 的层级迁移。
反直觉的一条:DeepSeek 官方页的涨价预告 + 峰时 2 倍计费公告 + V4-Pro 跳票,组合起来指向模型商自身推理算力吃紧——最便宜的模型第一时间撞上产能墙(与 K3 上线数日暂停注册如出一辙)。效率最高的玩家在超卖,这是算力与内存需求侧的短期利多信号,不是利空。
| 情景 | 核心条件 | 结果 | 当前证据 |
|---|---|---|---|
| 效率压过需求 | Token/Agent 量增长低于单位算力与内存降幅 | 闭源毛利、GPU 云租金、HBM 增速承压;应用层受益 | 未观测到(用量榜、积压、ARR 全部加速) |
| 🎯 价格与成本同步下移(基准) | 价格降、成本同步降、Agent 量覆盖大部分效率 | 基建总量继续增长但估值与利润率下修,价值向高利用率推理工厂与全栈平台集中 | 大摩 ROIC 结构、三家超大厂"双升"财报 |
| Jevons 主导 | Agent 成默认负载,步骤数与并发数量级增长 | Token 单价暴跌但总计算/内存/电力需求继续上升 | Alphabet 300 倍 Token 样本、OpenRouter 登顶、DeepSeek 自身超卖 |
| 商业模式 | 价格锚下移的含义 | 代表方向 | 评级 |
|---|---|---|---|
| Agent 应用层(吃 $9 劳动力预算、按结果收费) | 底层智能成本下降 = 毛利扩张 + 功能覆盖扩大;价值向工作流、数据与分发迁移 | 治理编排与 Agent 化平台(NOW/CRM/SNOW 类,参 Agent 1:9 框架) | 🟢 |
| 高利用率云平台 / 推理工厂 | 模型降价压推理单价,但拉高利用率并带动存储、数据库、网络收入;自有算力跑 API 的 ROIC 结构最优 | 超大规模云 + 全栈平台 | 🟢🟡 |
| 与模型效率解耦的物理层 | 效率事件不改电力/土地/并网的年级约束(AIDC v2 效率账结论) | 电力硬卡点(燃机/变压器/开关/现场电源) | 🟢 |
| 硬件斜率层(GPU/HBM) | 总需求未坍塌但"每任务线性增长"估值假设承压;盯 Token 弹性四指标 | NVDA/HBM 三家——订单强劲、叙事重估 | 🟡 |
| 纯模型 API(靠高 Token 毛利) | 最大负面:价格降速快于成本降速时训练成本难摊销 | 未上市闭源模型商 | 🔴 |
| GPU 转售 / 低利用率租赁 | 稀缺溢价消失后 ROIC 垫底(约 25%),价格战首先出清这一层 | neocloud 中无长约低利用率者 | 🔴 |
| # | 风险 | 反证信号(出现即证明本报告结论错) | 方向 |
|---|---|---|---|
| 1 | 效率压过需求 | 云厂商 资本开支 下修 + GPU 租价下行 + HBM 订单转弱三者同时出现 | 🔴 切换情景一 |
| 2 | Agent 量弹性不足 | OpenRouter/云厂商 Token 总量增速跌破单位成本降速 | 🔴 |
| 3 | 价格战二次降维 | V4-Pro 以旗舰能力 + Flash 级定价发布,闭源阵营被迫再降 50%+ | 🟡 模型层加速出清 |
| 4 | 基准可信度 | 第三方复测大幅低于官方口径、内部数据集问题发酵 | 🟡 |
| 5 | 超卖信号反转 | DeepSeek 涨价落地后用量与利用率双双回落——"算力吃紧"判断不再成立 | 🟡 |
| 6 | 地缘与合规 | 主要市场对开源中国模型的企业采用设限 | 🟡 |
| 结论 / 数字 | 来源 | 日期 | 口径 | 置信度 |
|---|---|---|---|---|
| V4-Flash-0731 本体(架构不变/价格/缓存/public beta/峰谷公告/涨价预告) | DeepSeek 官方文档与定价页 | 2026-08-06 直查 | 官方 | A |
| 各厂商目录价(Luna $0.20/$1.20 等) | OpenAI/Google/Anthropic 官方定价页 | 2026-08-06 直查 | 官方 | A |
| OpenAI 7-30 降价 80% | CNBC + 官方页印证 | 2026-07-30 | 事件 | A/B |
| AA 独立复测(智能指数 50、Pareto 跃升、Terminal-Bench 79%) | Artificial Analysis | 2026-08 | 第三方复测 | A |
| OpenRouter 周榜 7.22 万亿 Token 登顶、HF 月下载 43 万 | OpenRouter/HF + 多源 | 2026-08 | 平台数据 | B |
| 长上下文 10% FLOPs / 7% KV Cache、32 万亿 Token 预训练、DSec 沙箱 | 技术报告及其第三方拆解 | 2026 | 技术口径 | B |
| 微软/Alphabet/亚马逊/英伟达/海力士/美光 财务读数 | 各公司官方披露 | 2026-07 | 财报 | A |
| 单任务成本 $0.03 vs $3 量级、大摩 ROIC 三情景 | Artificial Analysis / 大摩(经转述) | 2026-08 | 测算 | C |
| 高盛中国 LLM ARR 上调、天风定性 | 券商报告(经转述) | 2026-08 | 卖方 | C |
| V4-Pro GA 窗口 8 月中旬 | 中文媒体汇总 | 2026-08 | 未获官方确认 | C |
| 行情(R1 对照、NVDA 五连涨、财报日归因) | EODHD 交易所日线 + 多源 | 2026-08-05 | 收盘 | A |
⚠️ 数据分歧显式披露:① 官方九项 Agent 基准与第三方复测存在 harness 口径差(82.7 vs 79%),本报告以第三方为准;② "缓存命中率 99%"为情景假设而非官方承诺(官方仅给命中单价、不承诺命中率);③ 单任务成本百倍差为单一测算机构口径,量级可信、精确值不做载重;④ V4-Pro 相关一切能力传闻("接近旗舰闭源")未获官方确认,不进入结论。 数字三道关自评:①量级一致性——混合价三档($0.071/$0.017/$0.004)按公式复算自洽;284B×4bit≈142GB 下限复算自洽;目录价倍数逐格按 8-06 直查价重算。②单位显式——每百万 Token 与每任务两套计量分列;FLOPs 压缩(10%)与内存压缩(7%)分列且注明对象为对 V3.2。③关键数字 ≥2 源——价格全部官方页直查;财务数取公司官方;单源测算(ROIC、单任务成本、GA 窗口)标 C 级不作载重论据。
免责:本报告为涌现资本产业研究部信息聚合与独立研究判断,不构成任何证券的买卖要约或投资建议,读者应独立决策并自负风险。市场有风险,投资需谨慎。© Emergence Capital
*涌现资本产业研究部 · 2026-08-06*