叙事差 · NARRATIVE DELTA 03
从中国开源模型的性价比冲击,到“有效 Token”成为 AI 基础设施的新标尺
2026 年,模型市场出现了一组看似矛盾的数字。
DeepSeek V4 Flash 的官方 API 输出价是每百万 Token 0.28 美元;OpenAI GPT-5.6 Sol 是 30 美元,二者标价相差超过 100 倍。与此同时,Kimi K3 的输出价又达到 15 美元,和 GPT-5.6 Terra 相同。
上述价格来自厂商公开价目表,MiniMax 与 Anthropic 的对比型号也采用相同口径。DeepSeek API 定价〔1〕 Kimi K3 定价〔2〕 OpenAI GPT-5.6 Sol 定价〔3〕 MiniMax M2.5〔4〕 Anthropic 定价〔5〕
这当然不是一场可以只看价签的横向评测。模型能力、延迟、可靠性、工具调用和服务保障都不同。但价差本身已经说明:“最强模型等于最高价值”正在变成一个不完整的叙事。
当 DeepSeek、Kimi、Qwen、GLM、MiniMax 以不同尺寸、不同激活参数和不同价格密集供给模型,企业第一次拥有了真正宽阔的选择谱系。模型没有变得不重要,但模型的稀缺性正在下降。
于是,产业竞争开始从“谁能训练出更强的模型”,转向一个更接近商业的问题:
谁能以最低的总成本,稳定完成一次正确的任务?
这就是本期的“叙事差”。Token 仍然是 AI 世界的计量单位,但最终值钱的不是 Token 本身,而是 Token 经过模型、算力和软件系统之后,能否变成一次可验证的工作结果。
一、旧叙事:模型越强,价值越大
过去三年,AI 的估值框架几乎沿着一条单行道展开:参数更多、训练算力更大、基准分数更高,模型就更接近通用智能,也就应该获得更高的价格和更厚的利润。
这套叙事在模型极度稀缺的阶段成立。企业没有多少选择,只能把最难的问题交给最强模型;应用公司也愿意用昂贵 API 换取更快上线。
但模型供给正在从“少数旗舰”变成“连续光谱”。
Kimi K3 采用 2.8 万亿总参数、1040 亿激活参数的 MoE 架构,并将原生视觉、百万上下文和量化感知训练放进同一个开放权重模型;DeepSeek V4 Flash 只有 130 亿激活参数,却把长上下文和推理任务压进每百万输出 Token 0.28 美元的价格;Qwen 的 MoE 路线则持续用更少激活参数逼近更大稠密模型的能力;GLM 5.2 甚至把稀疏注意力、推测解码和不同推理强度直接做成效率工具。Kimi K3〔6〕 DeepSeek V4〔7〕 Qwen3〔8〕 GLM 5.2〔9〕
严格来说,“开源”与“开放权重”并不完全相同,许可证、训练数据和商用限制也各不相同。但对企业采购者而言,真正重要的变化是:模型选择变多,私有化部署变得可行,闭源模型原有的能力溢价和价格保护伞开始被压缩。
OpenAI 自己也在回应这种变化。GPT-5.6 不再只有一个旗舰价位,而是同时推出 Sol、Terra、Luna 三档,并把发布重点写成“每个 Token 获得更多智能”和“更强的每美元性能”。这恰恰说明,效率已经从中国模型的挑战口号,变成了全球头部模型共同争夺的新标尺。OpenAI GPT-5.6〔10〕
主要模型API输出Token标价
这张图不能被解读为“DeepSeek Flash 与 GPT-5.6 Sol 能力相同”。它只展示了一件事:模型市场已经出现足够宽的价格带。只要任务允许分层路由,企业就不必再让最贵的模型处理所有问题。
二、第一个误区:Token 越便宜,AI 就越高效
Token 单价很直观,却可能是最容易误导人的指标。
假设模型 A 每百万 Token 只要 1 美元,但完成一个任务需要 10 万 Token,并且只有 60% 的成功率;模型 B 每百万 Token 需要 5 美元,却只用 1 万 Token,成功率达到 90%。只比较价签,A 便宜五倍;按一次成功任务计算,B 反而更便宜。
真正的成本公式更接近:
单次成功任务成本 = 模型调用成本 + 推理基础设施成本 + 重试成本 + 人工复核成本 + 错误损失
这也是推理模型带来的新矛盾。模型“会思考”以后,输入价格可能继续下降,但思考链、工具调用和多轮 Agent 会放大输出 Token 数量。一个看似便宜的模型,如果反复尝试、上下文不断膨胀、最终还需要人工返工,就没有创造真正的效率。
所以,AI 产业正在经历一次类似云计算早期的认知升级:从看服务器单价,变成看一个业务请求的总拥有成本;从看每百万 Token 价格,变成看每一个正确结果的完整成本。
三、真正的 Token 效率,有三层
Token 效率不是单一指标,而是一条从模型到业务的传导链。
Token效率三层框架
第一层:模型效率
模型效率回答的是:同样质量的结果,需要激活多少参数、生成多少思考 Token、调用多大的模型?
MoE、稀疏注意力、量化、蒸馏、推测解码和大小模型路由,本质上都在做同一件事:减少每次智能输出所消耗的计算。Qwen3 曾披露,其 MoE 基座模型只激活约 10% 参数,就能达到上一代稠密模型的水平;GLM 5.2 则称 IndexShare 在百万上下文下把单 Token FLOPs 降低 2.9 倍。这些数据都来自厂商披露,未必可以跨模型直接比较,但方向高度一致:参数规模不再等于实际计算量。
第二层:系统效率
系统效率回答的是:同样一批 GPU,能稳定吐出多少有效 Token?
这里的瓶颈不只在芯片。长输入会让 Prefill 阶段变重;长输出和高并发会把 Decode 阶段推向瓶颈;百万上下文会让 KV Cache 吞噬显存;跨卡通信、网络带宽、批处理、前缀缓存命中率和请求调度,都会决定最终成本。
一个很直观的例子来自智谱 ZCube:在 GLM-5.1 的生产负载中,网络带宽从 100Gbps 提升到 200Gbps,吞吐量提高约 19%,首 Token 延迟降低约 22%。这不是“模型算法”进步,却直接改变了 Token 生产效率。ZCube〔11〕
NVIDIA Dynamo、Ray Serve、vLLM、SGLang 等系统的价值也在这里。它们负责拆分 Prefill 与 Decode、根据 KV Cache 路由请求、跨节点调度模型并按负载伸缩。模型越来越多以后,企业需要的不只是一个模型 API,而是一套能回答“哪个请求该交给哪个模型、放在哪张卡、占用多少显存、何时扩容”的控制系统。NVIDIA Dynamo〔12〕 Ray Serve LLM〔13〕
第三层:业务效率
业务效率回答的是:更多 Token 最后有没有变成收入、利润或真实的人力替代?
代码 Agent 可以生成大量 Token,但如果合并率没有提高,价值接近于零;客服 Agent 可以处理更多会话,但如果升级人工和投诉率同步上升,成本并没有下降;研究 Agent 可以写出几十页报告,但如果关键数字不能核验,反而增加复核负担。
因此,企业真正需要跟踪的指标,不是“本月用了多少亿 Token”,而是:
- 每个成功任务消耗多少 Token;
- 一次任务需要重试多少次;
- 自动完成率和人工接管率是多少;
- 每一美元 AI 成本带来多少收入或节省多少工时;
- Token 成本下降的速度,能否跑赢 Token 使用量上升的速度。
只有走到第三层,Token 才从技术指标变成财务指标。
四、便宜不会杀死算力,反而可能制造更多需求
看到模型价格快速下降,一个自然推论是:AI 收入和算力需求会被压缩。
这可能只对了一半。
如果一项资源变便宜以后,需求弹性足够大,总消耗反而会上升。这就是“杰文斯悖论”。蒸汽机提高煤炭利用效率后,英国消耗的煤不是更少,而是更多;云计算降低服务器使用门槛后,企业部署的计算任务也没有减少。
AI 很可能重复这条路径。
Token杰文斯循环
MiniMax 披露,M2 系列在 2026 年 2 月的日均 Token 消耗已经超过 2025 年 12 月的 6 倍,Coding Plan 的 Token 消耗增长超过 10 倍。它不能代表整个行业,却提供了一个早期样本:当价格、速度和可用性同时改善,原本不会发生的调用开始发生。MiniMax 2025 年度业绩〔14〕
更便宜的 Token 会带来三个增量:
第一,原本 ROI 算不过来的场景开始上线;第二,单轮问答升级为长推理、多工具和多 Agent 协作;第三,软件从“人点击一次、AI 调用一次”,变成常驻后台、主动执行。
因此,未来可能同时出现两件事:每百万 Token 的价格持续下降,全球 Token 总量却以更快速度增长。
对算力产业来说,问题不再是“Token 降价是否利空 GPU”,而是两个速度的竞赛:
Token 使用量的增速,能否长期高于单 Token 成本的降幅?
如果答案是肯定的,算力总需求仍会增长;如果 Agent 的调用量没有兑现,或效率进步快于需求扩张,硬件投资就会进入消化期。
五、“谁是 AI 时代的 VMware”,现在有了更清晰的答案
服务器时代,VMware 的核心价值不是生产更多服务器,而是把一堆异构、低利用率的服务器,变成统一、可调度、可计量的计算资源。
AI 时代需要同一种抽象,只是被管理的对象变成了 GPU、显存、模型、KV Cache、推理请求和 Token。
过去企业问:“还有多少台机器?”
未来企业会问:“这些资本开支每小时能交付多少个合格结果?”
这就是 AI 时代控制层的机会。它要完成四件事:
- 把不同芯片池化:让 NVIDIA、国产 GPU 和不同代际设备尽量被统一调度;
- 把不同模型路由:简单任务交给便宜小模型,困难任务升级到强模型;
- 把推理过程优化:管理 Prefill、Decode、KV Cache、批处理、并发和网络;
- 把 Token 变成财务账本:追踪每个部门、应用和任务的成本、质量与回报。
NVIDIA 已经把 Dynamo 称为“AI 工厂的操作系统”,并通过 CUDA、TensorRT-LLM、NIM、Run:ai 和 Dynamo 把芯片、推理引擎与调度系统连起来。它是当前最完整的垂直答案。
但企业也会需要一个不被单一芯片和单一模型绑定的中立层。Kubernetes、Ray、vLLM、SGLang 组成的开放栈,IBM/Red Hat 这类企业平台,以及中国云厂商和 AI 平台公司的机会,都来自同一个需求:当模型不再稀缺,管理模型的复杂性反而成为新的稀缺。
六、沙盘推演:四种可能同时发生的未来
情景一:能力快速收敛,模型进入价格战
中国开放模型继续逼近闭源旗舰,大部分企业任务不再需要最强模型。API 毛利率承压,模型公司被迫向云、应用、数据和工作流寻找利润。
受益者是拥有分发入口的云厂商、能够跨模型路由的中立平台和低成本推理基础设施;承压者是没有流量、数据或应用闭环的纯模型 API。
需要验证:开放模型在真实生产任务而非榜单上的成功率,是否持续逼近闭源旗舰。
情景二:推理能力提升,但“思考通胀”更快
模型解决的问题更难,单任务思考 Token、上下文和工具调用同步增长。每 Token 更便宜,但每个任务未必更便宜。
受益者是显存、带宽、互联、KV Cache 和推理调度;承压者是按低 Token 预算设计、却无法把成本传给客户的 AI 应用。
需要验证:单位任务 Token 数量、缓存命中率和重试率,是否出现失控。
情景三:Agent 爆发,Token 需求跨过弹性拐点
AI 从聊天工具变成后台劳动力。编码、客服、研究、营销和企业流程中的调用频率指数级上升,Token 总量增长跑赢降价。
受益者是 GPU、网络、内存、推理云和能证明自动化 ROI 的垂直应用;承压者是只增加 Token 消耗、没有提高任务成功率的“伪 Agent”。
需要验证:日活 Agent 数量、每 Agent 完成任务数和人工接管率,而不是只看注册用户。
情景四:效率软件很重要,但利润被云和芯片厂商内部化
调度、路由和推理引擎成为标配,却以开源组件或云服务功能的方式存在,独立软件公司难以收费。价值最终回到能够捆绑硬件、云资源和客户合同的平台。
受益者是 NVIDIA、头部云厂商和拥有企业分发的综合平台;承压者是技术优秀但缺乏商业闭环的纯开源项目。
需要验证:企业是否愿意为中立控制层单独付费,以及它能否带来可量化的 GPU 节省。
这四个情景并不互斥。最可能的组合是:模型价格战、思考 Token 膨胀、Agent 调用增加、效率价值被大平台部分吸收——同时发生。
七、投资映射:不要只找“更便宜的模型”,要找效率红利的收费站
垂直全栈
代表性标的:NVIDIA(NVDA)
可能受益的逻辑:CUDA、推理引擎、Dynamo、Run:ai 与 GPU 形成完整闭环;效率提升也可能扩大 GPU 的经济可用场景
关键风险与验证指标:云厂商自研芯片、开源栈替代;看推理收入、GPU 利用率和软件渗透
网络与互联
代表性标的:Broadcom(AVGO)、Arista(ANET)
可能受益的逻辑:Prefill/Decode 拆分、KV Cache 迁移和大规模推理集群提高网络价值量
关键风险与验证指标:集群投资降速、客户集中;看 AI 网络收入与带宽升级节奏
内存与数据搬运
代表性标的:Micron(MU)、澜起科技(688008)
可能受益的逻辑:长上下文和高并发让显存、内存带宽与互联更重要
关键风险与验证指标:存储周期、产品兑现;看 HBM/内存接口的量价与份额
中立企业控制层
代表性标的:IBM(IBM)/ Red Hat
可能受益的逻辑:企业需要跨模型、跨云和可治理的调度层,OpenShift 与开源生态有入口
关键风险与验证指标:AI 业务在集团中占比小、开源变现难;看新增合同和软件收入
中国云与平台
代表性标的:阿里巴巴(BABA/9988)、第四范式(6682)、青云科技(688316)
可能受益的逻辑:国内模型与算力异构更强,企业更需要模型服务、资源调度与 AI 平台
关键风险与验证指标:价格战、项目制收入、资本开支压力;看经常性软件收入、客户留存与毛利
国产算力调度
代表性标的:中科曙光(603019)及生态
可能受益的逻辑:国产芯片并存提高异构调度、集群管理和液冷基础设施需求
关键风险与验证指标:订单波动、软硬一体利润率;看软件价值量与回款质量
AI 应用
代表性标的:能证明任务 ROI 的垂直 Agent
可能受益的逻辑:Token 降价扩大可服务市场,自动完成率提高可转化为利润
关键风险与验证指标:Token 消耗快于收入、模型同质化;看单任务毛利、留存和人工替代率
这里最值得警惕的是“正确方向、错误标的”。
推理效率会成为大行业,但不代表每个推理软件都能成为好公司。开源会加速技术扩散,也会压低独立软件的收费能力;云厂商可以把路由和调度当作留住算力消费的免费功能;芯片公司也可以用软件提高硬件黏性。
因此,判断一家公司能否兑现 Token 效率红利,至少要问四个问题:
- 它提高的究竟是跑分,还是客户的单次成功任务毛利?
- 它的优化是否跨芯片、跨模型,还是只能服务自家生态?
- 客户愿意单独为软件付费,还是价值最终被云资源打包吸收?
- 效率提高以后,客户会减少支出,还是因为 ROI 改善而扩大使用?
八、下一阶段真正应该盯的五个指标
未来一年,与其追逐每一次模型榜单更新,不如建立一张“有效 Token 仪表盘”:
- 能力价差:开放模型与闭源旗舰在真实任务成功率上的差距;
- 单任务成本:包含思考、重试、工具调用和人工复核后的完整成本;
- 需求弹性:Token 价格下降 1%,使用量能否增长超过 1%;
- 系统利用率:GPU、显存、KV Cache、网络和缓存命中率是否持续改善;
- 商业转化率:每一美元 AI 支出带来的收入、毛利或工时节省。
这五个数字会决定 AI 基础设施究竟走向“降价后的产能过剩”,还是“效率提升后的需求爆炸”。
结语:模型是原油,结果才是成品
中国开放模型的意义,不只是用更低价格挑战 OpenAI 和 Anthropic。
更深的变化是,它们正在把模型从稀缺的“智能成品”,变成供应充足、规格多样的“智能原料”。一旦原料不再稀缺,产业的利润就会向炼化、调度、分发和应用迁移。
训练时代最重要的问题是:谁能造出更强的模型?
推理时代更重要的问题是:谁能把最合适的模型、芯片、内存和网络组合起来,用最低成本完成正确任务?
所以,AI 基础设施的下一个估值单位,可能不是 GPU 数量,也不是 Token 数量,而是:
每一美元资本开支,能够稳定交付多少个有效结果。
当市场开始用这把尺子衡量公司,模型公司、云厂商、芯片公司、调度软件和 AI 应用的估值逻辑,都要重写。
这不是“模型不重要了”。
而是模型终于开始像一种真正的工业品,被按产出效率和商业结果定价。
本文仅为行业研究与叙事推演,不构成任何投资建议。模型性能、价格和公司经营数据可能快速变化,引用价格均为公开标准价,未计入缓存、批处理、折扣、区域税费与不同任务质量差异。
资料来源
〔1〕DeepSeek API 定价
https://api-docs.deepseek.com/quick_start/pricing/
〔2〕Kimi K3 定价
https://www.kimi.com/resources/kimi-k3-pricing
〔3〕OpenAI GPT-5.6 Sol 定价
https://developers.openai.com/api/docs/models/gpt-5.6-sol
〔4〕MiniMax M2.5
https://github.com/MiniMax-AI/MiniMax-M2.5
〔5〕Anthropic 定价
https://www-cdn.anthropic.com/files/4zrzovbb/website/3684c2faafb97418665782cea0001f439f74b1d2.pdf
〔6〕Kimi K3
https://github.com/MoonshotAI/Kimi-K3
〔7〕DeepSeek V4
https://api-docs.deepseek.com/news/news260424/
〔8〕Qwen3
https://qwenlm.github.io/blog/qwen3/
〔9〕GLM 5.2
https://z.ai/blog/glm-5.2
〔10〕OpenAI GPT-5.6
https://openai.com/index/gpt-5-6/
〔11〕ZCube
https://z.ai/blog/zcube
〔12〕NVIDIA Dynamo
https://www.nvidia.com/en-us/ai/dynamo/
〔13〕Ray Serve LLM
https://docs.ray.io/en/latest/serve/llm/index.html
〔14〕MiniMax 2025 年度业绩
https://www.minimax.io/news/minimax-global-announces-full-year-2025-financial-results