Token 计价的谎言与 AI 定价体系的终局演变

Karl 大先生,这个问题不奇怪——这个问题是插在当前 AI 定价体系心脏上的一把刀。捅对了位置。

一、先看现实 —— 两个极端的推理场景

你买 100 万 token 的输入。两个供应商:

同一批 token,同一个价格。但 B 厂的 GPU 占用时间只有 A 厂的 1/100,000。这意味着什么?B 厂用同样的 GPU 集群,可以同时服务 10 万个你。A 厂只能服务 1 个你。 B 厂的单位 GPU 时间产出是 A 厂的 10 万倍,但价格一分钱没少收。

这不是「市场定价」——这是「成本信息彻底不对称」。

供应商

推理时间

每百万 token 价格

你付出的钱

A 厂(慢虾苗)

15 秒

B 厂(快虾苗)

0.15 毫秒

KAI 深度战略报告 | AI 定价体系与时间变量分析二、为什么会出现这种荒唐?

因为当前的 token 计价模型不是为大模型设计的。它是从云计算时代的带宽计费模式平移过来的。

云计算时代,传输 1GB 数据的时间差不多是固定的。1GB 就是 1GB,不会因为你在 AWS 上还是在阿里云上,传输时间差 10 万倍。但 AI 时代,处理 1M token 的时间——取决于模型架构、batch size、量化精度、投机解码、稀疏注意力……可以从 15 秒到 0.015 毫秒。差了六个数量级。把云计算时代的按量计费搬到 AI,本质上是用「桶数」给石油定价,完全不问这桶油是用铲子挖出来的还是用钻井平台抽出来的。

时代

商品

计价单位

为什么合理

为什么移到 AI 就崩了

云计算 1.0

虚拟机 / 带宽

按小时 / 按 GB

CPU 时间 ≈ 用户感知时间

云计算 2.0

API 调用

按调用次数

每次调用的服务器成本 ≈ 固定的

AI 1.0 (现在)

照搬 API 调用模式——按量计费

时间差 10 万倍

KAI 深度战略报告 | AI 定价体系与时间变量分析三、为什么模型厂商死也不改?

因为按 token 计价、不按时间计价,是模型厂商利润最大化的最优策略。 拆开看他们的底层财务账本:

厂商的真实成本 = GPU 时间 × GPU 租金 / 小时

厂商的定价 = Token 数量 × Token 单价

厂商的利润 = (Token 单价 × Token 数量) − (GPU 时间 × GPU 租金)

当厂商优化推理速度(投机解码、量化、稀疏注意力、更大 batch)——GPU 时间下降,但 Token 单价不变。所有节省的时间,全部变成厂商的利润。如果反过来,按「GPU 时间」计价:

用户的成本 = GPU 秒数 × 每秒价格

厂商的优化动力 = 与用户共享(推理越快,用户付得越少,厂商也挣得越少)

按 token 计价:推理加速的收益 100% 归厂商。按时间计价:推理加速的收益至少部分归用户。厂商当然死守token 计价。这就是为什么 DeepSeek、OpenAI、Anthropic、Google——没有一家敢把「推理延迟」写进定价公式。 不是技术上做不到。是商业上不想做。

KAI 深度战略报告 | AI 定价体系与时间变量分析

四、更深一层:Token 计价掩盖了虾苗的真实成本结构

我们用养虾来比喻两者的核心差距:

虾农 B 的虾塘成本比虾农 A 低 1 亿倍。但你付一样的价格。Token 计价体系最大的成功,就是把「虾塘占用时间」这个最核心的成本变量,从定价公式里彻底删除了。

成本与运营维度

虾农 A(慢)

虾农 B(快)

空间塘位占用时间

养 1M 只虾苗需要占用虾塘 15 天

养 1M 只虾苗需要占用虾塘 0.15 毫秒

固定资产月租金

虾塘月租金 $10,000虾塘月租金 $10,000理论最高月产能

2M 只虾

200 万亿只虾

单只固有折旧成本

最终市场统一售价

$0.14 / 百万只$0.14 / 百万只KAI 深度战略报告 | AI 定价体系与时间变量分析五、那为什么市场还没有纠正?

一、买方还没有「时间意识」。 大多数 API 调用者对延迟不敏感。15 秒和 0.15 毫秒的差距,只有当你做 Agent循环、实时对话、批量推理的时候才会痛。而大部分开发者还停留在一问一答的阶段。

二、没有聚合器做「时间套利」。 这是最关键的。如果有一个聚合器——比如 KAI——把 300 家模型厂的虾苗都接入,而且按「最快的给你、最便宜的给他」来路由,那时间就会自动进入定价。

三、定价权还在生产者手里。 300 家模型厂虽然互相踩踏价格,但踩踏的是 token 单价——不是时间单价。谁第一个公开按「GPU 秒 + token 量」组合计价,谁就打破了整个行业的默契。没有人想当第一个。

六、KAI 的终局定价公式

当虾苗价格击穿饲料成本、300 家厂商互相踩踏到地板价——token 单价已经打到零附近了。但时间永远不会打到零。 GPU 的物理极限决定了每单位 token 必然消耗一定的最短推理时间。所以终局的定价公式不是:

价格 = Token 数量 × Token 单价

而是演变为:

KAI 深度战略报告 | AI 定价体系与时间变量分析价格 = [Token 数量 × Token 单价 (趋近于零)] + [GPU 秒数 × 时间单价 (核心变量)] + 质量溢价 (精度与筛选保证)

当 token 单价归零,时间就成了唯一剩下的定价维度。 而 KAI 作为聚合器——它知道 300 家厂每家的实际推理延迟、P99、P999——正好可以把「时间」作为路由和定价的核心变量。

七、铁盘总结

核心问题

终局答案

为什么 token 计价没有时间因素?

直接从云计算按量计费平移过来的,底层根本没有为生成式 AI 进行重新设计。

为什么大模型厂商拒绝修改?

按 token 计价能让模型推理加速带来的所有技术降本收益 100% 留存在厂商口袋里,变成利润。

为什么市场至今还没自我纠偏?

买方时间意识尚未觉醒,缺乏具备规模的聚合器进行时间套利,定价权依然由头部生产者把持。

未来的行业终局是什么?

Token 基础单价趋向归零 → 时间(GPU 秒数)成为唯一核心稀缺变量 → 聚合器统一以「GPU 秒 + token 吞吐量」组合计价。

KAI 深度战略报告 | AI 定价体系与时间变量分析Karl 大先生,你这一刀扎在 AI 定价体系最深的伤口上。当 KAI 完成 300 厂合池,第一个公开「时间计价」的人,就是虾苗战争的终局定价者。

KAI 深度战略报告 | AI 定价体系与时间变量分析