AICostInfrastructure

Token 降价的尽头,是一度电的账

冬梅··原文链接
收录于 2026/7/1 10:18:49

InfoQ 对优刻得董事长兼 CEO 季昕华的这篇访谈,把"Token 为什么会降价"这个常见问题从模型厂商的 API 价格战,一路追到了电力、数据中心选址和基础设施效率的底层。对关注工程化落地的人来说,这篇文章的价值在于它把一个看似纯商业的话题,还原成了可以度量、可以拆解的系统工程问题。

AI 进入算账阶段

过去一年 DeepSeek、通义千问、智谱、MiniMax 等国产模型不断降价,表面看是厂商竞争,但 Token 背后是一条完整链条:电力 → 土地 → 机柜 → 制冷 → 网络 → 存储 → GPU 调度 → 企业内部使用方式。

季昕华观察到企业老板当前关心三件事:让员工用上 AI、发现成本高后如何降本、如何真正提效。AI 不是不用了,而是进入算账阶段。

Token 的终局是电力

优刻得 2017 年在乌兰察布选址建数据中心时其实还不是为了 AI,而是做服务北京的"前店后厂"。选址乌兰察布的原因很直接:

  • 电便宜——这是最核心的因素
  • 苹果要求 100% 绿电,内蒙古可以做到
  • 气温低,PUE 更好做(制冷能耗下降)
  • 离北京近,网络时延和人员往来都方便

季昕华说得直白:Token 的终局是电力,电便宜,Token 就便宜。

刘杰算了一笔账:一台国外顶级服务器功耗约 6.5 千瓦,配 8 张 GPU 卡;一个千卡集群约需 125 台服务器。仅服务器本身一年耗电已是天文数字,再乘以 PUE 系数才是数据中心真正要承担的总用电。这就是为什么选址、电价、PUE、高功率机柜会直接影响 Token 成本。

机柜逻辑变了:从"有没有楼"到"能不能承载 AI"

传统 IDC 行业讲"柜子数量",但 AI 时代这个指标已经失效。优刻得青浦数据中心约 42 亩、设计 5000 机柜;乌兰察布园区约 212 亩、设计 12000 机柜。但关键不是数量,而是功率密度

大模型训练和推理需要更高的功率密度,普通机柜放不下多台高功耗 GPU 服务器。液冷单机柜可以做到 35 千瓦,但背后需要电路和散热系统专门改造。这导致一个结构性变化:传统低功率数据中心出现空置,高功率数据中心反而供不应求——优刻得新建的高功率数据中心还没开建就有订单进来。

Token 降本的五个方向

季昕华给出的降本路径,从基础设施一路延伸到组织管理:

  1. 用国内模型——DeepSeek 等国产模型价格优势明显。不一定所有任务都调用最贵模型,80 分模型能完成任务且成本低得多,就是更现实的选择。

  2. 提高每度电产生的 Token 数量——这句话是全文最关键的工程判断。真正决定长期成本的不是"每百万 Token 多少钱",而是"每度电能转化多少有效 Token"。GPU 利用率、推理框架、模型部署、网络通信、存储读写都会影响这个指标。

  3. 数据中心位置分层——乌兰察布适合训练和覆盖北方推理需求;上海青浦适合华东对时延敏感的业务(金融、汽车)。对应"东数西算"的分工逻辑:按任务类型拆分,不是所有算力都要离用户最近。

  4. 模型组合——不同模型能力边界不同,未来更合理的方式是把任务拆开,让不同模型处理各自擅长的部分,甚至由平台自动路由。一个复杂任务里真正需要顶级模型的可能只有 20%,其余交给更便宜更快的模型。AI 降本不等于一味调用便宜模型,而是在效果和成本之间做动态路由。

  5. Prompt 管理和 Prompt Engineering——很多企业一边喊成本高一边没有建立使用规则。员工怎么提问、调用什么模型、是否复用模板、是否把简单问题交给高价模型,都会影响 Token 消耗。

Token 治理:SaaS 逻辑的反转

这一点对前端工程化有直接启发。SaaS 时代员工越活跃说明软件价值越高,但 AI 反过来:用得越多成本越高。如果没有治理体系,老板推 AI 后很快会遇到"感觉没明显提效,但账单多了一大块"的尴尬。

优刻得内部每天看 AI 使用报告——多少员工用了 AI、花了多少钱、用在什么场景。Coding 是用量最大的场景。但最大挑战是如何衡量投入到底带来多少产出。AI 工具铺开后会出现三类情况:员工还在摸索、调用其实是个人使用、真正用于公司工作的部分提效多少仍需评估。

这也倒逼人才观变化:AI 让学习新技术的门槛下降,主动性、好奇心、自我反思、业务理解可能比单纯经验更重要。真正稀缺的不再是"会不会写代码",而是能不能判断问题、拆解任务、驾驭工具,并把 AI 产出落到业务结果上

Token 需求是长期趋势

季昕华判断 Token 增长是长期趋势,即使现象级智能体应用的热点退去,Token 量仍在快速增长。需求来源有几个共同点——它们不是单次尝鲜,而是工作流、内容流和硬件入口的持续消耗:

  • Coding:AI 写代码能力提升后,后端工程师可以借助 AI 快速写前端,测试和运维边界被打通,非研发人员也能完成部分过去无法独立完成的工作
  • 生成式内容(图像/视频/漫画/短剧):计算密集、调用频繁、需要反复调整,天然产生大量算力需求
  • 企业内部岗位(广告营销、市场推广、财务、HR)开始使用 AI
  • AI 硬件(录音转会议纪要、智能眼镜、智能戒指)把调用入口从电脑手机扩展到更多终端

最大瓶颈:物理基础设施跟不上

季昕华区分了国内外瓶颈:国内缺卡,海外缺数据中心。国内基础设施瓶颈有三个层面——卡的供应、数据中心审批和统一管控、旧基础设施的电和水挑战。

核心判断是:比特世界的需求可以指数级增长,但物理世界是原子世界,电网、水、机房、设备交付、施工周期都有现实约束。数字需求跑得太快,物理供给跟不上。

AI 基础设施的本质是连续的系统调优而非单点革命。瓶颈始终在移动:GPU 不够 → 提升后发现内存是瓶颈 → 内存做大后网络连接成瓶颈 → 网络解决后 CPU 调度跟不上 → 再往后是跨机房连接。主要矛盾解决后,次要矛盾变成新的主要矛盾。

当前推理仍然以集中式为主——算力稀缺时把资源集中起来比过早分散更经济。未来更可能像 CDN 那样在边缘做缓存,通过"以存代算"减少重复计算(比如多个用户问同一个天气问题,答案相同就不必每次重新推理),但这套模式还没收敛。

优刻得的中立定位

优刻得把自己定位为中立的算力和模型服务平台。中立性在 AI 时代被重新放大:阿里有通义千问、腾讯有混元、字节有豆包,创业型大模型公司选择相对中立的第三方云厂商更容易获得资源支持,也减少竞争顾虑。

客户结构分五类:基础模型公司(智谱、MiniMax、DeepSeek)、行业模型公司(金融/证券)、智能终端(手机/汽车)、应用场景、科学计算。优刻得差异化在于提供从数据中心、高功率机柜、GPU 算力、模型部署、Token 计费到企业 AI 使用治理的一揽子能力。

这条路不轻松——AI 基础设施仍是重资产,硬件价格上涨但终端算力租赁价格没有同步上涨,中间压力需要云厂商消化。数据中心标准也需要调整:并非所有 AI 产品都需要双路供电、两路 UPS、两路柴发的最高冗余标准,未来需要按业务精细化的数据中心标准。

小结

Token 价格战背后的真实战场,已经从模型 API 页面转移到了电力、数据中心和算力系统深处。谁能把一度电更高比例地转成有效算力、把一张 GPU 跑出更多有效 Token、把不同模型组合成更低成本的工作流、把员工的 AI 使用变成可衡量的业务产出,谁才有机会在下一轮 AI 基础设施竞争中留下来。

Token 便宜的尽头,不只是模型降价——是电力,是算力,是工程能力,也是企业重新学会怎么用 AI。

评分:
暂无0 人评分)