AILLM

暂时不跟进视频生成!Kimi K3 力压 Fable 5、登顶 Arena 榜单,提价近4倍对标Sonnet 5

四月··原文链接
收录于 2026/7/18 22:40:53

从 K2.6 到 K3 历时两个半月、跃升 17 个名次,月之暗面在 WAIC 大会首日交出一份亮眼成绩单。官方博客坦承"整体性能仍落后于最强闭源模型 Claude Fable 5 和 GPT 5.6 Sol",但在第三方权威平台 Arena 刚刷新的评测中,K3 以 1679 分登顶前端代码 / Web Dev 榜单,力压 Fable5 48 分、高于 GPT-5.6 Sol 61 分。

Arena Web Dev 榜单:K3 登顶

Arena 评测到底在测什么

Arena 评测并非检查代码能否通过固定单元测试,而是让模型面对相同的真实前端任务,由用户比较生成结果并投票。因此它同时衡量代码功能、交互体验、视觉效果和需求理解,更接近 Vibe Coding 时代用户对"成品"的主观选择——这对前端工程师而言是一个值得关注的信号:榜单衡量的不是"能跑",而是"能用、好看、对味"。

具体到七个前端细分领域,K3 在六项排名第一(品牌与营销、参考图复刻、数据与分析、消费产品、模拟应用、内容创作工具),游戏开发排名第二。两两对战平均胜率 76%,高于 Fable 5 的 63% 和 GPT-5.6 Sol 的 58%。

K3 前端细分领域排名

这组数据可以解读为:Kimi 能把视觉判断、产品理解、前端工程和多步执行结合得更完整,尤其适合网站生成、数据看板、可视化研究和互动内容。对前端侧的体感就是——用 Kimi 生成的网页综合审美更受认可。这同时也反映出一个超出预期的趋势:中国开源模型追赶美国闭源模型的速度,比 Anthropic CEO 达里奥此前"6-12 个月内才会出现同等能力开源模型"的判断来得更快。

WAIC 首日还展示了一段 36 秒官方宣传视频,由 K3 从 56 个源素材(Quellclips)中自主完成剪辑——一个具象的 agent 多步执行案例。

三大核心场景评测

K3 拥有 2.8 万亿总参数、原生视觉理解和 100 万 Token 上下文,官方将核心场景概括为长周期编程、知识工作和复杂推理

1)长周期编程

K3 在 Terminal Bench 2.1 取得 88.3 分(高于 Fable 5 的 84.6);Program Bench 77.8 分(高于 76.8);SWE Marathon 42 分(高于 35)。但在更强调真实代码仓库修复的 DeepSWE 和 FrontierSWE 中,K3 分别为 67.5 和 81.2 分,仍落后 Fable 5 的 70 和 86.6 分。

长周期编程 Bench 成绩对比

2)Agent 与知识工作

K3 在 BrowseComp 达到 91.2 分(高于 Fable 5 的 88);Automation Bench 30.8 分排名第一;SpreadsheetBench 2 为 34.8 分,略高于 Fable 5。但在 Job Bench、Toolathlon 和 GDPval-AA v2 等复杂职业任务中仍有差距。

3)视觉理解与文档处理

K3 在 OmniDocBench 达到 91.1 分(高于 Fable 5 的 89.8);MMMU-Pro 81.6 分(略高于 81.2);但在 CharXiv、MathVision 以及工具增强后的视觉推理项目中,仍普遍落后于 Fable 5。

综合来看,K3 的优势集中在终端操作、长周期执行、浏览研究、自动化和视觉化交付;短板在高难度仓库修复、复杂工具协调和部分深层视觉推理。工程侧值得一提:K3 能同时处理图像与视频输入,调用自定义工具,动态加载工具,输出严格 JSON,并自动进行上下文缓存。模型始终开启思考模式,目前只开放最高推理强度,没有提前测试账号大概率要排队。

路线判断:不做视频生成

值得专门拎出来说的是,Kimi 的多模态路线目前更偏理解与推理,而非生成视频。月之暗面联合创始人、算法团队负责人周昕宇在 x 上明确回复网友:Kimi 不会跟进视频模型,团队现阶段更关注提升模型的智能上限,并认为"视频生成难以提升智能"。他的判断是——视频生成虽然实用,但无论从理论还是实际效果看,对提升模型智能帮助都不大。这是一个在普遍追逐视频生成的行业氛围里相对克制的路线选择。

架构野心:1.79% 极致稀疏

从 K2.6 的 1T 到 K3 的 2.8T,Kimi 一直在践行 Scaling Law。但更大的模型意味着更高计算成本,所以核心并非简单"把模型做大",而是同时优化改造模型的容量、注意力和跨层信息流

K3 最激进的一步,是把 MoE 的稀疏激活率推向 1.79%(16/896):2.8 万亿总参数采用 Stable LatentMoE 架构,共 896 个路由专家,每次只调用 16 个。相当于建立一个更庞大的"能力库",再根据 Token 内容动态选择少数专家处理。

这是当前 MoE 架构的重要趋势:

  • DeepSeek-V3:每层 256 个路由专家,每个 Token 激活 8 个,另有共享专家,路由激活率约 3.13%
  • GPT-4(早期版本):256 个专家、每次激活 7 个,激活率约 2.73%
  • Kimi K3:896 个专家、每次激活 16 个,激活率 1.79%

MoE 稀疏激活率对比

逻辑是:在相近的单 Token 计算预算下,极度稀疏的 MoE 相比中等规模稠密模型,能容纳更多知识和技能,从而得到更高的能力上限。更大的模型参数本质追求的,是模型可以拥有远超单次计算规模的知识容量。

但代价也很现实——专家越多、调用比例越低,每一次错误路由造成的损失越大,对负载均衡、路由稳定和跨卡通信提出更大挑战。官方建议 K3 部署在至少 64 张加速卡组成的超节点上,以提供更大的高带宽通信域。架构上配套的几项设计都服务于这个目标:Stable LatentMoE 负责容量与路由,Quantile Balancing 根据路由分数分位数直接分配专家以减少对经验参数的依赖;KDA(Kimi Delta Attention)通过混合线性注意力为长序列提供更低成本的信息处理;AttnRes 允许当前层有选择地检索此前层表示,使超大模型更有效利用深层网络。整体改进让 K3 相较 K2 取得约 2.5 倍的整体 Scaling 效率。

K3 完整模型权重将于 2026 年 7 月 27 日前发布,架构、训练和评测细节会随技术报告一同公布。

提价近 4 倍,价格向 Claude 看齐

性能铺垫完毕,价格环节 Kimi 放弃了国产模型一贯的低价策略,向国际顶尖模型看齐。从 K2.6 到 K3:

  • 普通输入价格上涨至原来的约 3.16 倍
  • 输出价格上涨至 3.75 倍
  • 上下文从 256K 扩大到 1M
  • 始终开启思考模式,目前仅提供最高推理强度(K2.6 还允许关闭思考以控制延迟和 Token 消耗)

K3 与 Sonnet 5 价格对比

K3 定价完全对标 Claude Sonnet 5:两者标准价格均为每百万 Token 输入 3 美元、输出 15 美元。以 Sonnet 级价格提供 Fable 级结果,官方叙事里仍称"极具性价比"。

Token 单价看齐 ≠ 真实任务成本看齐

这是这篇文章最值得开发者警惕的部分。Artificial Analysis 测试显示,K3 在综合评测中生成了约 1.3 亿输出 Token,约为同类模型中位数 6300 万的两倍;输出速度约 62 Token/s,低于约 72 Token/s 的同类中位水平。

换句话说,K3 即便与 Sonnet 5 同 Token 单价,如果为完成同一项工作思考更久、输出更多,实际任务成本和等待时间仍可能更高。价目表只显示每个 Token 多少钱,真正决定是否划算的,是完成一次任务究竟消耗多少 Token、需要多少次重试。

真正让国内开发者肉疼的是 K3 对比 DeepSeek V4 的价格差距,特别是缓存命中价格,Kimi K3 将近 DeepSeek V4 Pro 的一百倍

K3 vs DeepSeek V4 成本对比

有网友按输入、输出和缓存命中比例完全不变的静态估算:从 DeepSeek V4 Pro 切换到 Kimi K3 后,同一工作负载消费额可能从 3.5 上涨至 61,整体成本扩大约 17.3 倍。而且这还没算上 K3 强制最高推理强度带来的更长思维链——真实任务成本仍可能明显高于 DeepSeek。

这种成本结构也映射到产品使用门槛:用户若要完整体验 K3 的百万 Token 上下文,需要购买 699 元的包月会员。

为什么必须提价

结合月之暗面的商业进程看这场提价的必要性会更清晰:

  • 年化经常性收入在 2026 年 4 月超过 2 亿美元
  • 5 月完成约 20 亿美元融资,估值超过 200 亿美元
  • 目前正寻求以约 300 亿美元估值融资 20 亿美元,为潜在香港上市做准备

到了这个阶段,Kimi 需要证明的已不只是模型能不能登顶榜单,也包括能力能否转化成收入,收入能否进一步转化成可持续的毛利。从 K2.6 的性价比低价策略转向对标 Sonnet 5 的定价,本质上是一次"用 Fable 级能力兑现商业溢价"的赌博——榜单是叙事,毛利才是上市故事的核心。

参考链接

评分:
暂无0 人评分)