梁神变牢梁的原因找到了!疑似DeepSeek发错模型,HF配置和API后台紧急切换
2026 年 8 月 13 日凌晨,DeepSeek 延续"不上发布会、不发海报"的极简风格,悄悄更新 API 文档,将背后的模型切到了等待近四个月的 DeepSeek-V4-Pro-0813 正式版。
起初全网一片欢腾:Terminal-Bench 2.1 砍下 87.9 分,距顶级闭源模型 Claude Fable 5(88.0 分)仅差 0.1 分;加上依旧降维打击的极低价格,海外开发者直呼"性价比之王又戴稳了皇冠"。
然而狂欢没过半天,实测党们接入真实业务流后画风彻底变了。这个拥有 1.6 万亿参数、单次激活 490 亿参数的旗舰庞然大物,实际体验极不稳定。Artificial Analysis 测出的综合得分仅有 53 分,只比参数量小得多的 V4 Flash 高出区区 1 分;网络安全扫描等真实场景误报率频频遭到吐槽。同一项任务相隔几小时测试,V4 Pro 的表现便出现明显变化。

到 13 日下午,DeepSeek 官网火速撤下 V4 Pro 正式版横幅和开放平台公告,将全网体验强行带回"原点"。从官测惊艳到实测争议再到发布即撤回,到底是夸大宣传的性能滑铁卢,还是工程部署上出了乌龙?
后台记录曝光:紧急抢修模式
扒开 HuggingFace 上的官方仓库 deepseek-ai/DeepSeek-V4-Pro-0813,会发现官方后台早已进入"生死时速"的连夜抢修。
"小弟装大哥":最初上传的 V4-Pro-0813 配置中,hidden_size 为 4096、路由专家数为 256、隐藏层数为 43、Attention Head 数为 64——这些数值与 V4-Flash-0731 完全一致。社区很快在 HuggingFace Discussion 中提出质疑,DeepSeek 官方成员 msr2000 回复"已处理"。修正后的配置变成 hidden_size=7168、384 个路由专家、61 层、128 个 Attention Head,与此前 V4 Pro 的架构配置重新对齐。MoE 中间层大小、Q-LoRA Rank、路由系数、DSpark 相关参数等一整串配置也随之变化。

二进制权重被替换:官方先提交了一次 Update config.json,紧接着通过 upload-large-folder tool 连续进行了两次大文件重新上传。翻开关键的权重分片(model-00035 至 model-00039.safetensors)对比记录,其 SHA256 校验码全部发生改变,文件体积也出现了微妙变化。这说明 DeepSeek 替换的远不止配置文件,至少部分真正的模型二进制文件也被重新处理过。
推理栈热切换
API 后端的指纹突变则揭示了 DeepSeek 后端集群正在经历的"云端抢修"。有开发者发现,模型的 system_fingerprint(系统指纹)发生了罕见的剧烈变动:此前可通过 API 返回的明文指纹直接读出构建日期(20260812)、生产环境、FP8 量化及 KV Cache 等工程细节;但实测过程中不到半小时,Pro 和 Flash 的系统指纹几乎在同一时间全部切成了无法解读的纯 32 位 Hash。
系统指纹的同步改变,直接对应着线上推理后端(Inference Backend)、部署版本、算力调度策略或指纹生成规则的彻底重构。这也印证了一个事实:DeepSeek 的线上推理栈刚刚经历了一场非常决绝的热切换。
结语
将上述线索串联起来看,有理由相信这次发版混乱并非简单的"模型翻车",极有可能是因为 DeepSeek 的前端接口、后端推理栈与权重配置三者出现了严重的错位,导致不同时间、不同入口的开发者拿到的体验完全不在同一个频道上。
这也给当前参数不断扩增、规模持续摸高的模型行业竞争敲响了警钟。当模型体量迈入万亿参数级别,任何微小的配置错位——哪怕只是一个 config 文件的参数写错——都可能在 Infra 层被无限放大,最终在前端体验上砸出巨大的"坑"。V4 Pro 的 FP8 量化版本权重高达 893 GB,由 66 个分片文件组成,这不仅是对算力调度、高并发吞吐等基础设施的极限考验,也意味着底层配置或算子调度上的微小瑕疵,反映到高并发的前端就会瞬间放大为显著的体验下滑。