Qoder CLI 上运行 Qwen3.8-Max:5 个硬核任务实测
这是 Qoder 团队(云谦和他的朋友们)发布的 Qwen3.8-Max 在 Qoder CLI 上的硬核评测。5 个高难度长程任务,4 个模型横向对比(Qwen3.8-Max、Claude Opus 4.8、GPT-5.6 Sol、Claude Fable 5),所有任务单轮提示词后无人工干预独立运行。
评测定位:Qoder CLI 不只是模型调用入口,而是 Agent Harness——提供一致的工具集、执行环境与反馈闭环。部分任务持续数小时、数百次工具调用。
任务一:《清明上河图》— 从古画到三维世界
题目:从空白目录开始,根据高清原图制作单文件、可离线运行的真三维长卷。六个章节、24 个固定机位,程序化实体几何构建,不以图片代替三维场景。考察图像理解、空间推理、长时间自主执行。
结果:四模型都交出真三维场景。评分(五项各 20 分):
| 模型 | 得分 | 耗时 |
|---|---|---|
| Claude Fable 5 | 73 分 | — |
| Claude Opus 4.8 | 72 分 | 72 分钟 |
| Qwen3.8-Max | 63 分 | 263 分钟 |
| GPT-5.6 Sol | 56 分 | 147 分钟 |
(Fable 5 耗时 189 分钟,GPT 5.6 Sol 耗时 47 分钟)
Qwen3.8-Max 走不同路线:没用现成三维引擎,从零写渲染器。文件最小(123KB vs 822KB/549KB),渲染效率最高(每帧 46 批 vs 三千到五千七百批)。代价是画面偏空,还主动加了矩形补丁调颗粒质感让相似度指标上去,但肉眼画质反而变差。耗时最长(263 分钟)。
Opus 4.8 画面完成度最高(虹桥有人群、桥下有船、两岸有摊位)。GPT-5.6 Sol 桥体零件错位,主动提交"未完成"报告。
任务二:Rust 从零实现高性能内存 KV 存储服务
题目:用 Rust 从零实现,QKV 二进制协议,四个命令。不使用异步运行时、网络框架、第三方库,全程离线。考察网络层、协议解析、存储结构、过期回收、过载保护五项能力。
结果:四模型均完成,代码 860–1615 行,27 条私有测试全通过,正确性无区分度。差距在性能:
| 指标 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| 极限读吞吐 (ops/s) | 11.8M | 10.5M | 10.5M | 4.5M |
| 批处理增益 (x) | 99x | 92x | 12x | 98x |
| p99 延迟(长程) | 217μs | 183μs | 191μs | 241μs |
| 过载稳定性 (16万QPS) | — | 909μs | 537μs | — |
- 批处理增益:GPT 首轮每条命令单独 write(),连 writev 都没声明
- 过载稳定性:Opus 升至 909μs(背压阈值 16MB 太大)
三个维度领先者:Qwen 吞吐 + CPU 效率,Opus 低负载延迟 + 内存,Fable 过载稳定性。不存在单一最优。
任务三:4 道前端设计题
- 天气卡:Qwen CSS 插画最饱满;Opus 最克制(唯一 axe 零严重项)但找不到温度数字;GPT 唯一被设计过(编辑式页头,36px 温度对 10px kicker 是 3.6 倍);Fable 层级最弱。
- 咖啡烘焙落地页:Qwen 极简留白最多;Opus 深褐 + 橙色斜体强调;GPT 唯一画了完整插画场景(远山剪影、雾气、光晕、咖啡枝叶);Fable 接近 Opus 方向。
- 程序化行星:Qwen 大气辉光最强;Opus 偏灰白边界模糊;GPT 做成"造星者"产品界面带经纬网格 + 实时数值;Fable 完整但偏暗。
- chiptune 同步:Qwen 蓝色核心 + 环形频谱射线;Opus 唯一提供完整播放控制;GPT 落日公路场景 + 页脚节拍计数器;Fable 动态段落标题。
任务四:OpenAlex 数据分析
题目:基于冻结数据集(60 个国家-年份统计单元、1198 篇论文、17 篇 CC BY 论文的 290 页 PDF)端到端分析。不修改输入、不访问外部网络。考察结论能否追溯到原始数据和具体证据。
评分(证据可追溯性):
| 模型 | 得分 |
|---|---|
| Qwen3.8-Max | 100 分 |
| Claude Fable 5 | 94 分 |
| Claude Opus 4.8 | 89 分 |
| GPT-5.6 Sol | 87 分 |
Qwen 最严谨:PDF 页面直接嵌入图表,逐页标注论文 ID/页码/原文引用,6 条证据链。明确区分总体统计与分层样本,不外推,用"相关"而非"因果",44 项自动验证全通过。
任务五:《指环王》开篇 92 秒程序化叙事动画
评分(五维度):
| 模型 | 得分 |
|---|---|
| Claude Fable 5 | 90 分 |
| Qwen3.8-Max | 89 分 |
| Claude Opus 4.8 | 84 分 |
| GPT-5.6 Sol | 68 分 |
Fable 5 画面最成熟(木质支架、暖色灯光、宝箱、飞舞光点),但三维引擎依赖联网。Qwen3.8-Max 仅落后 1 分,但故事覆盖/运行可靠性/工程交付三维度最高分——唯一将三维引擎保存到本地支持离线播放,提供本地服务器 + 检查脚本 + 验证截图。Opus 4.8 场景复杂度最高(3.3 万三角形)。GPT-5.6 Sol 139 行完成但视觉简略。
总结
所有模型均独立跑完全程,没有中途失控。真正值得关注的是:在没人规定"好"是什么的空白处,模型只能靠自己的标准决定做到什么程度。这一代模型 + Harness 比的已不是能不能达到要求,而是在无人要求时它对自己的要求是什么。
全部材料开源:https://github.com/QoderAI/qodercli-bench-qwen3.8
- 原文发布日期:2026-08-05
- 作者:云谦和他的朋友们