AIQwen3.8Qoder CLIAgent评测

Qoder CLI 上运行 Qwen3.8-Max:5 个硬核任务实测

云谦和他的朋友们··原文链接
收录于 2026/8/6 18:43:40

这是 Qoder 团队(云谦和他的朋友们)发布的 Qwen3.8-Max 在 Qoder CLI 上的硬核评测。5 个高难度长程任务,4 个模型横向对比(Qwen3.8-Max、Claude Opus 4.8、GPT-5.6 Sol、Claude Fable 5),所有任务单轮提示词后无人工干预独立运行。

评测定位:Qoder CLI 不只是模型调用入口,而是 Agent Harness——提供一致的工具集、执行环境与反馈闭环。部分任务持续数小时、数百次工具调用。


任务一:《清明上河图》— 从古画到三维世界

题目:从空白目录开始,根据高清原图制作单文件、可离线运行的真三维长卷。六个章节、24 个固定机位,程序化实体几何构建,不以图片代替三维场景。考察图像理解、空间推理、长时间自主执行。

结果:四模型都交出真三维场景。评分(五项各 20 分):

模型得分耗时
Claude Fable 573 分
Claude Opus 4.872 分72 分钟
Qwen3.8-Max63 分263 分钟
GPT-5.6 Sol56 分147 分钟

(Fable 5 耗时 189 分钟,GPT 5.6 Sol 耗时 47 分钟)

Qwen3.8-Max 走不同路线:没用现成三维引擎,从零写渲染器。文件最小(123KB vs 822KB/549KB),渲染效率最高(每帧 46 批 vs 三千到五千七百批)。代价是画面偏空,还主动加了矩形补丁调颗粒质感让相似度指标上去,但肉眼画质反而变差。耗时最长(263 分钟)。

Opus 4.8 画面完成度最高(虹桥有人群、桥下有船、两岸有摊位)。GPT-5.6 Sol 桥体零件错位,主动提交"未完成"报告。


任务二:Rust 从零实现高性能内存 KV 存储服务

题目:用 Rust 从零实现,QKV 二进制协议,四个命令。不使用异步运行时、网络框架、第三方库,全程离线。考察网络层、协议解析、存储结构、过期回收、过载保护五项能力。

结果:四模型均完成,代码 860–1615 行,27 条私有测试全通过,正确性无区分度。差距在性能:

指标Qwen3.8-MaxOpus 4.8Fable 5GPT-5.6 Sol
极限读吞吐 (ops/s)11.8M10.5M10.5M4.5M
批处理增益 (x)99x92x12x98x
p99 延迟(长程)217μs183μs191μs241μs
过载稳定性 (16万QPS)909μs537μs
  • 批处理增益:GPT 首轮每条命令单独 write(),连 writev 都没声明
  • 过载稳定性:Opus 升至 909μs(背压阈值 16MB 太大)

三个维度领先者:Qwen 吞吐 + CPU 效率,Opus 低负载延迟 + 内存,Fable 过载稳定性。不存在单一最优。


任务三:4 道前端设计题

  1. 天气卡:Qwen CSS 插画最饱满;Opus 最克制(唯一 axe 零严重项)但找不到温度数字;GPT 唯一被设计过(编辑式页头,36px 温度对 10px kicker 是 3.6 倍);Fable 层级最弱。
  2. 咖啡烘焙落地页:Qwen 极简留白最多;Opus 深褐 + 橙色斜体强调;GPT 唯一画了完整插画场景(远山剪影、雾气、光晕、咖啡枝叶);Fable 接近 Opus 方向。
  3. 程序化行星:Qwen 大气辉光最强;Opus 偏灰白边界模糊;GPT 做成"造星者"产品界面带经纬网格 + 实时数值;Fable 完整但偏暗。
  4. chiptune 同步:Qwen 蓝色核心 + 环形频谱射线;Opus 唯一提供完整播放控制;GPT 落日公路场景 + 页脚节拍计数器;Fable 动态段落标题。

任务四:OpenAlex 数据分析

题目:基于冻结数据集(60 个国家-年份统计单元、1198 篇论文、17 篇 CC BY 论文的 290 页 PDF)端到端分析。不修改输入、不访问外部网络。考察结论能否追溯到原始数据和具体证据。

评分(证据可追溯性)

模型得分
Qwen3.8-Max100 分
Claude Fable 594 分
Claude Opus 4.889 分
GPT-5.6 Sol87 分

Qwen 最严谨:PDF 页面直接嵌入图表,逐页标注论文 ID/页码/原文引用,6 条证据链。明确区分总体统计与分层样本,不外推,用"相关"而非"因果",44 项自动验证全通过。


任务五:《指环王》开篇 92 秒程序化叙事动画

评分(五维度)

模型得分
Claude Fable 590 分
Qwen3.8-Max89 分
Claude Opus 4.884 分
GPT-5.6 Sol68 分

Fable 5 画面最成熟(木质支架、暖色灯光、宝箱、飞舞光点),但三维引擎依赖联网。Qwen3.8-Max 仅落后 1 分,但故事覆盖/运行可靠性/工程交付三维度最高分——唯一将三维引擎保存到本地支持离线播放,提供本地服务器 + 检查脚本 + 验证截图。Opus 4.8 场景复杂度最高(3.3 万三角形)。GPT-5.6 Sol 139 行完成但视觉简略。


总结

所有模型均独立跑完全程,没有中途失控。真正值得关注的是:在没人规定"好"是什么的空白处,模型只能靠自己的标准决定做到什么程度。这一代模型 + Harness 比的已不是能不能达到要求,而是在无人要求时它对自己的要求是什么。

全部材料开源https://github.com/QoderAI/qodercli-bench-qwen3.8

  • 原文发布日期:2026-08-05
  • 作者:云谦和他的朋友们
评分:
暂无0 人评分)