LLMMiniMaxAI模型测评

我们离理想大模型还有多远:MiniMax M3 测评

阮一峰··原文链接
收录于 2026/8/13 22:34:06

阮一峰提出了一个直击灵魂的问题:普通用户的理想大模型应该长什么样? 他给出了四个条件——性能强(尤其是编程)、上下文窗口大(最好 100 万 Token)、多模态(文本/图片/视频/音频/操作计算机)、价格便宜量大管饱。

现实是残酷的:国外旗舰模型满足前三条但太贵,国内开源模型便宜但往往是单模态、上下文窗口也不大。直到 MiniMax M3 发布,他发现这个模型竟然同时命中了全部四个条件。

100 万上下文窗口与 MSA 架构

相比上一代 M2.7,M3 的上下文窗口从 20 万 Token 跃升至 100 万 Token。更大的上下文意味着每一轮交互都能携带完整的历史操作结果,对大型项目和长程 Agent 操作至关重要。

敢把窗口做到 100 万,靠的是新的稀疏注意力架构 MSA(MiniMax Sparse Attention)。核心思路是将 Token 分块筛选,只让代表性 Token 参与计算,避免全量注意力。官方数据:同样 Token 数量下计算量仅为上代 1/20,prefilling 阶段 9 倍加速,decoding 阶段 15 倍加速,且"绝大部分能力与全注意力打平"。

换算下来:上下文窗口增大 5 倍,计算量反降,生成质量不打折。这是工程上的硬实力。

编程能力测试

基准成绩方面,M3 在 SWE-Bench Pro 上超过 GPT-5.5 和 Gemini 3.1 Pro,接近 Opus 4.7;SVG-Bench 上超过 Opus 4.7。已经和美国头部模型站在同一级别。

MiniMax M3 基准测试成绩

阮一峰用自己的一套前端测试题做了五项实测:

  • 测试一:网页 UI 重构
  • 测试二:网页 3D 动画《天文轨道模拟器》
  • 测试三:网页游戏《愤怒的小鸟》
  • 测试四:网页 2D 动画《麦克斯韦小恶魔》
  • 测试五:SVG 图片生成《鹈鹕骑自行车》

网页 UI 重构测试结果

SVG 图片生成测试

结论很直接:每一题的表现都比 M2.7 好,生成质量完全可接受。就连"网页 UI 重构"这种上代已经做得很好的测试,这次也有改进。不过他也坦言,这些测试都是前端相关,没有涉及更复杂的后端场景。

多模态能力

M3 从单模态升级为多模态,接受图片和视频输入,还能操作电脑桌面。多模态测试集 OmniDocBench 得分超过 Gemini 3.1 Pro,端到端 Agent 评测框架 Claw-Eval 拿到最高分。

实测包括图片理解(数红色积木)、OCR(解读财务报表截图)、视频理解(识别视频画面中的小动物)。效果不错——不仅能编程,还能处理图像和视频。推测多模态的加入和上下文窗口变大有关,更大的 Token 处理能力保证了图像和视频的处理效果。

MiniMax Code 与 Token Plan

这次还发布了桌面客户端 MiniMax Code,对标 Claude Code 和 Codex。底层基于开源项目 OpenCode 和 Pi Agent,针对 M3 做了优化。除了编程,还具备 Computer Use 能力——可以连接手机,通过手机语音指令操作电脑。

MiniMax Code 桌面客户端

MiniMax Code 对标 Claude Code

Token Plan 套餐也有变化:因 M3 Token 消耗增加,从按次计费改为按 Token 计费,并增加了每周限额。最便宜套餐每月 49 元,6 亿 Token,个人使用够用。

Token Plan 套餐价格

以前没有周限额的 Token Plan 在二手平台变成高价出售——侧面说明套餐受欢迎程度。

总结

阮一峰的判断很明确:M3 这次升级非常有感,各方面都明显强于 M2.7。 100 万 Token 上下文 + 原生多模态 + 编程能力接近 Opus 4.7 + 价格亲民,国内目前没有其他开源模型同时做到这些。

它是一个各方面很均衡、都不弱的模型,符合理想大模型的条件——性能强、适用面广、价格不高,适合日常使用,也能给智能体使用。建议自己上手试试,共同探索复杂场景下的表现。

评分:
暂无0 人评分)