我们用 Qwen 3.8-Max 做了一个 AI 大模型宇宙:效果竟然胜过 GPT5.6?
📌 概要
Max长程Agent能力的背后,是精雕细琢的典范,还是算力黑洞的失控? 作者丨 李娜 编辑丨 岑峰 我让Qwen 3.8-Max从零搭建了一个3D大模型演进宇宙网站,又和GPT
⚡ 关键要点
- ▸Max长程Agent能力的背后,是精雕细琢的典范,还是算力黑洞的失控? 作者丨 李娜 编辑丨 岑峰
Max长程Agent能力的背后,是精雕细琢的典范,还是算力黑洞的失控? 作者丨李娜
编辑丨岑峰
我让Qwen 3.8-Max从零搭建了一个3D大模型演进宇宙网站,又和GPT-5.6做了迭代对比。
(Qwen3.8-Max运行成果截图)
效果上限方面,Qwen 3.8-Max 展现了远超 GPT-5.6 的交付细节;
效率和成本代价方面,Max高完成度背后是低效,而且因为无法自主判断任务终点导致了额度耗尽中断;
适用场景方面, 追求快速迭代、低成本原型,GPT 依然是首选,但在不计成本追求极致性能的场景,Qwen 3.8-Max 提供了一个昂贵但有效的国产替代。(雷峰网)

01
2.4万亿参数之后,
Max3.8为什么开始强调Agent?
8月3日,阿里正式发布Qwen 3.8-Max。
从规格看,它依然足够醒目:2.4万亿总参数、约950亿激活参数、100万Token上下文,覆盖文本、代码和视觉任务,并计划开放Max权重和27B小模型。榜单、规模、价格和开源,延续着Qwen过去几年的竞争路线。

(阿里Qwen3.8 max官方技术博客截图)
但到了这一代,仅靠这些已经很难解释Max的差异化。
相比Kimi K3用KDA混合线性注意力、Stable LatentMoE建立起鲜明的架构叙事,Qwen3.8-Max没有公布同等分量的新基础架构;它的价格相较海外旗舰仍有竞争力,却没有低到足以单独改变模型选择;2.4T权重即使开放,其主要价值也更偏向云厂商、企业和研究机构,而不是普通开发者直接本地部署。当头部模型已经普遍拥有很高的基础能力,“更大、更强、更开放”正在越来越难成为一款旗舰模型独有的理由。
Qwen3.8-Max这次把更多篇幅留给了另一个方向:长程Agent。正式版技术博客中,模型规格和榜单很快被带过,真正占据篇幅的是16天自主开发、125小时科研复现、数百轮芯片优化,以及编程、办公场景中的端到端执行项目。它们共同强调一种能力:模型能否在真实环境中调用工具、接收反馈、检查结果并继续修改,把复杂任务持续推向完成。
这也为Max找到了一个更明确的位置。它不必像中小模型那样承担普及和本地部署,而是负责抬高Qwen体系的能力上限,再由Qwen Code、办公Agent和阿里云把这种能力送进具体工作流。但是它的实际能力如何,这也是我们在后面实测中需要关注的地方。

02
Agent 能力从哪里来?
Max 把训练重心放在真实环境 RL
Qwen3.8-Max没有用一套新的基础架构来定义这一代,官方技术报告里显示“Qwen 3.8-Max 基于 Qwen 3.5 的架构基础构建”,对Agent能力提升的主要解释,落在了真实环境中的RL(强化学习训练)上。

(阿里Qwen3.8 max官方技术博客截图:RL训练环境数量与能力增长曲线,随着RL训练环境从0增加到4000左右,综合分数从SFT基线约0.474提高到最佳检查点0.725,官方把它作为持续扩展RL训练带来能力提升的证据。)
这里的“真实环境RL”,并不是让模型在更大的题库里反复做题,而是把它放进接近实际工作的环境:模型需要读取项目、调用工具、执行代码、观察页面、接收测试结果,再根据反馈继续修改。训练目标也不再只是生成一段更符合标准答案的文本,而是让模型逐渐学会一条完整的工作闭环:
规划任务、采取行动、检查结果、发现问题,再决定下一步。
这也是Agent能力与普通生成能力之间最关键的区别。一次生成只需要给出答案,Agent则必须理解当前状态,选择工具,并根据外部环境返回的结果不断调整策略。

(图:Qwen3.8-Max扩展真实环境强化学习系统的三项关键机制)
为了扩大这种能力,Qwen3.8-Max公开了三项训练工程。
第一项是环境解耦。官方将任务、工作空间和Agent Harness拆成三个可以独立扩展的维度。第二项是统一奖励系统。代码是否执行成功、文本是否符合要求、视觉结果是否正确、Agent行为是否合理,被纳入同一套评价机制。

(图:Qwen3.8-Max在不同Agent Harness中的官方测试表现。该图主要用于说明其跨Harness训练与泛化方向。)
第三项是在线数据均衡。不同任务类型、难度、工作空间和Harness中的训练数据被动态配平,避免模型只在少数场景中表现出长程能力。


(Qwen3.8-Max 被要求从零创建 oh-my-cli 项目,并在十天级长程自动编程中构建一套自进化 harness。)
因此,Qwen3.8-Max真正强化的,模型在外部反馈中持续行动的能力。官方展示的16天自主开发、125小时科研复现和数百轮芯片优化的项目,本质上都依赖同一种机制:模型采取行动,环境返回结果,模型再根据结果进入下一轮执行。
这也解释了为什么“长程”不能只用运行时间衡量。一个任务持续十几个小时,可能意味着模型在有效修正,也可能意味着它陷入了重复读取、低收益修改和无效验证。真正需要验证的是,这套反馈循环能否把项目不断推向完成,而不是单纯让模型一直工作。
如果Max的Agent能力确实来自这种真实环境训练,那么它进入复杂项目后,应该表现出更强的持续推进、自我检查和错误修正能力。但同一套执行循环也可能带来更长的时间、更高的Token消耗,以及更难判断何时结束的问题。
接下来的实测,验证的正是这条执行闭环是否真正存在,以及它为了提高完成度,需要付出多大的代价。
