aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型RESEARCH BRIEF

Qwen3.8

旗舰能力走向开放权重

IN A NUTSHELL

Qwen3.8 将旗舰级能力扩展到开放权重路线,提供超大 MoE 与 27B 版本,强调编程、专业工作和长程任务完成。除模型规模,还值得跟踪推理强度控制与多轮思考上下文保留。

01

方法与关键变化

发布沿用 Qwen3.5 架构基础,将能力改进集中到计划、环境反馈和多步骤执行。介绍仓库提供生态接入说明,详细数值与模型配置应查看各自模型卡。

接口允许调整 reasoning_effort,并通过 preserve_thinking 保留历史思考上下文;这些选项改变计算预算与多轮行为,比较模型时应固定配置。

02

实验与证据

8 月 12 日发布 2.4T-A95B,8 月 14 日发布 27B。官方评测与部署示例按型号分开提供;不能拿旗舰分数代表 27B,也不能将介绍仓库许可证等同于全部权重许可。

03

开放情况与使用许可

旗舰 2.4T-A95B 模型卡采用 qwen3.8-max 许可,不能用介绍仓库的 Apache-2.0 许可替代权重许可。27B 发布于 8 月 14 日。

LICENSE旗舰:Qwen3.8-Max License

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

可自行部署使能力提升能被放进同一套工具环境里研究。对长任务而言,开放模型的意义不仅是低单价,还在于能固定版本、检查上下文策略,并区分模型本身与代理框架的贡献。

反方 · 哪些结论还不够

系列内不同规模的成绩不能相互代用。更长的思考预算可能提高成功率,也可能放大延迟与错误工具调用;只看最高分会掩盖完成一个有效任务的真实成本。

综合判断

对已有本地部署需求的团队值得纳入对照,但选型应依据自身任务的成功率—成本曲线,不能只凭旗舰型号排名。

我会先做的验证

同一批有隐藏验收标准的任务,固定工具权限与上下文,改变型号和推理预算;记录有效完成率、总时长、失败返工与每个成功任务成本。

继续探索大模型