前言¶
2026 年 8 月 3 日,阿里云官方正式发布 Qwen 3.8-Max,这是 Qwen 系列迄今能力最强的模型。与此前 Max 级模型仅提供 API 不同,阿里宣布将在下周于 Hugging Face 和 ModelScope 放出权重——这是 Qwen-Max 级别模型首次开源。
对开发者而言,这次发布有几个值得关注的点:2.4 万亿总参数、95B 激活的稀疏 MoE 架构,100 万 token 上下文,以及面向 Agent 编程与长程任务的能力升级。模型已在 QwenCloud 和 Vercel AI Gateway 上线,API 可立即调用;权重开源则预计在一周后落地。
本文基于阿里云官方博客与开发者社区报道,梳理已核实的技术规格、能力边界与接入方式。
核心规格:2.4T MoE 与 1M 上下文¶
Qwen 3.8-Max 基于 Qwen 3.5 架构演进,采用稀疏混合专家(Sparse MoE)与混合注意力机制。官方披露的关键指标如下:
- 总参数量:2.4 万亿(2.4T)
- 激活参数量:每次推理约 95B
- 上下文窗口:最高 100 万 token
- 模态:文本 + 视觉(多模态输入)
- 架构:稀疏 MoE,在规模与推理效率之间做平衡
在公开评测中,官方称 Qwen 3.8-Max 在 Text Arena 排名第 5、Vision Arena 排名第 2、Frontend Code Arena 排名第 4。这些排名来自阿里官方新闻稿,具体榜单细节以各 Arena 平台为准。
MoE 设计的意义在于:总参数量可以很大,但每次只激活一部分专家,推理成本相对可控。对于需要长上下文、复杂推理的 Agent 场景,1M token 窗口意味着整库代码、长文档、多轮对话可以放在同一次请求里处理,而不必频繁截断或分段。
首次开源 Max 级权重¶
此前 Qwen 开源系列以 Qwen2、Qwen2.5、Qwen3 等为主,Max 级旗舰长期仅通过 API 提供。Qwen 3.8-Max 是官方明确表态的首个将放出权重的 Max 级模型。
当前状态(截至 2026-08-04):
| 渠道 | 状态 | 说明 |
|---|---|---|
| QwenCloud API | 已上线 | 模型 ID:qwen3.8-max |
| 阿里云 Model Studio | 已上线 | 全球开发者可通过 API 调用 |
| Vercel AI Gateway | 已上线 | 模型 ID:alibaba/qwen3.8-max |
| Hugging Face | 未发布 | 官方称下周放出权重 |
| ModelScope | 未发布 | 官方称下周放出权重 |
对自托管、微调、私有化部署的团队来说,权重开源是本次发布的 headline。2.4T 规模的 MoE 模型对算力与存储要求极高(社区估算下载体量可能在 TB 级),落地前需要评估集群资源;但「Max 级可本地跑」本身会改变不少团队的技术选型。
Agent 编程与长程任务¶
官方博客用多个长程案例说明模型定位,核心不是「写个函数」,而是在无人工干预下完成多日、多步骤的端到端任务。
自主编程:oh-my-cli 项目¶
Qwen 3.8-Max 被要求从零创建 oh-my-cli 项目,并在 10 天以上长程运行中构建自进化 harness。据官方披露,截至 2026 年 7 月 30 日,约 16 天全自动运行后,仓库累计 265 次 commit、127 个 PR、151 个 issue。完整 trace 公开在 GitHub:qwen-code-dev-bot/oh-my-cli。
论文复现与改进¶
模型拿到论文《Unified Data Selection for LLM Reasoning》后,在无 starter code 的情况下约 5 天(~125 小时)自主复现实验,编写约 7600 行代码,并在 AIME24 等数学 benchmark 上超越原论文方法。
多模态竞赛¶
在 WWW2025 多模对话意图识别挑战(526 支人类队伍参赛)中,模型在 24 小时限制内独立完成方案,最终准确率 0.853,超过 87% 的人类队伍。这些案例来自官方测试,实际效果因任务而异,开发者宜自行评测。
对日常开发,更直接的落点是官方已给出与主流 Agent 工具的对接配置,包括 Claude Code、Codex、Qwen Code、OpenClaw、Qoder CLI 等。
如何接入:API 与 Gateway¶
1. QwenCloud(OpenAI 兼容)¶
在 home.qwencloud.com 获取 DASHSCOPE_API_KEY 后,可用 OpenAI SDK 调用。官方示例:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("DASHSCOPE_API_KEY"),
base_url=os.environ.get(
"DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
),
)
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
extra_body={"enable_thinking": True},
reasoning_effort="xhigh", # 可选:xhigh(默认)、medium、low
stream=True,
)
reasoning_effort 用于调节推理深度与成本:xhigh 适合复杂任务,low 偏向速度与成本。官方称 preserve_thinking 默认开启。
2. Claude Code¶
若已使用 Claude Code,可通过 Anthropic 兼容端点切换模型,无需改工作流:
npm install -g @anthropic-ai/claude-code
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<your_api_key>
claude
3. Vercel AI Gateway¶
Vercel AI Gateway 已支持该模型。若项目使用 Vercel AI SDK,将 model 改为 alibaba/qwen3.8-max 即可,Gateway 负责路由、用量统计与 failover。对已在 Vercel 上跑 coding agent 或需要图文混合输入的场景,迁移成本较低。
4. 等待 ModelScope / Hugging Face 权重¶
计划自托管的团队可关注 ModelScope 与 Hugging Face 上的 Qwen 官方账号。权重尚未发布,不宜提前写死部署脚本;发布后需按模型卡说明准备 MoE 推理框架与硬件。
定价与选型参考¶
据 QwenCloud 官方定价页及第三方汇总,API 价格约为:
- 输入:$2 / 百万 token
- 输出:$6 / 百万 token
1M 上下文按统一单价计费,长上下文任务需留意 token 用量。与闭源 API 相比,Max 级开源权重一旦落地,自托管在数据合规、批量推理等场景会有新选项;但 2.4T MoE 的部署门槛不低,多数团队短期内仍以 API 或 Gateway 为主。
小结¶
Qwen 3.8-Max 把 Qwen 旗舰能力推到了 2.4T MoE + 1M 上下文,并首次承诺开源 Max 级权重。对开发者:
- 现在就能用:QwenCloud、Model Studio、Vercel AI Gateway 均已提供 API。
- Agent 工具链已就绪:Claude Code、Codex、Qwen Code 等有官方配置示例。
- 下周关注权重:Hugging Face / ModelScope 开源后,自托管与微调才会真正放开。
建议先用 API 在自有 benchmark(编码、长文档、多模态 Agent)上跑一轮,再决定是否等权重做私有化。官方博客与 API 文档会持续更新,以 阿里云 Qwen 3.8-Max 发布文 为准。