前言¶
2026 年 8 月 3 日,阿里巴巴在杭州正式发布 Qwen 系列迄今最强模型 Qwen3.8-Max。这是一款总参数量达 2.4 万亿、单次推理激活约 950 亿参数的稀疏混合专家(Sparse MoE)模型,支持最高 100 万 Token 上下文,并在 Hacker News 上获得 1090+ 分、近 600 条评论,成为近期开发者社区最热议的开源 AI 话题之一。
与此前 Qwen 系列「API 先行、权重滞后」的节奏不同,阿里宣布将在 8 月第二周(约 8 月 10 日前后)于 Hugging Face 与 ModelScope 首次公开 Max 级模型权重,同时还将开源体量更小的 Qwen3.8-27B 检查点。对关注长程自主编程 Agent 的开发者而言,这次发布值得认真拆解。
模型概览:2.4T MoE 与百万上下文¶
Qwen3.8-Max 基于 Qwen 3.5 架构演进,采用 Sparse MoE + 混合注意力(Hybrid Attention) 设计:总参数 2.4T,但每次请求仅激活约 95B 参数,在规模与推理成本之间做平衡。
官方披露的核心规格如下:
| 项目 | 数值 |
|---|---|
| 总参数量 | 2.4 万亿(2.4T) |
| 单次激活参数 | 约 950 亿(95B) |
| 上下文窗口 | 最高 100 万 Token |
| 最大输入 | 991K Token(开启 thinking 模式时为 983K) |
| 最大输出 | 131K Token |
| 模态 | 文本 / 图像 / 视频输入,文本输出 |
在公开榜单上,Qwen3.8-Max 在 Text Arena 排名第 5、Vision Arena 排名第 2,前端编码评测 Frontend Code Arena 排名第 4。阿里同期还上线了办公 Agent 平台 QwenWork,可在该平台直接体验模型能力。
16 天自主编程:oh-my-cli 案例¶
本次发布最受开发者关注的,并非单纯的 benchmark 分数,而是阿里披露的 长程自主软件工程(Long-horizon Autonomous Software Engineering) 内部测试。
据官方博客与多家媒体报道,Qwen3.8-Max 在 无人工干预 的条件下,历时约 16 天 从零搭建了一个名为 oh-my-cli 的自进化 Agent 框架。模型自行建立了「用户反馈 → 代码生成 → 测试 → 预览 → 日志分析」的工程闭环,并持续迭代。
该项目的 GitHub 仓库已公开:https://github.com/qwen-code-dev-bot/oh-my-cli
从 README 可见,oh-my-cli 是一个基于 Node.js 22 + TypeScript 的代码 Agent CLI,核心特性包括:
- 对接任意 OpenAI 兼容端点(含 DashScope)
- 默认 fail-closed 的安全审批与命令策略
- JSONL 持久化会话,支持 resume / compact / undo
- 无头 JSON 事件流,便于自动化集成
- 附带 Electron Desktop 与 Web Delivery Board
仓库采用 Apache 2.0 许可证,并配有 AUTONOMY.md 自治契约文档,说明其「自进化」并非营销话术,而是有明确治理边界的工程实践。
需要强调的是:16 天自主编程是阿里内部测试结论,第三方尚未独立复现;阅读时应将其视为能力方向展示,而非已验证的通用生产力基准。
API 接入:OpenAI 兼容与 Claude Code 集成¶
Qwen3.8-Max 现已通过 阿里云 Model Studio(QwenCloud)向全球开发者开放 API。官方支持 OpenAI Chat Completions 与 Anthropic API 两种协议,这意味着现有工具链改动极小——通常只需替换 base_url 与 model 即可接入。
据 the-decoder 等媒体报道,以下工具可直接对接:
- Claude Code
- Codex / Qoder CLI
- Qwen Code
- OpenClaw
模型还提供 reasoning_effort 参数,可在速度与子任务 thoroughness 之间切换三档推理强度。
快速接入示例¶
以 OpenAI 兼容方式调用(需替换为你的 API Key 与端点):
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "user", "content": "Review this Python module for edge cases."}
],
extra_body={"reasoning_effort": "medium"},
)
print(response.choices[0].message.content)
若使用 Claude Code,一般只需在配置中指定 Anthropic 兼容端点与模型 ID,即可将 Qwen3.8-Max 作为后端模型运行,无需重写 Agent 逻辑。
定价与限流(官方模型页)¶
MarkTechPost 援引阿里模型页数据,Qwen3.8-Max API 定价约为:
- 输入:$2 / 百万 Token
- 输出:$6 / 百万 Token
- 缓存输入:$0.25 / 百万 Token
限流:200 万 Token/分钟,1.5 万次请求/分钟。相较同档闭源旗舰模型,价格有一定竞争力,但具体成本仍需结合任务长度与 reasoning 模式实测。
开源权重:Max 级首次开放¶
阿里明确表示,Qwen3.8-Max 权重将在发布后的下一周(约 8 月 10 日前后)上线 Hugging Face 与 ModelScope。这是 Qwen 家族 首次对 Max 级模型开放权重。
同时开源的还有 Qwen3.8-27B——更适合普通 GPU 集群本地部署的检查点。需要清醒认识的是:
- 2.4T 全量权重属于多节点数据中心级 artifact,个人工作站几乎无法完整加载
- 截至成稿时,开源许可证文件名、激活参数精确值等细节尚未全部公开
- 对多数团队,API 调用 + 27B 本地部署才是更现实的组合
社区反响:HN 上的冷静与期待¶
Hacker News 帖子「Qwen3.8-Max: A New Bar for Coding and Cowork」(ID: 49150470)获得 1090 分与 594 条评论,讨论集中在几个方向:
- 16 天自主编程的可信度与可复现性——部分评论要求公开完整日志与中间产物
- 2.4T MoE 开源对自托管生态的意义——有人期待类似 DeepSeek 的蒸馏与社区微调
- Claude Code 兼容降低了迁移成本——已有开发者分享替换端点后的初步体验
- 中美模型差距——部分讨论将 Qwen3.8-Max 与 Opus、GPT-5.x 等旗舰做横向对比
整体而言,社区态度是「能力声明令人印象深刻,但等待权重与第三方评测再下结论」。
对开发者的实操建议¶
若你正在评估 Qwen3.8-Max,可按以下路径推进:
- 先走 API:在 Model Studio 注册,用 OpenAI SDK 或 Claude Code 做小规模编码 / Agent 任务验证
- 关注 oh-my-cli:阅读其
AUTONOMY.md与 session JSONL 设计,理解长程 Agent 的工程闭环 - 权重发布后优先试 27B:本地可部署性远好于 2.4T 全量 checkpoint
- 长上下文场景实测:百万 Token 窗口对代码库级 RAG、长文档分析有潜在价值,但需注意 latency 与费用
- 保持审慎:内部 benchmark 与 16 天案例是方向信号,生产环境仍需自有数据集压测
小结¶
Qwen3.8-Max 的发布,标志着阿里在 超大规模 MoE、百万上下文 与 长程自主 Agent 三条线上同时发力。16 天无人工干预构建 oh-my-cli 的案例、Max 级权重首次开源的承诺,以及 Claude Code / OpenAI 双协议兼容,共同推高了开发者期待。
接下来一到两周,权重落地、许可证细节与独立评测将陆续揭晓。对关注 coding agent 与开源大模型的读者而言,这无疑是 2026 年 8 月最值得跟踪的技术事件之一。