阿里发布 2.4T 参数旗舰模型 Qwen3.8-Max:16 天自主编程与开源权重引热议

前言

2026 年 8 月 3 日,阿里巴巴在杭州正式发布 Qwen 系列迄今最强模型 Qwen3.8-Max。这是一款总参数量达 2.4 万亿、单次推理激活约 950 亿参数的稀疏混合专家(Sparse MoE)模型,支持最高 100 万 Token 上下文,并在 Hacker News 上获得 1090+ 分、近 600 条评论,成为近期开发者社区最热议的开源 AI 话题之一。

与此前 Qwen 系列「API 先行、权重滞后」的节奏不同,阿里宣布将在 8 月第二周(约 8 月 10 日前后)于 Hugging Face 与 ModelScope 首次公开 Max 级模型权重,同时还将开源体量更小的 Qwen3.8-27B 检查点。对关注长程自主编程 Agent 的开发者而言,这次发布值得认真拆解。

模型概览:2.4T MoE 与百万上下文

Qwen3.8-Max 基于 Qwen 3.5 架构演进,采用 Sparse MoE + 混合注意力(Hybrid Attention) 设计:总参数 2.4T,但每次请求仅激活约 95B 参数,在规模与推理成本之间做平衡。

官方披露的核心规格如下:

项目 数值
总参数量 2.4 万亿(2.4T)
单次激活参数 约 950 亿(95B)
上下文窗口 最高 100 万 Token
最大输入 991K Token(开启 thinking 模式时为 983K)
最大输出 131K Token
模态 文本 / 图像 / 视频输入,文本输出

在公开榜单上,Qwen3.8-Max 在 Text Arena 排名第 5Vision Arena 排名第 2,前端编码评测 Frontend Code Arena 排名第 4。阿里同期还上线了办公 Agent 平台 QwenWork,可在该平台直接体验模型能力。

16 天自主编程:oh-my-cli 案例

本次发布最受开发者关注的,并非单纯的 benchmark 分数,而是阿里披露的 长程自主软件工程(Long-horizon Autonomous Software Engineering) 内部测试。

据官方博客与多家媒体报道,Qwen3.8-Max 在 无人工干预 的条件下,历时约 16 天 从零搭建了一个名为 oh-my-cli 的自进化 Agent 框架。模型自行建立了「用户反馈 → 代码生成 → 测试 → 预览 → 日志分析」的工程闭环,并持续迭代。

该项目的 GitHub 仓库已公开:https://github.com/qwen-code-dev-bot/oh-my-cli

从 README 可见,oh-my-cli 是一个基于 Node.js 22 + TypeScript 的代码 Agent CLI,核心特性包括:

  • 对接任意 OpenAI 兼容端点(含 DashScope)
  • 默认 fail-closed 的安全审批与命令策略
  • JSONL 持久化会话,支持 resume / compact / undo
  • 无头 JSON 事件流,便于自动化集成
  • 附带 Electron Desktop 与 Web Delivery Board

仓库采用 Apache 2.0 许可证,并配有 AUTONOMY.md 自治契约文档,说明其「自进化」并非营销话术,而是有明确治理边界的工程实践。

需要强调的是:16 天自主编程是阿里内部测试结论,第三方尚未独立复现;阅读时应将其视为能力方向展示,而非已验证的通用生产力基准。

API 接入:OpenAI 兼容与 Claude Code 集成

Qwen3.8-Max 现已通过 阿里云 Model Studio(QwenCloud)向全球开发者开放 API。官方支持 OpenAI Chat CompletionsAnthropic API 两种协议,这意味着现有工具链改动极小——通常只需替换 base_urlmodel 即可接入。

据 the-decoder 等媒体报道,以下工具可直接对接:

  • Claude Code
  • Codex / Qoder CLI
  • Qwen Code
  • OpenClaw

模型还提供 reasoning_effort 参数,可在速度与子任务 thoroughness 之间切换三档推理强度。

快速接入示例

以 OpenAI 兼容方式调用(需替换为你的 API Key 与端点):

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "user", "content": "Review this Python module for edge cases."}
    ],
    extra_body={"reasoning_effort": "medium"},
)

print(response.choices[0].message.content)

若使用 Claude Code,一般只需在配置中指定 Anthropic 兼容端点与模型 ID,即可将 Qwen3.8-Max 作为后端模型运行,无需重写 Agent 逻辑。

定价与限流(官方模型页)

MarkTechPost 援引阿里模型页数据,Qwen3.8-Max API 定价约为:

  • 输入:$2 / 百万 Token
  • 输出:$6 / 百万 Token
  • 缓存输入:$0.25 / 百万 Token

限流:200 万 Token/分钟1.5 万次请求/分钟。相较同档闭源旗舰模型,价格有一定竞争力,但具体成本仍需结合任务长度与 reasoning 模式实测。

开源权重:Max 级首次开放

阿里明确表示,Qwen3.8-Max 权重将在发布后的下一周(约 8 月 10 日前后)上线 Hugging Face 与 ModelScope。这是 Qwen 家族 首次对 Max 级模型开放权重

同时开源的还有 Qwen3.8-27B——更适合普通 GPU 集群本地部署的检查点。需要清醒认识的是:

  • 2.4T 全量权重属于多节点数据中心级 artifact,个人工作站几乎无法完整加载
  • 截至成稿时,开源许可证文件名、激活参数精确值等细节尚未全部公开
  • 对多数团队,API 调用 + 27B 本地部署才是更现实的组合

社区反响:HN 上的冷静与期待

Hacker News 帖子「Qwen3.8-Max: A New Bar for Coding and Cowork」(ID: 49150470)获得 1090 分与 594 条评论,讨论集中在几个方向:

  1. 16 天自主编程的可信度与可复现性——部分评论要求公开完整日志与中间产物
  2. 2.4T MoE 开源对自托管生态的意义——有人期待类似 DeepSeek 的蒸馏与社区微调
  3. Claude Code 兼容降低了迁移成本——已有开发者分享替换端点后的初步体验
  4. 中美模型差距——部分讨论将 Qwen3.8-Max 与 Opus、GPT-5.x 等旗舰做横向对比

整体而言,社区态度是「能力声明令人印象深刻,但等待权重与第三方评测再下结论」。

对开发者的实操建议

若你正在评估 Qwen3.8-Max,可按以下路径推进:

  1. 先走 API:在 Model Studio 注册,用 OpenAI SDK 或 Claude Code 做小规模编码 / Agent 任务验证
  2. 关注 oh-my-cli:阅读其 AUTONOMY.md 与 session JSONL 设计,理解长程 Agent 的工程闭环
  3. 权重发布后优先试 27B:本地可部署性远好于 2.4T 全量 checkpoint
  4. 长上下文场景实测:百万 Token 窗口对代码库级 RAG、长文档分析有潜在价值,但需注意 latency 与费用
  5. 保持审慎:内部 benchmark 与 16 天案例是方向信号,生产环境仍需自有数据集压测

小结

Qwen3.8-Max 的发布,标志着阿里在 超大规模 MoE百万上下文长程自主 Agent 三条线上同时发力。16 天无人工干预构建 oh-my-cli 的案例、Max 级权重首次开源的承诺,以及 Claude Code / OpenAI 双协议兼容,共同推高了开发者期待。

接下来一到两周,权重落地、许可证细节与独立评测将陆续揭晓。对关注 coding agent 与开源大模型的读者而言,这无疑是 2026 年 8 月最值得跟踪的技术事件之一。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜