前言¶
2026 年 8 月 3 日,阿里雲官方正式發佈 Qwen 3.8-Max,這是 Qwen 系列迄今能力最強的模型。與此前 Max 級模型僅提供 API 不同,阿里宣佈將在下週於 Hugging Face 和 ModelScope 放出權重——這是 Qwen-Max 級別模型首次開源。
對開發者而言,這次發佈有幾個值得關注的點:2.4 萬億總參數、95B 激活的稀疏 MoE 架構,100 萬 token 上下文,以及面向 Agent 編程與長程任務的能力升級。模型已在 QwenCloud 和 Vercel AI Gateway 上線,API 可立即調用;權重開源則預計在一週後落地。
本文基於阿里雲官方博客與開發者社區報道,梳理已覈實的技術規格、能力邊界與接入方式。
核心規格:2.4T MoE 與 1M 上下文¶
Qwen 3.8-Max 基於 Qwen 3.5 架構演進,採用稀疏混合專家(Sparse MoE)與混合注意力機制。官方披露的關鍵指標如下:
- 總參數量:2.4 萬億(2.4T)
- 激活參數量:每次推理約 95B
- 上下文窗口:最高 100 萬 token
- 模態:文本 + 視覺(多模態輸入)
- 架構:稀疏 MoE,在規模與推理效率之間做平衡
在公開評測中,官方稱 Qwen 3.8-Max 在 Text Arena 排名第 5、Vision Arena 排名第 2、Frontend Code Arena 排名第 4。這些排名來自阿里官方新聞稿,具體榜單細節以各 Arena 平臺爲準。
MoE 設計的意義在於:總參數量可以很大,但每次只激活一部分專家,推理成本相對可控。對於需要長上下文、複雜推理的 Agent 場景,1M token 窗口意味着整庫代碼、長文檔、多輪對話可以放在同一次請求裏處理,而不必頻繁截斷或分段。
首次開源 Max 級權重¶
此前 Qwen 開源系列以 Qwen2、Qwen2.5、Qwen3 等爲主,Max 級旗艦長期僅通過 API 提供。Qwen 3.8-Max 是官方明確表態的首個將放出權重的 Max 級模型。
當前狀態(截至 2026-08-04):
| 渠道 | 狀態 | 說明 |
|---|---|---|
| QwenCloud API | 已上線 | 模型 ID:qwen3.8-max |
| 阿里雲 Model Studio | 已上線 | 全球開發者可通過 API 調用 |
| Vercel AI Gateway | 已上線 | 模型 ID:alibaba/qwen3.8-max |
| Hugging Face | 未發佈 | 官方稱下週放出權重 |
| ModelScope | 未發佈 | 官方稱下週放出權重 |
對自託管、微調、私有化部署的團隊來說,權重開源是本次發佈的 headline。2.4T 規模的 MoE 模型對算力與存儲要求極高(社區估算下載體量可能在 TB 級),落地前需要評估集羣資源;但「Max 級可本地跑」本身會改變不少團隊的技術選型。
Agent 編程與長程任務¶
官方博客用多個長程案例說明模型定位,核心不是「寫個函數」,而是在無人工干預下完成多日、多步驟的端到端任務。
自主編程:oh-my-cli 項目¶
Qwen 3.8-Max 被要求從零創建 oh-my-cli 項目,並在 10 天以上長程運行中構建自進化 harness。據官方披露,截至 2026 年 7 月 30 日,約 16 天全自動運行後,倉庫累計 265 次 commit、127 個 PR、151 個 issue。完整 trace 公開在 GitHub:qwen-code-dev-bot/oh-my-cli。
論文復現與改進¶
模型拿到論文《Unified Data Selection for LLM Reasoning》後,在無 starter code 的情況下約 5 天(~125 小時)自主復現實驗,編寫約 7600 行代碼,並在 AIME24 等數學 benchmark 上超越原論文方法。
多模態競賽¶
在 WWW2025 多模對話意圖識別挑戰(526 支人類隊伍參賽)中,模型在 24 小時限制內獨立完成方案,最終準確率 0.853,超過 87% 的人類隊伍。這些案例來自官方測試,實際效果因任務而異,開發者宜自行評測。
對日常開發,更直接的落點是官方已給出與主流 Agent 工具的對接配置,包括 Claude Code、Codex、Qwen Code、OpenClaw、Qoder CLI 等。
如何接入:API 與 Gateway¶
1. QwenCloud(OpenAI 兼容)¶
在 home.qwencloud.com 獲取 DASHSCOPE_API_KEY 後,可用 OpenAI SDK 調用。官方示例:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("DASHSCOPE_API_KEY"),
base_url=os.environ.get(
"DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
),
)
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
extra_body={"enable_thinking": True},
reasoning_effort="xhigh", # 可選:xhigh(默認)、medium、low
stream=True,
)
reasoning_effort 用於調節推理深度與成本:xhigh 適合複雜任務,low 偏向速度與成本。官方稱 preserve_thinking 默認開啓。
2. Claude Code¶
若已使用 Claude Code,可通過 Anthropic 兼容端點切換模型,無需改工作流:
npm install -g @anthropic-ai/claude-code
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<your_api_key>
claude
3. Vercel AI Gateway¶
Vercel AI Gateway 已支持該模型。若項目使用 Vercel AI SDK,將 model 改爲 alibaba/qwen3.8-max 即可,Gateway 負責路由、用量統計與 failover。對已在 Vercel 上跑 coding agent 或需要圖文混合輸入的場景,遷移成本較低。
4. 等待 ModelScope / Hugging Face 權重¶
計劃自託管的團隊可關注 ModelScope 與 Hugging Face 上的 Qwen 官方賬號。權重尚未發佈,不宜提前寫死部署腳本;發佈後需按模型卡說明準備 MoE 推理框架與硬件。
定價與選型參考¶
據 QwenCloud 官方定價頁及第三方彙總,API 價格約爲:
- 輸入:$2 / 百萬 token
- 輸出:$6 / 百萬 token
1M 上下文按統一單價計費,長上下文任務需留意 token 用量。與閉源 API 相比,Max 級開源權重一旦落地,自託管在數據合規、批量推理等場景會有新選項;但 2.4T MoE 的部署門檻不低,多數團隊短期內仍以 API 或 Gateway 爲主。
小結¶
Qwen 3.8-Max 把 Qwen 旗艦能力推到了 2.4T MoE + 1M 上下文,並首次承諾開源 Max 級權重。對開發者:
- 現在就能用:QwenCloud、Model Studio、Vercel AI Gateway 均已提供 API。
- Agent 工具鏈已就緒:Claude Code、Codex、Qwen Code 等有官方配置示例。
- 下週關注權重:Hugging Face / ModelScope 開源後,自託管與微調纔會真正放開。
建議先用 API 在自有 benchmark(編碼、長文檔、多模態 Agent)上跑一輪,再決定是否等權重做私有化。官方博客與 API 文檔會持續更新,以 阿里雲 Qwen 3.8-Max 發佈文 爲準。