阿里發佈 2.4T 參數旗艦模型 Qwen3.8-Max:16 天自主編程與開源權重引熱議

前言

2026 年 8 月 3 日,阿里巴巴在杭州正式發佈 Qwen 系列迄今最強模型 Qwen3.8-Max。這是一款總參數量達 2.4 萬億、單次推理激活約 950 億參數的稀疏混合專家(Sparse MoE)模型,支持最高 100 萬 Token 上下文,並在 Hacker News 上獲得 1090+ 分、近 600 條評論,成爲近期開發者社區最熱議的開源 AI 話題之一。

與此前 Qwen 系列「API 先行、權重滯後」的節奏不同,阿里宣佈將在 8 月第二週(約 8 月 10 日前後)於 Hugging Face 與 ModelScope 首次公開 Max 級模型權重,同時還將開源體量更小的 Qwen3.8-27B 檢查點。對關注長程自主編程 Agent 的開發者而言,這次發佈值得認真拆解。

模型概覽:2.4T MoE 與百萬上下文

Qwen3.8-Max 基於 Qwen 3.5 架構演進,採用 Sparse MoE + 混合注意力(Hybrid Attention) 設計:總參數 2.4T,但每次請求僅激活約 95B 參數,在規模與推理成本之間做平衡。

官方披露的核心規格如下:

項目 數值
總參數量 2.4 萬億(2.4T)
單次激活參數 約 950 億(95B)
上下文窗口 最高 100 萬 Token
最大輸入 991K Token(開啓 thinking 模式時爲 983K)
最大輸出 131K Token
模態 文本 / 圖像 / 視頻輸入,文本輸出

在公開榜單上,Qwen3.8-Max 在 Text Arena 排名第 5Vision Arena 排名第 2,前端編碼評測 Frontend Code Arena 排名第 4。阿里同期還上線了辦公 Agent 平臺 QwenWork,可在該平臺直接體驗模型能力。

16 天自主編程:oh-my-cli 案例

本次發佈最受開發者關注的,並非單純的 benchmark 分數,而是阿里披露的 長程自主軟件工程(Long-horizon Autonomous Software Engineering) 內部測試。

據官方博客與多家媒體報道,Qwen3.8-Max 在 無人工干預 的條件下,歷時約 16 天 從零搭建了一個名爲 oh-my-cli 的自進化 Agent 框架。模型自行建立了「用戶反饋 → 代碼生成 → 測試 → 預覽 → 日誌分析」的工程閉環,並持續迭代。

該項目的 GitHub 倉庫已公開:https://github.com/qwen-code-dev-bot/oh-my-cli

從 README 可見,oh-my-cli 是一個基於 Node.js 22 + TypeScript 的代碼 Agent CLI,核心特性包括:

  • 對接任意 OpenAI 兼容端點(含 DashScope)
  • 默認 fail-closed 的安全審批與命令策略
  • JSONL 持久化會話,支持 resume / compact / undo
  • 無頭 JSON 事件流,便於自動化集成
  • 附帶 Electron Desktop 與 Web Delivery Board

倉庫採用 Apache 2.0 許可證,並配有 AUTONOMY.md 自治契約文檔,說明其「自進化」並非營銷話術,而是有明確治理邊界的工程實踐。

需要強調的是:16 天自主編程是阿里內部測試結論,第三方尚未獨立復現;閱讀時應將其視爲能力方向展示,而非已驗證的通用生產力基準。

API 接入:OpenAI 兼容與 Claude Code 集成

Qwen3.8-Max 現已通過 阿里雲 Model Studio(QwenCloud)向全球開發者開放 API。官方支持 OpenAI Chat CompletionsAnthropic API 兩種協議,這意味着現有工具鏈改動極小——通常只需替換 base_urlmodel 即可接入。

據 the-decoder 等媒體報道,以下工具可直接對接:

  • Claude Code
  • Codex / Qoder CLI
  • Qwen Code
  • OpenClaw

模型還提供 reasoning_effort 參數,可在速度與子任務 thoroughness 之間切換三檔推理強度。

快速接入示例

以 OpenAI 兼容方式調用(需替換爲你的 API Key 與端點):

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "user", "content": "Review this Python module for edge cases."}
    ],
    extra_body={"reasoning_effort": "medium"},
)

print(response.choices[0].message.content)

若使用 Claude Code,一般只需在配置中指定 Anthropic 兼容端點與模型 ID,即可將 Qwen3.8-Max 作爲後端模型運行,無需重寫 Agent 邏輯。

定價與限流(官方模型頁)

MarkTechPost 援引阿里模型頁數據,Qwen3.8-Max API 定價約爲:

  • 輸入:$2 / 百萬 Token
  • 輸出:$6 / 百萬 Token
  • 緩存輸入:$0.25 / 百萬 Token

限流:200 萬 Token/分鐘1.5 萬次請求/分鐘。相較同檔閉源旗艦模型,價格有一定競爭力,但具體成本仍需結合任務長度與 reasoning 模式實測。

開源權重:Max 級首次開放

阿里明確表示,Qwen3.8-Max 權重將在發佈後的下一週(約 8 月 10 日前後)上線 Hugging Face 與 ModelScope。這是 Qwen 家族 首次對 Max 級模型開放權重

同時開源的還有 Qwen3.8-27B——更適合普通 GPU 集羣本地部署的檢查點。需要清醒認識的是:

  • 2.4T 全量權重屬於多節點數據中心級 artifact,個人工作站幾乎無法完整加載
  • 截至成稿時,開源許可證文件名、激活參數精確值等細節尚未全部公開
  • 對多數團隊,API 調用 + 27B 本地部署纔是更現實的組合

社區反響:HN 上的冷靜與期待

Hacker News 帖子「Qwen3.8-Max: A New Bar for Coding and Cowork」(ID: 49150470)獲得 1090 分與 594 條評論,討論集中在幾個方向:

  1. 16 天自主編程的可信度與可復現性——部分評論要求公開完整日誌與中間產物
  2. 2.4T MoE 開源對自託管生態的意義——有人期待類似 DeepSeek 的蒸餾與社區微調
  3. Claude Code 兼容降低了遷移成本——已有開發者分享替換端點後的初步體驗
  4. 中美模型差距——部分討論將 Qwen3.8-Max 與 Opus、GPT-5.x 等旗艦做橫向對比

整體而言,社區態度是「能力聲明令人印象深刻,但等待權重與第三方評測再下結論」。

對開發者的實操建議

若你正在評估 Qwen3.8-Max,可按以下路徑推進:

  1. 先走 API:在 Model Studio 註冊,用 OpenAI SDK 或 Claude Code 做小規模編碼 / Agent 任務驗證
  2. 關注 oh-my-cli:閱讀其 AUTONOMY.md 與 session JSONL 設計,理解長程 Agent 的工程閉環
  3. 權重發布後優先試 27B:本地可部署性遠好於 2.4T 全量 checkpoint
  4. 長上下文場景實測:百萬 Token 窗口對代碼庫級 RAG、長文檔分析有潛在價值,但需注意 latency 與費用
  5. 保持審慎:內部 benchmark 與 16 天案例是方向信號,生產環境仍需自有數據集壓測

小結

Qwen3.8-Max 的發佈,標誌着阿里在 超大規模 MoE百萬上下文長程自主 Agent 三條線上同時發力。16 天無人工干預構建 oh-my-cli 的案例、Max 級權重首次開源的承諾,以及 Claude Code / OpenAI 雙協議兼容,共同推高了開發者期待。

接下來一到兩週,權重落地、許可證細節與獨立評測將陸續揭曉。對關注 coding agent 與開源大模型的讀者而言,這無疑是 2026 年 8 月最值得跟蹤的技術事件之一。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜