阿里旗下千問 AI 平台於 8 月 27 日正式推出 Qwen3-Max-Flash 模型,定位為多模態混合專家(MoE)架構,主打極致性價比。官方公佈的最新定價為:輸入每百萬 Tokens 收費 RMB¥0.80 (約 HK$0)、輸出每百萬 Tokens 收費 RMB¥2.70 (約 HK$2)、快取命中每百萬 Tokens 收費 RMB¥0.10 (約 HK$0)。
Qwen3-Max-Flash 採用全新混合注意力架構
Qwen3-Max-Flash 採用與過往千問大型模型截然不同的下一代(Next)架構,總參數量達千億級別,但每次推論僅激活 60 億(6B)參數,號稱刷新全球模型效率基準。在注意力機制方面,模型引入獨創的 QSA(Qwen Sparse Attention)稀疏注意力機制,與 GDN 形成高效融合的混合注意力架構,於高快取命中、1M Tokens 長上下文場景下,運算速度較傳統方案提升 8 倍以上,同時兼顧準確度。
在內部分層通訊方面,模型採用自研 Gated Residual 方法,把傳統 Transformer 單一資訊主通道拆分成 4 條獨立通道,讓模型按需求動態決定讀寫路徑,資訊傳遞更高效,訓練穩定性亦同步提升。此設計改變了過往單一通道造成的瓶頸,使大規模訓練時的梯度流通更為順暢。
51B N-gram Embedding 提升參數擴展效率
在參數擴展層面,模型額外引入 51B 的 N-gram Embedding 參數,為 Transformer 主幹提供高效的查表定位功能。該參數在每次 Token 計算時無需即時激活,僅以極低資源消耗「外掛」一個大規模記憶指南手冊,大幅提升模型參數擴展效率,並降低訓練成本。透過這種解耦設計,模型得以在維持推論速度的同時,把更多世界知識預載至靜態參數之中。
調參方面,Qwen3-Max-Flash 採取模型結構與後期優化協同推進的策略,令收斂效率及訓練吞吐量均顯著提升。綜合上述技術,新模型在編程、Agent 等真實任務場景中,能以更低單價提供高效推理服務,為企業級應用提供更具成本效益的選項。
| 項目 | 規格 |
|---|---|
| 架構類型 | 多模態混合專家(MoE) |
| 總參數量 | 千億級 |
| 激活參數 | 60 億(6B) |
| N-gram Embedding 參數 | 51B |
| 注意力機制 | QSA 稀疏注意力 + GDN 混合架構 |
| 長上下文速度提升 | 高快取命中 1M Tokens 場景下提升 8 倍以上 |
| 輸入價格 | RMB¥0.80 (約 HK$0) |
| 輸出價格 | RMB¥2.70 (約 HK$2) |
| 快取命中價格 | RMB¥0.10 (約 HK$0) |

