TL;DR
Qwen 3.8 Max 是一個以文字輸出為主的模型,設計用於程式開發、長上下文分析、多模態輸入、推理與代理工作流程。其正式生產模型 ID 為 qwen3.8-max。
截至 2026 年 8 月 3 日版本的關鍵規格與標準牌價為:
- 標準輸入: 每 100 萬詞元 $2
- 標準輸出: 每 100 萬詞元 $6
- 隱式快取的輸入: 每 100 萬詞元 $0.25
- 顯式快取建立: 每 100 萬詞元 $2.50
- 顯式快取讀取: 每 100 萬詞元 $0.17
- 上下文視窗: 100 萬詞元
- 最大輸入: 不啟用推理 991K 詞元,啟用推理 983K 詞元
- 最大輸出: 131K 詞元
- 最大推理長度: 262K 詞元
- 輸入: 文字、圖片與影片
- 輸出: 文字
在此摘要的已發布定價中,未另設長上下文的單位價格分層。大型提示之所以成本較高,是因為包含更多詞元,而不是因為跨越某個上下文門檻後單位價格改變。
重要的生產指標不是每百萬詞元的價格,而是包含輸出與推理用量、工具呼叫、重試、回退與人工審查在內的「每個已接受任務的成本」。
開發者可透過 CometAPI 的相容 OpenAI 工作流程評估受支援的 Qwen 模型。在正式上線前,請於 Qwen 3.8 Max API pricing page 確認目前的模型可用性、路由定價、限制與工具收費,因為可用性與促銷條款可能變動。
1. What is the Qwen 3.8 Max API model ID?
正式生產模型 ID 為:
qwen3.8-max
請將模型 ID 變更視為軟體遷移,而非簡單的字串替換。預覽與生產端點在預設值、錯誤行為、推理控制、結構化輸出處理、延遲與使用情況回報上可能不同。
最小的相容 OpenAI 請求樣式可能如下:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="YOUR_COMETAPI_BASE_URL"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "system", "content": "Return concise, verifiable answers."},
{"role": "user", "content": "Review this migration plan for production risks."}
]
)
print(response.choices[0].message.content)
print(response.usage)
請根據 CometAPI 的最新文件檢查確切端點、支援參數與模型可用性。不要假設所有供應商都以相同名稱暴露每一個原生參數。
2. How much does Qwen 3.8 Max cost?
標準價格為每 100 萬輸入詞元 $2、每 100 萬輸出詞元 $6。
基本估算為:
Request cost =
(input tokens ÷ 1,000,000 × $2)
+ (output-billed tokens ÷ 1,000,000 × $6)
+ cache charges
+ tool charges
這僅是詞元層級的估算。生產環境中的請求還可能因重試、回退模型、Web 搜尋、圖像搜尋、驗證與人工審查而產生成本。
Example: medium-sized agent request
假設某代理使用 100,000 輸入詞元與 10,000 計費輸出詞元:
Input: 100,000 ÷ 1,000,000 × $2 = $0.20
Output: 10,000 ÷ 1,000,000 × $6 = $0.06
Total token cost: $0.26
此例不含工具呼叫與重試。
Example: long-document analysis
若為 800,000 輸入詞元與 20,000 計費輸出詞元:
Input: 800,000 ÷ 1,000,000 × $2 = $1.60
Output: 20,000 ÷ 1,000,000 × $6 = $0.12
Total token cost: $1.72
因此,1M 詞元的上下文視窗並不代表每次請求成本固定。你需為實際處理的詞元付費,並受供應商的計量規則影響。
3. Is there a higher price for long-context requests?
所述的 Qwen 3.8 Max 定價未包含單獨的長上下文分層。發送 800K 詞元比 80K 詞元成本更高,是因為處理了十倍的輸入詞元——而不是因為在某個門檻後單位價格改變。
請勿混淆下列三種限制:
- 上下文視窗: 模型總容量,為 100 萬詞元。
- 最大輸入: 不啟用推理最多 991K 詞元;啟用推理最多 983K 詞元。
- 最大輸出: 最多 131K 詞元。
標示的上下文視窗並非保證應用可始終輸入恰好 100 萬提示詞元。訊息格式、系統指令、推理設定、工具定義、保留輸出容量與供應商層級的約束都可能降低可用的實際輸入額度。
生產系統應在文件最大值之下自行設定詞元上限。請用實際負載測試,而非依賴與目標模型無關的分詞器估算。
4. Why can reasoning make a short answer expensive?
Qwen 3.8 Max 支援推理,其最大推理長度為 262K 詞元。當啟用推理時,可見的簡短答案並不一定代表輸出用量低。
例如,應用可能顯示 500 詞元的結論,但 API 會記錄由推理帶來的顯著更多的輸出相關用量。僅依可見回覆監控成本將低估帳單。
請以 API 回傳的使用量欄位作為準則:
usage = response.usage
print(usage)
請記錄完整的使用量物件,因為供應商可能分別回報可見完成詞元、推理詞元、快取詞元與總詞元。請確認你所使用路由是如何計費每一個欄位。
推理應作為品質與成本的平衡控制。它對困難的程式變更、多步規劃與複雜分析可能很有價值,但對分類、抽取或簡單改寫則未必需要。
5. How does Qwen 3.8 Max cache pricing work?
快取費率如下:
| 快取操作 | 每 1M 詞元的價格 |
|---|---|
| 隱式快取的輸入 | $0.25 |
| 顯式快取建立 | $2.50 |
| 顯式快取讀取 | $0.17 |
快取在重用大型且穩定的前綴時最有用。常見候選包含:
- 系統提示與政策指令
- 跨多次程式開發輪次共用的版本庫快照
- 穩定的工具定義
- 產品型錄或技術文件
- 對同一文件集的重複分析
- 具有大型共享歷史的多輪會話
顯式快取損益平衡示例
為 300,000 詞元建立快取的成本為:
300,000 ÷ 1,000,000 × $2.50 = $0.75
讀取一次相同的快取內容成本為:
300,000 ÷ 1,000,000 × $0.17 = $0.051
若將這 300,000 詞元作為標準輸入處理,每次請求成本為 $0.60。支付建立成本後,重複讀取可快速變得更經濟。實際損益平衡取決於快取壽命、適用規則、失效機制、供應商行為,以及整個前綴是否都適用快取費率。
請勿不加選擇地建立快取。若上下文頻繁變更,可能產生快取建立費用,卻沒有足夠讀取次數來回收成本。
請追蹤:
cache savings = uncached equivalent cost
- cache creation cost
- cache read cost
6. What do multimodal requests cost?
Qwen 3.8 Max 接受文字、圖片與影片輸入並產出文字輸出。這使其適用於螢幕截圖分析、文件理解、介面除錯、目視檢查與基於影片的工作流程。
然而,僅以每 100 萬詞元 $2 的輸入費率,無法預測圖片或影片請求的成本。供應商必須將多模態內容轉換為可計費單位,且可能有前處理或尺寸限制。
在編列預算前,請測試具代表性的檔案並檢視回傳的使用量欄位。根據下列變數衡量成本:
- 圖片尺寸與張數
- 影片時長或取樣影格
- 隨附的文字上下文
- 推理設定
- 輸出長度
- 重試率
除非官方發布檢查點與授權,請勿宣稱該模型可下載、開源權重或自我託管。此處討論的 API 能力並不等於檢查點可用。
7. How do built-in tools affect the bill?
Web 搜尋與圖像搜尋可能在詞元用量之外增加工具費用。當代理進行多次搜尋、重試寬泛查詢,或將大型搜尋結果回填上下文時,工具呼叫支出將變得重要。
較為現實的計算公式為:
Total request cost =
model input
+ model output and reasoning usage
+ cache operations
+ Web Search calls
+ Image Search calls
+ retries and fallbacks
工具價格、促銷、配額與可用性具有時效性。請驗證目前的路由收費,而非將舊促銷數字複製到生產預測。
請為每個任務設定搜尋呼叫、推理長度、重試次數與總支出上限。若無上限,代理迴圈可能將低詞元價格轉變為高昂的任務成本。
8. Qwen 3.8 Max vs Qwen 3.7 Max: which should you use?
不應將 Qwen 3.8 Max 視為普遍更佳。正確選擇取決於已接受輸出比率、延遲、運營穩定性與總任務成本。
在 Qwen 3.7 Max 已達成品質與延遲目標的工作流中維持其使用。對困難的程式開發、多模態分析、長上下文作業或代理任務,測試 Qwen 3.8 Max,觀察其是否能透過更高的一次通過品質來減少重試與審查。
同時運行兩個模型,並保持以下一致:
- 評估提示與資料集
- 系統指令
- 工具綱要
- 可對比的推理設定
- 驗證器
- 重試與回退策略
- 延遲量測方法
- 人工審查標準
衡量的不僅是詞元成本:
| 指標 | 為何重要 |
|---|---|
| 一次通過接受率 | 顯示較高品質是否降低重試 |
| 每個已接受任務的成本 | 結合模型與運營成本 |
| P50 與 P95 延遲 | 捕捉典型與尾端表現 |
| 結構化輸出有效性 | 對自動化管線很重要 |
| 工具呼叫成功率 | 監測代理整合失敗 |
| 人工更正時間 | 可能主導模型詞元節省 |
| 錯誤與逾時率 | 決定生產可靠性 |
最有用的比較是:
Cost per accepted task =
(model tokens + tool calls + retries + fallback spend + review cost)
÷ accepted outputs
若某模型能產生更多已接受結果,即便每次請求價格較高,仍可能更便宜。相反地,對簡單任務而言,較新的模型可能增加成本卻未帶來價值。
9. What should a Qwen 3.8 Max migration test include?
請採用分階段遷移,而非一次性切換所有流量。
API compatibility
- 在測試環境將模型 ID 替換為
qwen3.8-max。 - 確認驗證、端點、串流與逾時行為。
- 以你的實際 JSON 綱要驗證結構化輸出。
- 重新測試工具名稱、描述、引數與結果訊息。
Reasoning and usage
- 確認推理的預設值與可用控制。
- 比較可見輸出長度與 API 回報的使用量。
- 為高推理需求的工作新增限制。
- 更新成本看板以包含快取與推理欄位。
Context and multimodal payloads
- 測試接近預期營運上限的真實長提示。
- 預留足夠空間給輸出與工具結果。
- 驗證圖片與影片的格式、尺寸與失敗模式。
- 測試被截斷、損壞與不支援的負載。
Reliability
- 測量 P50、P95 與 P99 延遲。
- 記錄速率限制、逾時與伺服器錯誤行為。
- 驗證在工具可能產生副作用時的重試冪等性。
- 在新路由穩定前保留回退路徑。
Quality
- 回放具代表性的生產樣本。
- 包含困難與先前失敗案例。
- 比較相同的驗證器與人工審查分數。
- 按任務類型分開品質,而非報告單一平均值。
自影子流量或小比例滾動開始。僅在品質、支出與延遲都維持在預先定義門檻內時擴大。
10. What is a practical model-routing strategy?
單一模型策略很少是最省成本的設計。
針對簡單的分類、抽取、格式化與常規支援請求,使用較低成本或較低延遲的模型。對已通過評估的工作流維持 Qwen 3.7 Max。將困難的程式開發、長上下文、多模態或多步代理任務路由到 Qwen 3.8 Max。
基本路由器可考量:
if task is simple and latency-sensitive:
use lower-cost model
elif Qwen 3.7 Max already meets acceptance target:
use Qwen 3.7 Max
elif task needs difficult reasoning, long context, or multimodal input:
use Qwen 3.8 Max
else:
run a controlled fallback policy
路由決策應基於量測結果,而非模型的生成標籤。
FAQs
Is the Qwen 3.8 Max context window exactly 1 million input tokens?
不是。標示的上下文視窗為 100 萬詞元,而最大輸入在不啟用推理時為 991K、啟用推理時為 983K。考量格式、工具、輸出保留與供應商約束後,實際容量可能更低。
Does Qwen 3.8 Max return images or video?
不會。它接受文字、圖片與影片輸入,但輸出模態為文字。
Are reasoning tokens free?
請勿做此假設。即便可見答案很短,推理仍可能帶來大量輸出相關用量。請檢視 API 使用量欄位並確認目前的計費規則。
Is explicit caching always cheaper?
不一定。根據此處摘要的定價,快取建立為每 100 萬詞元 $2.50。當穩定內容有足夠的後續讀取次數時才有利。
Can Qwen 3.8 Max replace Qwen 3.7 Max without testing?
不建議。請在遷移生產流量前,重新測試綱要、工具、推理行為、延遲、使用量回報、多模態負載、錯誤與任務層級品質。
Can I use Qwen 3.8 Max through CometAPI?
CometAPI 提供相容 OpenAI 的工作流程以支援模型。部署前請至 the current Qwen 3.8 Max page 確認可用性、路由定價、參數與限制。
Practical conclusion
Qwen 3.8 Max 結合 1M 詞元上下文視窗、可選的長推理、多模態輸入與文字輸出,並具標準定價每 100 萬輸入詞元 $2、每 100 萬輸出詞元 $6。這些標題數字有用,但本身不足以決定生產經濟性。
請以每個已接受任務的成本作為決策核心。記錄輸入、輸出、推理與快取用量;加上工具呼叫、重試、回退與審查時間;再在相同工作負載上比較 Qwen 3.8 Max 與 Qwen 3.7 Max。
在 CometAPI 的實務評估中,請先用小型且具代表性的資料集透過相容 OpenAI 的 API 測試,同時測試未快取與已快取的請求,並限制推理與工具使用。在擴大規模前確認目前的模型可用性與路由定價,尤其是可能改變的促銷、配額或工具費用。