📅 数据说明(2026年9月1日):文中价格同步自阿里云官方 百炼模型价格页 与国际版 Model Studio Pricing(官方页面更新于 2026 年 8 月 31 日)。展示的均为标准刊例价,限时促销(如 Qwen3.7-Max 五折)单独标注;生产预算请以控制台实时价格为准。
一、百炼是怎么计费的
阿里云百炼(国际版称 Model Studio)是阿里的一站式大模型平台:通义千问 Qwen 全系列、DeepSeek、千问 VL 视觉、QwQ 推理、嵌入/重排、语音与图像生成,全部通过 OpenAI 兼容 API 调用。计费规则很简单:
- 按 Token 后付费:费用 = 输入 Token × 输入单价 + 输出 Token × 输出单价,单价按每百万 Token 标注。
- 阶梯计价:部分模型按单次请求输入 Token 总量分档,整次请求所有 Token 都按落入档位的单价计费。例如分 0–32K、32K–128K 两档,一次 10 万 Token 输入的请求全部按第二档计费。
- Batch 调用半价:支持 Batch 的模型,输入输出单价均为实时价的 50%,异步返回结果,适合离线任务。
- 上下文缓存:显式缓存创建按输入价 125% 计费,但缓存命中的输入 Token 仅约 10%。重复的系统提示词、长文档知识库能省 60–90% 输入费用。
- 闲时折扣:部分模型北京时间 22:00–次日 08:00 自动打折(无需报名),目前 Qwen3.7 系列夜间低至两折。
- 免费额度:新账号每个模型输入、输出各 100 万 Token,开通后 90 天有效;几十个模型合计约 7000 万免费 Token。国内部署在华北2(北京)发放,国际部署在新加坡发放。
二、国内版价格表(人民币,每百万 Token)
面向国内业务、部署在华北2(北京)的常用模型:
| 模型 | 输入单价 | 输出单价 | 备注 / 免费额度 |
|---|---|---|---|
| qwen-turbo(等同 qwen-turbo-2025-04-28) | ¥0.367 | ¥1.468 | Batch 半价 |
| qwen-plus(qwen-plus-2025-04-28 等) | ¥0.8 | ¥2 | 各 100 万 Token |
| qwen3.6-plus(≤32K 档) | ¥2 | ¥12(思考模式) | 各 100 万 Token |
| qwq-plus(仅思考模式) | ¥1.6 | ¥4 | 各 100 万 Token,90 天 |
| qwen-long(长文档) | ¥0.5 | ¥2 | 各 100 万 Token;Batch 半价 |
| qvq-plus(视觉推理) | ¥2 | ¥5 | 各 100 万 Token |
| qvq-max | ¥8 | ¥32 | 各 100 万 Token |
| qwen3-vl-flash(≤32K) | ¥0.15 | ¥1.5 | 32K–128K 档 ¥0.3/¥3;Batch 半价 |
来源:阿里云帮助中心 · 百炼模型价格。旗舰 Qwen3.8-Max 国际版统一价 $2/$6(约合 ¥14/¥43),国内专属部署价格以控制台为准。
三、国际版价格表(美元,每百万 Token)
海外业务走新加坡 International 部署,标准实时价:
| Model | Input ($/1M) | Output ($/1M) | 上下文 |
|---|---|---|---|
| Qwen3.8-Max(2026/8/3 GA 旗舰) | $2.00 统一价 | $6.00 统一价 | 1M |
| Qwen3.7-Max | $2.50 刊例 (五折 $1.25) | $7.50 刊例 (五折 $3.75) | 1M |
| Qwen3-Max | $1.2 → $2.4 → $3.0 | $6 → $12 → $15 | 262K(32K/128K 分档) |
| Qwen3.7-Plus | $0.48(>256K:$1.44) | $1.92(>256K:$5.76) | 1M |
| Qwen-Plus | 低至 $0.40 | 低至 $1.20 | 1M |
| Qwen-Flash | 低至 $0.05 | 低至 $0.40 | 1M |
| Qwen3.7-Flash | 约 $0.03–0.07 | 约 $0.13–0.20 | 1M |
| Qwen-Turbo(旧版停更) | 约 $0.05 | 约 $0.20 | 1M |
来源:Alibaba Cloud Model Studio Pricing(2026-08-31 更新)。Batch 支持的模型直接半价;缓存与闲时折扣见第四节。
四、选模型就是选成本:四档怎么挑
- 高并发简单任务(分类、打标、抽取、客服首轮分流):用 Qwen-Flash / qwen-turbo。1000 万输入 + 200 万输出 Token,Flash 国际版一天约 $1.3,国内 turbo 一个月仅几十元人民币。
- 主流业务主力(摘要、写作、RAG 问答、代码辅助):用 Qwen-Plus / Qwen3.7-Plus。1000 万输入 + 200 万输出,Qwen3.7-Plus 标准价约 $8.6/月——这是绝大多数生产应用的默认选择。
- Agent 与复杂推理(多步工具调用、代码库 Agent、数学):上 Qwen3.8-Max。1M 上下文统一价 $2/$6,没有长上下文涨价悬崖;同样 1000 万+200 万量级约 $32/月。
- 离线/夜间任务:Batch 一律半价;Qwen3.7 夜间(北京 22:00–08:00,恰好覆盖美西白天工作时间)低至两折。离线管道绝不该按高峰实时价跑。
- 同平台还能直接调 DeepSeek-V4-Flash / V4-Pro,不用换基础设施即可做供应商 A/B。
五、真实业务月费测算
| 业务场景 | 月调用量 | 推荐模型 | 预估月费 |
|---|---|---|---|
| 客服机器人,5 万次对话 | 2000 万输入 / 400 万输出 | Qwen-Flash | 约 $2.6(¥19) |
| 知识库 RAG 助手,10 万次查询 | 5000 万输入 / 1000 万输出 | Qwen3.7-Plus | 约 $43(¥310) |
| 编程 Agent,5000 个重任务 | 3000 万输入 / 1000 万输出 | Qwen3.8-Max | 约 $120(¥860) |
| 同上,改走 Batch 离线 | 3000 万输入 / 1000 万输出 | Qwen3.8-Max Batch | 约 $60(¥430) |
| 长文档批量处理 | 1 亿输入 / 500 万输出 | qwen-long(国内 ¥) | 约 ¥60($8) |
结论很清楚:除重度 Agent 场景外,绝大多数生产应用的大模型月开销在几十到几百元区间;而前期开发测试基本被 7000 万免费 Token 全额覆盖。
六、免费额度的准确规则
- 免费额度按模型发放:每个模型输入、输出各 100 万 Token。
- 有效期:百炼开通 / 模型发布 / 申请通过之日起 90 天(以较晚者为准)。
- 国内部署在华北2(北京)发放;国际部署仅新加坡地域有免费额度。
- 2026 年 4 月 15 日起,旧的开发者长期免费层已结束,现在统一为这套按模型的试用包。
七、再省一笔的三个杠杆
- 开上下文缓存:系统提示词和检索文档跨用户重复时,缓存命中输入仅约一折,RAG 类应用普遍能省 60–80% 输入费。
- 非实时任务走 Batch:评测、夜间摘要、批量处理五折,效果完全一致。
- 模型路由:Flash 处理简单意图,只把 5–10% 的难请求升级到 Plus/Max。「全程 Max」的应用通常浪费 80% 以上预算。
八、10 分钟上手
- 打开 百炼控制台 开通服务,免费 Token 自动到账;海外业务注册国际版并 领取 $200 信用额度。
- 创建 API Key,用现成的 OpenAI SDK 把 base_url 改成百炼兼容端点即可调用,代码几乎不用改。
- 默认从 Flash / Plus 起步,质量不够再升级 Max;提示词稳定后开启缓存。
- 需要 7×24 跑自建 Agent 或开源模型的,搭配一台 阿里云 ECS(新用户 38 元/年起) 即可部署网关与调度。
常见问题
Qwen API 免费吗?
托管 API 按 Token 付费,但新账号每个模型送 100 万 Token(合计约 7000 万),90 天有效。Qwen 多数模型同时开源权重,稳定高量业务也可以租 GPU 服务器自建,零 Token 费用。
Qwen3.8-Max 多少钱?
国际版每百万输入 Token $2、输出 $6,1M 上下文全窗口统一价;Batch 半价后实际约 $1/$3。国内价格以百炼控制台为准。
Qwen 和 DeepSeek 谁便宜?
DeepSeek-V4-Flash 输出价更低,Qwen-Plus 输入价略低;两者在百炼同一账号内都能调,建议直接 A/B——对多数业务,模型与任务的适配差异比价差更重要。
价格会经常变吗?
阿里随新模型发布持续降价:Qwen3.7-Max 目前五折、Flash 档不断下探。长期预算建议按刊例价估,促销当作额外空间。