发布次日再降价20%——输入0.8元/百万Token,训练成本暴降90%,编程能力对标DeepSeek V4 Pro
✅ 输入 ¥0.8/M Token ✅ 输出 ¥2.7/M Token ✅ 缓存命中 ¥0.1/M 🔥 比DeepSeek V4 Flash便宜67%以下为阿里云百炼平台官方价格,单位:人民币元/百万tokens。
| 计费项 | 调整前(8/26首发) | 调整后(8/27起) | 降幅 |
|---|---|---|---|
| 输入价格 | ¥1.0 | ¥0.8 | ↓20% |
| 输出价格 | ¥3.0 | ¥2.7 | ↓10% |
| 缓存命中 | — | ¥0.1 | — |
| 计费项 | 价格(美元/百万tokens) |
|---|---|
| 输入 | $0.15 |
| 输出 | $0.47 |
| 缓存命中 | $0.016 |
以下为2026年8月国内主流大模型API价格对比,单位:元/百万tokens。
| 模型 | 输入价格 | 输出价格 | 激活参数 | 上下文 |
|---|---|---|---|---|
| Qwen3.8-Flash 新 | ¥0.8 | ¥2.7 | 6B (MoE) | 1M |
| Qwen3.5-Flash (≤128K) | ¥0.8 | ¥4.8 | — | 1M |
| Qwen3.7-Flash | 约¥0.24 | 约¥0.95 | — | 128K |
| DeepSeek V4 Flash(高峰) | ¥3.0 | ¥9.0 | 13B | 128K |
| DeepSeek V4 Flash(低谷半价) | ¥1.5 | ¥4.5 | 13B | 128K |
| DeepSeek V4 Pro(高峰) | ¥9.0 | ¥27.0 | — | 128K |
| GLM-5.3-Flash | — | — | 18B (MoE) | — |
Qwen3.8-Flash(研发代号Qwen3.8-Flash-Next)是Qwen4架构的先导预览,采用了四项核心创新:
引入独特的Qwen Sparse Attention (QSA)机制,与GDN高效融合。GDN负责压缩历史信息,QSA选择关键上下文,在100万tokens高缓存命中场景中Prefill提速7.6倍、Decode提速4.9倍。
将传统Transformer的1条信息主通道拆分为4条并行分支,模型可动态决定读写信息,信息传递更高效,训练更稳定。
采用Muon+AdamW混合优化策略,重新拟合Scaling Law,消除batch warm-up过程,收敛效率和训练吞吐大幅提升。
据Qwen官方技术报告,Qwen3.8-Flash在以下基准测试中表现突出:
| 基准测试 | 测试场景 | 表现 |
|---|---|---|
| SWE-bench Pro | Agentic编程 | 62.5分,领先同类 |
| CoWorkBench | 长周期办公任务 | 领先DeepSeek V4 Flash |
| Toolathlon Verified | 真实工具调用 | 对标Claude Opus 4.6 |
| MathVision | 视觉数学推理 | 多模态强项 |
| AndroidWorld | 移动端Agent | 具身智能能力 |
| ERQA | 嵌入式推理 | 多模态理解 |
在14项评测中,基础模型(6B激活参数)取得8项最佳成绩。微调版本在代码、Agent和多模态任务上表现更强。
访问阿里云百炼控制台,新用户可获免费Token额度。Qwen3.8-Flash已首发上线千问AI平台。
进入百炼控制台 →通过Model Studio调用,新用户享免费额度。API兼容OpenAI格式,迁移成本低。
领取国际站$200免费额度 →Qwen3.8-Flash-Next(开源版本)权重已在Hugging Face和ModelScope开放下载,支持本地部署和微调。生产版本Qwen3.8-Flash在QwenCloud提供API服务。
Qwen3.8-Flash是MoE模型(125B总参数/6B激活),主打极致性价比和高并发;Qwen3.8-27B是Dense视觉语言模型(27B参数全部激活),适合需要深度推理的专业场景,输入3元/输出12元。
当请求命中上下文缓存时(如重复的系统提示、长文档前缀),缓存部分的输入tokens按0.1元/百万计费,相比标准输入0.8元节省87.5%。这对Agent、多轮对话、RAG等场景影响巨大。
Qwen3.8-Flash支持文本和图像输入(input_modalities: ["text", "image"]),可处理图表分析、文档OCR、视觉数学等任务。生产版本支持视频分析。
根据百炼文档,Qwen3.8系列限流为5000 RPM(每分钟请求数)和500万 TPM(每分钟tokens数),适合企业级高并发场景。