Qwen3.8-Flash 深度评测

发布次日再降价20%——输入0.8元/百万Token,训练成本暴降90%,编程能力对标DeepSeek V4 Pro

✅ 输入 ¥0.8/M Token ✅ 输出 ¥2.7/M Token ✅ 缓存命中 ¥0.1/M 🔥 比DeepSeek V4 Flash便宜67%
免费领取百炼Token → ECS 99元/年起

📌 30秒核心要点

  • 发布即降价:Qwen3.8-Flash于8月26日发布,首发价输入1元/输出3元;8月27日12时立即下调至输入0.8元、输出2.7元(每百万tokens)
  • 架构革命:125B总参数MoE模型,每token仅激活6B,附加51B N-gram嵌入层,训练成本仅为Qwen3.7-Plus的1/9(降低约89%)
  • 性能对标:SWE-bench Pro编程基准达62.5分,在14项评测中8项领先,能力对标DeepSeek V4 Flash和Claude Opus 4.6
  • 超长上下文:原生支持262K tokens,通过YaRN扩展至100万tokens;支持文本、图像、视频多模态输入
  • 极致缓存价:缓存命中仅0.1元/百万tokens,非常适合Agent、长对话等高频场景
👉 正在选云服务器? 阿里云新客1折特惠 腾讯云爆款2折 全部优惠汇总

💰 最新价格表(2026年8月27日生效)

以下为阿里云百炼平台官方价格,单位:人民币元/百万tokens。

计费项调整前(8/26首发)调整后(8/27起)降幅
输入价格¥1.0¥0.8↓20%
输出价格¥3.0¥2.7↓10%
缓存命中¥0.1

国际站价格(Model Studio)

计费项价格(美元/百万tokens)
输入$0.15
输出$0.47
缓存命中$0.016
💡 实际成本示例:一个日均100万次调用的AI客服应用,每次平均输入2000 tokens、输出500 tokens,使用Qwen3.8-Flash的日成本约为:
输入:100万 × 2000 × ¥0.8/100万 = ¥1600
输出:100万 × 500 × ¥2.7/100万 = ¥1350
日总成本约¥2950(约$415),而使用DeepSeek V4 Flash高峰时段需约¥9000/天。

⚔️ 竞品价格横评

以下为2026年8月国内主流大模型API价格对比,单位:元/百万tokens。

模型输入价格输出价格激活参数上下文
Qwen3.8-Flash ¥0.8¥2.76B (MoE)1M
Qwen3.5-Flash (≤128K)¥0.8¥4.81M
Qwen3.7-Flash约¥0.24约¥0.95128K
DeepSeek V4 Flash(高峰)¥3.0¥9.013B128K
DeepSeek V4 Flash(低谷半价)¥1.5¥4.513B128K
DeepSeek V4 Pro(高峰)¥9.0¥27.0128K
GLM-5.3-Flash18B (MoE)
关键发现:
  • Qwen3.8-Flash输出价格比DeepSeek V4 Flash高峰便宜70%(¥2.7 vs ¥9.0)
  • 即使DeepSeek低谷半价,Qwen3.8-Flash仍便宜40%
  • 相比Qwen3.5-Flash,输出价格降低44%(¥2.7 vs ¥4.8),且原生支持1M上下文
  • API价格仅为GLM-5.3的十分之一,限时折扣阶段更达二十分之一

🏗️ 技术架构解析

Qwen3.8-Flash(研发代号Qwen3.8-Flash-Next)是Qwen4架构的先导预览,采用了四项核心创新:

1. MoE混合专家架构

2. QSA稀疏注意力 + GDN混合架构

引入独特的Qwen Sparse Attention (QSA)机制,与GDN高效融合。GDN负责压缩历史信息,QSA选择关键上下文,在100万tokens高缓存命中场景中Prefill提速7.6倍、Decode提速4.9倍。

3. Gated Residual门控残差

将传统Transformer的1条信息主通道拆分为4条并行分支,模型可动态决定读写信息,信息传递更高效,训练更稳定。

4. Muon优化器

采用Muon+AdamW混合优化策略,重新拟合Scaling Law,消除batch warm-up过程,收敛效率和训练吞吐大幅提升。

成果:训练成本仅为Qwen3.7-Plus(397B参数/激活17B)的约1/9(降低89%),但在编程和办公任务上表现更优。

📊 性能基准测试

据Qwen官方技术报告,Qwen3.8-Flash在以下基准测试中表现突出:

基准测试测试场景表现
SWE-bench ProAgentic编程62.5分,领先同类
CoWorkBench长周期办公任务领先DeepSeek V4 Flash
Toolathlon Verified真实工具调用对标Claude Opus 4.6
MathVision视觉数学推理多模态强项
AndroidWorld移动端Agent具身智能能力
ERQA嵌入式推理多模态理解

在14项评测中,基础模型(6B激活参数)取得8项最佳成绩。微调版本在代码、Agent和多模态任务上表现更强。

🎯 适用场景

Qwen3.8-Flash特别适合:
  • AI编程助手:SWE-bench Pro 62.5分,支持代码仓库级理解(1M上下文)
  • AI Agent/工具调用:原生支持parallel_tool_calls,长周期任务成本极低
  • 智能客服/对话:缓存命中0.1元/M,长对话综合成本极低
  • 文档分析/RAG:100万tokens上下文可处理数百页文档,缓存加速8倍
  • 多模态应用:支持文本+图像+视频输入,视觉数学和图表理解
  • 高并发批量处理:5000 RPM / 500万TPM限流,适合大规模部署

🚀 如何开始使用

方式一:阿里云百炼平台(国内)

访问阿里云百炼控制台,新用户可获免费Token额度。Qwen3.8-Flash已首发上线千问AI平台。

进入百炼控制台 →

方式二:阿里云国际站(海外)

通过Model Studio调用,新用户享免费额度。API兼容OpenAI格式,迁移成本低。

领取国际站$200免费额度 →

方式三:开源权重自部署

Qwen3.8-Flash-Next(开源版本)权重已在Hugging Face和ModelScope开放下载,支持本地部署和微调。生产版本Qwen3.8-Flash在QwenCloud提供API服务。

新用户福利汇总:
  • 百炼平台新用户:赠送大量免费Token额度(90天有效)
  • 国际站新用户:最高$200免费试用额度
  • ECS云服务器:2核2G仅99元/年,续费同价

❓ 常见问题

Qwen3.8-Flash和Qwen3.8-27B有什么区别?

Qwen3.8-Flash是MoE模型(125B总参数/6B激活),主打极致性价比和高并发;Qwen3.8-27B是Dense视觉语言模型(27B参数全部激活),适合需要深度推理的专业场景,输入3元/输出12元。

缓存命中价格0.1元/M是怎么算的?

当请求命中上下文缓存时(如重复的系统提示、长文档前缀),缓存部分的输入tokens按0.1元/百万计费,相比标准输入0.8元节省87.5%。这对Agent、多轮对话、RAG等场景影响巨大。

支持哪些输入模态?

Qwen3.8-Flash支持文本和图像输入(input_modalities: ["text", "image"]),可处理图表分析、文档OCR、视觉数学等任务。生产版本支持视频分析。

API限流是多少?

根据百炼文档,Qwen3.8系列限流为5000 RPM(每分钟请求数)和500万 TPM(每分钟tokens数),适合企业级高并发场景。

立即体验 Qwen3.8-Flash

新用户免费Token + ECS 99元/年 + 国际站$200额度,一站式开启AI开发

免费领取百炼Token → ECS特惠 99元/年