阿里千问发布Qwen3.8-Flash:多模态MoE模型开启低成本推理新阶段

8月26日,阿里千问正式发布Qwen3.8-Flash模型,该版本为Qwen4架构的早期预览形态,首次引入多模态处理能力,并采用稀疏激活的MoE(混合专家)结构,显著提升计算效率。

极致成本效益:每Token仅激活60亿参数

尽管模型总参数量达1250亿,搭配510亿N-gram嵌入参数,但实际运行中每个输入或输出Token仅激活约60亿参数,实现极高的资源利用率,大幅降低推理开销。

商业化部署即将落地,定价透明可预期

生产版本的Qwen3.8-Flash将通过Qwen Cloud API快速上线,输入成本为每100万Token 0.16美元,输出费用为0.47美元,价格策略极具竞争力,适用于大规模应用场景。