简要说明
阿里巴巴通义团队将于周三发布Qwen 3.8-Flash-Next,这是一款混合专家模型,被称作Qwen4架构的预览版。
该团队的发布前说明中提到,模型总参数量为1250亿,但每个token仅使用60亿个活跃参数。
目前尚未公布严格的基准测试分数,且截至本文撰写时,相关权重也尚未在ModelScope上上线。
阿里巴巴将于周三发布Qwen 3.8-Flash-Next,这是一款拥有1250亿参数的模型,每个token仅激活60亿个参数。Qwen团队将其定位为下一代Qwen 4架构的预览版本,而非最终的旗舰产品。
目前尚无关于该模型的官方信息,但据传闻称,它很可能采用一种专家混合系统,即把网络拆分为多个专用的子模型,并在执行每项任务时仅激活与之相关的子模型。因此,一个拥有1250亿个参数的模型,其计算开销将相当于一个仅有60亿个参数的模型。

众说纷纭:克劳德会停赛几天?点击进行您的预测.
参数基本上就是模型可以调节的所有“旋钮”。参数越多,模型的能力越强,同时也需要更多的计算资源。专家混合模型则使得极其强大的模型只需激活其所需的部分,从而在不浪费资源的前提下获得最佳输出。
阿里巴巴的通义千问团队确实将该模型描述为多模态的,并基于即将推出的Qwen 4架构构建,同时表示已推出早期版本,以便开发者为完整系列做好准备。
为什么“3.8”并不是新闻

阿里巴巴已发布一则预告,不过团队称其为预览版。计划在Qwen 4全面上线之前,先行推出这些架构层面的优化改进。Hugging Face,模型权重的托管平台,也将其描述为“Qwen 4 架构的预览版”。
硬性基准测试尚未公布。Qwen尚未公布与其自身Qwen 3系列或西方竞争对手的对比得分,因此1250亿和60亿参数的数值尚未经验证,我们只能对其性能进行推测。
中国在大模型权重方面的开放步伐可谓毫不停歇。一款神秘的免费模型Ox Alpha近日在部分编码基准测试中击败了Anthropic的Fable,而其背后并无已知的开发者团队。阿里巴巴、DeepSeek和Moonshot等机构均已发布功能强大的模型权重,供用户下载、微调并运行。
开放权重使开发者无需将数据发送至封闭式 API 即可进行模型构建,并且降低了托管模型的使用成本。正因如此,一个拥有 1250 亿个参数、其中 60 亿个为活跃参数的开放模型才显得尤为重要:它能够在通用硬件上实现接近前沿水平的性能。
不过我们还得等具体数据。截至发稿时,Qwen尚未公布其在各项基准测试中的得分。
