阿里巴巴将发布Qwen 3.8-Flash-Next,作为Qwen 4功能的预览

来源:Jose Antonio Lanz 57℃

简要说明

  • 阿里巴巴通义团队将于周三发布Qwen 3.8-Flash-Next,这是一款混合专家模型,被称作Qwen4架构的预览版。

  • 该团队的发布前说明中提到,模型总参数量为1250亿,但每个token仅使用60亿个活跃参数。

  • 目前尚未公布严格的基准测试分数,且截至本文撰写时,相关权重也尚未在ModelScope上上线。

阿里巴巴将于周三发布Qwen 3.8-Flash-Next,这是一款拥有1250亿参数的模型,每个token仅激活60亿个参数。Qwen团队将其定位为下一代Qwen 4架构的预览版本,而非最终的旗舰产品。

目前尚无关于该模型的官方信息,但据传闻称,它很可能采用一种专家混合系统,即把网络拆分为多个专用的子模型,并在执行每项任务时仅激活与之相关的子模型。因此,一个拥有1250亿个参数的模型,其计算开销将相当于一个仅有60亿个参数的模型。

Myriad: How many days will Claude go down? Click to make your prediction.
众说纷纭:克劳德会停赛几天?点击进行您的预测.

参数基本上就是模型可以调节的所有“旋钮”。参数越多,模型的能力越强,同时也需要更多的计算资源。专家混合模型则使得极其强大的模型只需激活其所需的部分,从而在不浪费资源的前提下获得最佳输出。


阿里巴巴的通义千问团队确实将该模型描述为多模态的,并基于即将推出的Qwen 4架构构建,同时表示已推出早期版本,以便开发者为完整系列做好准备。

为什么“3.8”并不是新闻

阿里巴巴已发布一则预告,不过团队称其为预览版。计划在Qwen 4全面上线之前,先行推出这些架构层面的优化改进。Hugging Face,模型权重的托管平台,也将其描述为“Qwen 4 架构的预览版”。

硬性基准测试尚未公布。Qwen尚未公布与其自身Qwen 3系列或西方竞争对手的对比得分,因此1250亿和60亿参数的数值尚未经验证,我们只能对其性能进行推测。

中国在大模型权重方面的开放步伐可谓毫不停歇。一款神秘的免费模型Ox Alpha近日在部分编码基准测试中击败了Anthropic的Fable,而其背后并无已知的开发者团队。阿里巴巴、DeepSeek和Moonshot等机构均已发布功能强大的模型权重,供用户下载、微调并运行。

开放权重使开发者无需将数据发送至封闭式 API 即可进行模型构建,并且降低了托管模型的使用成本。正因如此,一个拥有 1250 亿个参数、其中 60 亿个为活跃参数的开放模型才显得尤为重要:它能够在通用硬件上实现接近前沿水平的性能。

不过我们还得等具体数据。截至发稿时,Qwen尚未公布其在各项基准测试中的得分。


标签: