模型与产品 · AI 动态

125B 多模态 MoE 模型预览 Qwen4 架构

一句话结论:阿里 Qwen 团队发布 Qwen3.8-Flash-Next,一个 125B 参数的多模态 MoE 模型,仅 6B 激活参数,并预览了 Qwen4 架构。原始信息详细拆解了参数分布:125B 主干、51B N-gram 嵌入表… 对中文用户来说,重点是判断它是否会影响“模型发布与实时多模态能力”方向的工具选择、工作流搭建或内容选题;模型使用者、产品经理、内容团队和 API 接入团队 可以优先看原文细节。

模型与产品配图
原文配图,来源:AI旗页热点日报

01

核心要点

  • 来源为 AI旗页热点日报,原文入口保留在页面底部,适合继续核对完整信息。
  • 这条内容被归入“模型发布与实时多模态能力”,可作为后续工具选型、教程选题或趋势观察线索。
  • 相关标签:AI热点日报 / 多模态 / 模型架构。

编辑判断

AI旗页判断

这条资讯来自 AI旗页热点日报,更适合当作“模型发布与实时多模态能力”方向的信号来看:它说明相关能力正在进入更具体的产品、行业或工作流场景,而不只是停留在演示层。

读这类新闻时,建议重点看模型能力是否已经开放、支持哪些输入输出、价格和速率限制如何,以及能否接入真实业务。

AI旗页的处理方式是保留来源、摘要和相关入口,不做全文转载。这样既能让中文用户快速判断是否值得继续读,也避免把站点做成低价值搬运页。

03

来源信息

原文标题:Alibaba’s Qwen Team Releases Qwen3.8-Flash-Next: A 125B Multimodal MoE With 6B Active Parameters Previewing the Qwen4 Architecture

We look at Qwen3.8-Flash-Next, Alibaba's open-weight multimodal Mixture-of-Experts model and an early preview of the Qwen4 architecture. We break down where the 180B parameters actually sit: a 125B backbone, a 51B N-gram embedding table, and a 4B multi-token prediction module, with only 6B active per token. We walk through the four architectural changes — the Gated DeltaNet and Qwen Sparse Attention hybrid, Gated Res

一句话结论:阿里 Qwen 团队发布 Qwen3.8-Flash-Next,一个 125B 参数的多模态 MoE 模型,仅 6B 激活参数,并预览了 Qwen4 架构。原始信息详细拆解了参数分布:125B 主干、51B N-gram 嵌入表、4B 多 token 预测模块,每 token 仅激活 6B 参数。架构上引入了 Gated DeltaNet 与 Qwen Sparse Attention 的混合、Gated Res 等四项关键变化。为什么值得关注:这是 Qwen4 架构的首次公开预览,MoE 设计大幅降低推理成本,同时多模态能力可能带来更广泛的应用场景。影响谁:关注高效模型架构的研究人员、需要低成本多模态能力的开发者,以及使用 Qwen 系列模型的企业。下一步验证:可以等待模型权重开放后,在本地或云端测试其推理速度和多模态任务表现,并与现有 Qwen 模型对比。

来源信息:AI旗页热点日报,发布时间或入库日期为 2026-08-26。页面底部保留原文入口,适合继续核对完整上下文、原始表述和附带链接。

原文摘录

来源摘要

We look at Qwen3.8-Flash-Next, Alibaba's open-weight multimodal Mixture-of-Experts model and an early preview of the Qwen4 architecture. We break down where the 180B parameters actually sit: a 125B backbone, a 51B N-gram embedding table, and a 4B multi-token prediction module, with only 6B active per token. We walk through the four architectural changes — the Gated DeltaNet and Qwen Sparse Attention hybrid, Gated Res

以上内容来自来源页/RSS 提供的摘要信息,AI旗页做中文整理、重点标注和入口归档;完整内容、上下文和版权归原作者所有,请以原文为准。

05

下一步怎么用

  • 需要确认细节时,优先打开原文链接,看发布时间、上下文和官方表述。
  • 如果这条动态与你的工作有关,可以继续查看同标签资讯和相关工具,判断是否需要写教程、做对比或加入工作流。
  • 如果是产品或模型更新,建议同时比较价格、可用地区、中文体验、API 接入和数据安全边界。

标签

标签与来源

原始来源地址:www.marktechpost.com

相关阅读

相关资讯