模型与产品 · AI 动态

320B 参数原生多模态 MoE,上下文窗口达百万 Token

一句话结论:GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以 320B 总参数、18B 激活参数的 MoE 架构和 1M Token 上下文窗口亮相。原始信息显示,该模型权重采用 MIT 许可在 Hugging Fac… 对中文用户来说,重点是判断它是否会影响“模型发布与实时多模态能力”方向的工具选择、工作流搭建或内容选题;模型使用者、产品经理、内容团队和 API 接入团队 可以优先看原文细节。

模型与产品配图
原文配图,来源:AI旗页热点日报

01

核心要点

  • 来源为 AI旗页热点日报,原文入口保留在页面底部,适合继续核对完整信息。
  • 这条内容被归入“模型发布与实时多模态能力”,可作为后续工具选型、教程选题或趋势观察线索。
  • 相关标签:AI热点日报 / 多模态 / 百万上下文 / 开源模型。

编辑判断

AI旗页判断

这条资讯来自 AI旗页热点日报,更适合当作“模型发布与实时多模态能力”方向的信号来看:它说明相关能力正在进入更具体的产品、行业或工作流场景,而不只是停留在演示层。

读这类新闻时,建议重点看模型能力是否已经开放、支持哪些输入输出、价格和速率限制如何,以及能否接入真实业务。

AI旗页的处理方式是保留来源、摘要和相关入口,不做全文转载。这样既能让中文用户快速判断是否值得继续读,也避免把站点做成低价值搬运页。

03

来源信息

原文标题:Z.ai Releases GLM-5.3-Flash: A 320B-A18B Natively Multimodal MoE With a 1M-Token Context

Z.ai has released GLM-5.3-Flash, the first natively multimodal model in the GLM-5 series — a 320B-total / 18B-active MoE with a 1,048,576-token context window, MIT-licensed weights on Hugging Face, and API pricing at $0.15/M input and $0.50/M output. It scores 84.3 on Terminal-Bench 2.1 and 63.4 on DeepSWE v1.1, using hybrid KDA linear plus NoPE sparse MLA attention to cut attention compute ~3× and KV cache 4.4× vers

一句话结论:GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以 320B 总参数、18B 激活参数的 MoE 架构和 1M Token 上下文窗口亮相。原始信息显示,该模型权重采用 MIT 许可在 Hugging Face 开放,API 定价为输入 $0.15/M、输出 $0.50/M,在 Terminal-Bench 2.1 上得分 84.3,DeepSWE v1.1 上得分 63.4。技术上,它使用混合 KDA 线性注意力和 NoPE 稀疏 MLA 注意力,相比前代将注意力计算量减少约 3 倍,KV 缓存减少 4.4 倍。值得关注的原因是,百万级上下文和原生多模态能力使其在长文档处理、复杂代码生成和多模态推理场景具有竞争力,且 MIT 许可有利于商业应用。它影响的是大模型应用开发者、企业 AI 平台选型者以及研究多模态 MoE 架构的团队。下一步建议:在 Hugging Face 下载权重进行本地推理测试,或通过 API 试用,重点验证长上下文下的信息保持能力和多模态输入的实际效果。

来源信息:AI旗页热点日报,发布时间或入库日期为 2026-08-26。页面底部保留原文入口,适合继续核对完整上下文、原始表述和附带链接。

原文摘录

来源摘要

Z.ai has released GLM-5.3-Flash, the first natively multimodal model in the GLM-5 series — a 320B-total / 18B-active MoE with a 1,048,576-token context window, MIT-licensed weights on Hugging Face, and API pricing at $0.15/M input and $0.50/M output. It scores 84.3 on Terminal-Bench 2.1 and 63.4 on DeepSWE v1.1, using hybrid KDA linear plus NoPE sparse MLA attention to cut attention compute ~3× and KV cache 4.4× vers

以上内容来自来源页/RSS 提供的摘要信息,AI旗页做中文整理、重点标注和入口归档;完整内容、上下文和版权归原作者所有,请以原文为准。

05

下一步怎么用

  • 需要确认细节时,优先打开原文链接,看发布时间、上下文和官方表述。
  • 如果这条动态与你的工作有关,可以继续查看同标签资讯和相关工具,判断是否需要写教程、做对比或加入工作流。
  • 如果是产品或模型更新,建议同时比较价格、可用地区、中文体验、API 接入和数据安全边界。

标签

标签与来源

原始来源地址:www.marktechpost.com

相关阅读

相关资讯