Z.ai 发布 GLM-5.3-Flash:320B 参数原生多模态 MoE,上下文窗口达百万 Token
一句话结论:GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以 320B 总参数、18B 激活参数的 MoE 架构和 1M Token 上下文窗口亮相。原始信息显示,该模型权重采用 MIT 许可在 Hugging Face 开放,API 定价为输入 $0.15/M、输出 $0.50/M,在 Terminal-Bench 2.1 上得分 84.3,DeepSWE v1.1 上得分 63.4。技术上,它使用混合 KDA 线性注意力和 NoPE 稀疏 MLA 注意力,相比前代将注意力计算量减少约 3 倍,KV 缓存减少 4.4 倍。值得关注的原因是,百万级上下文和原生多模态能力使其在长文档处理、复杂代码生成和多模态推理场景具有竞争力,且 MIT 许可有利于商业应用。它影响的是大模型应用开发者、企业 AI 平台选型者以及研究多模态 MoE 架构的团队。下一步建议:在 Hugging Face 下载权重进行本地推理测试,或通过 API 试用,重点验证长上下文下的信息保持能力和多模态输入的实际效果。