GLM-5.3-Flash让多模态更便宜

智谱发布 3200 亿参数、每 token 激活 180 亿参数的开源模型,原生支持视觉,并宣称上下文达到 100 万 token。

✓ 已核实 来源 Z.ai official announcement on X, cross-checked with the official GLM-5.3-Flash blog, Hugging Face model card, and Z.AI API documentation ⚑ AI 模型

60 秒版本

GLM-5.3-Flash 是一款 MIT 许可的 320B/18B 开源模型,原生支持视觉,并宣称上下文达到 100 万 token。

要点

  • 模型总参数量为 320B,每个 token 激活约 18B 参数。
  • 模型原生接受图像和文字输入,适合代码、图表和文档等视觉任务。
  • 稀疏注意力与线性注意力组合,目标是降低长上下文计算和 KV 缓存成本。
  • 智谱报告的基准、价格和中国芯片服务结果属于自测,需要独立复现。

结论. 它对开放多模态部署具有技术意义,但真实的性价比仍取决于可复现测试和实际硬件条件。

智谱发布了 GLM-5.3-Flash:它同时处理图像和文字,并试图让超长上下文推理保持在更低的服务成本内。根据模型卡和官方文档,模型总参数量为 3200 亿,但每个 token 激活约 180 亿参数。

这次发布模型很大,激活路径更小

模型以 MIT License 发布在 Hugging Face。它采用混合专家设计,总参数量 320B,激活参数量 18B。两者不能混为一谈:总参数体现容量,激活参数更接近每个 token 实际经过的专家计算量。

关键变化视觉能力不再是外挂

官方将 GLM-5.3-Flash 称为 GLM-5 系列首个原生多模态模型。API 文档支持把图片和文字一起输入,这对代码截图、图表、文档和仪表盘等任务有直接意义,因为先把视觉信息全部翻译成文字会增加额外摩擦。

架构思路稀疏与线性注意力服务长上下文

模型把稀疏注意力和线性注意力组合起来。智谱称,与 GLM-5.3 相比,这种混合设计可以减少注意力计算和 KV 缓存,同时保持长上下文能力。模型配置把最大位置长度设为 1,048,576,并使用 IndexPool 压缩索引器键。

证据边界性能数字仍需独立复现

官方博客还称,模型发布前曾以 Ox Alpha 名义在 OpenCode 和 OpenRouter 上匿名预览,相关流量运行在中国 AI 芯片上。智谱介绍了基于 SGLang 的专用服务栈,并报告同硬件端到端服务性能提升 3 倍。这些信息能说明工程方向,但公开证据仍主要来自公司自述。

实际意义开放权重改变部署选择

实际问题不是 GLM-5.3-Flash 是否绝对最好,而是原生视觉、超长上下文和 MIT 许可是否足以匹配具体工作负载,并抵消硬件与服务复杂度。模型卡列出 SGLang、vLLM、TokenSpeed 和 KTransformers 等部署路径,给运营者留下了多种验证方案。

这次发布不只是参数变大,而是尝试让前沿多模态能力更容易被部署、检查和迁移到开放环境。