# GLM-5.3-Flash让多模态更便宜

> 智谱发布 3200 亿参数、每 token 激活 180 亿参数的开源模型，原生支持视觉，并宣称上下文达到 100 万 token。

_Source: Z.ai official announcement on X, cross-checked with the official GLM-5.3-Flash blog, Hugging Face model card, and Z.AI API documentation · 2026-08-26 · 6 min read · Verified against primary sources_

Canonical: https://iyu.app/zh/e/glm-5-3-flash-native-multimodal-release

## 60 秒版本

GLM-5.3-Flash 是一款 MIT 许可的 320B/18B 开源模型，原生支持视觉，并宣称上下文达到 100 万 token。

**要点**

- 模型总参数量为 320B，每个 token 激活约 18B 参数。
- 模型原生接受图像和文字输入，适合代码、图表和文档等视觉任务。
- 稀疏注意力与线性注意力组合，目标是降低长上下文计算和 KV 缓存成本。
- 智谱报告的基准、价格和中国芯片服务结果属于自测，需要独立复现。

**结论.** 它对开放多模态部署具有技术意义，但真实的性价比仍取决于可复现测试和实际硬件条件。

## 全文

智谱发布了 GLM-5.3-Flash：它同时处理图像和文字，并试图让超长上下文推理保持在更低的服务成本内。根据模型卡和官方文档，模型总参数量为 3200 亿，但每个 token 激活约 180 亿参数。


### 这次发布 — 模型很大，激活路径更小

模型以 MIT License 发布在 Hugging Face。它采用混合专家设计，总参数量 320B，激活参数量 18B。两者不能混为一谈：总参数体现容量，激活参数更接近每个 token 实际经过的专家计算量。


### 关键变化 — 视觉能力不再是外挂

官方将 GLM-5.3-Flash 称为 GLM-5 系列首个原生多模态模型。API 文档支持把图片和文字一起输入，这对代码截图、图表、文档和仪表盘等任务有直接意义，因为先把视觉信息全部翻译成文字会增加额外摩擦。


### 架构思路 — 稀疏与线性注意力服务长上下文

模型把稀疏注意力和线性注意力组合起来。智谱称，与 GLM-5.3 相比，这种混合设计可以减少注意力计算和 KV 缓存，同时保持长上下文能力。模型配置把最大位置长度设为 1,048,576，并使用 IndexPool 压缩索引器键。


### 证据边界 — 性能数字仍需独立复现

> **⚑ Caveat:** 智谱称 GLM-5.3-Flash 在多个基准上超过 GLM-5.2，在代码和智能体评测中接近 Claude Opus 4.8，并达到更低的成本前沿。这些是厂商基于自身评测设置报告的结果，不等同于独立的横向测评。

官方博客还称，模型发布前曾以 Ox Alpha 名义在 OpenCode 和 OpenRouter 上匿名预览，相关流量运行在中国 AI 芯片上。智谱介绍了基于 SGLang 的专用服务栈，并报告同硬件端到端服务性能提升 3 倍。这些信息能说明工程方向，但公开证据仍主要来自公司自述。


### 实际意义 — 开放权重改变部署选择

实际问题不是 GLM-5.3-Flash 是否绝对最好，而是原生视觉、超长上下文和 MIT 许可是否足以匹配具体工作负载，并抵消硬件与服务复杂度。模型卡列出 SGLang、vLLM、TokenSpeed 和 KTransformers 等部署路径，给运营者留下了多种验证方案。

> 这次发布不只是参数变大，而是尝试让前沿多模态能力更容易被部署、检查和迁移到开放环境。


## Primary sources

- [Z.ai official X announcement](https://x.com/zai_org/status/2092616204787626030)
- [Z.ai official blog](https://z.ai/blog/glm-5.3-flash)
- [Hugging Face model card](https://huggingface.co/zai-org/GLM-5.3-Flash)
- [Z.AI API documentation](https://docs.z.ai/guides/llm/glm-5.3-flash)

---
_Published by iyu (https://iyu.app) — the day's AI news, checked against primary sources and rewritten in plain language. Free to quote with attribution and a link to the canonical URL._
