GLM-5.3-Flash
GLM-5.3-Flash 是智谱(Z.ai / BigModel 开放平台)GLM-5 系列中首个原生多模态模型,总参数量 320B、激活参数量 18B,采用稀疏/线性注意力混合架构,在大幅降低单 Token 计算量与 KV 缓存占用的同时,实现超越 GLM-5.2 的编码与智能体(Agent)能力,可原生理解图片、视频、文件等输入并生成可交互代码。模型支持 1M 上下文窗口、最大输出 128K Tokens,强制启用深度思考并可通过 reasoning_effort(low/high/max)调节推理强度,同时支持 Function Calling、结构化 JSON 输出、上下文缓存与流式输出。定价约为 GLM-5.3 的 1/10(限时折扣期内为 1/20),主打“前沿智能、Flash 成本”的高性价比定位,权重以 MIT 协议开源。