GLM-5.3
模型介绍
GLM-5.3 是智谱面向工程编码与智能体(Agent)场景的最新旗舰模型。它与上一代 GLM-5.2 使用同一个基座模型,全部能力提升来自后训练,因此在保持同等部署成本的前提下, 复杂编码与长程任务能力有明显跃升。
官方数据显示:在智谱自建的 Z.ai Code Bench 上,GLM-5.3 相比 GLM-5.2 提升约 50%; 在 Terminal Bench 3.0(28.3 vs GLM-5.2 的 4.6)、Agents' Last Exam、AutomationBench、 GDPval-AA v2 等公开基准上达到开源权重模型的最优水平,是构建长程 Coding Agent 与 自主智能体的理想基座。
架构上,GLM-5.3 采用 MLA 低秩注意力 + DSA 稀疏注意力的混合专家(MoE)设计, 并在权重中自带 MTP(Multi-Token Prediction)层,可直接开启投机解码显著提升生成速度; 支持 100 万 token 上下文。
核心特性
- 工程编码与智能体能力领先:面向真实工程任务优化,在终端任务、长程自主执行、 自动化流程等基准上取得开源权重模型最优成绩。
- 与 GLM-5.2 同基座、纯后训练提升:部署形态和资源需求与 GLM-5.2 一致, 升级不需要改变部署规格。
- DSA 稀疏注意力 + MLA:显著降低长上下文推理的显存与计算开销, 在 Blackwell 架构上自动走 TensorRT-LLM 加速后端。
- 自带 MTP 投机解码:权重内含 MTP 层,开启后实测平均接受 3.35 个草稿 token, 单流生成速度可达 300+ tokens/s。
- 超长上下文:支持 1,048,576(1M)token。
- 思考过程可控:通过
reasoning_effort参数控制是否输出思考过程。
模型概要
| 项 | 值 |
|---|---|
| 架构 | 混合专家模型(MoE),MLA + DSA 稀疏注意力 |
| 层数 | 78 |
| 隐藏维度 | 6144 |
| 注意力头数 | 64 |
| 专家数量 | 256(另含 1 个共享专家) |
| 每 token 选择的专家数 | 8 |
| 投机解码 | 权重自带 MTP 层(1 层) |
| 上下文长度 | 1,048,576 |
| 词表大小 | 154,880 |
| 量化 | FP8(E4M3,block 128×128) |
| 支持模态 | 文本 |
API调用
服务部署成功后,可在服务列表查看调用信息。
基础对话
GLM-5.3 默认以最高思考预算运行,思考过程在 message.reasoning_content,
最终回答在 message.content。建议 max_tokens 不低于 2048,避免预算被思考内容占满。
1curl -X POST "<访问地址>/v1/chat/completions" \
2-H "Content-Type: application/json" \
3-H "Authorization: Bearer token" \
4-d '{
5 "model": "GLM-5.3",
6 "messages": [{"role": "user", "content": "请用中文简要回答:为什么天空是蓝色的?"}],
7 "max_tokens": 2048,
8 "temperature": 0.6
9}'
流式调用时需要同时消费 delta.reasoning_content 和 delta.content,
只读 delta.content 会拿不到思考过程。
控制思考过程
用 reasoning_effort 控制:不传或传 max 会输出思考过程;传 low 或 high 则不输出
(reasoning_content 为空,回答更快)。传其它值会返回参数校验错误。
1curl -X POST "<访问地址>/v1/chat/completions" \
2-H "Content-Type: application/json" \
3-H "Authorization: Bearer token" \
4-d '{
5 "model": "GLM-5.3",
6 "reasoning_effort": "low",
7 "messages": [{"role": "user", "content": "用一句话打个招呼"}],
8 "max_tokens": 512
9}'
多轮对话场景建议显式传 chat_template_kwargs: {"clear_thinking": true},
让上一轮的思考内容在下一轮被清除。
工具调用
1curl -X POST "<访问地址>/v1/chat/completions" \
2-H "Content-Type: application/json" \
3-H "Authorization: Bearer token" \
4-d '{
5 "model": "GLM-5.3",
6 "messages": [{"role": "user", "content": "今天山东济南的天气如何"}],
7 "tools": [{"type": "function", "function": {
8 "name": "get_weather",
9 "description": "Get the current weather in a given location",
10 "parameters": {"type": "object", "properties": {
11 "location": {"type": "string", "description": "City and state"},
12 "unit": {"type": "string", "enum": ["celsius", "fahrenheit"]}},
13 "required": ["location"]}}}],
14 "tool_choice": "auto",
15 "max_tokens": 2048
16}'
工具调用命中时 finish_reason 为 tool_calls,参数在
message.tool_calls[].function.arguments。
长上下文
服务默认以 131072(128K)上下文启动,实测 4.5 万 token 的输入可正常检索作答。
需要更长上下文时,可在部署时调大启动命令里的 --context-length
(模型上限 1,048,576),并相应评估显存。
评价此篇文章
