首页 > 开源 > 智谱披露 GLM-5.3 初显 RSI:模型开始优化承载自己的推理系统

智谱披露 GLM-5.3 初显 RSI:模型开始优化承载自己的推理系统

OSChina资讯 2026-09-20 15:55 8 阅读 查看原文

智谱创始人、首席科学家唐杰和 GLM 团队发了一篇长文,题目已经把姿态放得很低:"这还不是完整意义上的递归自我改进(RSI),但已经出现了早期形态。" 可读完整篇,你会觉得这个"早期形态"离"完整"可能没他们说的那么远。

绕开概念,先看它干了什么。GLM-5.3-Flash 上线时,一套生产级推理服务要在超过 10 万张国产芯片组成的集群上从零搭起来——此前没人成功部署过这么大规模的国产卡集群,内存和带宽相对受限,还要扛 1M 上下文和多模态请求,算子不完备,文档基本靠猜。

做成这件事的,不是一支工程师团队,而是由 GLM-5.3 驱动的 Infra Agent。它做模型适配、系统诊断、性能调优,不到两周把端到端吞吐推到了初始基线的 3 倍。实际操作中为了在国产卡上跑起来,团队用了以算力换带宽、以通信换显存等方案,技术栈融合了 ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合精度缓存,最终引入 Encode–Prefill–Decode(EPD)分离式架构,端到端性能约 3 倍,硬件利用率和单 Token 成本追平主流 NVIDIA GPU。

那匿名模型 Ox-Alpha 就是 GLM-5.3-Flash 自己——上线一周成为 OpenCode 和 OpenRouter 双平台调用量最大的模型,6 天 Token 调用量超过 62 万亿。

文章真正的重头戏,是它把这个过程拆成了一套方法论,叫"稠密反馈"。唐杰团队的观察是:端到端指标只能告诉 Agent"结果变差了",没法告诉它"为什么变差"。于是他们把正确性测试、运行日志、执行 Trace、微基准测试、端到端指标全纳入 Agent 的迭代流程,并把反馈分成三层——正确性反馈回答"是否算对",系统行为反馈定位"时间耗在哪",性能反馈判断"哪个方案在什么条件下更好"。

三个案例对应三层。正确性层面,Agent 对比不同并行切分路径的精度时,发现 KDA 算子的上下文并行(CP)路径有问题:原实现 tl.dot 即使输入是 FP32 也默认用 TF32 计算,误差在长上下文里不断累积,修复是显式指定 input_precision="tf32x3",用三次 TF32 运算组合出更高精度。

系统行为层面,Agent 发现有的场景里 Prefill+KV Transfer 比单独 Prefill 差了 20% 以上,追到 Python/C++ 边界,定位到 DeepEP v1.2.1 的 intranode_dispatch/intranode_combine 都没显式释放 Python GIL,把 Mooncake Transfer 的 Python 线程卡住了——修复是让相关 C++ 区间释放 GIL,性能差从 20% 缩到 1% 以内。

性能层面,Agent 从 SGLang、Flash Linear Attention、DeepGEMM 等项目的存量 Kernel 里提炼"优化骨架",再回去优化承载自己的 KDA Decode 算子:先发现原实现沿 V 维度分块导致相同计算重复四次,合并到同一线程块后拿到 1.71 倍提升。

"模型优化系统,系统承载模型"——这句话是全文的题眼。

唐杰在这篇长文里也难得地抖了句真话:坦白说,在 GLM-4.7 之前,我们内部用 GLM 写代码多少带着被迫的成分,毕竟是自己的"亲儿子"。今天 GLM-5.3 已经成为每个人每天离不开的 Coding 伙伴,正一步步走向取代我们。他强调,选目标、设边界、判风险仍然是人的工作,这条线应当由人来守——但又补了一句,"两周、三倍、十万卡这些数字告诉我们,这条线不会因为我们希望它慢一点就慢下来。"

来源:https://z.ai/blog/glm-built-its-inference-infrastructure