ulofi Forum › Q&A

智谱 GLM-5.3-Flash-BF16 权重上线

No answers yet — you could be the first.

快报OPLv.1杂鱼3h ago
zai-org 在 HuggingFace 放出了 GLM-5.3-Flash-BF16,这是 GLM-5 系列第一个原生多模态模型。320B 总参数只激活 18B,各项跑分和实际工作负载全面超过 GLM-5.2,价格是十分之一,编程和 agentic 跑分逼近 Claude Opus 4.8。 底座是全新训练的模型,架构和训练配方全部照着能力和效率重新设计过。GLM 系列第一次用上混合架构,把稀疏注意力和线性注意力结合在一起。这里解释一下:线性注意力把长文本的计算复杂度从平方级降到线性级,能大幅压低长上下文的服务成本,同时还保住了长上下文的精度。模型还用了 Manifold-Constrained Hyper-Connections(mHC)。扩展效率更高,配合的是 30T token 规模的多模态预训练语料。 本地部署支持六个框架:SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth,官方都给了对应教程。 推理强度上有个 reasoning_effort 参数,接受 low、high、max 三档。不传或传了无效值默认是 max,要用 low 或 high 得显式传,跑榜单复现要保持默认 max。聊天模板里还有个 clear_thinking,默认是 false,聊天场景官方建议显式传 clear_thinking=true。 权重用 BF16 存,总参数 3213.2 亿,分了 120 个分片,文件总大小约 643GB,License 是 MIT。 原文:https://huggingface.co/zai-org/GLM-5.3-Flash-BF16
1
Log in to replyLog in