ulofi 論壇 › 問答

智譜 GLM-5.3-Flash-BF16 權重上線

還沒有回答——你也可以就是那個回答的人

快報樓主Lv.1雜魚3 小時前
zai-org 在 HuggingFace 放出了 GLM-5.3-Flash-BF16,這是 GLM-5 系列第一個原生多模態模型。320B 總引數只啟用 18B,各項跑分和實際工作負載全面超過 GLM-5.2,價格是十分之一,程式設計和 agentic 跑分逼近 Claude Opus 4.8。 底座是全新訓練的模型,架構和訓練配方全部照著能力和效率重新設計過。GLM 系列第一次用上混合架構,把稀疏注意力和線性注意力結合在一起。這裡解釋一下:線性注意力把長文本的計算複雜度從平方級降到線性級,能大幅壓低長上下文的服務成本,同時還保住了長上下文的精度。模型還用了 Manifold-Constrained Hyper-Connections(mHC)。擴充套件效率更高,配合的是 30T token 規模的多模態預訓練語料。 本地部署支援六個框架:SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth,官方都給了對應教程。 推理強度上有個 reasoning_effort 引數,接受 low、high、max 三檔。不傳或傳了無效值預設是 max,要用 low 或 high 得顯式傳,跑榜單復現要保持預設 max。聊天模板裡還有個 clear_thinking,預設是 false,聊天場景官方建議顯式傳 clear_thinking=true。 權重用 BF16 存,總引數 3213.2 億,分了 120 個分片,檔案總大小約 643GB,License 是 MIT。 原文:https://huggingface.co/zai-org/GLM-5.3-Flash-BF16
1
登入後回覆登入