Stop paying Dario! Escape the permanent underclass! 免费用 Colibri 在个人电脑本地运行 GLM 5.2 前沿模型 (完整744B参数),只需要 25GB system RAM 和 400GB SSD storage
Colibri本地运行GLM 5.2的方法与速度争议
关键信息
- 运行原理:GLM 5.2 是一个 sparse 混合专家模型(MoE),总参数 744B,但每个 token 仅激活 40B 参数(需 25GB RAM),每次变化的参数仅 11GB。利用最新 NVMe SSD 超过 11GB/s 的带宽,可以直接从硬盘运行模型 (#1)。
- 硬件要求:最低需要 25GB 空闲系统 RAM 和 400GB SSD 存储空间,无 GPU 强制要求(无 GPU 时使用 CPU)(#1)。
- 宣称速度:运行速度约为 0.5 到 2+ token/second。配备 GPU/VRAM、额外内存或双 SSD 组 striped reads 可提速,且模型预热后会加快 (#1)。
经验与数据点
- 部署步骤 (#1):
- 下载并解压 Colibri 项目。
- 通过 PowerShell 安装 Python 3.14 及 git-xet (
winget install git-xet)。 - 克隆 HuggingFace 上的 ~400GB INT4 量化版 GLM 5.2 模型。
- 配置环境变量
COLI_MODEL,运行py coli plan规划内存,再运行py coli chat启动对话。 - 可选优化:若有双 SSD,可将模型复制到第二块 SSD 并设置
COLI_MODEL_MIRROR环境变量以实现双盘条带化读取加速。 - Web/API 支持:运行
py coli web可在浏览器(http://127.0.0.1:8000)中对话;亦支持 OpenAI API 格式。
争议或不同意见
- 速度质疑:有用户指出 0.5~2 token/second 的速度在实际体验中极慢,可能导致“一个 prompt 跑一小时” (#3) 或实际速度等同于 "20s/token" (#13)。
- 可行性与硬件瓶颈:
- 有用户实测使用 2*L40S + 1T 内存(MoE 实际占用约 700G)时生成速度仍不足 1 token/s,强烈质疑仅靠 SSD 达到 0.5~2 token/s 的可能性 (#6)。
- 有用户指出 PCIe Gen3 SSD 的带宽过低,无法满足 11GB/s 的读取需求 (#8)。
- 有用户提到本地部署的瓶颈在于 RAM 价格高昂 (#11),且自费硬件玩家难以承受高昂的硬件成本 (#5)。