Hacker News Show9/2 00:4271 分精选
在48GB Mac上运行104GB Qwen3.8-Flash-Next,约12 tok/s
Show HN: Running 104GB Qwen3.8-Flash-Next on 48GB Mac with at ~12 tok/s
推荐理由:我认为这条对 Mac 用户和本地大模型玩家直接有用:它展示了如何用专家卸载+SSD 流式在 48GB 内存跑 125B 模型,速度约 12 tok/s,相当于把硬件门槛砍半。对想低成本跑大模型的独立开发者,值得直接抄思路。
开发者carloslfu在Hacker News上发布了slotstream项目,旨在让低内存Mac(从16GB起)运行Qwen3.8-Flash-Next 4-bit模型。该模型拥有1250亿参数,通常需要100GB以上内存,但通过专家卸载和SSD流式传输技术,可在48GB Mac上以约12 tok/s的速度运行。项目基于MLX和Swift,易于安装和更新,并提供自动模式以平衡内存使用和速度。开发者计划下一步实现并移植MTP模块用于推测解码。该帖子在Hacker News上获得26分,讨论链接已附。