Folia
← 返回头版

开发者分享M4 Pro Mac mini上的本地大模型部署方案

一位开发者在Hacker News上分享了在M4 Pro Mac mini上搭建本地大语言模型服务器的完整技术方案。该系统采用48GB RAM的硬件配置1,部署耗时约30分钟1,通过oMLX推理服务器1运行Qwen 3.6-35B和Gemma-4等多个模型1。其中Qwen 3.6-35B-A3B-OptiQ-4bit模型占用约20GB存储空间1,Gemma-4-E4B-it-OptiQ-4bit模型占用约2.4GB1。作者采用Tailscale mesh网络方案1实现多设备对本地模型的访问。

相比云端API服务,本地部署具有明显的经济优势。作者指出,云端月均订阅成本约400美元1,而本地方案仅需硬件一次性投资加电费支出1。在模型精度方面,采用4-bit量化版本相比BF16基准精度仅损失1-2个百分点1。该方案特别适用于MoE(混合专家)架构模型,以Qwen 3.6-35B为例,虽然总参数达35B,但每个token仅激活其中3B参数1,有效降低了推理成本。本地部署还提供了数据隐私保护和离线可用等优势1。


评论