DEV Community · Show DEV9/2 11:1253 分
用单个Rust二进制在Apple Silicon上运行私有OpenAI兼容LLM端点
Run a private OpenAI-compatible LLM endpoint on Apple Silicon with one Rust binary
作者维护的Ferrum是一个MIT许可的Rust本地LLM推理服务器,可在M系列Mac上提供私有OpenAI兼容端点,无需Python或容器。文章以M1 Max上的Ferrum v0.8.3 Homebrew构建为例,演示了安装、诊断、运行和提供API服务的完整流程。ferrum doctor可检查本地环境,曾捕获缺失的Xcode命令行工具。首次运行需下载约2.55 GiB模型。默认启用Qwen3.5的推理模式,可用--disable-thinking关闭。通过curl请求本地8000端口的/v1/chat/completions接口验证服务。作者寻求Apple Silicon用户的失败导向反馈,并声明未做性能比较。