oMLX 是一个 macOS 原生的推理服务器,基于 MLX,专门为在 Mac 上跑本地模型做优化。

它针对的痛点很明确:编码 Agent 一个会话里会反复让 KV 缓存失效,每次都要从头重算 prompt,等待时间能到 30 到 90 秒。oMLX 的做法是把缓存块以 safetensors 格式持久化到 SSD,热块留在内存、冷块按 LRU 落盘,之前见过的前缀可以在毫秒级从磁盘恢复,跨请求甚至跨服务器重启都有效。官方给的结果是第二轮之后首字延迟压到 5 秒以内。

API 兼容 OpenAI 和 Anthropic 两套格式,Claude Code、OpenClaw、Cursor 都能直接指过去。项目采用 Apache 2.0 协议,需要 Apple Silicon 和 macOS 15 及以上。

适合手里有大内存 Mac、想把编码 Agent 的推理挪到本地的开发者。

oMLX相关导航

oMLX 暂无评论

none
暂无评论...