苹果发布新 Mac mini:想为本地大模型上 64GB,先想清楚用途
Apple 昨天发布了新款 Mac mini。M6 版 6999 元起,统一内存最高 32GB;想上 64GB,需要选择 12999 元起的 M5 Pro 版。

Apple 昨天发布了新款 Mac mini。M6 版 6999 元起,统一内存最高 32GB;想上 64GB,需要选择 12999 元起的 M5 Pro 版。
Apple 在新闻稿中把本地模型、AI 智能体和设备端运行列为重点用途,还将 Mac mini 称作“全天候智能体计算工具”。如果购买这台机器的主要原因是运行本地大模型,建议先把“能运行”和“适合长期使用”分开考虑。
64GB 运行 27B 量化模型,只能算可用
新款 Mac mini 将于 9 月 22 日发售,目前还没有可信的真机测试。现有参考数据来自同为 M5 Pro、20 核 GPU、64GB 统一内存的平台。
oMLX 使用 Qwen3.8-27B 4bit 测试,在 32K 上下文下测得每秒 15.3 个输出 token,首 token 约 114 秒。GPU 平均占用 97%,系统已用内存峰值为 52.89GB。
这组数据不是 Mac mini 实测,机身散热、功耗策略和软件版本都可能改变结果。64GB 确实可以运行 27B 量化模型,但长上下文已经占用了大部分内存和 GPU 资源。
普通短问题不会等待 114 秒。只按生成速度计算,一段 500 token 的回答也需要半分钟左右。单人做摘要、写作和问答尚可接受;多个 Agent 同时读取长文档、调用工具并保留各自上下文,64GB 就谈不上宽裕。
本地和云端的速度要看任务
Artificial Analysis 对同一款 Qwen3.8-27B 的云 API 测速约为每秒 47.1 至 52.9 个输出 token。本地与云端的输入长度、量化精度和推理参数不同,不能据此计算严格倍数;同一模型的云服务完全可能比单台 64GB Mac 更快。
API 还允许用户按任务切换模型。日常工作可以调用便宜模型,复杂推理、长文档和代码任务再换更强的模型。新模型上线以后也不需要重新下载、量化和维护。
因此,购买前更值得回答的问题是,自己是否真有必须在本机运行的任务。数据不能交给外部服务、必须断网、调用量长期稳定且很高,或者本地部署本身就是工作,这些需求适合优先考虑本地。
其余用户可以先查看真实 API 账单,再列出那些“没有本地 27B 模型就无法完成”的工作。如果列不出来,API 或“小模型本地、大模型上云”的组合通常更灵活。
新 Mac mini 会是一台很好的本地 AI 小主机。选 64GB 以前,最好先等 9 月 22 日之后的真机测试,再确认这份算力每天都能用上。
本文写于 2026 年 8 月 26 日。文中性能数据来自同规格 M5 Pro 64GB 平台,不是尚未发售的新款 Mac mini 真机实测。