4万多的 Mac Studio M5 Max 128G 还没到,我已经等着在本地跑 Qwen3.8-27B
花四万多买下一台还在路上的 Mac Studio,我已经先去查同配置 MacBook Pro 跑 Qwen3.8-27B 的结果,也替它安排好了到货后的第一晚。
订单页面上的绿色进度条,只走到“正在处理订单”。
8 月 27 日下单,预计 9 月 28 日至 10 月 3 日送达。41749 元已经付了,机器连包装箱都还没见着。

我不算技术宅。这次却为了 M5 Max、128GB 统一内存、1TB SSD,下了一笔过去很难想象的订单。我买下这套配置,想在自己的桌上跑起一套本地大模型。这个念头比“换一台更快的电脑”更让我兴奋。
四万多当然不是一笔可以轻描淡写的钱。它贵到我不能只拿“打开软件快一点”安慰自己。我想要的是一套留在自己桌上的 AI:模型常驻本机,材料和文章尽量在自己的机器里处理,需要时就把它叫起来。它能搭成什么样,我现在不知道;正因为不知道,等待才有意思。
这台机器的第一位住客,我已经想好了:Qwen3.8-27B。让它读中文长文,找出人名、时间、金额和出处;让它挑一篇稿子的事实缺口,陪我来回改上几轮;偶尔写点小脚本,碰到长材料时也不至于读到一半就忘了前面。现在这些都只是设想。可越是还没发生,越容易让人惦记。
机器没到,我先去看别人跑到了哪里
我能做的事情很有限,于是去找同芯片、同内存 MacBook Pro 的测试,多少算给自己解解馋。
那台参考机同样是 M5 Max、40 核 GPU、128GB 统一内存。Apple 当前规格显示,我买的 Mac Studio 也是 18 核 CPU、40 核 GPU、614GB/s 内存带宽。机身、供电和散热不同,笔记本成绩不能提前算到 Studio 头上,至少芯片和内存这两个最要紧的条件对得上。
公开记录里,Qwen3.8-27B 的社区 MLX 4bit 版本开启 MTP 后,浅上下文生成速度是 47.00 tok/s,8bit 是 28.72 tok/s;到了 8K,两者还有 36.05 和 26.44 tok/s。
这些数字要跟运行时、量化、MTP 和上下文一起看,不能提前记到我的 Mac Studio 头上。它们仍然让我踏实了一点:同一颗芯片、同样 128GB 内存的机器,确实已经把这个模型跑起来了。4bit 在那套短基准里达到 47.00 tok/s。至少,在那套锁定条件下,我已经有了一组可以参考的生成速度。
那套短基准里,4bit 的常驻内存约十几 GB,8bit 约二十多 GB。128GB 给我的期待还在后面。上下文越来越长,模型开始连续处理整批材料时,这块内存能把边界推到哪里。另一项条件没有完全展开的长 Agent 会话记录里,GPU 分配曾到 105.30GB。它不能和前面的短基准横比,更不能预测我的 Mac Studio,却让我更想知道这 128GB 到底能撑到哪一步。
我想把它变成什么
一张漂亮的跑分截图只能让我高兴一会儿。我买它想做的事还在后面。
我想先拿真实的中文材料试它。一篇很长的文章,能不能忠实地说清来龙去脉;一堆人物、时间、金额和出处,能不能找全,又不顺手编几个;同一篇稿子改到第三轮、第四轮,它还记不记得前面已经定下的边界。
然后让它连续工作一个小时。不追一张最好看的跑分,只看它能不能一直把这些事做下去,机器会不会越来越热,风扇会不会打破桌面的安静。4bit 和 8bit 怎么选、上下文能加到多长,都等真机来了再慢慢拆。现在把每一项列成表,除了让等待显得更漫长,没有别的用处。
现在只能等
我已经想过机器到手后的第一个晚上。先用最省事的方式把模型跑起来,看第一句话能不能顺利出现;随后拿出自己会用的材料,不让它只做一个昂贵的演示品。
这些想法写下来,很像一个外行给新玩具安排节目。我承认,确实有这一层。花四万多买一台电脑,若只剩下冷静的参数核对,反倒不像真的买了东西。
真机也可能让我失望。Mac Studio 未必比同芯片、同内存的 MacBook Pro 快多少,8bit 未必在我的任务里明显更好,长上下文也可能先带来漫长的等待。到货后跑成什么样,就写成什么样。
眼下的迫不及待很具体:第一批问题、第一组材料、要比较的两个版本,已经列在计划里。偏偏今天一项也做不了。
订单进度条还停在“正在处理订单”。我只能继续等。