最慢的 Flash 也比最快的 Luna 快,我把 Sol 留给了难题
54 轮同题测试里,最慢的 Flash 仍比最快的 Luna 先交卷;速度、可用线和难题表现,最后变成了一张 Hermes 排班表。

测试跑完,报告里有两个数字很扎眼。
DeepSeek V4 Flash 最慢的一轮用了 28.747 秒。GPT-5.6 Luna 最快的一轮用了 29.111 秒。
在这 54 轮测试里,最慢的 Flash 仍然先交卷。
我一直觉得 Flash 用在 Hermes 里很顺。回答出来得快,格式通常听话,拿来继续做事也少有大修。可“感觉很快”这种话写进文章,跟饭店门口那句“本店味道正宗”差不多,老板自己说了不算。
于是我让 Hermes 按同一套题正式跑了 54 轮,看看这份顺手究竟能不能落到数字上。
三个模型跑了 54 轮
测试机是一台 Mac mini M2,16GB 内存。Hermes 版本是 0.20.0。
六道题分为低、中、高三档,包括合同信息提取、时间计算、证据强弱判断、任务排程、合同解除后果和 Hermes 日志诊断。每道题跑三次,三个模型各跑 18 次。
Flash 用 deepseek-v4-flash/high,Luna 用 gpt-5.6-luna/max,Sol 用 gpt-5.6-sol/max。测的是进程启动到最终答案完成的整轮时间,里面包含 Hermes 和各自通道的开销。
这个口径很贴近我的真实使用。我点下去以后,需要等多久才能拿到答案,这才是每天会碰到的那只表。
最慢的 Flash 没有掉出队伍
Flash 的整轮中位时间是 24.5 秒,18 次落在 23.1 到 28.7 秒之间。
Luna 的中位时间是 38.4 秒,范围是 29.1 到 43.8 秒。Sol 的中位时间是 38.3 秒,范围是 31.1 到 48.1 秒。
拿六道题分别比,Flash 比 Luna 快了 7.7 到 16.7 秒。六道题全部是 Flash 先完成,没有靠某一道特别占便宜的题撑起整个中位数。
全部 54 次正式运行也都交了答案,本次没有超时,没有记录到 fallback,也没有出现“合同作废”这类严重错误。
我愿意把这叫作“这 18 次很稳”。长期稳定性还需要更长时间的记录,18 次成功不能替未来作保。
快还得过可用线
只看速度,这篇文章写到这里就可以收工了。我更在意答案能不能接着用。一份 15 秒出来的东西,要是得重写半小时,这 15 秒也没多大本事。
按测试的严格机器评分,Flash 有 10 次直接可用,Luna 有 11 次,Sol 有 14 次。
Flash 没有拿到最高的直接可用率。它的价值落在另一处。把“轻微修改后可用”也算进来,Flash 和 Sol 都是 15 次,Luna 是 14 次。Flash 用明显更短的等待,迈过了同一条可用线。
T2 到 T4 三道低、中难度题里,三个模型全部拿到 10 分。T1 结构化提取题有一些字符串和数组的形式差异,内容仍然基本可用。
这类活很常见。从材料里抽字段,算时间,给判断归类,或者按依赖关系排个计划。Flash 不用每次都拿满分,它只要快速交出一份能接着干活的答案,我就愿意让它坐在常驻位置。
难题给 Sol 留出了位置
两道高难度题让事情多了一点变化。
第一道要求根据题内法条,处理合同解除后的返还、赔偿和结算。机器评分把三个模型全部判为需要重做,Flash、Luna、Sol 的中位分别是 6、2 和 4。
这道题的自动评分很看关键词,对“返还 6 万元”这种实际处理反而没有单独给分。因此,6、2、4 不适合拿来排法律能力座次。它至少提醒了我,三个模型都没有稳定覆盖人工设定的全部检查点。法律结论这种活,还不能放心地点一下就对外交付。
第二道高难度题要诊断一段 Hermes 时钟日志,找出 300 秒等待的来源,还要列出后续最低限度的监测项。Flash 的中位得分是 8.33,Luna 和 Sol 都是 10。Sol 对请求时间、实际模型、超时和回退的覆盖更完整。
这一题里,Sol 多等的十几秒换来了更少的补字。这就是我想给高阶模型留下的工作。
它不需要天天坐在前台。
我给 Hermes 重新排了班
测完以后,Flash 继续做我的常驻主力。
日常的信息提取、整理、计算和第一轮诊断,我会让 Flash 直接做。它交卷早,大部分答案又能继续用,少改一两处也比坐着等更强的模型划算。
法条需要结合事实时,我会切到 Sol。材料互相打架,或者答案要直接拿去行动,我也愿意多等十几秒。Sol 在这类任务中充当二审,帮我查漏项,最终还得由人决定能不能用。
Luna 在这组题里的位置比较尴尬。它的等待时间和 Sol 差不多,严格评分下直接可用次数又少于 Sol。这六道题还不足以给 Luna 做综合定性,却已经足以影响我在当前 Hermes 里的排班。
一个小任务多等 14 秒,连做六个就是一分多钟。如果结果只需要我改一个字段,这笔等待没有必要。碰到合同结论和复杂日志时,漏掉一项的代价可能高得多,Sol 就有了位置。
这 54 轮没有给我一张模型总排名。它给了我一张排班表。
Flash 手脚快,坐在前台先接活。Sol 多看几眼,留给做错比等待更贵的事。
大模型全部挤在前台,看着人手充足,最后可能只是排队更长。
本文结论只适用于这台 Mac mini M2、Hermes 0.20.0、上述模型档位和六道测试题。整轮时间不等于纯模型生成速度。