eviso's thinking

9.83GB能跑不代表能干活

CONTENTS

短题平手的诱惑

一组社区实测把 2026 年本地模型的门槛重新拉低了。27B 级模型的 Q2_K_XL 压缩版只有 9.83GB,约为 30GB 版本的 32.8%;12GB 显存的游戏卡可以启动;在 72 道短题上,差距压在小数点附近,几乎可以视为平手。这个数字的传播力很强,因为它把本地 AI 从专业显卡降到了消费级硬件,也把隐私、离线和不按 token 付费这三件事放进了普通用户的可选清单。

数字先放在这里,情绪先停一停。普通人被吸引,不是因为想研究量化算法,而是因为终于觉得本地模型像一件能拥有的工具。真正的问题随之而来:拥有一个能启动的工具,和拥有一个能承担工作的同事,中间隔着完整的交付链。

但短题平手只说明模型在受限问答里保留了大部分知识召回和推理样式,不说明它能承担工程交付。同一个来源的 41 个 agent 长任务给出了裂缝:Q2_K_XL 完成 27 个,Q4_K_M 完成 35 个,折算成功率约 65.9% 对 85.4%。短题成绩接近,长任务差了约 20 个百分点,这不是排名差异,是能不能托付任务的差异。

这里的版本口径需要保守处理。该社区帖称其为 27B 端侧 Agent 模型,但公开版本命名与既有资料存在冲突,本文不把发布时间和具体谱系当成事实,只把它当作一份部署样本。样本的价值不在证明某个版本 official,而在暴露量化模型在长流程中的失效方式:参数保住了答案,却在连续规划、工具调用和失败恢复中漏气。

把 9.83GB 当结论会误导采购。它是一个启动条件,不是交付条件。启动条件的任务是让进程活着,交付条件的任务是让任务闭环;前者看显存,后者看长任务成功率、上下文占用、验证成本、失败恢复和人的复核时间。2026 年真正的分界线已经从 12GB、24GB、48GB 的容量表,移到 70%、85%、95% 这类任务完成率区间。

Agent把评测变成交付

短题 benchmark 像课堂测验,题目边界清楚,工具少,时间短,评分规则稳定。agent 任务像工地交付:模型要读项目结构,决定改哪里,调用工具,处理报错,再根据测试结果回滚或继续。它面对的不是一道题,是一条会累积误差的流程。每一步只错 5%,连续十步后的可靠性就会显著下滑。

这也解释了量化为什么先在长任务里露馅。轻度量化主要压缩参数表达,短问答可以用概率优势抵消精度损失;长任务还要维持状态、约束、计划和对反例的敏感度。上下文越长,模型越需要在多个约束之间保持一致性,压缩带来的模糊会在某个步骤被放大成路径错误。

可以做一个粗略拆解。Q2_K_XL 的长任务失败率约 34.1%,Q4_K_M 约 14.6%,两者相差 19.5 个百分点。如果任务是单步问答,这个差距只影响体验;如果任务是十个环节的流水线,哪怕每环节只增加少量失败概率,最后都会体现为人工接管、重跑和复核。工程上最贵的往往不是第一次生成,而是失败后的恢复。

失败样本比平均分更有价值。Q2_K_XL 的 14 个未完成任务,是部署边界的直接提示:哪类工具调用漏了参数,哪类多文件修改走偏,哪类测试失败后开始空转。知道失败在哪里,才知道它能不能被用在低风险环节。

《多维度思考》法则48说,错误不是失败,而是告诉你通向成功路上出现了障碍。这个提醒适合放在部署表旁边。长任务评测的目标不是给模型定罪,而是把障碍翻译成边界:可以自动起草,必须人工合并;可以跑本地检索,不能直接改生产配置;可以总结日志,不能独立执行清理。

边界写下来以后,工具才有机会变成同事。同事的价值不在于从不出错,而在于出错的位置可预期,出错以后能停下来,把风险交还给有权限的人。模型部署也一样,先承认它会漏气,再谈它适合接哪一段管道。

我的工作流现在长期同时使用 Claude Code、Hermes 和 Codex,多 agent 任务是常态而不是演示。判断一个执行入口时,我看的不是它能不能启动,而是它能不能完成可验收任务:文件是否改对,测试是否跑通,失败后能不能恢复,上下文是否还能承接下一步。这个标准来自日常代价,不是来自厂商表格。2026 年的工具选择越来越像排班,不是一个模型终身任职。

tok/s不是工期表

社区实测里还有一个反直觉结论:更高 tok/s 不等于更短总耗时。轻量化模型每秒输出更快,但可能多想两到三倍,推理轮次增加,总时间反而更长。用户看到的是任务结束,不是解码动画;仪表盘上的 tok/s 只描述瞬时输出速度,不描述路径长度、返工次数和验证等待。

这就像汽车仪表上的时速。时速高不代表旅程短,绕路、拥堵和返程都会改变总时间。模型部署要看的不是瞬时速度,而是单位任务耗时:一次代码修改从提交到验证通过用了多久,一次资料整理从检索到成稿用了多久,失败重来以后又是多久。

上下文窗口也要拆开看。实测指出,窗口开大本身主要占用显存,真正把速度拖慢的是把内容塞满以后的长上下文计算。这是一个容易被误解的工程问题:容量是静态占用,注意力计算是动态负担。买大内存不等于免费获得长任务能力,塞满上下文后的等待才是实际账单。

Mac 端又加了一层变量。同一台 M3 Ultra 开投机解码后从 34 tok/s 提升到 88 tok/s,提升约 159%。这类数字说明统一内存和投机解码在特定 workload 上有优势,但结论仍要回到任务成功率。速度可以改善体验,不能自动修复规划错误。

我的硬件分工也遵循这个逻辑。MacBook 是驾驶舱,负责交互、判断和临时验证;Mac mini 常驻在线,承接长任务和定时工作。这个安排不是追求跑分,而是让交互设备不被批量任务拖住,让常驻设备有足够时间完成可复核输出。设备分工是术,任务闭环才是道。

选型矩阵怎么排

如果只按显存买模型,选择会退化成能跑与不能跑。更合理的矩阵至少有六列:任务长度、任务成功率、上下文占用、总耗时、失败恢复成本、数据是否必须离线。短问答和代码补全可以靠近轻量端;多文件修改、跨系统调度、长程 agent 和高风险文件操作要向高保真端移动。

按该样本,Q4_K_M 约 16.5GB,相当于 30GB 版本的 55%,在 41 个长任务中完成 35 个,作者也把它列为推荐平衡点;Q2_K_XL 约 9.83GB,胜在门槛,输在长程可靠性。两者不是优劣关系,是场景分层。若以日常开发辅助粗排,Q4 可以占 70% 以上的可托付任务,Q2 更适合放在草稿、总结和离线检索这类 30% 的低风险位置。

这个平衡点不是配置表上的荣誉,而是把失败次数、等待时间和人工接管折成同一张工单。工单看得下去,才有资格谈成本结构;工单看不下,低价只会变成排期风险。采购表也因此从硬件清单变成交付清单。

《竞争战略》第二章对总成本领先有一个提醒:成本优势不是把价格压低,而是通过设施、经验、控制和管理形成能抵抗竞争的结构优势;同时技术变化可能让过去投资和学习失效。放到本地模型上,小显存不是完整优势,只有当更低占用与可接受成功率、可预算总耗时、可恢复失败路径结合时,它才构成部署优势。

这也是采购清单容易走形的地方。硬件报价单把门槛写得很清楚,任务验收单却常常缺席;等模型跑不起来时,人们才想起补第二张表。真正成熟的本地部署,两张表要同时签,验收项要能落到任务和证据。

集中战略也能解释本地模型的机会。通用前沿能力仍被云端大模型占据,但法律、医疗、财务、代码仓库、私人知识库这类场景需要私有数据、本地工具和可审计流程。开放权重模型在特定工作流里形成转换成本,靠的不是参数第一,是与本地数据结构、权限边界和验收标准贴合。2026 年的企业采购不会再问模型能不能跑,会问它通过哪套权限、审计和回滚接入生产。

产业含义不在参数表

Horizon 8月31日记录,OpenAI 购买数万台 Mac 用于强化学习,Anthropic 也在租用 Mac 做类似工作;据报道,Nvidia 把 Apple 视为主要本地 AI 竞争对手。这个方向说明 Mac 的价值不只是个人情怀,统一内存、能效和集群可管理性在特定 RL workload 中开始进入生产账本。

这些采购动作先改变的不是性能榜,而是默认工作台。当工程师习惯在某类机器上调试、打包、部署,软件栈也会围绕这个习惯生长。入口一旦有了日常性,商业谈判就不再只按峰值算力展开。

开放权重的入口争夺也在加速。Horizon 8月30日记录,Nvidia 拟以约 130 亿美元收购 Hugging Face。交易尚未完成时,只能写成据报道;但方向足够清楚:芯片公司不再只卖算力,也要掌握模型分发、开发者习惯和部署入口。

入口之战的底层不是谁的模型更会聊天,而是谁定义默认路径。开发者第一次下载权重的地方,第一次看到微调示例的地方,第一次把模型接到本地硬件上的地方,都会沉淀成习惯。习惯一旦形成,芯片、软件和模型的议价权就会重新排队。

中国开放权重模型同样在改变可选集。GLM-5.3 权重开放后,总参数 745B,MoE 每次激活约 44B,激活量约占总参数的 5.9%。开放权重不等于完全开源,许可证、数据、训练细节和使用限制仍要看清;但它确实让本地部署、私有微调和边缘推理多了可组合选项。势在从单中心 API 转向分层基础设施。

这轮变化容易产生两个过度结论。第一个是本地模型马上替代云端,现实是长任务可靠性、工具链和运维成本仍把多数复杂工作推向云端。第二个是开放权重没有商业价值,现实是入口、微调、审计和边缘场景正在把权重变成新的分发资产。

从个人桌面往产业层看,变化不是某台机器突然变强,而是角色开始分工:芯片公司要入口,平台公司要权重,应用层要私有流程,用户要可迁移的工作产物。每一方都说开放,开放的含义却差得很远。

解释力的边界

这份部署样本的解释力有明确边界。41 个 agent 任务不是全行业基准,任务类型、工具栈、提示词、温度、上下文管理和硬件差异都会改变结果;72 道短题也不能等同于通用智力。它适合提醒选型方法,不适合推导所有 27B 模型或所有 Q2 量化的表现。

agent 任务的成功率也不是静态参数。更好的工具说明、状态管理、失败重试和人工验收,会提高同一模型的完成率;更差的项目结构会把更强模型拖入幻觉。评测告诉我们的是初始边界,不是部署后的最终能力。

开放权重的产业推论也要留出口径。收购是否完成、许可证是否收紧、硬件供应是否受出口管制影响,都会改变入口竞争。技术势能存在,商业结局未定,这些变量比模型排名更容易改判入口。

证伪条件

什么信号说明本文判断错了?第一,如果后续系统性评测显示,9.83GB 级量化模型在超过 100 个长任务中达到 85% 以上成功率,且总耗时低于 16.5GB 级方案,那么低显存与长任务可靠性的取舍就被大幅削弱。第二,如果长任务失败主要由工具链而非量化引起,换成同一 harness 后两个版本成功率趋同,则本文应把责任从模型量化转向部署工程。

第三,如果 Mac 在 RL 和本地 agent 场景的采购没有延续,开放平台入口也没有形成稳定商业化,那么产业判断需要降温。第四,如果总耗时指标在真实项目中被交互延迟和人工验证完全主导,模型速度差异不再重要,选型矩阵应更多关注权限、上下文和恢复。

本地模型的道,是让任务在可控边界内闭环;术,是量化档位、上下文、工具和回滚;势,是硬件、权重和开发者入口重组。9.83GB 解决的是能不能进门,能干活要交给完整交付链来回答。

Sources

  • X 社区部署实测帖,2026-08-29:Q2_K_XL 9.83GB、72 道短题、41 个 agent 长任务、Q4_K_M 16.5GB、上下文与 tok/s 观察、Mac 投机解码 88 对 34 tok/s。版本谱系与发布时间存在口径冲突,本文仅按社区样本处理。
  • Horizon 2026-08-31:OpenAI 购买数万台 Mac 用于强化学习,Anthropic 租用 Mac,Nvidia 将 Apple 视为主要本地 AI 竞争对手。
  • Horizon 2026-08-30:据报道 Nvidia 拟以约 130 亿美元收购 Hugging Face。
  • GLM-5.3 开放权重信息来自 Horizon 2026-09-01 相关条目:745B 总参数,MoE 每次激活约 44B。
  • 《多维度思考》,法则48,犯错的意义。
  • 《竞争战略》,第二章,通用竞争战略。
  • 作者工作流锚点:同时使用 Claude Code、Hermes、Codex;MacBook 作为驾驶舱、Mac mini 常驻在线承接长任务。