模型越强,Harness越厚:多智能体管控崛起

引言
AI 编程圈正在经历一次“极简”与“复杂”的拉扯。Pi 代表的极简 Agent 思路主张少工具、短 Prompt,让模型自己发挥;另一边,多智能体协作(Agent Swarm)越做越复杂,强调系统化管控。于是一个关键争论浮出水面:底层的 Harness(模型外层的工程管控与编排)会不会被更强的模型淘汰?
前 Kimi CLI 负责人提出的观点颇具反常识:模型越强,Harness 反而会更“厚”。但这个厚度不再是给模型“补课”的堆砌,而是向上迁移到协作与管控层,承担多智能体协作、状态一致性、资源安全的“脏活累活”。
被误解的 Harness
误解一:Harness 终将被“训进模型”,彻底消失
只要真正做过工程就会明白:是 Harness 先铺了路,模型才有东西可以学。分工、协作、约束这些“社会制度”并非模型天赋,它们需要外部运行时结构去塑形。把流程结构、工具契约、权限边界都塞进模型参数,既难以泛化,也丧失可控性与可观测性。
更高智能往往解锁更复杂的真实场景。模型从能写函数,走向能主导长流程、跨系统协作,会遇到状态同步、冲突解决、审计追责这些工程问题。它们天然属于系统设计,而不是单一模型“靠记忆靠推理”能可靠兜住的范围。
误解二:模型越强,Harness 就会越薄
确实,补丁式的底层 Harness 在变薄:少些格式强约束、少写冗长教学 Prompt、减少死板重试。但这不是 Harness 的消亡,而是复杂度的上移。更强模型带来的是更多“上层管控”需求:多 Agent 的角色分工与协调、跨会话状态与记忆治理、动态权限与跨系统标准、可回滚与审计的流程控制……这些在弱模型时代根本没出现过。
简言之,过去厚是为了“补能力”,未来厚是为了“管协作”。
重新理解 Harness:模型外层的运行时工程管控层

大众常把 Harness等同于 System Prompt + 工具封装,这过于狭窄。更准确的定义是:Harness 是包裹在模型外的运行时工程管控层,目标是让模型稳定、持续、可控地与真实世界交互。它的核心要素至少包括:
- Agent 执行循环:明确意图分解、计划-执行-评估-反思的闭环,支持中断与恢复。
- 上下文与状态管理:跨会话的记忆治理、显式状态与检查点、幂等与回滚策略。
- 工具与资源调度:能力契约化(输入输出与副作用)、队列与并发控制、成本与配额管理。
- 安全与边界治理:最小权限、数据分级、合规策略、可审计日志与行为解释。
这是一种“阴阳共生”的结构:模型擅长不确定环境下的生成与推理,Harness 负责确定性的秩序与边界。两者不是替代关系,而是互补关系。
模型变强后的“厚度”会厚在哪里?

当模型升级为能驱动复杂业务的“行动者”,Harness 的厚度体现在系统级设计,而非提示词的长度。
- 多智能体协作图:角色定义、能力编排、冲突仲裁与共识形成,类似分布式系统里的调度与事务。
- 事件驱动与流程编排:用显式任务图和状态机描述长流程,支持异常分支与补偿机制。
- 记忆与知识治理:主动写入/读取策略、冷热分层、检索与更新的准入与一致性。
- 动态权限与标准化接口:跨系统工具的统一协议、沙箱执行、基于策略的能力开关。
- 可观测性与审计:从“模型答对没”转向“系统级 SLA”,关注延迟、可靠性、成本、风险轨迹。
典型场景包括客户服务的跨会话闭环、复杂代码库的多轮重构、数据管道与外部 API 的稳态调度。这些都要求 Harness 提供可预测的结构与可追踪的行为,让模型的创造力被安全地托举起来。
落地建议:何时极简,何时加厚?
- 任务边界清晰、单轮完成、低风险的场景(如摘要、改写、小工具调用),倾向极简 Harness。
- 涉及长流程、多角色、跨系统状态、需要审计与合规的场景,务必“加厚”到编排与治理层。
- 设计原则:
- 显式状态与检查点,避免“全靠模型脑子记”。
- 工具契约清晰,输入输出与副作用可验证。
- 最小权限与沙箱,默认拒绝,按策略放行。
- 幂等与可回滚,容错优先于智能炫技。
- 全链路观测与审计,系统级指标比单轮正确率更重要。
- 评估转向系统层:延迟、成本、成功率、异常恢复时间、合规事件数,构成新的质量基线。
影响与展望
从业者角色会发生迁移:提示词工程的“补丁匠”减少,走向“生成式运行时”的架构与治理。企业侧将更加重视标准化的工具协议、权限模型与消息总线,让多智能体像微服务一样被统一调度与审计。监管与风控也会前置进 Harness,形成可解释、可追责的生产体系。
长期看,Harness 会成为 AI 的“操作系统层”。模型越强,应用边界越广,系统问题越突出:协作、状态、资源与安全不会被参数化吞掉,反而需要更成熟的工程秩序来约束与放大模型的能力。极简与复杂并非对立,它们服务于不同任务分布:小任务轻装上阵,大任务厚重护航。理解这点,才能在下一个阶段做对工程取舍,搭建可靠的 AI 系统。
标签: Harness 多智能体 AI工程 Agent编排