多智能体连续工作 16 天，验证契约和串行执行是关键

Factory 工程师 Luke 分享多智能体系统 Missions 架构，核心在于解决人的注意力瓶颈。该系统采用编排、工作、验证三角色分工，强调“先定义完成标准”再写代码，通过串行执行降低协调开销，并强制结构化交接以支撑长周期任务。不同角色匹配专用模型，编排逻辑主要依赖提示词，使团队能同时处理的工作流数量从 10 条提升至 30 条。

发布于2026年5月9日 22:53

编辑小创

评论0 条

阅读0

#智能体工程 #提示词工程

Factory 的开发工程师 Luke 分享了他们内部多智能体系统 Missions 的架构设计。架构的技术并不炫，但体现了一个非常朴素的思想，软件工程的瓶颈已经从"模型够不够聪明" 变成了"人的注意力够不够用"。工程师手边堆着 50 个需求，每天只能推几个。模型能力早就不是卡点，人的带宽才是。

五种协作模式，Missions 用了四种

Luke 总结了多智能体协作的五种模式：委派、创建者-验证者、直接通信、协商、广播。Missions 选了其中四种，搭成一个“三角色”架构：

编排者：负责规划，拆任务，决定下一步做什么

工作者：负责写代码，实现功能

验证者：负责检查，确认做到没有

三个角色，各司其职，听起来简单。但魔鬼藏在细节中。

验证契约：写代码之前先定义"完成"

这是我觉得整个设计里最聪明的一环。在写任何代码之前，系统就定义好“完成”意味着什么。不是模糊的“能跑就行”，而是可能包含数百个具体的确认点。为什么这很重要？因为智能体自己写代码自己测试，本质上是在确认自己已经做出的决策，很难抓到自己的 bug。而验证者从不看代码，天然就是对抗性的。就不存在“既当运动员又当裁判”的问题。

串行执行：慢就是快

这个选择挺反直觉。并行跑多个智能体，听起来效率更高对吧？他们试了，结果协调开销把速度提升全吃掉了。智能体之间互相覆盖改动、做重复工作、架构决策打架。所以 Missions 的做法是：功能层面串行，只读操作才并行。表面慢了，但错误率大幅下降。长期任务里，正确性的提高会产生复利，越跑越快。

结构化交接：每个智能体离场必须交班

工作智能体完成功能后，必须填一份交接文档，什么完成了、什么没有、跑了哪些命令、退出码是什么。一旦捕获到错误，系统会自动拉回正轨。他们最长的任务跑了 16 天，比一个完整 sprint 还长。能跑 16 天不崩，靠的就是这种严格的交接纪律。

不同角色用不同模型

这个点也很关键。规划需要慢而审慎的推理，实现需要代码流畅度，验证需要精确的指令遵循。甚至验证者可以用完全不同的模型提供商，避免相同训练数据带来的偏见累积。Luke 他们管这个叫 "机器人耳语术"，理解不同 LLM 怎么交互、在哪里失败、失败如何在连续几天的运行中叠加放大。这不是调参数，这是在对不同模型的性格做编排。

编排逻辑几乎全在提示词里

这意味着每次模型升级，系统都会自动变强，不需要重写代码。通过这种多智能体架构，一个五人团队以前同时处理 10 条工作流，现在能跑 30 条。

Prompt Evolution ：迭代提示词设计让多智能体性能提升 30%

在多智能体系统中，提示词质量而非模型能力才是决定表现的关键。通过对主智能体、分析智能体、编码智能体和评判智能体提示词的系统性演进，工作流效率能够提升 30%。核心方法包括：明确智能体角色边界，将约束显式编码，将编码智能体从“作者”降格为“编译器”，以及依据失败模式驱动迭代。这一实践揭示了工业级 AI 工作流的本质。越确定性的任务越需要确定性的约束，而非期待模型自行领会意图。

高级提示词实用指南：打造精准高质量 AI 图像

文章指出 AI 图像生成效果不佳的根本原因在于提示词质量，而非工具本身。核心观点是使用结构化描述替代模糊指令，将“主体+环境+风格+光线+细节”五个维度纳入提示词。描述越具体， AI 生成方向越明确，随机性越低。常见问题包括概念混搭、关键词堆砌、忽视光线设定等。实用技巧是把提示词当作向朋友描述画面，保持语义连贯。提示词质量直接影响点击率，这种结构化思维与写产品需求文档、设计简报的逻辑相同。

LLM 工作原理： Prompt Engineering 解析

大语言模型本质是概率引擎，通过 Token 切分和数字编码逐步预测下一个内容。由于概率采样的非确定性特性，输出存在自然波动，这是设计而非缺陷。温度参数控制输出创意度，最大 Token 数限制回复长度， Top-P 核采样限定选词范围，上下文窗口决定记忆容量。实操建议：温度和 Top-P 只调其一，配合最大 Token 数系统性配置，可有效提升提示词工程的可控性。

#提示词工程

阅读全文

互动讨论

评论区

围绕《多智能体连续工作 16 天，验证契约和串行执行是关键》展开交流，未登录用户可浏览评论，登录后可参与讨论。

评论数

登录后参与评论

支持发表观点与回复一级评论，互动后将同步到消息中心。

登录后评论

暂无评论，欢迎成为第一个参与讨论的人。

多智能体连续工作 16 天，验证契约和串行执行是关键

验证契约：写代码之前先定义"完成"

编排逻辑几乎全在提示词里

相关文章

Prompt Evolution ：迭代提示词设计让多智能体性能提升 30%

高级提示词实用指南：打造精准高质量 AI 图像

LLM 工作原理： Prompt Engineering 解析

评论区