工作流设计:从手工到自动搜索
AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流
本页解决的问题
先给结论「工作流设计:从手工到自动搜索」要解决的关键问题是什么?
AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流
让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。
写下一个问题:试完这个方法后,你能用什么证据回答它?
结论听起来很完整,却没有检查最关键的假设。
管线流程:
- 提出研究想法
- →
- 写代码
- →
- 跑实验
- →
- 分析结果
- →
- 写论文
- →
- 同行评审
角色体系:
工作机制:
1. Meta-Agent 先生成一个高层描述(Agent 的架构、工具使用、推理策略)
2. 将高层描述实现为可执行代码
3. 通过 self-refine 检查新颖性:确保不是简单重复已有方案
4. 在基准任务上评估,保留表现最好的设计
关键创新:用代码作为 Agent 设计的搜索空间表示,使设计可以被自动生成、修改和评估。
MCTS 优化流程:
- 初始化起始工作流作为搜索树的根节点
- 用 soft mixture of score and uniform exploration 选择待扩展节点(平衡利用与探索)
- 让 LLM 生成修改后的工作流变体(添加/删除/修改节点和边)
- 在目标任务上执行并评估新工作流的表现
- 如果有改进,加回搜索树中作为新的候选
- 重复直到 top-k 平均分稳定或达到计算预算
| 方法 | 设计方式 | 搜索策略 | 核心优势 |
|---|---|---|---|
| 手工设计 | 人类专家迭代 | 无(凭经验) | 可解释性强 |
| ADAS | Meta-Agent + 代码 | Self-refine | 自动化设计 |
| AFlow | 图表示 + MCTS | 蒙特卡洛树搜索 | 系统化搜索 + 稳定收敛 |
核心洞见
- 搜索空间巨大:工作流的组合可能性远超人类手动探索的能力范围,手工设计只能触及冰山一角
- 设计即搜索:把工作流设计当作搜索问题,用算法(如 MCTS)取代直觉去寻找好的解决方案
- 代码是通用语言:Harness 本质上就是编排 prompt、工具调用、子 Agent、控制流、记忆和工作流逻辑的代码
- 从 ADAS 到 AFlow 的进化:Agent 设计的自动化程度在不断提升,从让 LLM 设计进化到让算法系统化搜索
「当工作流本身成为搜索空间,设计就从艺术变成了工程」里的算法代价曲线
「AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流」真正训练的不是背诵步骤,而是识别重复工作:输入变大时,程序到底多做了多少次比较、移动或递归。
先找重复工作,再谈快慢
「AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流」可以拆成输入规模、每轮做什么、以及是否能缩小下一轮范围三个问题。Big-O 是描述增长趋势的语言,不是对每台机器的精确计时;常数、内存和真实数据分布也会影响最终结果。
- 用 soft mixture of score and uniform exploration 选择待扩展节点(平衡利用与探索)
- 让 LLM 生成修改后的工作流 变体(添加/删除/修改节点和边)
- 重复 直到 top-k 平均分稳定或达到计算预算
别把理论最优当成无条件最优
面对 AI 写出的算法,先用小输入手算一遍,再用逐渐放大的数据做基准测试。这样才能把「AI Scientist / ADAS / AFlow,用 MCTS 和 Meta-Agent 搜索最优工作流」从一句结论变成可检查的性能判断。
从「当工作流本身成为搜索空间,设计就从艺术变成了工程」走到「手工设计的工作流」
「当工作流本身成为搜索空间,设计就从艺术变成了工程」先把问题落在「从完全手工的管线设计,到用 MCTS 自动发现最优工作流,Agent 系统的设计范式正在发生根本转变。代码是定义 Harness 的通用语言」上;到了「手工设计的工作流」,讨论继续推进到「💬 说人话: 工作流就是给 AI 安排的 做事流程表 。就像新员工入职,你得告诉他「先做 A,再做 B,出问题找 C 核对」。以前这张流程表全靠人一步步写,下面这两个例子就是人手工写出来的最强流程表。 Lu et al. 2026 AI Scientist 构建完整的科研自动化管线 核心思想: 将科学研究的完整流程交给一个 Agent 系统自动完成:从零开始执行一轮完整的研究循环。 管线流程: 提出研究想法 → 写…」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。
把这条判断带到下一个场景
算法题换成真实任务后,先找出重复工作,再问输入规模如何变化,最后用一个小基准验证理论判断。这样不会把复杂度记成脱离场景的标签。
- 「当工作流本身成为搜索空间,设计就从艺术变成了工程」:从完全手工的管线设计,到用 MCTS 自动发现最优工作流,Agent 系统的设计范式正在发生根本转变。代码是定义 Harness 的通用语言
- 「手工设计的工作流」:💬 说人话: 工作流就是给 AI 安排的 做事流程表 。就像新员工入职,你得告诉他「先做 A,再做 B,出问题找 C 核对」。以前这张流程表全靠人一步步写,下面这两个例子就是人手工写出来的最强流程表。 Lu et al. 2026 AI Scientist 构建完整的科研自动化管线 核心思想: 将科学研究的完整流程交给一个 Agent 系统自动完成:从零开始执行一轮完整的研究循环。 管线流程: 提出研究想法 → 写…
- 「最后的要点」:设计即搜索 :把工作流设计当作搜索问题,用算法(如 MCTS)取代直觉去寻找好的解决方案
最后的「最后的要点」把讨论落到「设计即搜索 :把工作流设计当作搜索问题,用算法(如 MCTS)取代直觉去寻找好的解决方案」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。
我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。
读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。
如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。
还没有这篇文章的讨论。