RESEARCH PLAN · PAGE 03

先找出何时值得重选,再决定训练什么

Page 02 已经说明,Router 可以读取 Agent 的执行状态,保持当前模型也能减少 cache 丢失和状态交接。Page 03 只回答三个决策问题:为什么值得继续探索、最小实验怎样验证、第一周需要投入哪些资源。

WHY

先确认“何时重选”具有独立价值

只有自适应重选在扣除 Router、cache、重试和模型交接开销后仍超过固定策略,才值得训练新 Router。

HOW

从同一状态执行不同模型和重选时机

保存 Agent 状态与外部世界快照,运行配对分支,用确定性验证器比较成功、价格和完成时间。

FIRST-WEEK INPUT

先投入一周工程试验,不投入训练集群

160 个分支起步;建议一台 32 vCPU / 128 GB / 2 TB NVMe 服务器。若模型均走 API,Phase 0 不需要训练 GPU。

现有工作已经利用执行状态和会话连续性,但还没有算清自适应重选的净收益

综合分析Page 02 中的工作已经让 Router 读取执行历史,也开始考虑 cache 和状态交接。接下来需要回答的是:中间状态改变模型优先级以后,实际切换是否仍然更划算;Router 又能否只根据决策当时可见的信息识别这种机会。

查看支撑这一判断的相关工作
TRAJECTORY EVIDENCE

执行状态已经被用于下一次模型选择

MTRouter、Hera 与 EvoRoute 已让 Router 读取历史、环境状态或经验,并在每一步选择完整模型。

仍未回答:每一步都运行 Router,扣除额外开销后是否仍比稀疏事件路由更好。

CONTINUITY EVIDENCE

保持当前模型本身具有系统价值

TRACE 为整项任务固定模型,HyDRA 在会话中保持模型,vLLM SAAR 根据 cache、模型交接和供应商内部续写状态限制切换。

仍未回答:学习得到的重选时机能否稳定超过这些强固定策略和系统规则。

COUNTERFACTUAL EVIDENCE

已有评测会从相同轨迹状态执行不同分支

TwinRouterBench 从相同前缀出发,并在分支后采用共同的后续策略;Harness-Native 则记录工具、错误、恢复和验证状态。

仍未回答:在本次已核验工作中,尚未发现从同一个 Harness 状态和同一个外部世界快照出发,系统比较“模型 × 下次重选事件”长期结果的实验。

LEARNABILITY WARNING

事后知道最佳选择,不代表 Router 能提前选对

Opportunity Is Not Realizability 区分三种收益:看到所有结果后的理论上限、只给定当前可见信息时的最优收益,以及 Router 在独立测试数据上真正实现的收益。

仍未回答:PlanIR 或 Harness 状态是否保留了路由所需的信息,以及这些字段是否混入了决策之后才出现的结果。

执行状态带来新信息新的工具结果或错误可能改变最合适的模型。
重新判断和切换都要付出代价收益必须覆盖 Router 计算、cache 丢失、上下文重读和状态交接。
Router 还要能够提前识别只有决策时可见的状态能够预测结果,理论机会才能转化为实际收益。

工具返回、测试结果和错误恢复,最可能提供新的路由信息

待检验判断“Agent 当前处于哪个阶段”未必能从系统中直接读出。因此先使用 Harness 已经记录的事件和可验证状态。若 Agent 没有明确输出计划或里程碑,就不让强模型补写一个无法核验的阶段标签。

OBSERVE外部状态到达
PLAN多为内部派生
RETRIEVE文档与 schema 到达
ACT切换与不可逆风险
VERIFY确定性结果
RECOVER错误类型与回滚
ANSWER通常没有新外部证据
第一轮实验只抓三类事件:工具或检索结果返回、外部验证完成、错误与恢复结果出现。这些事件既能从 Harness 中直接定位,也最可能带来足以改变模型选择的新信息。
查看七个 Agent 阶段的完整分析
阶段
产生什么新信息
验证与切换风险
首先检验的路由方式
OBSERVE
工具结果、页面、数据库状态或用户补充信息,可能直接暴露原输入中没有出现的约束。
可以通过事件记录和状态差异验证;需要保留未经改写的原始结果。
先检验在外部结果到达后重选,并保持到下一次外部事件。
PLAN
子目标、约束和假设主要由模型生成,通常没有增加外部证据。
计划写得清楚不等于计划正确;中途换模型还可能破坏术语和计划的一致性。
默认保持到下一次外部结果;只有计划检查失败时才重新选择模型。
RETRIEVE
检索到的文档、数据结构、记忆命中或空结果会改变上下文长度和所需领域能力。
检索是否完成通常可以验证;只交接摘要可能丢失模型选择所需的细节。
在检索结果返回后重选,不在生成检索词的过程中切换。
ACT
拟执行的工具动作主要由模型内部推导;新的外部信息通常要等工具执行后才出现。
不可逆操作和工具参数错误使这一阶段的切换风险最高。
高风险动作前可以用规则升级模型;动作发出后保持到执行结果返回。
VERIFY
测试结果、代码差异、环境奖励和约束检查可以直接区分成功与不同失败类型。
确定性验证器最可靠,而且多数验证失败仍可以恢复。
在验证结果返回后重选;机器可检查的证据优先于 LLM 判断。
RECOVER
错误类型、重试次数、回滚结果和剩余预算可能突然提高对推理、代码或工具能力的要求。
错误事件通常可以验证;新模型需要读懂前面已经发生的失败。
明确失败时允许提前结束当前模型的保持期,并选择更适合恢复的模型。
ANSWER
通常没有新的外部信息,主要任务是汇总结果并满足格式和表达要求。
此时换模型容易造成结论、术语和语气不一致。
最终回答阶段保持当前模型;只有终检失败时才重新选择。
Harness 直接记录的状态工具结果、错误、重试、用量、cache 和当前模型。直接提取,并保留事件 ID。
可以由规则确定的状态退出码、测试是否通过、上下文是否超过阈值。规则需要版本化,缺失值保留为“未知”。
由小模型概括的语义状态当前子目标、粗略能力需求和文档类型。保留置信度,并用实际执行结果校准。
由强模型推断、但难以核验的状态隐含里程碑、精确进度和剩余任务。只作为离线候选;不能与外部证据对应的字段不用作可靠标签。

只有三个判断都成立,训练 Router 才有意义

这三个判断构成研究主线:先证明动态选择在真实系统中值得做,再证明重选可以集中在少数事件,最后确认决策时可见的信息足以支持预测。任意一步失败,都不应通过训练更大的模型来掩盖。

H1 · 值不值得

动态选择带来净收益

从相同状态运行不同分支,比较任务成功率、每个成功任务的费用和首次验证成功所需时间。

继续条件
扣除 Router、cache、重试、上下文重读和模型交接后,动态策略仍优于最佳固定策略。
失败后做什么
停止训练 Router,转向 Agent Router 的系统成本测量。
H2 · 何时判断

新信息集中在少数事件之后

比较工具返回、验证结果和错误恢复之后,与普通模型调用之间的模型排序变化和净收益。

继续条件
只在这些事件后运行 Router,能够用更少的判断保留大部分收益。
失败后做什么
采用逐调用 Router,或报告事件类型没有额外预测价值。
H3 · 能不能学

决策前的状态能够预测最佳选择

只使用当时已经可见的 Harness 状态、PlanIR 或原始轨迹,在独立测试任务上进行预测。

继续条件
Logistic 或 LightGBM 扣除自身开销后仍超过最佳固定策略。
失败后做什么
检查状态缺失和标签噪声,不继续扩大 Router。
Phase 0 实际估计什么:我们从参考策略 πref 到达的同一状态出发,执行不同分支,并比较计入全部成本后的结果。它给出这些状态上的局部反事实收益上限(local Oracle),但没有覆盖新策略改变早期动作后产生的新状态。因此,端到端收益仍要在 Phase 2 中验证。两个候选模型也无法说明对新模型的泛化能力,单一 Harness 只能支持该执行框架内的结论。

最小实验分三步推进,每一步都设有停止条件

第一周先用少量分支验证实验系统,再扩大到足以判断净收益和重选时机的规模。只有前三步都通过,才进入状态表示和 Router 训练。

STEP 1 · 160

先确认实验可信

20 个状态 × 8 种动作,各运行 1 次。检查世界快照、验证器和每次模型调用记录能否正确复现与归属。

停止条件
同一状态无法恢复,或 token、工具和失败调用不能正确计量。
STEP 2 · 480–1,200

再确认动态选择有净收益

补足重复实验,并在 40–50 个随机状态运行全部动作,比较模型与重选时机是否产生稳定差异。

停止条件
扣除切换和恢复成本后,动态策略不再优于最佳固定策略。
STEP 3 · 1,680–3,000

最后判断自适应时机是否必要

扩展到 120–200 个状态,比较逐调用、固定事件和根据状态选择重选事件的策略。

停止条件
一种固定事件已经取得几乎全部收益,或事件附近没有更多可预测信息。
这三步回答的是方法是否值得做,而不是训练什么模型。Router 训练从第 4 周开始;在此之前只运行规则、固定策略和反事实分支。
查看完整的六项检查、统计条件和转向路径
CHECK 0 · 实验是否可信
快照能否复原同一个外部世界,每次模型调用能否正确计量?每个进入分析的分支都要通过世界状态哈希、验证器前置条件和调用归属检查。
未通过:先修实验系统

此时不能解释 Router 效果,但可以形成可复现的实验系统和失败审计。

通过:比较不同选择的原始差异

只有初始状态相同、外部世界相同且成本可归属的分支,才进入配对分析。

CHECK 1 · 是否存在稳定差异
不同模型和不同重选事件,是否反复产生有意义的结果差异?主要比较相对最佳固定策略的损失,并按参考策略访问各状态的频率加权。“出现多少次排序反转”只能作为辅助描述。
未通过:简单固定策略已经足够

停止开发动态 Router;结论只适用于当前模型池、任务类型和成本范围。

通过:继续计算完整系统代价

这一步只说明存在更好的局部选择,还没有证明实际切换值得。

CHECK 2 · 完整成本下是否仍有收益
计入 Router、cache 丢失、上下文重放、重试和状态交接以后,优势还存在吗?价格、成功率、p95 延迟和任务成功所需时间分别报告,不合并成一个难以解释的美元效用值。
未通过:停止方法开发,转向系统测量

此时更有价值的问题是:Agent loop 和模型切换怎样消耗了局部选择优势。

通过:检查哪些事件值得重新判断

只有确认净收益存在,才需要进一步研究 Router 应在何时重新运行。

CHECK 3 · 外部事件是否提供更多信息
只在工具返回、验证和恢复之后重新判断,能否保留大部分局部收益?将这些事件与普通模型调用比较,同时加入每次调用都重选和局部 Oracle 两个参照。
未通过:事件触发没有额外价值

转向每次调用都判断的 Router,或报告事件类型不能进一步预测模型排序。

通过:继续比较固定事件和自适应边界

这说明新信息集中在少数事件附近,减少 Router 调用次数可能可行。

CHECK 4 · 自适应时机是否优于固定事件
根据当前状态选择下一次重选事件,能否进一步超过表现最好的固定事件策略?小规模试运行结束后,预先登记“停止、继续和证据不足”三类统计区间,并校正选择最佳策略带来的偏差。
停止:额外收益小到可以排除

若 95% 置信区间上界同时低于 1 个百分点成功率和 5% CPS 改善,就采用更简单的固定事件策略。

继续:观察到具有实际意义的正收益

置信区间下界超过预先登记的成功率或 CPS 门槛,且另一项指标不变差,再进入下一项检查。

证据不足:置信区间同时覆盖停止和继续区域

只有在价格、时间和存储预算允许时才增加随机状态或重复次数。达到资源上限后仍不确定,就如实报告,暂不训练 Router。

CHECK 5 · Router 能否提前识别最佳选择
只看决策前的状态,能否在独立测试任务上选出净收益最高的动作?依次比较系统事实、PlanIR 和原始轨迹,先使用 Logistic、kNN 与 LightGBM。
未通过:停止训练更大的 Router

转而研究“机会存在但不可学习”的评测问题,并检查状态信息缺失、结果归因困难和标签噪声。

通过:进入 Phase 1

轻量 Router 在独立测试数据上实现净收益后,再进行 Phase 2 的动态端到端实验。

选择策略和检验策略要使用不同数据:模型、固定事件和 Router 类型在设计集或嵌套交叉验证中选择,最终收益只在从未参与选择的任务级测试集上计算。同一状态下观察到的最小成本只能称为训练内的局部 Oracle 上限;最佳固定策略的置信区间还要校正“从多种策略中挑出最好者”带来的选择偏差。具有实际意义的收益门槛应在小规模试运行后预先登记,不能因为点估计略高于零就继续投入。

以下三类结果会把研究引向其他问题

只有重新规划 workflow 时才有收益

主要变量已经变成规划和工作流生成,后续应转向 EASy、GraphPlanner 一类问题。

几乎所有状态都选择下一次调用时重选

结果支持现有的逐调用 Router,没有必要继续学习更长的保持时间。

几乎所有状态都选择整任务保持模型

结果支持 task pinning。此时应分析保持同一模型为何更好,而无需提出新的自适应边界方法。

先合并实际效果相同的动作:在某些状态中,下一次模型调用也恰好是下一次工具返回或任务结束;“验证后的里程碑”也可能一直不出现。实验要记录每个状态允许哪些动作,合并实际终点相同的动作,并规定长时间未触发时怎样超时和计入删失数据。否则,同一执行过程可能被误记成不同边界带来的排序变化。

实验最终只需要支持三种投入决策

实验前规划结果首先决定是否继续投入,而不是强行导向一种方法。具体统计门槛在小规模试运行后预先登记,并同时约束成功率、费用和完成时间。

停止方法开发

如果看到:动态选择没有稳定差异,或者切换、cache、重试和恢复成本抵消了局部优势。

研究产出:Agent Router 的系统成本测量、评测协议或负结果。
资源决策:不训练 Router,不扩大 API 分支规模。

实现固定事件 Router

如果看到:工具返回、验证结果或错误恢复后固定重选,已经取得几乎全部净收益。

研究产出:简单、可审计的事件触发规则及其适用条件。
资源决策:停止训练边界预测器,只实现轻量规则或分类器。

继续训练 RouteCraft

如果看到:自适应时机超过最佳固定事件,而且决策前的状态能在独立测试任务上预测这种差异。

研究产出:联合选择模型与重选事件的方法,以及同状态反事实评测集。
资源决策:先训练 Logistic、kNN 和 LightGBM;只有轻量表示不足时才考虑小模型。
查看两类需要先修数据、暂不扩大模型的问题
理论机会存在,但决策前无法识别

先检查状态缺失、结果归因和标签噪声,可转为“机会存在但不可学习”的评测研究。

原始轨迹有效,但 PlanIR 丢失信息

先补充状态表示并重新比较,不通过扩大 Router 掩盖过度压缩。

第一周需要 API、通用服务器和工程时间,不需要训练 GPU

最小实验的资源重点是可复现执行和远程模型调用。下面给出可启动工作的建议配置;它属于研究规划值,不是已经实测的硬件下限。API 金额要在前 160 个分支完成后,根据实际 token、重试和任务时长再决定。

API BUDGET

先批准 160 个执行分支

起步:20 个状态 × 8 种动作,各运行 1 次。一个分支可能包含多次模型调用。计量正确后再补到 480,并按证据决定是否扩大到 960–1,200 或一周版的 1,680–3,000。

金额怎样确定:按任务域测得每个分支 API 费用的 P95,再乘下一批分支数;估算上界超过批准预算的 80% 就不扩批。

COMPUTE

一台通用服务器即可起步

建议配置:32 vCPU、128 GB 内存、2 TB NVMe。逻辑上划分一个调度进程和两个隔离的任务 worker,用于容器、快照、验证器和日志。

扩容依据:只有 SWE 容器内存不足或任务排队成为主要工期时,才增加 worker;不先购买训练集群。

GPU

Phase 0 可以不使用训练 GPU

若两个候选模型都通过 API 调用,快照、验证器和 LightGBM 都可在 CPU 上运行。本地 GPU 不影响前三个核心判断。

以后何时需要:只有轻量特征不足,而且小型 encoder 或 0.5B–1.5B Router 的预期收益足以覆盖推理开销时,才单独申请 GPU。

PEOPLE & TIME

按一周工程验证安排人员

最低投入:1 名研究工程师全职完成 Harness 接入、快照和调用记录;建议另有 1 名研究人员复核 verifier、抽样和统计设计。

第一周交付:20 个状态可重复恢复、160 个分支可核算,并给出下一批 API、机器时间和存储的实测上界。

查看反事实分支的定义和各阶段运行量

一次反事实分支包含一段完整的 Agent 执行

先让参考策略 πref 运行并保存一个 Agent 中间状态,同时保存外部世界快照。随后从该状态执行一种(模型,下次重选事件)组合,再使用相同的后续策略运行到可验证终点。这一分支估计该状态附近的局部效果。保持到任务结束的分支通常远长于只保持到下一次调用的分支,因此相同分支数不代表相同价格或时间。

N_branch = Σ_state∼d(π_ref) Σ_feasible-action repeats(state, action)
实验阶段
状态与动作规模
累计分支数
这一阶段要回答的问题
20 个状态的工程试运行
每项任务暂取 1 个中间状态,共 20 个状态 × 8 种动作;先执行 1 次,工程检查通过后补到 3 次
160 → 480
快照能否复原、模型调用能否正确归属,以及单个分支的价格、时间和存储分布
随机参照状态
40–50 个状态 × 8 种动作 × 3 次重复
960–1,200
在不依赖主动抽样的情况下,估计原始差异、完整成本后的收益和排序稳定性
一周版 Phase 0
120–200 个状态;随机参照状态运行全部动作,其余状态只运行 3–4 种动作
约 1,680–3,000
是否继续研究自适应重选,并记录每个状态的可行动作和随机性
扩展的全因子实验
240–300 个状态 × 2 个模型 × 4 种边界 × 3 次重复
5,760–7,200
获得更完整的覆盖,但不作为第一周的默认投入
Phase 1 示例
500 个状态 × 2 个模型 × 4 种边界 × 3 次重复
12,000
形成完整的模型—边界结果向量;若只执行部分动作,需要同时发布已观察动作的标记
Phase 2
各任务域 × 入选策略 × 重复次数 × Harness
按任务域单独计算
真实 Agent loop 中的成功率、每个成功任务成本、p95 延迟和成功所需时间

表中数字为累计规模。如果工程试运行中的状态继续作为随机参照状态,不能再次相加。为了获得这些中间状态,参考策略还要先执行原始任务,这部分费用不包含在表中的分支数里。

查看如何用试运行结果更新价格、工期和存储预算

小规模试运行需要同时估算价格、工期和存储

PRICE

根据分层实测结果估算价格

分别汇总不同任务域、模型和边界产生的输入、cache 读写、输出、推理、工具和失败费用。总预算采用 95% 预测上界,并让该上界不超过已批准预算的约 80%,为重试和长尾分支留出余量。

TIME

分别计算任务完成时间和整批实验工期

记录每个分支的 p50/p95、排队、工具执行、快照 I/O 和模型推理时间。整批实验还会受到速率限制和长尾任务影响,不能简单用平均时长除以理论并发数。

STORAGE

按照实际新增的存储量估算

SWE 环境共用只读 OCI 层,每个分支只保存写时复制(CoW)产生的增量。实际测量基础状态、状态差分、日志、工具产物和外部世界差分占用的字节数,并保留约 20% 余量。

工程试运行全部成功,仍不能证明系统绝不会出错:即使 60 次独立恢复全部成功,按二项模型估计,真实失败率的单侧 95% 上界仍约为 4.87%。因此,每个进入配对分析的分支都要单独检查快照状态。无法归属的供应商调用和缺失的 token 计量应标记为“未知”,不能记为 0。

只有前一项结果支持继续,才增加下一类投入

现在建设外部世界快照、每次调用记录、确定性验证器和 20 个状态的工程试运行。
工程检查通过后把远程分支从 160 次逐步增加到 480 次和 960–1,200 次,同时检查预算。
确认存在净收益后训练 Logistic、kNN、LightGBM,并构造确定性的 PlanIR。
轻量状态表示确实不足后再使用教师生成的 RouteCard、小型 encoder 或 0.5B–1.5B Router。
端到端实验成立后再增加第二套 Harness、AppWorld、长记忆压力测试和在线 bandit/RL。

前三周决定是否停止,后五周属于条件性投入

W1–W3 分别检查实验可信、动态选择有净收益和自适应时机有额外价值。三项都得到支持后,才开始训练 Router、建设评测集和扩大端到端实验。

周次
完成什么
回答什么问题
什么条件下继续
W1
固定 Harness 版本;完成 20 个状态的工程试运行;实现世界状态哈希、快照和每次调用记录
同一个状态和外部世界能否可靠恢复,成本能否正确归属
若未通过,只修实验系统,不运行大批模型分支
W2
抽取 40–50 个随机参照状态;完整执行 2 个模型 × 4 种边界;每项重复 3 次
不同选择是否产生稳定差异,计入全部系统代价后是否仍有净收益
若没有净收益,停止开发动态 Router
W3
扩展到 120–200 个状态;比较事件触发、固定事件、整任务固定和逐调用路由
外部事件是否提供更多信息,自适应时机是否超过最佳固定事件
若事件没有额外价值,或固定事件已经足够,MVP 在此结束
前三周通过后,查看 W4–W8 的条件性计划
周次
完成什么
回答什么问题
什么条件下继续
W4
实现 State Compiler 和 PlanIR v0;比较 Logistic、kNN、LightGBM;检查标签泄漏
决策时可见的状态能否预测最佳选择
只有净收益和自适应时机的额外收益都存在才启动
W5
整理 Phase 1 数据格式、模型—边界结果向量,以及排序、遗憾和校准基线
能否形成可发布的反事实评测集,PlanIR 是否保留足够信息
若 PlanIR 失败,转向状态表示或系统测量问题
W6
在 τ²-Bench 和 SWE-bench 子集运行动态端到端实验
离线观察到的收益能否在真实 Agent loop 中转化为成功率、成本和时间收益
轻量 Router 仍有净收益才继续
W7
增加第二套 Harness,并改变价格、负载和 cache 条件
结论适用于哪些任务和系统,是否依赖特定 Harness
若跨系统失败,就把结论限定在已经验证的范围内
W8
增加 AppWorld 或长记忆压力测试;整理代码、数据和论文
证据最终支持新方法、评测集、固定规则还是负结果
论文主张只覆盖实验真正支持的范围

当前建议:批准一周工程验证和首批 160 个分支

当前判断 · 有条件继续

先测清现象和资源消耗,再决定是否训练 Router。

本周投入:1 名研究工程师、一台建议配置为 32 vCPU / 128 GB / 2 TB NVMe 的服务器,以及首批 160 个反事实分支产生的 API 费用。实现薄 HarnessAdapter、外部世界快照、每次实际模型调用记录和确定性验证器。

本周交付:20 个状态可以重复恢复;每个分支的成功、token、cache、重试、工具、价格和完成时间可以归属;给出下一批 API 和机器时间的 P95 预算。

暂时不投入:训练 GPU、强教师批量标注、0.5B–1.5B Router、强化学习、第二套 Harness、AppWorld 和大规模全因子数据。

继续条件:工程检查通过后才扩大到 480 和 960–1,200 个分支;前三周确认净收益和自适应时机的额外价值后,才进入 Router 训练。

前三周的检查通过后,下一页再讨论 PlanIR 和 Router 训练。下一步先判断哪些状态字段足以支持模型选择,哪些字段会提前暴露执行结果,然后再决定是否需要训练小模型。
返回目录 →

来源、暂定判断标准与证据状态

  1. 直接 Agent routing 证据:MTRouter(ACL 2026 long)HeraEvoRouteTRACE-RouterTwinRouterBench 在本页按 preprint 使用。论文报告仅适用于各自模型池和协议。
  2. 系统连续性证据:HyDRAvLLM SAAROpenSquilla 0.5.3。系统事实来自论文、官方文档和固定代码审计。
  3. 方法学依据:Opportunity Is Not Realizability 用于区分事后 Oracle 给出的理论机会和可部署 Router 真正实现的收益;Harness-Native technical report 提供 Harness 状态和数据积累方法;MemoryCraft 提供固定执行协议、逐调用计量和 Agent loop 成本审计,在本页作为实验方法参考。
  4. 暂定判断标准:分支数量来自实验设计的直接计算;1 个百分点的非劣范围、1 个百分点/5% 的额外收益门槛、80% 的预算使用上限和 6–8 周安排,都只作为前期实验的候选值。需要根据小规模试运行结果,在正式预注册前修订。

阅读说明:本页引用的已有结果来自论文和官方系统;三个假设、六项检查和资源上限属于后续研究计划。页面列出多种可能结果,是为了提前规定怎样解释实验,并不表示已经知道实验会得到哪一种结果。