先确认“何时重选”具有独立价值
只有自适应重选在扣除 Router、cache、重试和模型交接开销后仍超过固定策略,才值得训练新 Router。
Page 02 已经说明,Router 可以读取 Agent 的执行状态,保持当前模型也能减少 cache 丢失和状态交接。Page 03 只回答三个决策问题:为什么值得继续探索、最小实验怎样验证、第一周需要投入哪些资源。
只有自适应重选在扣除 Router、cache、重试和模型交接开销后仍超过固定策略,才值得训练新 Router。
保存 Agent 状态与外部世界快照,运行配对分支,用确定性验证器比较成功、价格和完成时间。
160 个分支起步;建议一台 32 vCPU / 128 GB / 2 TB NVMe 服务器。若模型均走 API,Phase 0 不需要训练 GPU。
综合分析Page 02 中的工作已经让 Router 读取执行历史,也开始考虑 cache 和状态交接。接下来需要回答的是:中间状态改变模型优先级以后,实际切换是否仍然更划算;Router 又能否只根据决策当时可见的信息识别这种机会。
MTRouter、Hera 与 EvoRoute 已让 Router 读取历史、环境状态或经验,并在每一步选择完整模型。
仍未回答:每一步都运行 Router,扣除额外开销后是否仍比稀疏事件路由更好。
TRACE 为整项任务固定模型,HyDRA 在会话中保持模型,vLLM SAAR 根据 cache、模型交接和供应商内部续写状态限制切换。
仍未回答:学习得到的重选时机能否稳定超过这些强固定策略和系统规则。
TwinRouterBench 从相同前缀出发,并在分支后采用共同的后续策略;Harness-Native 则记录工具、错误、恢复和验证状态。
仍未回答:在本次已核验工作中,尚未发现从同一个 Harness 状态和同一个外部世界快照出发,系统比较“模型 × 下次重选事件”长期结果的实验。
Opportunity Is Not Realizability 区分三种收益:看到所有结果后的理论上限、只给定当前可见信息时的最优收益,以及 Router 在独立测试数据上真正实现的收益。
仍未回答:PlanIR 或 Harness 状态是否保留了路由所需的信息,以及这些字段是否混入了决策之后才出现的结果。
待检验判断“Agent 当前处于哪个阶段”未必能从系统中直接读出。因此先使用 Harness 已经记录的事件和可验证状态。若 Agent 没有明确输出计划或里程碑,就不让强模型补写一个无法核验的阶段标签。
这三个判断构成研究主线:先证明动态选择在真实系统中值得做,再证明重选可以集中在少数事件,最后确认决策时可见的信息足以支持预测。任意一步失败,都不应通过训练更大的模型来掩盖。
从相同状态运行不同分支,比较任务成功率、每个成功任务的费用和首次验证成功所需时间。
比较工具返回、验证结果和错误恢复之后,与普通模型调用之间的模型排序变化和净收益。
只使用当时已经可见的 Harness 状态、PlanIR 或原始轨迹,在独立测试任务上进行预测。
第一周先用少量分支验证实验系统,再扩大到足以判断净收益和重选时机的规模。只有前三步都通过,才进入状态表示和 Router 训练。
20 个状态 × 8 种动作,各运行 1 次。检查世界快照、验证器和每次模型调用记录能否正确复现与归属。
补足重复实验,并在 40–50 个随机状态运行全部动作,比较模型与重选时机是否产生稳定差异。
扩展到 120–200 个状态,比较逐调用、固定事件和根据状态选择重选事件的策略。
此时不能解释 Router 效果,但可以形成可复现的实验系统和失败审计。
只有初始状态相同、外部世界相同且成本可归属的分支,才进入配对分析。
停止开发动态 Router;结论只适用于当前模型池、任务类型和成本范围。
这一步只说明存在更好的局部选择,还没有证明实际切换值得。
此时更有价值的问题是:Agent loop 和模型切换怎样消耗了局部选择优势。
只有确认净收益存在,才需要进一步研究 Router 应在何时重新运行。
转向每次调用都判断的 Router,或报告事件类型不能进一步预测模型排序。
这说明新信息集中在少数事件附近,减少 Router 调用次数可能可行。
若 95% 置信区间上界同时低于 1 个百分点成功率和 5% CPS 改善,就采用更简单的固定事件策略。
置信区间下界超过预先登记的成功率或 CPS 门槛,且另一项指标不变差,再进入下一项检查。
只有在价格、时间和存储预算允许时才增加随机状态或重复次数。达到资源上限后仍不确定,就如实报告,暂不训练 Router。
转而研究“机会存在但不可学习”的评测问题,并检查状态信息缺失、结果归因困难和标签噪声。
轻量 Router 在独立测试数据上实现净收益后,再进行 Phase 2 的动态端到端实验。
主要变量已经变成规划和工作流生成,后续应转向 EASy、GraphPlanner 一类问题。
结果支持现有的逐调用 Router,没有必要继续学习更长的保持时间。
结果支持 task pinning。此时应分析保持同一模型为何更好,而无需提出新的自适应边界方法。
实验前规划结果首先决定是否继续投入,而不是强行导向一种方法。具体统计门槛在小规模试运行后预先登记,并同时约束成功率、费用和完成时间。
如果看到:动态选择没有稳定差异,或者切换、cache、重试和恢复成本抵消了局部优势。
如果看到:工具返回、验证结果或错误恢复后固定重选,已经取得几乎全部净收益。
如果看到:自适应时机超过最佳固定事件,而且决策前的状态能在独立测试任务上预测这种差异。
先检查状态缺失、结果归因和标签噪声,可转为“机会存在但不可学习”的评测研究。
先补充状态表示并重新比较,不通过扩大 Router 掩盖过度压缩。
最小实验的资源重点是可复现执行和远程模型调用。下面给出可启动工作的建议配置;它属于研究规划值,不是已经实测的硬件下限。API 金额要在前 160 个分支完成后,根据实际 token、重试和任务时长再决定。
起步:20 个状态 × 8 种动作,各运行 1 次。一个分支可能包含多次模型调用。计量正确后再补到 480,并按证据决定是否扩大到 960–1,200 或一周版的 1,680–3,000。
金额怎样确定:按任务域测得每个分支 API 费用的 P95,再乘下一批分支数;估算上界超过批准预算的 80% 就不扩批。
建议配置:32 vCPU、128 GB 内存、2 TB NVMe。逻辑上划分一个调度进程和两个隔离的任务 worker,用于容器、快照、验证器和日志。
扩容依据:只有 SWE 容器内存不足或任务排队成为主要工期时,才增加 worker;不先购买训练集群。
若两个候选模型都通过 API 调用,快照、验证器和 LightGBM 都可在 CPU 上运行。本地 GPU 不影响前三个核心判断。
以后何时需要:只有轻量特征不足,而且小型 encoder 或 0.5B–1.5B Router 的预期收益足以覆盖推理开销时,才单独申请 GPU。
最低投入:1 名研究工程师全职完成 Harness 接入、快照和调用记录;建议另有 1 名研究人员复核 verifier、抽样和统计设计。
第一周交付:20 个状态可重复恢复、160 个分支可核算,并给出下一批 API、机器时间和存储的实测上界。
先让参考策略 πref 运行并保存一个 Agent 中间状态,同时保存外部世界快照。随后从该状态执行一种(模型,下次重选事件)组合,再使用相同的后续策略运行到可验证终点。这一分支估计该状态附近的局部效果。保持到任务结束的分支通常远长于只保持到下一次调用的分支,因此相同分支数不代表相同价格或时间。
表中数字为累计规模。如果工程试运行中的状态继续作为随机参照状态,不能再次相加。为了获得这些中间状态,参考策略还要先执行原始任务,这部分费用不包含在表中的分支数里。
分别汇总不同任务域、模型和边界产生的输入、cache 读写、输出、推理、工具和失败费用。总预算采用 95% 预测上界,并让该上界不超过已批准预算的约 80%,为重试和长尾分支留出余量。
记录每个分支的 p50/p95、排队、工具执行、快照 I/O 和模型推理时间。整批实验还会受到速率限制和长尾任务影响,不能简单用平均时长除以理论并发数。
SWE 环境共用只读 OCI 层,每个分支只保存写时复制(CoW)产生的增量。实际测量基础状态、状态差分、日志、工具产物和外部世界差分占用的字节数,并保留约 20% 余量。
W1–W3 分别检查实验可信、动态选择有净收益和自适应时机有额外价值。三项都得到支持后,才开始训练 Router、建设评测集和扩大端到端实验。
本周投入:1 名研究工程师、一台建议配置为 32 vCPU / 128 GB / 2 TB NVMe 的服务器,以及首批 160 个反事实分支产生的 API 费用。实现薄 HarnessAdapter、外部世界快照、每次实际模型调用记录和确定性验证器。
本周交付:20 个状态可以重复恢复;每个分支的成功、token、cache、重试、工具、价格和完成时间可以归属;给出下一批 API 和机器时间的 P95 预算。
暂时不投入:训练 GPU、强教师批量标注、0.5B–1.5B Router、强化学习、第二套 Harness、AppWorld 和大规模全因子数据。
继续条件:工程检查通过后才扩大到 480 和 960–1,200 个分支;前三周确认净收益和自适应时机的额外价值后,才进入 Router 训练。
阅读说明:本页引用的已有结果来自论文和官方系统;三个假设、六项检查和资源上限属于后续研究计划。页面列出多种可能结果,是为了提前规定怎样解释实验,并不表示已经知道实验会得到哪一种结果。