RELATED WORK · PAGE 02

现有 Router 已经解决了什么?还缺少哪些证据?

本页按照模型选择发生的时机梳理相关工作,比较它们如何选模、能读取哪些 Agent 状态,以及计入了哪些系统成本。通过这些比较,可以明确当前研究已经做到哪里,以及要让 Router 根据状态决定下一次何时重选,还需要补充哪些证据。

DECIDE EARLY

在请求或任务开始时选定模型

Router 只运行一次,容易保留 cache 和会话连续性;判断依据主要来自初始 prompt。

DECIDE OFTEN

在执行过程中逐轮重新选择

工具结果、测试失败和恢复状态都能进入决策;系统需要承担多次 Router 计算和潜在模型切换。

DECIDE ON EVENT

在工具或验证事件后重新选择

系统等到可观察事件出现再调用 Router;现有实现通常预先规定哪些事件触发重选。

比较 Router,需要同时看四个问题

本页的比较方法第一,Router 何时被调用;第二,它能读取哪些任务状态;第三,它能执行哪些动作;第四,它是否同时改动 Agent workflow。四个问题分别描述调用时机、可见状态、动作范围和流程影响。

现有方法常用的六类决策机会

FIGURE 01 / DECISION OPPORTUNITY
请求前Prompt Router
任务开始Task pinning
固定 K 轮后Escalation
每轮 / 每次调用Trajectory routing
固定事件触发Sticky session
Workflow 节点邻近路线
这些节点列出 Router 可能获得决策机会的位置,不表示严格时间顺序或频率高低:事件触发可能比逐调用更密,也可能更疏。是否修改 workflow 需要另看矩阵最后一列。
决策时机
代表工作与动作
可利用的状态
下一次何时重选
请求前
RouteLLM、SCOPE、R²:选择模型或预算
Query 与模型实测档案
通常不再选择
回答后
FrugalGPT:接受回答或升级模型
Query、候选回答与升级状态
验收失败后继续升级
任务开始
TRACE、Agent-as-a-Router:固定本任务模型
任务入口信息与过去任务反馈
任务终止后再选
固定 K 轮后
SWE-Router:继续便宜模型或升级
便宜模型已经执行 K 轮的轨迹
K 由实验者预设
每轮 / 每次调用
MTRouter、Hera、Twin、SAAR 等
历史、工具、预算、错误、验证与连续性
固定在下一轮或下一次调用
固定事件
HyDRA:事件发生后重新选择模型
当前消息、session 标记与模型档案
上下文压缩、摘要等预设事件
Workflow 节点
GraphPlanner、EASy、Aragog:生成或调度节点
Workflow、milestone 或服务负载
由生成流程或预定义 DAG 决定
这张表给出的核心观察:本轮样本覆盖了请求前、回答验收、任务开始、固定 K、逐轮调用和系统事件等常见机会集合。多数方法预先规定下一次重选发生在第 K 轮、下一次调用或某个事件;它们学习选择哪个模型,却不学习何时再次调用 Router。

面向单次 LLM 请求的 Router:选择模型、分配输出预算或逐级升级

这类工作把一项用户请求作为评测单位。Prompt Router 在生成前选择模型;R²-Router 还会为本次回答分配输出 token 预算;cascade 则先取得候选回答,再决定接受还是调用更强模型。路由依据主要来自 query、模型实测表现和当前候选回答。

LLM ROUTER01
要解决的问题一次独立请求应该调用哪个模型、分配多少输出预算,或者是否接受当前回答。
何时作出选择生成前选择一次;或者在新的候选回答产生后,按级联规则判断是否升级。
REPRESENTATIVE METHODS · 精讲按原论文图示和公式重绘,只展开能代表一种决策机制的工作
CASCADE · ANSWER-AWARE

FrugalGPT:先试便宜的,回答不可靠时再升级

每个候选回答生成后,可靠性预测器判断是直接返回,还是继续调用更强的模型 API。

一个学出来的三级 cascade

据 FIGURE 3 重绘
Query同一个请求
GPT-J先调用便宜 API
可靠性 g ≥ 0.96?是:接受;否:升级
J1-L第二级候选回答
仍不足则 GPT-4论文示例阈值 0.37
论文在 HEADLINES 上学到 GPT-J → J1-L → GPT-4 的顺序与阈值。图中数值适用于该数据集、模型池和 2023 年价格条件。

停止位置

z(q) = min { i : g(q, fLᵢ(q)) ≥ τi }

g 读取 query 与当前回答;τi 是第 i 级的接受阈值。返回第 z 个 API 的回答。

学习目标

maxL,τ E[r(a, fLz(q))]   s.t.   E[Σi=1z CLᵢ] ≤ b

模型顺序 L 和阈值 τ 一起搜索;优化的是预算约束下的平均质量。

达到最佳单模型相同准确率时

TABLE 3 · 原文数值
数据集
最佳单模型成本
FrugalGPT 成本
HEADLINES
33.1
0.6
OVERRULING
9.7
2.6
COQA
72.5
29.6
作者据此报告分别节省 98.3%、73.3% 和 59.2%。成本与价格来自论文当时条件,不能直接外推到今天。
新增信息候选回答及其可靠性分数,为升级判断提供了初始 query 中没有的信息。
论文已经计入的费用停止前发生的各级 API 调用已经累计,因此成本包含已经尝试过的便宜模型。
尚未单独统计的开销可靠性预测器的在线时间、离线结果矩阵、级联策略搜索,以及多级模型顺序生成造成的等待。
要点

FrugalGPT 把候选回答视为新的决策信息:可靠性足够时停止,否则继续调用更强模型。它还说明 cascade 的成本应累计停止前已经发生的全部模型调用。

PROMPT ROUTING · PREFERENCE LEARNING

RouteLLM:预测强模型是否值得调用,再用阈值控制调用比例

它把约 80K 条 Chatbot Arena 偏好转成“强模型胜过弱模型”的概率;阈值变化对应不同的质量—成本工作点。

从偏好监督到一次选模

据 FIGURE 1 重绘
偏好数据query + strong/weak 胜负
轻量预测器MF、BERT 或 causal LLM
P(strong wins | q)估计调用强模型的价值
与阈值 α 比较扫描 α 得到整条曲线
Weak / Strong生成前只选择一次
RouteLLM 比较多种 Router 架构,但线上决策都归结为同一个概率与阈值。每个 query 在生成前独立选择一次模型,不读取本次生成结果。

路由规则 · Equation (2)

Rα(q) = Mweak, 若 P(strong wins | q) < α;否则为 Mstrong

α 越高,越多请求交给 weak model;调整 α 就能选择所需的成本—质量工作点。

恢复了多少强弱模型差距

PGR = [r(MR) − r(Mw)] / [r(Ms) − r(Mw)]

PGR=1 表示恢复全部性能差距;论文再沿调用比例积分得到 APGR。

同一方法的正结果与反例

TABLES 1–3 / 7
近分布条件在 MT-Bench,Arena + judge augmentation 的 matrix-factorization Router 达到 APGR 0.802;论文据其价格假设报告某工作点约 3.66× 节省。
分布偏移只用 Arena 训练时,在 MMLU 和 GSM8K 上接近或差于随机 Router;加入少量近分布数据后才改善。
Router serving 很轻Table 7 中 MF 为 155.16 requests/s、估算每百万请求 3.32 美元;但约 700 美元的 Judge 数据构建和最高 8×A100 的训练没有进入 3.66× 在线结果。
模型学到的范围在训练分布下,哪些 query 更可能需要预先指定的 strong model。
迁移限制增加 Router 参数量无法自动解决分布偏移;二元 strong/weak 判断也未提供新模型的实测能力描述。
要点

RouteLLM 表明,小型预测器可以完成请求生成前的强弱模型选择。它的分布外结果也说明,训练数据是否覆盖部署请求,可能比单纯增加 Router 参数量更重要。

JOINT ACTION · MODEL × OUTPUT BUDGET

R²-Router:同时选择模型和输出 token 预算,控制本次回答的质量与成本

它把输出 token 上限作为显式决策变量,为每个模型预测不同预算下的质量,再从“模型 × 预算”组合中选择本次请求的配置。

从“模型点”变成“模型曲线”

据 FIGURES 2 / 4 重绘
30,968 queries15 models × 16 budgets
0.6B query encoder得到 zx
模型—预算预测头预测每个点的质量
质量—预算曲线可用 anchor 插值
选择 (M*, b*)随后只生成一次
论文由强 LLM Judge 为每个回答给出 0–1 质量分,并记录实际 token。Router 训练较轻,但数据生产仍需执行大量 model × budget 组合。

质量预测

Q̂(x,Mi,bk) = σ(gi,k(Enc(x)))

每个模型—预算锚点有一个三层 MLP head,以 judge quality 做 MSE 监督。

联合决策

(M*,b*) = arg maxMᵢ,bₖ [(1−λ)Q̂(x,Mᵢ,bₖ) − λCi(bₖ)]

b 是本次回答的输出 token 预算。λ 控制预测质量和推理成本之间的取舍。

论文报告与生产代价要同时看

FIGURES 5 / 7 / 8
作者报告相近约 0.8 平均质量时,point-based baselines 按被选 LLM 的 input + output inference cost 计算,需要约 4–5× 成本;单 query 路由平均低于 400 ms、低于生成时间 1%。
接入新模型6–8 个预算 anchor 已接近 16 点效果;新增模型仍需重新测量不同预算下的表现,并训练 Router。
关键反例极短 token 限制并非所有模型都可靠遵守;完整数据构建使用强 Judge 和大规模推理,不能只报告小预测头训练时间。
理论保证的边界扩大 model × budget 搜索集合只保证 Oracle 最优值不下降,不保证预测器能找到它,也不保证加入数据采集和 Judge 成本后仍然更省。
成本统计范围论文的主要成本曲线按被选模型的 input 与 output inference cost 计算;模型能力测量、Judge 和数据生产费用需要另行核算。
要点

R²-Router 说明,同一个模型在不同输出 token 预算下会形成不同的质量—成本点。模型选择和输出长度预算可以作为一个联合路由动作,而不必把每个模型视为固定成本的单一点。

LANDSCAPE INDEX · 其余工作保留短卡片用于横向查阅,避免精讲与总览混在一起

SCOPE:用校准题构建模型能力档案,以支持未见模型接入

ARXIV PREPRINT · 2026
观察固定 model ID 的分类器难以接入新模型;候选模型需要可比较的实测描述。
方法每个模型运行约 250 个校准问题,形成实测能力档案;Qwen3-4B 再预测正确率和输出长度。
论文范围:7 个 seen 与 4 个 unseen models;项目页写代码 future release。
要点:SCOPE 根据模型的实测能力档案匹配请求,为接入训练阶段未见过的新模型提供了一种候选条件化方案。
本节小结

请求级 LLM Router 已经形成三类主要动作:生成前选择模型、同时分配输出 token 预算,以及看到候选回答后决定是否升级。它们共同说明,单次请求的成本—质量优化不只是选择一个模型,也可以联合选择生成预算和升级路径。

任务固定与固定 K 升级减少了任务内的重选次数

Agent 的奖励通常到任务结束才知道,模型切换还可能破坏 cache 和执行一致性。因此,一些工作宁愿在任务开始时固定模型;另一些工作允许便宜模型先执行固定轮数,再做一次升级判断。

ROUTE FAMILY02
要解决的问题如何避免逐调用信用分配和频繁切换,同时保留部分成本节省。
下一次何时重选任务结束,或由实验者预先指定的第 K 轮。
REPRESENTATIVE METHODS · 精讲一个把模型固定到底,一个先购买 K 轮信息;两者构成自适应边界的强对照
TASK PINNING · DELAYED REWARD

TRACE-Router:入口处只选一次,随后固定到任务结束

TRACE 不把每个 LLM call 当作独立样本。它按 task_id 维持一个活动任务表,终局正确率与端到端延迟只更新最初负责接纳该任务的 bandit。

Task admission 与后续复用

据 FIGURE 2 重绘
首次 request携带持久 task_id
规则 contexteasy / medium / hard
每 context 一个 UCB选择 backend
活动任务表task_id → model
后续 request 复用直到 terminal feedback
论文中的 context 由 regex、长度和关键词规则构造,不调用 LLM;后续请求不再运行一次新的模型选择。

分桶 UCB · Equation (9)

mt = arg maxm [ μ̂cₜ,m + √(2 log(1/δ) / Ncₜ,m) ]

每个粗粒度 context 维护独立统计;先强制探索,再在均值与探索项之间取舍。

终局更新 · Equation (11)

rt,m(α) = (1−α)at,m − α·min(ℓt,m/ℓ0, 1)

正确率 a 与整任务 latency ℓ 合成一个标量奖励;中间调用不单独分配信用。

Terminal-Bench 报告点

TABLE 1 / FIGURE 3
策略
Resolved
秒 / 任务
TRACE · α=0.75
46.8%
172
Always-27B
39.7%
270
作者报告约 +7.1 个百分点、延迟低 36%。该子集只有 48 个任务;wall-clock 含工具和环境交互,但未分解 cache、货币成本或能耗。
这样做的好处减少每次调用都要判断“哪一步应为最终成败负责”的困难,也降低跨模型切换破坏状态连续性的风险。
这样做的代价任务开始后即使出现新的工具证据,系统仍沿用初始模型选择。
要点

TRACE 代表整项任务固定模型的强对照。如果终局监督、cache 与连续性占主导,保持同一模型到任务结束可能比中途重选更省。

FIXED-K ESCALATION · TRAJECTORY VALUE

SWE-Router:先让便宜模型执行 K 轮,再判断是否值得升级

前 K 轮会产生模型费用和等待时间,同时提供“便宜模型能否完成当前 issue”的执行证据。预测失败时,强模型从原始 issue 重新开始。

固定 K 轮后的单次升级判断

据 FIGURE 1 / ALGORITHM 1 重绘
Cheap model 执行 K 轮q,(z₁,a₁,o₁),…,(zK,aK,oK)
value ≥ θ继续 cheap model
value < θstrong model 从 q 重启
Qwen2.5-Coder-7B 加二分类 head,标签来自最终 unit test success。K 由实验者预设;方法最多升级一次。

实际部署规则

continue m1 ⇔ r̂1(T≤K,1) ≥ θ

若低于阈值,系统丢弃前 K 轮上下文,让强模型从原 issue 重新执行。

信息单调性 · Theorem 4.1

V(Z)=E[max{E[U1|Z],E[U2|Z]}],   V(St) ≥ V(Q)

轨迹包含初始问题时,Bayes-optimal 决策能力不会因看到更多状态而下降;定理没有扣除 K 轮 rollout、重启和上下文重读成本。

信息增益并不稳定

TABLE 2 · ROUTE-AUC
SWE-bench VerifiedGPT-5-mini 模型对的最佳固定 K Route-AUC 为 0.709;DeepSeek-V3.2 模型对为 0.780,后者较 K=0 的 0.627 高 15.3 个点。
SWE-Smith 测试集读取时序轨迹的 GPT-5-mini 变体没有稳定优于不读取时序轨迹的基线;不同模型对的最佳 K 也不同。
轨迹为何可能有用工具 observation、执行动作和早期错误揭示了 prompt 中没有暴露的可解性。
为何不能只看定理获得信息本身要付 K 轮价格与时间;重启还可能重复读取上下文并丢失已完成工作。
要点

SWE-Router 的结果显示,检查执行轨迹的轮数 K 会影响路由效果。K 仍由实验者固定,因此自适应方法需要与调优后的最佳固定 K 比较,并计入前 K 轮、重启和上下文重读。

LANDSCAPE INDEX · 横向查阅短卡片保留发表状态、结果和与候选方案的边界

Agent-as-a-Router

ARXIV PREPRINT · 2026
观察静态 Router 会随任务和模型池变化而退化;过去任务的验证结果可以积累。
方法每个 coding task 选择一次模型,完成后把性能、成本和 trace 写回 memory,影响后续任务。
论文范围:跨任务持续学习;单个任务内固定模型,provider cache 被作者标为不可观测。
研究启示:过去任务经验可以改进下一项任务的入口选择;当前任务内部仍采用 task pinning。
本节小结

TRACE-Router 把一个模型保持到任务结束,SWE-Router 在预设的第 K 轮判断一次是否升级。两者都主动减少任务内的重选次数,因为终局奖励难以归因,而且切换可能丢失状态或迫使强模型重新开始。自适应方法需要同时超过最佳 task pinning 和最佳固定 K。

执行轨迹让 Router 能根据工具结果和错误状态调整模型

工具返回、测试、错误和剩余预算会改变对任务难度的判断。2026 年多项工作开始让 Router 读取完整历史或 Harness 状态,并在每轮或每次模型调用前重新选择。

ROUTE FAMILY03
要解决的问题把工具结果、错误和剩余预算等执行证据加入模型选择。
下一次何时重选下一轮或下一次 LLM call;重新决策频率通常固定。
REPRESENTATIVE METHODS · 精讲MTRouter 展示怎样逐轮选模;Twin 展示怎样为逐调用选择制造可执行标签
PER-TURN ROUTING · HISTORY × MODEL

MTRouter:把完整历史与候选模型一起评分

每个 Agent 交互轮开始前,Router 优先保留最近的执行历史,并逐个预测候选模型从当前状态继续执行后的最终表现。

历史编码与候选模型编码在评分器中汇合

据 FIGURE 2 重绘
Agent 历史 ht任务、动作、输出和环境反馈
历史向量表示0.6B 编码器;优先保留最近内容,约 8192 tokens
候选模型属性价格、上下文上限和知识截止时间
模型向量表示结构化属性 + 可学习残差
联合 outcome estimator对每个候选预测终局表现
arg max选下一模型;下 turn 再重选
结构化模型属性与可学习残差同时存在:前者描述可解释的模型属性,后者补充元数据无法表达的模型差异。

候选条件评分 · Equations (3–4, 8)

za=W[MLP(attra);ea]+b
θ(ht,a)=fθ([zx;za])
a*t=arg maxaθ(ht,a)

评分器逐个回答:当前历史交给这个候选模型,预计结果如何。

训练标签 · Equations (5–6)

t=Sfinal−Σi=tT−1ρi
ρi=1[Ei≠∅]·βsev(Eᵢ)·w((i+1)/Tmax)

终局分数再扣除未来 format、code、invalid-action 或 tool error;越晚错误惩罚越重。

作者报告的质量与 API 成本

TABLE 3
ScienceWorld
Score
总成本
MTRouter
53.8±3.2
$5.7
Always GPT-5
48.4±2.1
$13.9
论文另在 HLE 报告 26.0±2.3 / $35.0,对比 GPT-5 的 25.1±1.6 / $61.8。表中费用仅统计模型 API token;cost per successful task 未单独报告。
训练规模1,291 个实例、29,693 条轨迹、515,221 turns;论文估算一次性采集约 $1,620。
反事实仍不严格匹配数据来自逐轮随机选模轨迹和单模型轨迹;并未在每个相同状态下执行全部候选模型,也没有使用 IPS/DR 修正。
成本统计仍不完整向量编码 Router、工具、Judge、cache 丢失、模型交接与能耗未一起计入;跨模型 cache 丢失被论文列为局限。
要点

MTRouter 已经使用完整执行历史,并在每轮选择完整模型。RouteCraft 需要进一步检验:是否有必要同时决定模型保持多久,以及扣除切换成本后是否仍有收益。

COUNTERFACTUAL BENCHMARK · SEQUENTIAL LOCKING

TwinRouterBench:逐步降级,再用完整任务结果验证标签

它首先找强模型已成功的轨迹,然后只改当前 step 的模型 tier、保持过去锁定输出和未来强模型 continuation;只有整条任务仍通过,降级才被接受。

Sequential-locking downgrade

据 FIGURE 2 / ALGORITHM A1 重绘
Strong 成功轨迹只从已通过任务开始
锁定过去 steps使用已验证的 tier 输出
当前 step 降级尝试 low → high tier
未来恢复 strong固定 continuation policy
终局 verifier通过才接受该 tier
逐步锁定把最坏的指数搜索降到 O(|T|N)。结果对应特定的降级顺序和统一后续执行规则,用来判断当前一步能否使用更便宜的模型。

当前 prefix 的最低可行 tier

t*i=min { t∈T : ∃m∈Mt, Vi(m;xi)=1 }

LLM proposer 只用于剪枝;训练标签取自重新执行后的终局 verifier,强模型的文字判断不作为标签。

四桶 token 成本

ci(t)=[ninpin+ncrpcr+ncwpcw+noutpout]/106

区分 cache-miss input、cache-read、cache-write 和 output;这是比只乘统一 token 单价更可信的账单。

100 个 held-out SWE-bench Verified

TABLE 3 · LIVE TRACK
Policy
Resolved
API cost
Logistic router
75 / 100
$25.66
Opus 4.6
74 / 100
$54.73
作者报告相近 resolved rate 下 API cost 下降 53.1%;加入默认 $0.60 失败补救罚金后,两者账单为 $40.66 与 $70.33。
比普通日志监督更强当前步骤的标签经过实际执行验证,而且后续执行策略保持一致。
仍有顺序偏差逐步锁定的贪心策略可能漏掉多步降级之间的相互影响;只从强模型成功的轨迹出发,也会改变训练数据分布。
任务级成本统计仍不完整Router 推理、工具调用、排队与 P95 延迟、能耗,以及换模后的行为衔接尚未统一计入。
要点

Twin 已经从同一前缀比较不同模型,并统一后续执行规则。RouteCraft 若采用反事实数据,需要进一步比较“模型选择与保持时长”的组合,并保存可恢复的外部环境状态。

LANDSCAPE INDEX · 横向查阅其余逐步 / Harness-native 工作保留短卡片与证据边界

EvoRoute

ARXIV PREPRINT · 2026
问题Agent 各步骤对能力、价格和延迟的要求会变化,历史任务反馈可以沉淀为经验。
方法每一步按角色、子任务和预计工具调用检索经验;筛除明显更贵且效果更差的模型,再用 Thompson sampling 探索候选。
作者报告:在其 GAIA 与 BrowseComp+ 设置中,cost 最多下降 80%、latency 超过 70%;论文指向的 GitHub 在执行日返回 404。
研究启示:逐步、经验驱动的完整模型路由已有直接先例;下一次决策仍固定在下一步。

Hera

ARXIV PREPRINT · 2026
观察长程任务的难度会逐执行步变化;整任务只选一次 device / cloud 模型可能过于粗糙。
方法先比较本地模型和云模型在相同状态下的动作,再利用最终任务回报和后续云模型调用次数训练逐步选择器。
论文报告:达到 cloud-only success 的 92.5%,cloud 模型用于 46.3% steps;官方代码未核验。
研究启示:逐步完整模型路由和“未来强模型调用数”监督已有直接先例;下一次决策固定在下一步。

Budget-Aware Agentic Routing

ARXIV PREPRINT · 2026
观察每一步使用强模型的价值取决于当前历史和剩余预算。
方法1.5B Router 每步读取完整交互历史和剩余预算,先用监督数据训练,再用强化学习优化。
论文反例:严格预算下,把强模型用于最前几步的简单规则仍有竞争力;Router 开销只做吞吐估算。
研究启示:复杂强化学习未必超过简单时序规则,第一版实验应先比较轻量方法。

Harness-Native Data Flywheel

TECHNICAL REPORT · 2026
问题可用于路由的状态还包括 observation、artifact、tool、recovery 和 verification 等 Harness 事件。
方法OpenSquilla 把这些事件记录成结构化数据,再用规则和 LightGBM 为每一步选择模型。
作者报告:PinchBench score 93.14、平均 billed cost $0.0204/task;同一 OpenSquilla harness 的 fixed Opus score 94.33、$0.1649/task。多项持续更新机制仍是设计方案。
研究启示:直接读取 Harness 事件的 Router 已有实现;未来事件和完整任务成本仍需进一步实验。
本节小结

MTRouter、EvoRoute、Hera 与 Budget-Aware Router 在执行过程中读取历史、环境状态或剩余预算,再为下一步选择模型;TwinRouterBench 和 Harness-Native 进一步加入执行验证、cache 账单与 Harness 事件。工具结果和执行状态能够补充初始 prompt。这些方法通常仍在每一步重新选择,完整评估还需要加入 Router、cache 失效、上下文重读、重试和切换。

会话连续性让“保持当前模型”具有独立价值

每次调用都允许重新选择,并不代表每次都应该切换。已有前缀 cache、正在进行的工具调用,以及供应商内部保存的续写状态,都可能使保持当前模型更有利。

ROUTE FAMILY04
要解决的问题模型能力需求会变化,但切换会丢失 cache、状态和行为连续性。
下一次何时重选HyDRA 只在 compaction 等事件重选;SAAR 每次请求、OpenSquilla 每轮都会运行 Router,但连续性规则可能让系统保持当前模型。
REPRESENTATIVE SYSTEMS · 精讲HyDRA 学习“选谁”但固定重选事件;SAAR 每请求计算,但用连续性规则约束是否切换
CAPABILITY MATCHING · FIXED EVENT BOUNDARY

HyDRA:学习当前需要什么能力,系统预先规定何时再选

它把需求预测与模型能力档案分开:编码器预测四维能力需求,YAML 文件保存候选模型的实测表现,再按能力缺口选最便宜的可行模型。

需求预测、模型画像与 shortfall matching

据 FIGURE 1 重绘
当前消息 + 7 个状态标记512 tokens;不读历史输出和工具结果
ModernBERT + 4 个预测头输出推理、代码、调试和工具需求
公开基准测试按能力维度加权,并在当前模型池内校准
模型能力档案保存在外部 YAML 文件中,可独立于编码器更新
Shortfall matching逐模型计算四维能力缺口
最便宜 eligible model无可行项则最小 shortfall
某一维的能力富余不能抵消另一维的不足。模型能力档案和阈值可以独立更新,但新模型仍要重新运行基准测试,并按当前模型池进行相对归一化。

四个需求头 · Equation (1)

k=σ(wkT dropout(hCLS)+bk)

输入只含当前 user message 与 turn/error/file/URL/command/code/short-message flags;明确排除 prior assistant、tool output 和 repository state。

能力缺口 · Equation (5)

smk=14k max(0, r̂k−cm,k)

先取 sm≤τ 的可用模型,再选其中成本最低者;为空时 fail-open 到 shortfall 最小者。

模型保持到固定系统事件

SECTION 8 · STICKY ROUTING
Turn 1 ◆运行 Router
Keep保持当前模型/cache
Keep中途难度漂移不触发
Compaction ◆重新运行 Router
Keep直到 summary / terminal
生产策略只在新会话、显式 compaction 和 background summarization 后重新选模。◆ 表示系统预设的触发点。
论文离线结果SWE-Bench Verified 的保守工作点相对 always-strong 低 0.3 个 resolution point,作者按模型调用价格报告 cost saving 54.1%。
生产 A/B 的实际结果相对 prior control:median time-to-complete −6.4%、TTFT −4.6%、per-inference-request cost −2.3%;aggregate segment COGS 因请求量变化大致持平。
论文报告了两组延迟数据正文报告离线 CPU 路由耗时 55 ms P50 / 120 ms P99;arXiv 摘要页另报生产环境中位数 86 ms,两组数据来自不同环境,不能直接合并。
代理标签风险能力需求来自强模型与便宜模型回答的 LLM Judge 分差,并非真实任务属性;工具使用维度与人工判断的一致性也很弱。
要点

HyDRA 学习如何选择模型,重新选择的时机由新会话、上下文压缩和摘要完成等事件固定。RouteCraft 需要与这些简单事件规则直接比较。

PER-REQUEST SELECTION · CONTINUITY GATE

vLLM SAAR:先检查能不能切,再计算值不值得切

每个请求先运行已有的基础选择器;会话状态层再根据工具状态、供应商内部续写状态的硬锁,以及 cache 和模型交接惩罚,决定保持上一模型还是接受新的候选。

硬约束优先于经济权衡

据 BLOG FIGURE 3 与源码重绘
基础选择器 + 会话记录上一模型、调用轮次和切换次数、cache 记录、空闲时间、上游选模结果
处于工具调用链,或供应商状态无法迁移?是:保持上一模型
长时间空闲,或上游选模结果改变?是:清除部分连续性惩罚后重新选择
否则比较调整后的保持和切换分数
这里的“上游选模结果改变”只表示基础 Router 给出的候选名称发生变化,并不表示系统识别了 planning、verification 等 Agent 阶段。后端错误和失败回退由恢复层处理,不属于这个会话选择器。

源码规则的等价转写:保持

Astay=bcurrent+bstay+Pprefix-benefit+1toolbtool

硬锁在打分比较之前生效,更高的 base score 无法抵消它。

源码规则的等价转写:切换

Aswitch(m)=bm+qgap−whHhandoff−Pprefix−Phistory−δswitch

默认还考虑工具状态、前缀 cache、历史切换次数和切换门槛;这些分数来自系统配置或查表,并不都对应实测费用。

整场会话固定模型更省,但质量损失更大

21,600 DETERMINISTIC SYNTHETIC TURNS
Policy
Switch / unsafe
估算成本 / 质量变化
Single-turn
9,709 / 3,836
基准 / 0
Sticky
340 / 0
−98.65% / −0.1433
Full SAAR
2,011 / 0
−78.71% / −0.0453
Sticky 的估算成本更低,质量损失也更大;SAAR 位于逐请求切换与整会话固定之间。上述数字是作者在实验配置下估算的模型调用费用,完整任务成本仍需另行测量。
会话记录中保存的状态当前模型、调用轮次和切换次数、prompt/cache 写入/cache 读取/输出 token、累计费用、是否处于工具调用链,以及上一条策略。
在线系统结果2,896 个在线 ROCm 请求中,论文定义的连续性违规为 0;选择器 p95 约 6.181 ms(balanced)至 26.805 ms(stateful)。这项指标只衡量策略定义的连续性约束;论文没有报告外部 verifier 判断的任务错误率。
证据范围核心矩阵来自确定性合成工作负载;前缀 cache 和模型交接惩罚仍未覆盖真实排队、模型驻留、跨集群网络与失败恢复。
要点

SAAR 已经把基础选模、保持或切换、cache 和状态迁移约束放进每次请求。RouteCraft 需要检验,学习“保持到某个未来事件”能否超过这些逐请求固定规则。

IMPLEMENTATION INDEX · 系统查阅短卡片保留版本、结果范围,以及作为 baseline 时需要固定的附加行为

OpenSquilla 0.5.3

OFFICIAL OPEN-SOURCE · 2026
问题Router 计划选择的模型与最终实际调用的模型可能不同;供应商内部续写状态是否可迁移也需要记录。
方法每轮读取语义消息、token 用量、近五次路由历史与附件;分别记录计划选择、实际调用和 cache token。
比较条件:默认还会改变 thinking level 和 prompt policy,最高 tier 可启用模型集成;比较模型路由时需要关闭或固定这些附加行为。
研究启示:OpenSquilla 可作为第二种 Harness,用于检验同一 Router 在不同执行框架中的表现。
证据关系:Harness-Native 报告和 OpenSquilla 0.5.3 代码描述同一系统生态。前者提供方法与实验,后者提供实现细节,相关工作统计中合并为一项。
本节小结

HyDRA 用会话内模型保持保护 prefix cache;vLLM SAAR 用供应商状态、交接惩罚和硬锁限制切换;OpenSquilla 分别记录计划选择与实际模型调用。保持当前模型会同时影响费用、延迟和后续调用能否继续。重新选择时机因此既取决于任务出现了多少新信息,也取决于切换会付出多少代价。

现有工作只测量了部分 Router 开销,完整任务的成本和耗时仍缺少统一统计

Page 01 说明,多做一轮就可能多调用一次模型、再读一次上下文。引入 Router 后,系统还要承担选择模型本身的开销,包括在线判断、离线训练与模型能力测量、额外候选调用、结果验证,以及切换模型造成的 cache 丢失和排队等待。相关论文只测量了其中一部分,而且采用的指标和统计范围并不一致。

一次路由决策会在哪些地方增加成本?

FIGURE 02 / ROUTER COST LIFECYCLE
BEFORE DEPLOYMENT先建立判断依据

采集多模型结果、生成教师或 Judge 标注、训练 Router,并通过能力测试建立新模型的实测档案。

AT DECISION运行 Router

分类器、向量编码模型、检索器或小语言模型都要占用 CPU/GPU,并增加一次决策等待。

AFTER DECISION试探、升级与验证

级联调用、模型集成、固定 K 轮探索、失败回退和验证器可能增加模型、工具或测试调用。

ON SWITCH / SERVING切换与服务端等待

前缀 cache 失效、重新计算前缀、供应商内部续写状态丢失,以及排队、模型驻留、网络传输和尾部延迟。

等待时间可能来自 Router 计算、所选模型所在队列、顺序升级、重新 prefill 或工具阻塞。价格与时间分别记录,再按用户目标权衡。

Router 计算与离线准备

已有局部实测
论文已经测到

RouteLLM 报告矩阵分解 Router 约 155.16 requests/s、估算每百万请求 $3.32;R²-Router 报告单次请求平均低于 400 ms;Hera 实测约 61 ms/step;HyDRA 报告离线 CPU 路由耗时为 55 ms P50 / 120 ms P99。RouteLLM · R²-Router · Hera · HyDRA

尚未计入线上节省比例的准备成本

现有结果通常没有摊入 RouteLLM 约 $700 的 Judge 数据构建和最高 8×A100 训练、R²-Bench 的大规模模型测试与 Judge,以及 SCOPE 为每个新模型运行的 250 个校准问题。并发负载下的 p95/p99 也需要单独测量。

额外模型调用、升级与恢复

调用费用部分覆盖
论文已经测到

FrugalGPT 已累计 cascade 停止前发生的全部 API 调用费用;Unified Routing and Cascading 也把被调用模型的成本相加,并在 11 模型实验中报告约 9.53–15.26 ms 的决策搜索时间。SWE-Router 则把 cheap 模型前 K 轮探索与强模型重启纳入策略比较。FrugalGPT · Unified · SWE-Router

尚未拆分的额外等待与恢复

累计 API 价格只说明调用花了多少钱。可靠性评分、测试验证、工具执行、失败重试、失败回退和强模型重启所增加的等待时间通常没有单独报告,因此先用便宜模型的策略是否更快完成任务仍需实测。

模型切换、cache 与状态交接

主要采用费用记录或规则估算
现有工作已经计费或显式建模

TwinRouterBench 区分未缓存输入、cache 读取、cache 写入与输出四类计费;HyDRA 通过会话内保持模型来保护前缀 cache;vLLM SAAR 把工具状态和供应商内部续写状态设为硬锁,并在保持/切换分数中加入前缀 cache、模型交接与历史切换惩罚;OpenSquilla 记录计划选择、实际模型调用和状态迁移诊断。TwinRouterBench · SAAR

尚未实测的跨模型切换代价

四类 token 费用没有给出 cache miss 引起的前缀重算、排队和尾部延迟;SAAR 的多项惩罚来自规则或查表。DeepSeek Harness 固定代码还显示,跨 adapter 时供应商内部续写状态会被移除,同一 adapter 跨模型也需自行验证能否迁移。需要从同一 Agent 状态分别执行“保持”与“切换”,直接比较新增价格、时间和失败风险。固定代码

排队、工具等待与任务尾延迟

完整任务时间缺少统一测量
论文已经测到

TRACE-Router 报告包含工具与环境执行的平均任务用时;Hera 报告平均端到端轨迹时间;Harness-Native 的多模型集成实验报告 p50/p95,但不能说明只选一个模型时的 Router 延迟;Aragog 在负载实验中报告端到端 P25/P50/P95,并显式读取排队状态。相邻的模型服务工作也说明,前缀复用、prefill 与 decode 之间的资源干扰会改变平均延迟和 p99。TRACE · Hera · Aragog · Preble · DistServe

尚未统一报告的任务完成时间

本轮核验尚未发现一项工作同时报告:经过外部验证的任务完成时间、p95/p99、Router 计算、排队、工具、失败恢复,以及跨模型 cache 和状态交接。无法观察供应商队列时,应明确标为 unknown。

避免重复统计

同一次实际模型调用只计算一次。重试和错误恢复用于说明为什么出现了额外调用;新增调用计入模型费用,等待计入任务完成时间。离线训练、Judge 和模型能力测试单独说明如何分摊。

把现有证据放在一起

几类论文分别补上了不同部分:基础 Router 测量在线选模开销,cascade 累计升级产生的模型调用,会话系统记录 cache 和供应商状态,serving 工作测量排队与重新 prefill。完整评估需要同时覆盖 Router、Agent 执行和模型服务三层。现有论文尚未在同一执行协议下,把这些量统一成每个成功任务的价格和完成时间。

邻近研究提供了 workflow、停止和重新规划的时间控制方法

方法参照这些工作同样研究一项策略要保持多久,控制对象包括 workflow、Agent 角色、答案 refinement、上下文管理和重新规划。它们为时间扩展决策提供方法先例;端到端比较时需要单独控制 workflow 和任务目标的变化。

Workflow 与 milestone执行路径的时间结构

GraphPlanner · EASy · Aragog

GraphPlanner 联合选择角色、模型和 workflow;EASy 逐个生成 milestone 与 DAG;Aragog 在预先给定的 DAG 阶段按负载选择模型配置。

控制的动作

生成 workflow、分配角色,或在已有 stage 中调度配置。

对本页的启示

Milestone 和 stage 都能提供有意义的时间单位;实验需要把模型选择收益与 workflow 变化分别统计。

下一模型与当前终止结束当前过程的判断

Router-R1 · Critique Controller

Router-R1 同时拆分问题、选择模型并聚合答案;Critique Controller 每轮选择下一模型,同时输出 stop 或 continue。

控制的动作

决定当前解题或答案改写过程是否结束。

对本页的启示

模型与停止可以联合决策;这里的 stop 结束当前过程,未来何时再次允许选模仍是另一个变量。

配置、上下文与计划状态失效后的重新考虑

ARC · AgentSwing · SyncPlan

ARC 为整条请求选择 Agent 配置;AgentSwing 在规则触发后比较上下文管理分支;SyncPlan 检测计划是否因环境变化而失效。

控制的动作

保持或更新 Agent 配置、上下文管理策略和计划。

对本页的启示

SMDP option、lookahead 和 staleness detector 为“保持多久”提供理论和算法参照,控制对象与完整模型选择需要分别定义。

本页采用的研究范围:保持原 Agent workflow,动作选择一个完整模型,同时指定下一次允许 Router 重新选择模型的未来事件。邻近方法用于解释时间边界与停止策略,直接实验则需要固定 workflow、工具和任务目标。

现有工作覆盖了多种固定重选时机;自适应重选仍需实验验证

截至 2026-08-18,本轮英文一手资料已经覆盖请求前选模、任务固定、固定 K 升级、逐轮路由和事件触发。下一步需要检验的组合是:保持原 Agent workflow,同时选择完整模型和下一次允许 Router 重新选择模型的未来事件。关键判断标准是计入全部系统代价后是否仍有净收益。

现有文献已经覆盖的能力

  • 根据初始输入选模、cheap-first 升级和整任务固定模型
  • 固定 K 轮后升级,以及每轮或每次调用重新选模
  • 读取执行历史和 Harness 事件,并用模型实测档案接入部分新模型
  • 用 cache、状态迁移和会话保持规则限制切换
  • 在 workflow 阶段分配模型,或同时选择下一模型和当前停止
  • 从相同前缀执行分支,并学习配置、上下文或计划保持多久

RouteCraft 仍需通过实验回答的问题

  • 联合选择:能否同时选择模型和下一次重新选模的事件
  • 执行条件:保持原有工具、规划和执行流程
  • 外部验证:边界由工具反馈、测试或环境状态确认
  • 分支比较:从相同 Agent 状态和外部世界执行模型—边界组合
  • 完整评估:计入 Router、cache、重读、重试、状态交接、工具和任务完成时间
  • 主要对照:任务固定、固定 K、逐调用和固定事件策略

RouteCraft 的候选问题:选定模型后,保持到哪个事件再重新选择?

FIGURE 03 / CANDIDATE RESEARCH QUESTION
当前 Harness 状态

任务进展、工具结果、错误、预算、cache 与当前模型。

联合选择(model, boundary)

在边界触发前保持模型;失败、超时或安全风险按预先规定的安全规则中断。

外部事件触发

到达所选事件后,Router 再次选择模型和保持时长。

NEXT_CALL下一次模型调用
NEXT_OBSERVATION下一次工具反馈
VERIFIED_MILESTONE外部证据确认子目标
TASK_TERMINAL整任务结束
待验证假设首先观察不同 Agent 状态下最合适的模型保持时长是否发生变化;再检验计入 Router、模型切换和上下文重读后,动态策略是否仍优于最佳固定时机。安全中断规则在实验前确定,提前中断的分支单独统计。

现有证据要求 RouteCraft 先做现象验证

EVIDENCE 01

分别报告理论机会和实际收益

Opportunity Is Not Realizability在线 PDF)区分三层结果:已知全部分支结果时的理论上限、只使用当前可见状态时的理论收益,以及 Router 在未参与训练的数据上实际实现的收益。

EVIDENCE 02

对照方法覆盖四种主要重选策略

至少比较整任务固定模型、固定 K 轮升级、每步重新选模,以及带会话保持规则的保持/切换策略。

DECISION 03

把信息价值和切换代价同时测量

下一页要逐阶段检查:哪些 Agent 事件带来足以改变模型选择的新信息,哪些只增加 Router 开销。

RELATED-WORK VERDICT · REVISE

先验证重选时机是否有价值,再决定是否训练 Router。

RouteCraft 当前适合继续做现象验证:检查 Agent 事件是否会改变最佳模型,以及这种变化能否补偿重新决策和模型切换成本。只有在未参与调参的数据上仍能实现一部分理论收益,才值得继续投入更复杂的 Router。

下一页:把这些问题转成可执行的研究决策树:每一步说明继续、收窄或停止的条件,并估算需要运行多少个反事实分支。继续阅读 Page 03 →

来源与证据状态

  1. 正式论文:FrugalGPT(TMLR 2024);RouteLLM(ICLR 2025);A Unified Approach to Routing and Cascading(ICML 2025);LLMRouterBench(Findings ACL 2026);Router-R1(NeurIPS 2025);R²-Router(ICML 2026);MTRouter(ACL 2026 long);GraphPlanner(ICLR 2026)。
  2. Workshop / preprint / technical report:SWE-Router 为 ICML 2026 workshop preprint;TRACE、SCOPE、HyDRA、Hera、EvoRoute、TwinRouterBench、Budget-Aware、Agent-as-a-Router、Iterative Critique Controller、ARC、AgentSwing、SyncPlan、Opportunity Is Not Realizability 与 Aragog 按 preprint 标注;EASy 明示 under review;Harness-Native 按 technical report/preprint 标注。
  3. 开源系统:vLLM Semantic Router 固定提交OpenSquilla 0.5.3 固定提交。系统事实来自官方代码和文档,不将其等同于同行评议论文结论。
  4. 成本与延迟的邻近系统证据:Aragog 在固定 workflow 阶段中根据负载和排队状态选择配置;Preble(ICLR 2025)研究前缀复用与负载均衡;DistServe(OSDI 2024)分离 prefill 与 decode,并用 TTFT/TPOT 的服务目标评估。后二者用于解释等待机制,作为系统证据引用。
  5. 未核验:SCOPE、HyDRA、Hera、TRACE、Budget-Aware、EASy、Iterative Critique Controller、ARC 与 Aragog 的官方代码未核验;SWE-Router 仅核验官方 Hugging Face 组织,源码仓库未核验;SyncPlan 论文写明代码将公开,执行日未核验到官方仓库。

阅读说明:卡片中的“论文报告”只适用于原论文的模型池、benchmark、价格与执行协议,不能横向组成统一排行榜。卡片中的“研究启示”是本报告基于多篇来源作出的综合判断。相关论文 PDF 已保存在本地分类目录。