摘要
IBM Research 的研究人员在 Hugging Face 发表文章,讨论智能体系统中的模型路由。文章认为,路由决策不应仅被当作模型选择或任务难度分类问题,而应在成本、质量、延迟、缓存行为、服务基础设施及治理约束之间进行优化。
文中称,在 AppWorld Test Challenge 的 417 项任务上,使用同一 CodeAct 智能体时,缓存机制会显著改变不同模型的实际成本比较。其所述一项延迟优先配置达到 84% 准确率、93 美元成本和 83 秒延迟;相较仅使用 Opus,成本降低 21%、延迟降低 9%,准确率低 4%。作者还称,该路由优化本身每项任务约消耗 6 毫秒和 2 kB 内存。
这意味着企业部署模型路由时,定价表或单一难度评分未必能反映端到端效果;缓存命中、服务状态和合规限制等运行条件可能改变成本与延迟的实际权衡。