【快讯要点】微软论文 编码智能体不应按聊天请求调度
【核心细节】微软对 13.5M 次 GitHub Copilot 会话的生产轨迹分析显示,87% 的 LLM 调用来自智能体自身而非用户。用户提示会衍生出包含模型调用、工具操作与重试的自主链条。单轮内 KV 缓存命中率从首次调用的 45% 升至第三次起的 92–94%,而模型切换时骤降至 8%。论文提出轻量预测器可捕获 86–90% 的总空闲时间,表明编码智能体基础设施应按轮次调度工作流状态,而非请求级策略。
来源:Rohan Paul
(注:本文由 AI 整理生成)