跳转至

SkillOpt:自进化智能体技能的执行级优化策略

概述

SkillOpt(Yang 等,Microsoft,2026)是一种文本空间优化器,专为冻结参数的 LLM 智能体训练可复用的自然语言技能文档——无需更新模型权重。它不依赖微调,而是将一个紧凑的 Markdown 文件(skill.md)作为唯一的可训练参数,通过带评分的轨迹 rollout、反思驱动的编辑以及留存集验证门控来学习优化该文件。训练产出的最终制品是 best_skill.md(通常为 300–2,000 个 token),在推理时仅需将其前置于任意冻结目标模型,无需额外的模型调用。

该方法发表于 arXiv:2605.23904,并在全部 52 个评测单元(模型、基准测试、运行框架的组合)中取得最优或并列最优的结果。

SkillOpt 概念示意:有界的技能编辑在验证误差曲面上向更优的任务专属技能收敛,避免了临时更新带来的不稳定性

图 1:技能文档的优化曲面。有界编辑配合留存集选择门控可实现稳定收敛(蓝色路径),而临时更新则产生幅度过大、不稳定的跳跃(红色路径)。右侧面板将神经网络训练概念映射到其文本空间对应项。来源:microsoft/SkillOpt(MIT 许可证)

核心概念

技能文档作为可训练状态

SkillOpt 将技能文档视为冻结智能体的外部参数。该文档包含: - 任务级指令与工具调用指南 - 从成功轨迹中提炼的少样本示例 - 经优化精炼的领域专属启发式规则

这种设计将智能体行为改进与模型权重更新解耦,使技能文档可跨不同模型规模、厂商及运行框架(harness)复用。

文本空间优化循环

训练循环与基于梯度的优化相对应,但完全在自然语言空间中运作:

权重空间概念 SkillOpt 文本空间对应
参数 技能文档
梯度方向 基于轨迹推导的编辑方向
学习率 编辑预算(约束每轮编辑范围)
验证检查 留存集选择门控
稳定训练配置 批次 / 小批次 / 调度策略 / 门控
动量 / 慢速更新 被拒编辑缓冲区;轮次级元更新

训练超参数(文本空间)

  • Epochs:在训练集上进行多轮遍历
  • Batch size:每轮采样的轨迹数量
  • Textual learning rate:控制单次已接受编辑的结构变动幅度
  • Rejected-edit buffer:记录历史被拒编辑,防止优化振荡

可部署制品

训练结束后,仅保留 best_skill.md,其特点如下: - 推理时零额外模型调用 - 可跨模型规模迁移(已在 7 个目标模型上验证) - 可跨运行框架迁移(直接对话、Codex CLI、Claude Code CLI) - 无需进一步优化即可迁移至相邻基准测试

架构

SkillOpt 完整训练流水线:小批次 rollout 经过优化器模型处理,合并验证后,要么被接受写入 best_skill.md,要么被拒绝存入缓冲区;每轮结束后,轮次级元更新对优化器本身进行精炼

图 2:SkillOpt 完整训练流水线。上方:各小批次 rollout 证据并行发送给优化器模型实例,优化器提出原子级编辑;这些编辑经合并、在文本学习率预算约束下排序后,通过验证门控筛选。下方:每个 epoch 结束后,优化器元技能对改进、回退、持续失败与稳定成功的模式进行反思,并据此更新后续优化器调用。来源:microsoft/SkillOpt(MIT 许可证)

训练阶段逐步说明:

  1. 冻结的目标智能体在带评分的任务批次(训练集 rollout)上运行。
  2. 独立的前沿优化器模型接收每个小批次,并提出结构化的 add / delete / replace 编辑操作。
  3. 编辑操作经聚合、在文本学习率预算约束下排序后,应用为有界候选技能。
  4. 候选技能在留存选择集上评测——仅当分数严格提升时才被接受;否则加入被拒编辑缓冲区。
  5. 每个 epoch 结束后,轮次级反思步骤分析改进、回退与持续失败的规律,生成元技能更新,影响后续优化器模型的调用方式。
  6. 所有 epoch 中验证分数最高的技能作为 best_skill.md 输出。

部署阶段:best_skill.md 前置于不变的目标模型,无需新增任何模型调用。

评测结果

跨 6 个基准测试、7 个目标模型、3 个运行框架的评测结果:

运行框架 GPT-5.5 平均准确率提升
直接对话 相对无技能基线提升 +23.5 个点
Codex 智能体循环 +24.8 个点
Claude Code CLI +19.1 个点

基准测试:SearchQA、ALFWorld、DocVQA、SpreadsheetBench、LiveMath 及另一个智能体任务。

对比结果:以 52/52 的成绩全面超越 Trace2Skill、TextGrad、GEPA、EvoSkill、人工设计技能及单样本技能。

SkillOpt 在 SpreadsheetBench、SearchQA 和 LiveMath 上的轮次学习曲线:留存集最优分数(橙色)稳定维持在未见测试泛化分数(绿色)之上,而训练 rollout 分数(蓝色)则存在较大波动

图 3:三个基准测试在各 epoch 检查点上的学习曲线。留存集选择门控(橙色,"Selection best")能可靠地追踪泛化性能(绿色,"Unseen test"),同时抑制噪声更大的训练 rollout 信号(蓝色)。来源:microsoft/SkillOpt(MIT 许可证)

优势

  • 使用无法微调的冻结生产 LLM 的团队(出于成本、合规或模型访问限制)
  • 需要跨多个模型厂商保持统一行为基线的智能体
  • 需要最小化推理时提示词开销的场景
  • 跨运行框架部署(同一技能文件可用于直接对话、Codex 和 Claude Code)

局限

  • 训练阶段需要一个独立于目标模型的前沿优化器模型来提出编辑
  • 训练成本与 rollout 量及优化器模型调用次数成正比——并非零成本离线过程
  • 技能文档可能无法捕获需要结构化状态或工具记忆的深度程序性行为
  • 技能向分布差异显著的基准测试迁移的效果尚未得到验证

与现有智能体技能规范的关系

SkillOpt 的 skill.md 制品在概念上与 SKILLS.md 规范(Anthropic,2025)相邻——该规范使用 Markdown 文件编码按需调用的智能体工作流。SkillOpt 通过数据驱动的优化自动生成此类文档,无需人工整理。两者相辅相成:SKILLS.md 定义接口,SkillOpt 可填充内容。

最佳实践

领域 建议
优化器模型选型 即使目标模型规模较小,也应选用前沿模型(如 GPT-4 级别)作为优化器——编辑质量直接决定验证收益
批次大小 较大的批次可降低编辑噪声,但会增加训练成本;建议初始每轮采用 8–16 条轨迹
文本学习率 每轮编辑幅度应保持有界;训练早期的大规模结构重写容易过拟合到批次伪特征
验证集 使用独立于训练集和测试集的留存集;跨基准迁移需要多样化的验证覆盖
技能文档长度 300–2,000 token 为实际可用范围;文档过长会出现收益递减且提高前置成本
迁移能力 在宣布跨领域迁移成功之前,应在二级基准测试上进行验证;分布外任务的效果增益无法保证

参见

参考资料