事件概述:ServiceNow CoreAI于2026年10月2日在Hugging Face官方博客介绍AutoSynthData,用目标模型的失败轨迹和更强教师模型的成功轨迹,自动生成、验证并筛选面向企业环境的合成训练任务。
发布方与对象:发布方为ServiceNow CoreAI团队,面向需要在ITSM、企业运营等有状态系统中训练和评测AI代理的研究人员、平台工程师与企业AI团队。实验以EnterpriseOps Gym为环境,目标模型包括Gemma-4-26B-A4B-it,教师模型包括Qwen3.8-27B和DeepSeek-V4.1-Flash。
关键能力与改动:AutoSynthData把训练任务定义为系统规范、用户请求和验证器三部分。它先在目标环境中诊断目标模型的薄弱能力,再生成能力规格卡;目标阶段并行生成可执行任务,教师模型提供成功轨迹;每个候选样本都要经过执行、正向验证、负向验证、求解器评估和有限次修复,确认任务可行、参考解能完成目标且错误终态会被拒绝。Multiply阶段再扩展不同提示、实体、初始状态、工具组合和难度的变体,同时由批次审查控制覆盖率和重复度。
实际结果:在EnterpriseOps Gym Hybrid实验中,AutoSynthData生成2000条合成样本约用18小时,Gemma微调后的最佳检查点让平均Pass@1提高7.2个百分点,验证器成功率由63.01%升至68.55%;在ITSM实验中生成1994条样本约用66小时,平均Pass@1由18.77%升至27.18%。这些结果只描述对应环境与配置。
适用对象:要把代理在自有系统中的失败转化为可执行训练数据,并要求训练样本能通过确定性验证的企业研发团队。
实际影响与限制:AutoSynthData把“生成更多样本”改成围绕当前能力边界的闭环课程,强调环境可执行性、正负验证和批次覆盖,有助于减少不可用或验证器过松的训练数据。但样本生成仍依赖目标环境、教师模型、验证器设计和计算时间;官方实验在EnterpriseOps Gym的受控设置中完成,不能据此保证其他企业系统或生产代理一定提升,训练数据也需要继续做安全、隐私和偏差审查。
官方来源:https://huggingface.co/blog/ServiceNow-AI/autosynthdata |