|
事件概述:微软与Hugging Face于2026年10月3日在Hugging Face官方博客介绍ThinkingBox,并开放评测环境与ThinkingBox-Bench。它不只看代理说了什么或调用了哪些工具,而是检查任务结束后数据库记录和副作用是否达到要求,并重复运行同一任务来观察可靠性。
发布方与对象:项目由微软Copilot Studio团队与Hugging Face合作,协作者来自Toloka及多所大学。ThinkingBox面向需要评估客服、零售、保险、旅行、咨询等有状态业务流程的AI代理开发者、平台团队和安全评测人员。
关键能力与改动:基准包含507个有状态业务工作流,每个任务在独立的MCP工具会话中运行20次;评测器根据终态数据库、所需副作用和必要的语义响应进行确定性检查,而不是把一条成功回复当成完成。微软报告称,在12个模型的121,680次有效试验中,约四分之三失败了可执行检查,其中67.24%的失败仍然正常结束、调用过状态变更工具且没有报告最终工具错误。ThinkingBox还区分pass@1、pass@20和Observed 20/20,帮助团队分别衡量单次成功、至少成功一次和20次都成功。项目通过OpenEnv提供可复现接口,公开了代码、数据和运行步骤。
适用对象:要验证代理是否正确修改业务记录、是否产生额外副作用,或需要比较模型在重复执行中稳定性的企业AI团队、评测研究者和平台工程师。
实际影响与限制:ThinkingBox把“工具调用轨迹”与“业务终态证据”分开,提醒部署团队在提交前检查真实状态,并针对可恢复的工具错误设计重试和人工审批。公开基准中的客户与流程是合成重建,不是真实客户;复现实验还依赖固定版本的OpenEnv、数据、模型端点和本地服务,公开分数不等于生产成功率。评测也不能替代企业自己的权限、数据和回滚测试。
官方来源:https://huggingface.co/blog/microsoft/thinkingbox |
0