统一智能体执行轨迹,评测工具调用,核算时延与成本,并在候选版本退化时生成发布阻断与整改队列。
以下摘录自发布者现有说明,不代表平台已完成运行验证。完整交付范围、限制与验收要求请继续阅读原文。
包含 4 个独立技能目录,每个都有 _meta.json、SKILL.md、OpenAI Agent 配置、README、Python 执行器和脱敏输入输出样例。 4 个脚本均可在 Python 3.10 以上独立运行,输出 UTF-8 JSON;相同输入应得到相同 event_id、评测、汇总和门禁结论。 验收应能识别遗漏/禁用工具调用,计算 P95 时延与自定义费率成本,并在候选指标超过阈值时生成 BLOCK 和整改队列。 错误输入不得静默通过;ID 重复、时间倒置、场景引用缺失或指标字段不完整时应停止并提示修正,原输入不被修改。 不包含第三方账号、API 凭据、模型额度、监控 SaaS、OpenTelemetry Collector、真实生产日志、代部署、长期运维或事故响应服务。
已脱敏的 run、agent、model/tool span、起止时间、状态与 token 导出 每个测试场景的期望工具、调用次数、必需参数键和禁止工具 组织自行确认的模型与工具计价规则,不提供时允许保留未知费率项 基线版本汇总指标及允许退化阈值 测试环境发布、例外审批与回滚责任人
分别进入 4 个技能目录,先按 README 使用 examples 做最小验证;所有输入采用 UTF-8 JSON。 按 4 步顺序运行 Python 脚本,把标准化结果映射到第二、三步,再把评测和画像指标写入第四步候选数据。 在测试环境核对 PASS/BLOCK、异常 span 和估算成本,只有门禁通过或完成有记录的人工例外审批后,再由负责人操作真实发布系统。
本套装交付本地规则脚本、样例和操作说明,不会自动采集 OpenTelemetry、Langfuse、n8n、Dify、Coze 或其他平台数据,也不会替代平台原生日志、专业安全测试和人工发布审批。买家需要依据自身数据分类、隐私制度、模型版本、工具权限和实时供应商价格维护输入规则;哈希与脱敏不能自动消除所有重识别风险。工具调用“符合预期”不等于业务答案正确,成本估算不等于账单,回归门禁也不能证明零故障或绝对合规。正式上线前必须使用代表性测试集、保留上一可回滚版本,并由有权限人员复核阻断与例外。
以下为套餐组成,实际执行顺序请按上方工作流说明。安装所需环境、账号与外部服务费用请在购买前确认。
Profile agent latency, tokens, retries, failures, and estimated cost from user-supplied rates.
Compare baseline and candidate agent metrics and create a blocking remediation queue for regressions.
Compare observed agent tool calls with expected tools, argument requirements, and forbidden operations.
Normalize redacted multi-agent and tool spans into deterministic local observability records.