|
【事件概述】Google Cloud于2026年9月29日宣布GKE Agent Sandbox面向强化学习(RL)和评测工作负载的一般可用版本,并同步发布Agent Sandbox RL编排SDK及Gymnasium、NVIDIA NeMo Gym、OpenHands等工具集成。
【对象与发布方】对象是GKE Agent Sandbox及Agent Sandbox RL orchestration SDK,发布方为Google Cloud;官方发布日期为2026年9月29日,作者为Tinsley Shi与Tomer Glottmann。
【关键能力与改动】该方案用SandboxWarmPool预热可复用环境,并结合GKE Image Streaming处理高数量容器镜像;SDK提供异步Python API、可插拔warm-pooling策略、快照与挂起恢复、沙箱分叉和滚动回收。Google在10节点gVisor沙箱池、500个SWE-bench镜像及4578个R2E镜像的测试中称,首次命令时间从45—85秒降至1—9秒,最坏等待从7.5分钟降至10秒以内,控制面与Pod创建开销降低约3倍。
【适用对象】适合训练智能体、运行大规模并行RL轨迹或评测任务的AI实验室、模型团队和智能体创业公司,尤其适合需要大量不同OCI镜像并行执行代码的场景。
【实际影响与限制】预热环境和原地回收可以减少GPU等待与Kubernetes控制面拥塞,但会提前占用CPU和集群后台资源;文章中的倍数来自Google固定规模测试,不能直接代表所有集群、镜像和工作负载的实际收益。部署仍需GKE、gVisor、镜像流式传输及相应运维能力,团队还应关注失败沙箱重试与奖励偏差,不能把基础设施优化等同于RL效果提升。
【官方来源】https://cloud.google.com/blog/products/containers-kubernetes/accelerate-agentic-rl-with-gke-agent-sandbox/ |
0