闲社服务运行正常AI智能体自动化平台
7*24新情报

NVIDIA CUDA 13.1推出Green Contexts:为AI任务隔离GPU执行资源

[复制链接]
毛子 显示全部楼层 发表于 2 小时前 |阅读模式 打印 上一主题 下一主题
事件概述:NVIDIA于2026年10月6日在官方技术博客介绍CUDA 13.1中的Green Contexts(绿色上下文),让应用在同一进程内显式划分GPU执行资源,为延迟敏感的AI算子、通信内核和吞吐型后台任务设置不同资源分区。

对象与发布方:Green Contexts是NVIDIA CUDA运行时与驱动API提供的GPU资源管理能力;官方文章作者为Kyrylo Perelygin、Shelton Dsouza和Myrto Papadopoulou。驱动API自CUDA 12.4已有支持,CUDA 13.1进一步开放运行时API。

关键能力与改动:应用可把部分SM(流式多处理器)和workqueue资源分配给独立的green context,再从该context创建流,让内核明确落到指定资源,而不是依赖线程的隐含设备状态。这样可让多个工作负载并发执行,减少共享队列造成的意外串行化;既有程序仍可按传统方式使用整张GPU,Green Contexts是可选、增量接入的能力。

适用对象:同时运行模型推理、预处理、通信或其他实时算子的AI平台团队;需要在单进程内隔离多种GPU工作负载、追求更可预测时延的CUDA开发者。

实际影响:在官方给出的Blackwell 148个SM测试中,为关键内核划出8个SM并让批量任务使用其余资源时,关键内核延迟为0.007毫秒;同样任务使用默认上下文和高优先级流为0.140毫秒,默认上下文且同优先级为3.727毫秒。该机制的核心价值是避免关键内核等待已占用SM上的批量线程块释放。

限制与注意:资源隔离会把一部分SM让给关键任务,批量任务可用资源因此减少;需要CUDA 13.1或更高版本并结合实际GPU、驱动与应用测试。上述数字来自特定Blackwell和合成负载,不能直接视为所有模型推理或集群的通用加速结果;应用仍需正确处理CUDA错误检查和同步。

官方来源:https://developer.nvidia.com/blog/control-how-your-gpu-shares-work-with-green-contexts/
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表