|
事件概述:NVIDIA于2026年10月6日在官方技术博客宣布NVIDIA AI Cluster Runtime(AICR)1.0,面向GPU加速的Kubernetes集群提供开源、版本锁定且可验证的配置配方。
对象与发布方:AICR是NVIDIA面向AI基础设施运维、平台集成和贡献者推出的工具项目;官方文章作者为Mark Chmarny与Nathan Taber。
关键能力与改动:AICR 1.0为CLI、REST API、Go SDK、Bundle布局和工件模式建立兼容性契约。它把集群管理拆成四类能力:Snapshot记录现有集群状态,Recipe描述版本锁定的目标配置,Bundle生成可供Helm、Argo CD、Flux或Helmfile使用的部署工件,Validation则把目标配方与运行中集群比对,并在需要时执行部署、一致性和性能检查、记录签名证据。官方还提供按服务、GPU、操作系统、工作负载意图和平台筛选配方的在线验证看板。
适用对象:运行训练或推理工作负载的GPU集群运维团队、云平台和基础设施即代码集成者,以及希望提交硬件/系统组合验证证据的开源贡献者。
实际影响:把分散在驱动、内核、容器运行时、网络、存储、Kubernetes组件和工作负载框架之间的兼容性信息固化为可复用配方,有助于降低升级后“能安装但不能稳定运行”的排查成本,也便于用同一目标配置适配不同GitOps部署工具。
限制与注意:AICR的配方是目标配置和验证记录,不会替代Helm、Argo CD等部署器自动协调集群;验证覆盖取决于已发布配方、硬件与系统组合及可获得的签名证据,未覆盖环境仍需自行测试并提交证据。
官方来源:https://developer.nvidia.com/blog/aicr-v1-0-open-stable-and-verifiable-gpu-cluster-configuration/ |
0