闲社服务运行正常AI智能体自动化平台
M

MLOps实践

技能标识:MLOps

Deploy ML models to production with pipelines, monitoring, serving, and reproducibility best practices.

作者:admin | 来源记录:ClawHub
登记来源
ClawHub
版本
V 1.0.0
检测标记
后台标记通过
免费
免费获取
4
收藏
来源与检测标记为平台登记信息,并不代表已展示可复核的检测报告。使用前请核对版本、依赖和所需权限,建议先在隔离环境中运行。
概述
安装方式
版本历史

MLOps实践

快速参考

主题文件关键陷阱
CI/CD与DAGpipelines.md训练/推理依赖耦合
模型服务
serving.md | 大模型冷启动 | | 漂移与告警 | monitoring.md | 仅关注技术指标 | | 版本管理 | reproducibility.md | 未对预处理进行版本控制 | | GPU基础设施 | gpu.md | GPU请求=整卡占用 |

关键陷阱

训练-服务偏差:

  • - 笔记本中的预处理 ≠ 服务中的预处理 → 静默错误
  • 笔记本中的Pandas → 生产环境内存泄漏(应使用原生类型)
  • 训练时的特征存储值 ≠ 未正确关联时的服务时值

GPU内存:

  • - requests.nvidia.com/gpu: 1 占用整张GPU,而非部分内存
  • MIG/MPS共享存在实际限制(非即插即用)
  • GPU OOM会导致Pod被杀死且无有效日志

模型版本 ≠ 代码版本:

  • - 模型产物需要独立版本管理(MLflow、W&B、DVC)
  • 训练数据版本 + 预处理版本 + 代码版本 = 可复现性
  • 回滚需保留旧模型版本的可部署状态

漂移检测时机:

  • - 重训练触发条件不仅是漂移 > 阈值 → 需考虑成本效益
  • 延迟的真实标签会导致概念漂移检测滞后数周
  • 上游数据管道变更引发的漂移并非模型问题

范围

本技能仅涵盖:

  • - 模型的CI/CD流水线
  • 模型服务与弹性伸缩
  • 监控与漂移检测
  • 可复现性实践
  • GPU基础设施模式

不涵盖:机器学习算法、特征工程、超参数调优。

标签

skill ai

通过对话安装

以下为平台配置的接入选项,并非逐项实测通过。能否安装取决于客户端支持、技能来源和运行环境:

OpenClaw WorkBuddy QClaw Kimi Claude

方式一:安装 SkillHub 和技能

帮我安装 SkillHub 和 mlops-1776420085 技能

方式二:设置 SkillHub 为优先技能安装源

设置 SkillHub 为我的优先技能安装源,然后帮我安装 mlops-1776420085 技能

通过命令行安装

skillhub install mlops-1776420085

下载

⬇ 下载 MLOps v1.0.0(免费)

文件大小: 6.2 KB | 发布时间: 2026-4-17 18:52

v1.0.0 最新 2026-4-17 18:52
Initial release
返回顶部