闲社服务运行正常AI智能体自动化平台
M

监控

技能标识:Monitoring

Set up observability for applications and infrastructure with metrics, logs, traces, and alerts.

作者:admin | 来源记录:ClawHub
登记来源
ClawHub
版本
V 1.0.0
检测标记
后台标记通过
免费
免费获取
4
收藏
来源与检测标记为平台登记信息,并不代表已展示可复核的检测报告。使用前请核对版本、依赖和所需权限,建议先在隔离环境中运行。
概述
安装方式
版本历史

监控

复杂度等级

等级工具搭建时间适用场景
极简UptimeRobot、Healthchecks.io15分钟副业项目、最小可行产品
标准
Uptime Kuma、Sentry、基础Grafana | 1-2小时 | 小团队、初创公司 | | 专业 | Prometheus、Grafana、Loki、Alertmanager | 1-2天 | 生产系统 | | 企业级 | Datadog、New Relic或完整开源栈 | 持续投入 | 大规模运营 |

三大支柱

支柱回答的问题工具
指标系统运行状况如何?Prometheus、Grafana、Datadog
日志
发生了什么? | Loki、ELK、CloudWatch | | 链路追踪 | 为什么这个请求很慢? | Jaeger、Tempo、Sentry |

按使用场景快速入门

我只想知道系统是否宕机
→ UptimeRobot(免费)或 Uptime Kuma(自托管)。参见 simple.md。

我需要调试生产环境错误
→ 使用框架SDK集成Sentry。5分钟搭建。参见 apm.md。

我想要真正的可观测性
→ Prometheus + Grafana + Loki。参见 prometheus.md。

我需要集中管理日志
→ 简单场景用Loki,复杂查询用ELK。参见 logs.md。

监控内容

应用(RED方法)

  • - Rate — 每秒请求数
  • Error — 按端点的错误率
  • Duration — 延迟(p50、p95、p99)

基础设施(USE方法)

  • - Utilization — CPU、内存、磁盘使用率
  • Saturation — 队列深度、平均负载
  • Error — 硬件/系统错误

告警原则

应该做不应该做
对症状告警(用户影响)对原因告警(CPU高)
包含操作手册链接
需要调查才能理解 | | 设置适当的严重级别 | 把所有问题设为P1 | | 需要采取行动 | 对有趣的指标告警 |

告警疲劳会毁掉监控。 如果告警被忽略,就等于没有监控。

关于告警配置、严重级别和值班设置,参见 alerting.md。

成本对比

方案月度成本(小型)月度成本(中型)
UptimeRobot免费$7
Uptime Kuma
$5(VPS) | $5(VPS) | | Sentry | 免费 / $26 | $80 | | Grafana Cloud | 免费套餐 | $50+ | | Datadog | $15/主机 | $23/主机 + 功能费 | | 自托管方案 | $10-20(VPS) | $50-100(VPS) |

常见错误

  • - 在Uptime Kuma已足够时,却从Prometheus/Grafana开始
  • 没有告警(无人查看的仪表盘)
  • 告警过多(告警疲劳 → 被忽略)
  • 缺少操作手册(告警触发,无人知道如何处理)
  • 未从外部监控(仅做内部检查)
  • 永久存储日志(成本激增)

标签

skill ai

通过对话安装

以下为平台配置的接入选项,并非逐项实测通过。能否安装取决于客户端支持、技能来源和运行环境:

OpenClaw WorkBuddy QClaw Kimi Claude

方式一:安装 SkillHub 和技能

帮我安装 SkillHub 和 monitoring-1776420088 技能

方式二:设置 SkillHub 为优先技能安装源

设置 SkillHub 为我的优先技能安装源,然后帮我安装 monitoring-1776420088 技能

通过命令行安装

skillhub install monitoring-1776420088

下载

⬇ 下载 Monitoring v1.0.0(免费)

文件大小: 11.15 KB | 发布时间: 2026-4-17 19:59

v1.0.0 最新 2026-4-17 19:59
Initial release
返回顶部