基础设施层
Node Exporter
- 计算资源:CPU 使用率(系统、用户、I/O 等待)、CPU 负载、内存使用率与 Swap 交换区状态。
- 存储 I/O:磁盘空间使用率、磁盘读写吞吐量(IOPS)、磁盘读写延迟、文件系统 Inode 使用率。
- 网络带宽:网卡每秒收发包数量(PPS)、网络丢包/错包率、网卡带宽吞吐率。
k8s集群层
cAdvisor
- K8s 核心组件:API Server 响应延迟与请求成功率、Controller Manager 队列深度、Etcd 的选主状态及写盘延迟、CoreDNS 域名解析延迟。
- Pod/容器状态:Pod 重启次数(如
CrashLoopBackOff)、容器 CPU/内存限额(Throttling/OOM Killed)情况。 - 集群调度:节点状态(Ready/NotReady)、集群整体 CPU/内存分配率、物理持久卷(PV)的剩余空间。
中间件/数据库层
专属 Exporter
-
数据库类 (如 MySQL, Elasticsearch)
- MySQL:当前活跃连接数、每秒查询率(QPS)/每秒事务数(TPS)、慢查询数量、主从同步延迟。
- Elasticsearch:集群健康状态(Green/Yellow/Red)、JVM 内存垃圾回收(GC)频率、索引写入延迟、分片(Shards)状态。
-
缓存与队列类 (如 Redis, Kafka, RabbitMQ)
- Redis:内存占用大小与碎片率、Key 的命中率、连接的客户端数、持久化(AOF/RDB)是否失败。
- Kafka:消费者组积压量(Consumer Lag)(最关键的指标,防止消息处理不及时)、Broker 副本同步状态、每秒生产/消费消息条数。
-
接入层网络 (如 Nginx, Ingress)
- Nginx / Ingress:HTTP 状态码比例(尤其是 5xx 占比)、连接并发数、单次请求响应耗时(P99/P95 延迟)。
业务应用层
-
语言运行时指标(以 Java JVM 为例)
- 堆内存:Eden 区、Old 区、Metaspace 内存分配及回收趋势。
- 垃圾回收:Young GC / Full GC 触发的频次与垃圾回收造成的 STW 停顿时间。
- 线程状态:死锁数量、活动线程数、业务线程池(ThreadPoolExecutor)的队列积压深度和拒绝策略触发次数。
-
业务黄金指标(RED 方法论)
- Rate(吞吐量):每秒订单创建量、用户登录 QPS、支付接口调用频次。
- Errors(错误率):下单失败率、第三方通道超时比例、异常抛出(Exception)统计。
- Duration(耗时):核心结算接口的平均响应时间、高并发场景下的 P99 核心长尾延迟。