Align metric names with Prometheus naming conventions
Build Docker image on push / docker (push) Successful in 21s
Build and push Docker image on tag / docker (push) Successful in 22s

Use base units, export cumulative values as _total counters, update docs, dashboards and rules.
This commit is contained in:
2026-08-24 19:13:05 +02:00
parent 9b076d4353
commit 92e54418bc
16 changed files with 541 additions and 284 deletions
+25 -25
View File
@@ -20,7 +20,7 @@ groups:
- alert: PveGuestCpuSaturated
expr: |-
pve_vm_cpu_usage > 0.95 or pve_ct_cpu_usage > 0.95
pve_vm_cpu_usage_ratio > 0.95 or pve_ct_cpu_usage_ratio > 0.95
for: 1h
labels:
severity: warning
@@ -74,7 +74,7 @@ groups:
- alert: PveNodeCpuSaturated
expr: |-
pve_node_cpu_usage > 0.95
pve_node_cpu_usage_ratio > 0.95
for: 1h
labels:
severity: warning
@@ -99,8 +99,8 @@ groups:
- alert: PveClusterClockSkew
expr: |-
max by (cluster) (pve_node_localtime)
- min by (cluster) (pve_node_localtime) > 15
max by (cluster) (pve_node_localtime_seconds)
- min by (cluster) (pve_node_localtime_seconds) > 15
for: 1m
labels:
severity: critical
@@ -113,9 +113,9 @@ groups:
- alert: PveNodeSubscriptionExpiringSoon
expr: |-
(
pve_node_subscription_nextduedate > time()
pve_node_subscription_next_due_timestamp_seconds > time()
and
pve_node_subscription_nextduedate < time() + (30 * 24 * 60 * 60)
pve_node_subscription_next_due_timestamp_seconds < time() + (30 * 24 * 60 * 60)
)
and on (cluster, node)
(pve_node_subscription_status == 1)
@@ -147,7 +147,7 @@ groups:
- alert: PveNodeDiskWearout
expr: |-
pve_node_disk_wearout < 5
pve_node_disk_wearout_percent < 5
for: 1m
labels:
severity: critical
@@ -242,7 +242,7 @@ groups:
- alert: PveNodeZfsReadErrors
expr: |-
pve_node_zfs_read_errors > 0
pve_node_zfs_read_errors_total > 0
for: 5m
labels:
severity: warning
@@ -255,7 +255,7 @@ groups:
- alert: PveNodeZfsWriteErrors
expr: |-
pve_node_zfs_write_errors > 0
pve_node_zfs_write_errors_total > 0
for: 5m
labels:
severity: warning
@@ -268,7 +268,7 @@ groups:
- alert: PveNodeZfsChecksumErrors
expr: |-
pve_node_zfs_checksum_errors > 0
pve_node_zfs_checksum_errors_total > 0
for: 5m
labels:
severity: warning
@@ -284,12 +284,12 @@ groups:
(
sum by (cluster, node) (
(
pve_vm_mem_total_bytes
pve_vm_memory_total_bytes
and on (cluster, node, vmid, name) (pve_vm_state == 1)
)
or
(
pve_ct_mem_total_bytes
pve_ct_memory_total_bytes
and on (cluster, node, vmid, name) (pve_ct_state == 1)
)
)
@@ -400,9 +400,9 @@ groups:
- alert: PveNodeDiskWearoutWarning
expr: |-
(pve_node_disk_wearout < 20)
(pve_node_disk_wearout_percent < 20)
and
(pve_node_disk_wearout >= 5)
(pve_node_disk_wearout_percent >= 5)
for: 15m
labels:
severity: warning
@@ -417,9 +417,9 @@ groups:
- alert: PveGuestMemoryHigh
expr: |-
pve_vm_mem_used_bytes / pve_vm_mem_total_bytes > 0.90
pve_vm_memory_used_bytes / pve_vm_memory_total_bytes > 0.90
or
pve_ct_mem_used_bytes / pve_ct_mem_total_bytes > 0.90
pve_ct_memory_used_bytes / pve_ct_memory_total_bytes > 0.90
for: 15m
labels:
severity: warning
@@ -433,9 +433,9 @@ groups:
- alert: PveGuestDiskFillingUp
expr: |-
pve_vm_disk_usage_bytes / pve_vm_disk_size_bytes > 0.90
pve_vm_disk_used_bytes / pve_vm_disk_size_bytes > 0.90
or
pve_ct_disk_usage_bytes / pve_ct_disk_size_bytes > 0.90
pve_ct_disk_used_bytes / pve_ct_disk_size_bytes > 0.90
for: 15m
labels:
severity: warning
@@ -461,9 +461,9 @@ groups:
- alert: PveVmDiskErrorsIncreasing
expr: |-
delta(pve_vm_disk_failed_rd_ops[10m]) > 0
increase(pve_vm_disk_failed_read_operations_total[10m]) > 0
or
delta(pve_vm_disk_failed_wr_ops[10m]) > 0
increase(pve_vm_disk_failed_write_operations_total[10m]) > 0
for: 1m
labels:
severity: critical
@@ -476,7 +476,7 @@ groups:
- alert: PveNodeClockDrift
expr: |-
abs(pve_node_time - time()) > 60
abs(pve_node_time_seconds - time()) > 60
for: 5m
labels:
severity: warning
@@ -489,7 +489,7 @@ groups:
- alert: PveNodeRestarted
expr: |-
resets(pve_node_uptime[15m]) > 0
resets(pve_node_uptime_seconds[15m]) > 0
for: 0m
labels:
severity: info
@@ -501,8 +501,8 @@ groups:
- alert: PveCollectorSlow
expr: |-
rate(pve_metrics_collection_latency_ms_sum[5m])
/ rate(pve_metrics_collection_latency_ms_count[5m]) > 5000
rate(pve_metrics_collection_duration_seconds_sum[5m])
/ rate(pve_metrics_collection_duration_seconds_count[5m]) > 5
for: 10m
labels:
severity: warning
@@ -510,7 +510,7 @@ groups:
summary: PVE exporter collector is slow.
description: >-
Collector {{ $labels.collector }} has taken an average of
{{ printf "%.0f" $value }} ms per successful run for at least ten
{{ printf "%.1f" $value }} s per successful run for at least ten
minutes.
- alert: PveExporterDown