Đừng để số trung bình đánh lừa. Học cách sử dụng Histogram Quantile và Subquery trong PromQL để đo lường P99 latency và tối ưu hóa hệ thống monitoring của bạn.
Hướng dẫn bật Prometheus metrics endpoint trên Traefik v3, cấu hình Docker Compose cho toàn bộ monitoring stack, và tạo Grafana dashboard với PromQL queries để theo dõi request rate, error rate, P95 latency theo từng service. Thêm alert rules để tự động cảnh báo khi có vấn đề.
Prometheus Recording Rules giúp dashboard Grafana load nhanh hơn bằng cách tính toán trước các metric phức tạp. Kết hợp với Alerting Rules được cấu hình đúng cách (dùng tham số `for` hợp lý), bạn loại bỏ alert flapping và xây dựng hệ thống cảnh báo đáng tin cậy cho môi trường production.