Bài viết này hướng dẫn chi tiết cách triển khai Prometheus Operator và Grafana để giám sát Kubernetes cluster. Chúng ta sẽ khám phá cách Prometheus Operator tự động thu thập metrics từ các Pod và Service, giải quyết thách thức của môi trường động trong Kubernetes. Kèm theo là kinh nghiệm thực tế và các tips hữu ích.
Giám sát hệ thống thôi chưa đủ, bạn cần nhận thông báo tức thì khi sự cố xảy ra. Hướng dẫn này chỉ bạn cách cấu hình Alertmanager để gửi cảnh báo trực tiếp qua Telegram và SMS, giúp bạn xử lý vấn đề kịp thời.
Hướng dẫn cài đặt Prometheus, Node Exporter và Grafana trên Ubuntu 22.04 để giám sát server theo thời gian thực. Bao gồm cấu hình scrape targets, import dashboard sẵn có (ID 1860) và thiết lập alert khi CPU/RAM vượt ngưỡng.
Hướng dẫn cài đặt Graylog bằng Docker Compose để tập trung log từ nhiều server Linux về một nơi. Bài viết bao gồm cấu hình rsyslog, Docker GELF logging driver và tạo stream alert — dựa trên kinh nghiệm thực tế 6 tháng chạy production.