Grafana: dashboards de observabilidade com Prometheus, Loki e Tempo
PromQL, LogQL, correlação de métricas/logs/traces e alertas. Como construir dashboards que revelam o estado real de sistemas distribuídos em produção.
PromQL, LogQL, correlação de métricas/logs/traces e alertas. Como construir dashboards que revelam o estado real de sistemas distribuídos em produção.
Pull model, exporters, service discovery, PromQL e Alertmanager. Guia técnico para instrumentar aplicações .NET, Node.js e Angular com Prometheus.
Os 4 golden signals do SRE, histogramas, percentis e como definir SLOs/SLAs baseados em dados reais de produção.
Configuração de HPA por CPU, memória e métricas custom via KEDA. VPA para right-sizing de recursos. Trade-offs e interação entre os dois controllers.
Availability, latency, throughput, error rate: como escolher SLIs que representam a experiência real do usuário e são tecnicamente mensuráveis.
RED (Rate, Errors, Duration) é para serviços; USE (Utilization, Saturation, Errors) é para recursos. Entenda como definir SLIs que mapeiam para experiência do usuário, alertar em burn rate de error budget e evitar alert fatigue.