Handling Failures
Course Content
0 / 44 completedWhat is Site Reliability Engineering
Core Tenets of SRE
Benefits of SRE
DevOps vs. SRE vs. Platform Engineering
A Typical Day of an SRE
What to Monitor
Logs, Metrics, and Traces
The Four Golden Signals
Observability Platforms
Demo Monitoring Using Splunk
Service Level Objectives (SLO)
Service Level Indicators (SLI) and Service Level Agreements (SLA)
Implementing SLOs Real-world Examples
Using Error Budgets
Demo SLOSLI
Managed vs. Unmanaged Incidents
Running War Rooms
Conducting Blameless Postmortems
Using Postmortem Templates
Being On-call
Load Balancing
Handling Failures
CAP Theorem and its Implementation
Auto Scaling
Progressive Rollout
Minimizing user Impact During Releases
Monitoring the CICD Pipeline
Rolling Back Changes
Four Ways of Implementing in Your Organization
Benefits of a Central SRE Team
Production Readiness Review
Course Summary
Next Steps
Learning objectives (1)
Learning objectives (2)
Learning objectives (3)
Learning objectives (4)
Learning objectives (5)
Learning objectives (6)
Learning objectives (7)
Learning objectives
Site Reliability Engineering Essentials Introduction (1)
Site Reliability Engineering Essentials Introduction
Site Reliability Engineering Essentials Summary