DevOps · Beginner → Expert
📈 Site Reliability Engineering and Observability
Operate reliable systems using SLOs, metrics, logs, traces, alerting, incident management, capacity planning, resilience testing and automation.
Course roadmap
Pass each module exam to unlock the next module.
Module 1 · Beginner
SRE Principles, Reliability and Error Budgets
Locked
Module 2 · Beginner
SLIs, SLOs and Service-Level Reporting
Locked
Module 3 · Beginner
Metrics and Time-Series Monitoring
Locked
Module 4 · Beginner
Centralized Logging and Structured Events
Locked
Module 5 · Intermediate
Distributed Tracing and Context Propagation
Locked
Module 6 · Intermediate
Dashboards, Visualization and Operational Views
Locked
Module 7 · Intermediate
Alert Design, Paging and Noise Reduction
Locked
Module 8 · Intermediate
Incident Command, Triage and Communication
Locked
Module 9 · Advanced
Postmortems, Root Cause and Corrective Actions
Locked
Module 10 · Advanced
Capacity Planning and Performance Engineering
Locked
Module 11 · Advanced
Resilience, Redundancy and Failure Domains
Locked
Module 12 · Advanced
Chaos Engineering and Controlled Failure Testing
Locked
Module 13 · Expert
On-Call Design, Runbooks and Operational Readiness
Locked
Module 14 · Expert
Automation, Toil Reduction and Self-Healing
Locked
Module 15 · Expert
Observability Security, Cost and Data Governance
Locked
Module 16 · Expert
Expert Capstone: Reliability Program for a Production Service
Locked
Certification gate
Final course exam
Pass mark: 80%. Time limit: 360 minutes. All module exams must be passed first.
Locked until modules are passed