Source description
About the role
Reliability Engineering & Architecture: Define and implement SLIs, SLOs, and error budgets with product and engineering teams Conduct reliability reviews for new and existing services Design scalable, fault-tolerant architectures in AWS and Azure environments Lead capacity planning, performance and cost optimization initiatives Improve system resilience through automation and self-healing patterns Drive organizational observability maturity (metrics, logs, traces, alert quality)