Senior Site Reliability Champion
HybridCharlotte, North Carolina, United States or Dallas, Texas, United States
Job Summary
Evaluate applications, platforms, and vendors to assess resiliency, reliability, and operational risk. Design and implement processes that enforce enterprise resiliency and reliability standards. Lead blameless post-incident reviews for high-severity incidents and partner with product teams to remediate risks proactively. Develop, communicate, and evangelize new standards, tools, and frameworks across subdivisions. Troubleshoot complex production issues, implement durable solutions, and participate in a periodic on-call rotation. Evaluate and onboard resiliency tooling while contributing to reliability engineering communities. Participate in strategic initiatives advancing Vanguard's operational maturity. No visa sponsorship offered.
Required Qualifications
- Experience with modern observability and monitoring tools, such as Splunk, Honeycomb, CloudWatch, Dynatrace, or AppDynamics
- Strong understanding of SLIs, SLOs, and SLAs, including dashboarding and reporting practices
- Experience with alert design, anomaly detection, predictive alerting, and synthetic monitoring using structured methodologies
- Experience with automation and resilience practices such as Python-based automation, RPA platforms (e.g., Blue Prism, UiPath), chaos engineering, and failure analysis techniques (e.g., FMEA)
- Participation in a periodic on-call rotation to support production stability
Hiring someone like this?
Get your role in front of qualified candidates on Sorce.