Vanguard logo
VanguardPosted 1 month ago

Senior Site Reliability Champion

HybridCharlotte, North Carolina, United States or Dallas, Texas, United States

Full TimeSenior LevelAssociates DegreeEnterpriseFINANCE

Job Summary

Evaluate applications, platforms, and vendors to assess resiliency, reliability, and operational risk. Design and implement processes that enforce enterprise resiliency and reliability standards. Lead blameless post-incident reviews for high-severity incidents and partner with product teams to remediate risks proactively. Develop, communicate, and evangelize new standards, tools, and frameworks across subdivisions. Troubleshoot complex production issues, implement durable solutions, and participate in a periodic on-call rotation. Evaluate and onboard resiliency tooling while contributing to reliability engineering communities. Participate in strategic initiatives advancing Vanguard's operational maturity. No visa sponsorship offered.

Required Qualifications

  • Experience with modern observability and monitoring tools, such as Splunk, Honeycomb, CloudWatch, Dynatrace, or AppDynamics
  • Strong understanding of SLIs, SLOs, and SLAs, including dashboarding and reporting practices
  • Experience with alert design, anomaly detection, predictive alerting, and synthetic monitoring using structured methodologies
  • Experience with automation and resilience practices such as Python-based automation, RPA platforms (e.g., Blue Prism, UiPath), chaos engineering, and failure analysis techniques (e.g., FMEA)
  • Participation in a periodic on-call rotation to support production stability

Hiring someone like this?

Get your role in front of qualified candidates on Sorce.

Get started

Apply to this job in one click with Sorce

Apply on Sorce