Analista de Observabilidade Sênior - Vaga Afirmativa para Mulheres
RemoteBrazil
Job Summary
Lead the evolution of the organization's observability strategy using Datadog as the primary platform, defining corporate standards for applications, APIs, and cloud workloads. Design, implement, and optimize solutions across APM, Infrastructure Monitoring, Logs Management, and RUM to proactively reduce incidents and improve user experience. Establish executive and operational dashboards, create intelligent monitors to minimize noise, and conduct root cause analysis for critical failures. Support engineering teams with OpenTelemetry instrumentation, develop self-healing initiatives, and disseminate a culture of reliability through training and documentation.
Required Qualifications
- Formação superior completa em Ciência da Computação, Engenharia, Sistemas de Informação ou áreas correlatas.
- Experiência avançada com Datadog, atuando tanto na implementação quanto na administração e evolução da plataforma.
- Experiência prática com Datadog APM.
- Experiência prática com Datadog Infrastructure Monitoring.
- Experiência prática com Datadog Logs Management.
- Experiência prática com Datadog Dashboards.
- Experiência prática com Datadog Monitors.
- Experiência prática com Monitoring Service Catalog.
- Conhecimento avançado dos pilares de observabilidade: Logs, Métricas, Tracing Distribuído.
- Experiência em observabilidade de APIs e arquiteturas de microsserviços.
- Experiência com ambientes AWS.
- Vivência em troubleshooting e investigação de incidentes complexos.
- Conhecimento em OpenTelemetry e instrumentação de aplicações.
- Conhecimento de automação utilizando Python, Shell Script ou PowerShell.
- Experiência com Kubernetes, Docker e ecossistemas cloud-native.
- Conhecimento sólido sobre disponibilidade, performance, escalabilidade e confiabilidade de sistemas.
- Capacidade de traduzir indicadores técnicos em impactos para negócio.
- Excelente comunicação e habilidade para atuar com múltiplos stakeholders.
Desired Qualifications
- Certificação Datadog Certified Associate ou superior.
- Experiência com práticas de SRE (Site Reliability Engineering).
- Experiência em implementação de estratégias de observabilidade para ambientes distribuídos de alta escala.
- Conhecimento em CI/CD e DevSecOps.
- Experiência com automação de resposta a incidentes e processos de self-healing.
- Vivência em governança operacional, gestão de incidentes, Problem Management e processos ITIL.
- Experiência prévia com ferramentas como Dynatrace, Grafana, Prometheus, Elastic Stack ou Zabbix.
Hiring someone like this?
Get your role in front of qualified candidates on Sorce.