Analista de Infraestrutura Cloud Pleno
RemoteBrazil
Job Summary
Operar e sustentar ambientes críticos de produção em AWS, monitorando, analisando e solucionando incidentes com Dynatrace, Datadog e monitoramento sintético. Realizar troubleshooting avançado em Kubernetes/EKS, investigar falhas em APIs, redes, bancos de dados e pipelines, além de diagnosticar problemas em SQS e SNS. Conduzir análises de causa raiz, implementar ações corretivas e propor melhorias de disponibilidade, observabilidade e otimização de custos. Comunicar incidentes e riscos ao cliente, garantindo o cumprimento dos SLAs. Atuar com autonomia em escalonamento técnico e sustentar ambientes 24x7. Junte-se a uma empresa premiada pela AWS e líder no ranking GPTW, oferecendo incentivos educacionais, reembolso de certificações e flexibilidade de horário.
Required Qualifications
- Operar e sustentar ambientes críticos de produção em AWS
- Monitorar, analisar e solucionar incidentes utilizando Dynatrace, Datadog e monitoramento sintético
- Realizar troubleshooting avançado em Kubernetes/EKS, incluindo pods, OOM, consumo de CPU e memória, resource limits, HPA e scaling
- Investigar falhas envolvendo APIs, redes, bancos de dados, mensageria e pipelines de dados
- Diagnosticar problemas em SQS e SNS, incluindo DLQs e mensagens retidas
- Conduzir análises de causa raiz e implementar ações corretivas e preventivas para incidentes recorrentes
- Apoiar a estabilidade e o desempenho de API Gateways, service mesh e componentes de integração
- Comunicar incidentes, riscos e evolução dos atendimentos ao cliente, garantindo o cumprimento dos SLAs
- Propor melhorias de disponibilidade, observabilidade, capacidade e otimização de custos do ambiente AWS
- Atuar com autonomia e realizar o escalonamento técnico quando necessário
- Experiência em sustentação de ambientes críticos de produção 24x7
- Domínio de Kubernetes e Amazon EKS, incluindo troubleshooting, gestão de recursos, scaling e alta disponibilidade
- Experiência com serviços AWS, especialmente EC2, RDS, S3, SQS, SNS, CloudFront e API Gateway
- Experiência com Dynatrace para análise de alertas, correlação de eventos, identificação de causa raiz e tuning
- Capacidade de diagnosticar problemas entre diferentes camadas: infraestrutura, containers, aplicações, APIs, redes, bancos de dados e mensageria
- Experiência em gestão de incidentes, análise de causa raiz e tratamento de problemas recorrentes
- Autonomia, proatividade e boa comunicação com equipes técnicas e cliente
- Experiência prévia no setor financeiro, meios de pagamento ou Open Finance
Desired Qualifications
- Experiência com Kong, KrakenD, Envoy ou outras soluções de API Gateway e service mesh
- Conhecimento de Keycloak, AWS IAM e soluções de autenticação e SSO
- Familiaridade com QuickSight, OpenMetadata, Budibase ou CKAN
- Conhecimento de práticas de FinOps e otimização de custos em AWS
Hiring someone like this?
Get your role in front of qualified candidates on Sorce.