Resumo Tech Jobs
Sobre a oportunidade
Estamos buscando um(a) Analista de Infraestrutura - SRE Pleno , focado em viabilizar a entrega de software escalável e resiliente. Atuação híbrida entre a sustentação de ambientes críticos e o apoio consultivo a Squads de Desenvolvimento, promovendo a cultura de Self-Service Infrastructure e automação end-to-end. Expert em reduzir a carga operacional através de engenharia de software aplicada à infraestrutura. Este é um time de SRE. A equipe é composta por profissionais engajados e dispostos a atingir todos os resultados em equipe. Nosso ambiente é leve e positivo, trabalhamos com foco no que temos de melhor!
Responsabilidades
Seus desafios para fazer a diferença neste time: Desenvolver projetos em conjunto com todas as equipes de tecnologia; Construir relações com os seus pares; Conceber e implementar melhorias para aumentar a disponibilidade, escalabilidade, confiabilidade e segurança; Criar rotinas automatizadas para o provisionamento de infra-estruturas utilizando ferramentas de automatização; Resolver incidentes e criar os documentos de postmortem; Trabalhar nos aspectos de confiabilidade e desempenho dos bancos de dados, dentro das squads de SRE de cada um dos nossos produtos; Analisar soluções e implementar as melhores práticas para os nossos clusters de backing services (Kubernetes, Kafka, MongoDB, Redis); Trabalhar na observabilidade das métricas relevantes e assegurar que atingimos os nossos objetivos; Trabalhar com os pares em SREs nas implementações e/ou mudanças nos nossos ambientes de produção, com o objetivo de ajudar a mitigar incidentes; Trabalhar na automatização da infra-estrutura, com o objetivo de facilitar e agilizar a disponibilização de novos componentes de infraestrutura; Planejar o crescimento e gerir a capacidade da infra-estrutura de cada produto ou canal da Zenvia; Conceber, construir e manter cada componente da infraestrutura, de maneira que estes suportem centenas de milhares de clientes, conexões e/ou transações simultâneas; Apoiar e/ou realizar o troubleshooting de problemas em ambiente de produção; Construir monitorização e triggers com base em sintomas e SLOs, e não apenas com base em interrupções, incidentes e/ou problemas; Documente cada ação para que os seus conhecimentos se transformem em ações repetíveis e depois em automatização. Todas as nossas vagas são para todos. Aqui as pessoas são únicas, respeitamos e valorizamos as diferenças.