Sobre a oportunidade
- Monitorar ambientes on-premises, cloud e híbridos, garantindo alta disponibilidade de sistemas críticos
- Detectar, analisar e tratar alertas de forma proativa, evitando impacto ao negócio
- Operar e evoluir plataformas de observabilidade e monitoramento: Zabbix, Grafana, Dynatrace, Datadog, SolarWinds, entre outras
- Analisar métricas de infraestrutura, aplicações, bancos de dados e redes
- Atuar na gestão de incidentes P1/P2, conduzindo war rooms e garantindo comunicação clara
- Registrar, acompanhar e documentar incidentes, mudanças e problemas em Jira e ServiceNow
- Executar e manter runbooks, playbooks e procedimentos operacionais
- Realizar escalonamentos técnicos conforme SLA, severidade e impacto
- Interagir com times de Infra, Redes, Cloud, SRE, Segurança e Aplicações
- Produzir relatórios operacionais, indicadores e análises utilizando Microsoft Office (Excel, PowerPoint e Word)
- Apoiar auditorias, compliance e controles exigidos pelo ambiente financeiro.
Requisitos
- Experiência em Command Center, NOC ou Operações de Monitoramento
- Conhecimento sólido em Zabbix e Grafana
- Vivência com ferramentas de APM e Observabilidade como Dynatrace e/ou Datadog
- Experiência em ambientes críticos e de alta disponibilidade, preferencialmente no setor financeiro
- Conhecimentos em Linux e Windows
- Noções consistentes de redes (latência, perda de pacotes, TCP/IP, ICMP)
- Vivência com gestão de incidentes ITIL
- Experiência prática com Jira e ServiceNow para registro, acompanhamento e comunicação de chamados e incidentes
- Domínio de Microsoft Office, com foco em Excel para controles e indicadores, PowerPoint para apresentações executivas e Word para documentação técnica
- Capacidade analítica para correlação de eventos, métricas e logs e evoluir em automação de alertas, dashboards e respostas operacionais