Monitorar continuamente os ambientes e serviços da empresa, acompanhando métricas, logs, dashboards e alertas para garantir a disponibilidade da plataforma.
Investigar e atuar na resolução de incidentes relacionados à indisponibilidade, degradação de desempenho e interrupção da ingestão de dados.
Realizar análises iniciais de problemas envolvendo aplicações, containers, infraestrutura, conectividade e integrações, efetuando o devido escalonamento quando necessário.
Executar procedimentos operacionais e ações de recuperação conforme runbooks e boas práticas estabelecidas pela equipe.
Acompanhar indicadores de capacidade, desempenho e utilização dos ambientes, identificando oportunidades de melhoria.
Registrar, acompanhar e atualizar chamados técnicos internos e de clientes, garantindo a correta documentação das atividades realizadas.
Documentar incidentes, procedimentos operacionais, soluções adotadas e conhecimentos adquiridos, contribuindo para a melhoria contínua dos processos.
Atuar em conjunto com as equipes de Desenvolvimento, Infraestrutura e Segurança na investigação e resolução de problemas.
Participar da escala de plantão e sobreaviso, prestando suporte aos ambientes críticos quando necessário.
Ensino superior completo ou em andamento em Ciência da Computação, Sistemas de Informação, Engenharia da Computação, Analise e Desenvolvimento de Sistemas, Redes de Computadores, Segurança da Informação ou áreas correlatas.
Experiência prévia, incluindo estágio, em Suporte Técnico, Infraestrutura, NOC, Operações, DevOps, SRE ou áreas relacionadas.
Conhecimentos em Linux, incluindo utilização do terminal, gerenciamento de arquivos, permissões, processos, serviços e análise de logs.
Fundamentos de redes, como TCP/IP, DNS, portas, protocolos e conectividade.
Conceitos básicos de Docker e containers.
Git e controle de versão.
Bash ou outra linguagem para automação de tarefas.
Conceitos básicos de serviços e infraestrutura em AWS.
Conceitos de monitoramento e observabilidade, envolvendo métricas, logs, alertas e dashboards.
Conhecimentos básicos em Segurança da Informação.
Experiência com ferramentas como OpenSearch, Elasticsearch ou similares.
Conhecimento em ferramentas de monitoramento e observabilidade.
Experiência com Wazuh ou outras plataformas de monitoramento e segurança.
Conhecimentos básicos em Python.
Familiaridade com pipelines de coleta, processamento e ingestão de dados.
Conhecimentos básicos de CI/CD.
Experiência na investigação de incidentes em ambientes de produção.
Perfil analítico e investigativo, com interesse em compreender o funcionamento dos sistemas.
Capacidade de manter a organização e a calma durante situações de incidente.
Atenção aos detalhes e responsabilidade na execução de atividades em ambientes produtivos.
Boa comunicação e facilidade para trabalhar em equipe.
Proatividade para aprender novas tecnologias e evoluir tecnicamente.
Compromisso com documentação, compartilhamento de conhecimento e melhoria contínua.
Disposição para desenvolver autonomia gradativamente, mantendo colaboração e abertura para pedir apoio quando necessário.
Alerta-me sobre empregos como este
Descrição da Vaga Somos uma empresa brasileira de varejo reconhecida pelo nosso compromisso com a excelência no atendimento e um...
Candidatar-se a Este EmpregoDescrição da Vaga Unidade de Negócio: Gringo & Zapay Local de trabalho: Pinheiros – SP Modelo de trabalho: Híbrido Nosso...
Candidatar-se a Este EmpregoAnalista de Processos – Pleno – Salesforce Buscamos Analistas de Processos para atuar em um programa estratégico de transformação digital,...
Candidatar-se a Este EmpregoDescrição da Vaga Se você se identifica com uma empresa jovem, dinâmica e ágil, onde a inquietude e a sede...
Candidatar-se a Este EmpregoDescrição da Vaga Excelente porque somos plurais! Cada pessoa que compõe a BP tem uma história de vida, uma trajetória,...
Candidatar-se a Este EmpregoDescrição da Vaga Somos Todos Instituto Fundado em 2008, o Instituto de Responsabilidade Social Sírio-Libanês (IRSSL) nasceu com o propósito...
Candidatar-se a Este Emprego