No Reclame AQUI, não somos apenas um site de reclamações; somos a maior plataforma de confiança do país e estamos em plena expansão global. Nossa infraestrutura é o palco onde milhões de vozes encontram solução e onde as empresas constroem suas reputações. Como SRE Pleno, você entra em um momento estratégico: nosso desafio é escalar com previsibilidade e transformar nossa monitoração em uma aliada da experiência real do usuário.
Buscamos um(a) profissional que entenda que soft skills são tão importantes quanto hard skills e que demonstre capacidade de manter um alto nível de entrega continuamente, não apenas em projetos pontuais. Procuramos alguém com atitude colaborativa e mentalidade de dono para ajudar a blindar nossa plataforma, garantindo que a confiança nunca fique offline. Aqui, você terá autonomia para errar, aprender rápido e ser protagonista na evolução da nossa cultura de confiabilidade.
Sua missão é ser o guardião da estabilidade, previsibilidade e performance do ecossistema Reclame AQUI. Esperamos que você colabore ativamente com a squad no dimensionamento de tarefas, trazendo previsibilidade para o fluxo de trabalho. Daqui a um ano, esperamos que você tenha consolidado um ambiente onde o monitoramento proativo seja o padrão, onde falhas simples sejam mitigadas por rotinas preditivas criadas por você, e onde a nossa plataforma de desenvolvimento (FAÍSCA) seja uma ferramenta de aceleração diária para todos os times de produto.
Previsibilidade e Planejamento: Apoiar o time no dimensionamento e refinamento técnico de tarefas de SRE nas cerimônias da sprint, garantindo entregas consistentes e previsíveis.
Excelência em Observabilidade (Predictive Ops): Implementar rotinas preditivas para reduzir e evitar falhas simples, evoluindo nosso monitoramento para os Golden Signals (Latência, Erro, Tráfego e Saturação) com o objetivo de antecipar impactos na jornada do consumidor.
Gestão de Confiabilidade: Apoiar ativamente a definição e o cumprimento de SLOs e SLAs das squads, acompanhando os Error Budgets para equilibrar a velocidade de deploy com a estabilidade do sistema.
Engenharia de Plataforma (IDP): Colaborar na evolução do FAÍSCA (nosso portal baseado em Backstage), desenvolvendo templates e automatizando o provisionamento de recursos (como buckets, bancos e microsserviços) para eliminar a fricção operacional dos desenvolvedores.
Operação e Resiliência em Kubernetes: Realizar o troubleshoot e o ajuste fino de workloads no K8s, tratando problemas de recursos de forma ágil (como CPU, memória, storage) e atuando diretamente na contenção de gargalos como DiskPressure.
Cultura Blameless e Segurança Psicológica: Participar ativamente de rituais de post-mortem, focando no aprendizado técnico, na correção de processos e no fortalecimento da segurança psicológica do time para reportar erros e aprender com eles.
Infraestrutura como Código (IaC): Desenvolver, modularizar, versionar e manter códigos em Terraform, garantindo que nossa infraestrutura na GCP seja segura, padronizada e reprodutível.
Eficiência Financeira (FinOps): Auxiliar no controle de custos e desperdício de nuvem, apoiando o monitoramento do faturamento na GCP e a eficiência das ferramentas de escalabilidade inteligente (como Spotinst Ocean).
Automação e Redução de Toil: Mapear tarefas operacionais repetitivas no dia a dia da infraestrutura e desenvolver scripts (Python ou Golang) para eliminá-las, liberando o time para atuações mais estratégicas.
Experiência Prática Consistente: Bagagem anterior atuando como SRE, DevOps ou Engenheiro(a) de Infraestrutura, demonstrando capacidade de entrega contínua de alto nível.
Domínio de Kubernetes: Conhecimento sólido em gerenciamento de pods, troubleshoot diário de workloads, Helm Charts e ciclo de vida de containers.
Vivência em Cloud (GCP): Experiência de mercado com os principais serviços da Google Cloud Platform.
Cultura de Automação: Prática no desenvolvimento de IaC com Terraform e habilidade para escrever scripts utilitários em Python ou Golang.
Foco em Entrega Contínua (CI/CD): Familiaridade com pipelines de integração e entrega contínua, utilizando ferramentas como Argo CD e Bitbucket.
Mente de Observabilidade: Prática na configuração de métricas, alertas e painéis utilizando Prometheus e Grafana.
Habilidade de Colaboração (Soft Skills): Boa comunicação para atuar de forma cross-functional com desenvolvedores, facilitando a cultura de qualidade e entrega segura.
Conhecimento prático ou forte interesse em portais internos baseados em Backstage.
Noções de FinOps e análise de consumo de recursos em nuvem (GCP / Flexera / Spotinst).
Vivência com redes em nuvem (VPC, Cloud Ingress, Service Mesh).
Familiaridade com monitoramento e operação de bancos de dados gerenciados (como MongoDB Atlas).
Alerta-me sobre empregos como este
Buscamos um(a) profissional para atuar como parceiro da Brivia. Somos um ecossistema especializado na transformação de marcas, ajudando nossos clientes...
Candidatar-se a Este EmpregoSomos inspired by tech powered by people. Por isso, precisamos de pessoas apaixonados por desafios e com sede de aprendizado...
Candidatar-se a Este EmpregoAuxiliar no acompanhamento e controle das atividades de manutenção predial preventiva e corretiva; Apoiar na realização de vistorias e inspeções...
Candidatar-se a Este Emprego#VemSerMCA Na MCA, consolidamos nossa posição como líderes em Consultoria, Auditoria e Gerenciamento de Projetos desde 2002. Pelo segundo ano...
Candidatar-se a Este EmpregoA primeira coisa que você precisa saber é que aqui você não vai cair na rotina. A Radix desenvolve soluções...
Candidatar-se a Este EmpregoDescrição da Vaga Profissional atuará com administração, manutenção, monitoramento e evolução dos bancos de dados corporativos em SQL Server e...
Candidatar-se a Este Emprego