Missão da posição
Responsabilidades
Administração e evolução da AWS
• Administrar os ambientes de desenvolvimento, homologação e produção na AWS.
• Manter e evoluir recursos de computação, rede, armazenamento, banco de dados, cache, filas e segurança.
• Avaliar arquiteturas existentes e propor melhorias de disponibilidade, escalabilidade, segurança e custo.
• Identificar recursos ociosos, superdimensionados, mal configurados ou sem monitoramento.
• Planejar mudanças de infraestrutura com análise de impacto e estratégia de rollback.
• Garantir a padronização dos ambientes.
• Apoiar a criação e evolução de arquiteturas para novas aplicações e microsserviços.
• Documentar topologias, dependências, configurações e procedimentos operacionais.
• Atuar na sustentação de ambientes críticos e na resolução de incidentes.
Kubernetes e containers
• Liderar tecnicamente a implementação e evolução do Kubernetes na Hero.
• Participar do desenho, implantação e operação de clusters Amazon EKS.
• Planejar a migração gradual de aplicações executadas em ECS e Fargate para Kubernetes.
• Definir padrões para deployments, services, ingress, secrets, config maps, jobs e cron jobs.
• Criar e revisar manifestos Kubernetes e charts Helm.
• Definir padrões de namespaces, permissões, isolamento e organização dos clusters.
• Configurar requests, limits, autoscaling, readiness probes e liveness probes.
• Definir estratégias de rolling update, rollback, blue-green e canary deployment quando aplicável.
• Investigar pods com falhas, reinícios, problemas de memória, CPU, rede, DNS ou dependências.
• Gerenciar imagens Docker e repositórios no Amazon ECR.
• Revisar Dockerfiles quanto a segurança, tamanho, desempenho e boas práticas.
• Apoiar desenvolvedores na adequação de aplicações para execução em containers.
Redes e conectividade
• Administrar VPCs, subnets públicas e privadas, tabelas de rotas, gateways e NAT Gateways.
• Criar e revisar Security Groups e Network ACLs.
• Configurar conectividade segura entre aplicações, bancos, caches e serviços internos.
• Implementar restrições e liberações de acesso por IP.
• Administrar acessos por VPN e redes privadas.
• Apoiar integrações que exijam IP fixo de saída ou inclusão em listas de IP permitidos.
• Diagnosticar problemas de rede, DNS, rotas, portas, latência e resolução de nomes.
• Administrar Route 53, certificados digitais e AWS Certificate Manager.
• Configurar e revisar Application Load Balancers e Network Load Balancers.
• Garantir que bancos de dados, caches e serviços internos não sejam expostos desnecessariamente à internet.
• Avaliar conectividade entre regiões, contas e redes externas.
Segurança de infraestrutura
• Aplicar o princípio do menor privilégio em usuários, grupos, roles e policies do IAM.
• Revisar acessos humanos, acessos de aplicações e permissões concedidas a pipelines.
• Estruturar e revisar políticas de acesso aos ambientes de produção.
• Gerenciar segredos por meio do AWS Secrets Manager.
• Administrar chaves e criptografia utilizando AWS KMS.
• Garantir criptografia de dados em trânsito e em repouso.
• Configurar e revisar regras no AWS WAF.
• Analisar trilhas de auditoria no AWS CloudTrail.
• Identificar recursos públicos, portas abertas e configurações inseguras.
• Apoiar a rotação de credenciais, chaves, tokens e certificados.
• Participar da investigação de incidentes de segurança.
• Implementar controles para evitar alterações manuais não rastreadas.
• Apoiar requisitos relacionados à LGPD, governança e proteção de dados.
• Manter sistemas operacionais, imagens e componentes de infraestrutura atualizados.
Infraestrutura como código
• Criar e manter infraestrutura utilizando Terraform ou CloudFormation.
• Priorizar o Terraform como ferramenta de padronização e evolução do ambiente.
• Estruturar módulos reutilizáveis.
• Organizar estados, ambientes e variáveis de forma segura.
• Implementar validações, revisões e planos antes da aplicação de mudanças.
• Evitar criação manual de recursos sem rastreabilidade.
• Manter a infraestrutura versionada em Git.
• Criar padrões para desenvolvimento, homologação e produção.
• Documentar procedimentos de execução, rollback e recuperação do estado.
• Apoiar a implementação de políticas e controles automatizados sobre a infraestrutura.
Observabilidade e monitoramento
• Configurar e evoluir o Amazon CloudWatch.
• Criar dashboards técnicos e operacionais.
• Configurar métricas, logs, alarms e filters.
• Centralizar logs de aplicações, containers, load balancers e serviços AWS.
• Criar alertas para indisponibilidade, erros, latência e saturação.
• Monitorar CPU, memória, storage, rede, conexões, filas e health checks.
• Definir retenção adequada de logs, equilibrando necessidade operacional e custo.
• Criar alertas que sejam acionáveis e possuam responsáveis definidos.
• Apoiar a definição de indicadores de disponibilidade e desempenho.
• Investigar aumentos inesperados no volume de logs ou nos custos de observabilidade.
• Desenvolver runbooks para resposta a alertas e incidentes recorrentes.
• Avaliar a adoção de Prometheus, Grafana e OpenTelemetry quando necessário.
Gestão e otimização de custos AWS
• Analisar continuamente os custos da infraestrutura.
• Identificar anomalias de consumo e aumentos inesperados.
• Avaliar custos de EC2, ECS, EKS, RDS, ElastiCache, Load Balancers, VPC, CloudWatch e Data Transfer.
• Realizar rightsizing de instâncias, bancos e containers.
• Analisar a adoção de Savings Plans e Reserved Instances.
• Revisar custos de NAT Gateway, transferência de dados e tráfego entre regiões.
• Revisar retenção de logs, snapshots, volumes, imagens e arquivos.
• Criar rotinas de desligamento de ambientes não produtivos quando aplicável.
• Identificar recursos sem utilização ou sem proprietário definido.
• Criar dashboards, alertas e relatórios de custos.
• Avaliar o impacto financeiro antes da implantação de novas arquiteturas.
• Recomendar ações de redução de custos sem comprometer disponibilidade, segurança ou desempenho.
• Apoiar a criação de uma cultura de FinOps na empresa.
Bancos de dados e cache
A posição não substituirá o DBA, mas deverá possuir conhecimento suficiente para administrar e diagnosticar a infraestrutura desses serviços.
Será responsável por:
• Monitorar ambientes Amazon RDS.
• Analisar CPU, memória, storage, IOPS, conexões e latência.
• Apoiar o dimensionamento de instâncias MySQL e PostgreSQL.
• Analisar gargalos de infraestrutura que afetem o banco de dados.
• Apoiar configurações de backup, snapshots, read replicas e failover.
• Participar de testes de restore.
• Monitorar e administrar Amazon ElastiCache e Redis.
• Investigar consumo de memória, conexões, eviction e indisponibilidade do cache.
• Apoiar a análise de queries lentas e excesso de conexões em conjunto com desenvolvimento e DBA.
• Planejar manutenções e mudanças com menor impacto para as aplicações.
• Participar da definição de RTO e RPO para bancos e caches.
CI/CD e automação
• Criar e manter pipelines utilizando AWS CodePipeline e CodeBuild.
• Automatizar build, criação de imagens, publicação no ECR e deploy.
• Integrar pipelines com ECS, EKS e infraestrutura como código.
• Criar processos seguros de promoção entre desenvolvimento, homologação e produção.
• Implementar validações antes de alterações de infraestrutura.
• Criar scripts em Python ou Bash para automação de atividades operacionais.
• Utilizar Python e boto3 para inventário, monitoramento, segurança, custos e rotinas administrativas.
• Reduzir tarefas manuais e repetitivas.
• Apoiar a implementação de estratégias de rollback.
• Garantir rastreabilidade das mudanças executadas.
Continuidade e recuperação de desastre
• Definir e revisar políticas de backup.
• Garantir que recursos críticos estejam incluídos nas rotinas de backup.
• Realizar testes periódicos de restauração.
• Documentar procedimentos de recuperação.
• Apoiar a definição de RTO e RPO por sistema.
• Avaliar a necessidade de redundância entre zonas e regiões.
• Planejar a recuperação de aplicações, bancos, arquivos, configurações e segredos.
• Criar runbooks de disaster recovery.
• Participar de simulações de falha e indisponibilidade.
• Identificar pontos únicos de falha e propor correções.
Incidentes e suporte à produção
• Atuar diretamente na investigação de incidentes de infraestrutura.
• Identificar rapidamente se a origem está em rede, container, cluster, banco, cache, pipeline ou serviço AWS.
• Participar de salas de crise quando necessário.
• Comunicar impacto, diagnóstico e ações de maneira objetiva.
• Executar correções emergenciais com controle de risco.
• Registrar as mudanças realizadas durante o incidente.
• Conduzir ou participar de análises de causa raiz.
• Criar ações preventivas para evitar recorrência.
• Apoiar equipes de desenvolvimento durante incidentes relacionados às aplicações.
• Criar automações e documentação para problemas recorrentes.
Requisitos obrigatórios
• Experiência sólida como Engenheiro de Infraestrutura, Cloud Engineer, Platform Engineer ou função equivalente.
• Experiência prática e recente com AWS em ambientes críticos de produção.
• Conhecimento avançado de Amazon VPC.
• Conhecimento avançado de Security Groups, rotas, subnets e conectividade.
• Experiência sólida com IAM, roles, policies e princípio do menor privilégio.
• Experiência prática com Amazon ECS e AWS Fargate.
• Experiência com AWS CodePipeline e CodeBuild.
• Experiência com AWS Secrets Manager.
• Experiência avançada com Amazon CloudWatch.
• Experiência com configuração de alarms, metrics, logs e dashboards.
• Experiência prática com Docker.
• Experiência prática com Kubernetes em produção.
• Capacidade de implementar e administrar clusters Kubernetes.
• Experiência com Amazon EKS ou Kubernetes gerenciado equivalente.
• Experiência com Terraform ou CloudFormation.
• Experiência com criação e manutenção de pipelines de CI/CD.
• Domínio de Linux e troubleshooting.
• Conhecimento de redes, DNS, certificados, VPN e controle de acesso por IP.
• Conhecimento de Load Balancers e health checks.
• Experiência com investigação de incidentes de produção.
• Conhecimento de backup, restore, alta disponibilidade e disaster recovery.
• Conhecimento de segurança de infraestrutura em nuvem.
• Capacidade de analisar e otimizar custos AWS.
• Conhecimento operacional de bancos de dados relacionais e Redis.
• Experiência com Git e processos de revisão de mudanças.
• Capacidade de criar documentação técnica e runbooks.
• Disponibilidade para atuação presencial quatro vezes por semana em São Paulo.
Conhecimentos esperados de Kubernetes
Para esta posição, não será suficiente ter apenas realizado cursos ou laboratórios de Kubernetes.
O profissional deverá possuir experiência prática com:
• Arquitetura de clusters Kubernetes;
• Deployments;
• StatefulSets;
• DaemonSets;
• Services;
• Ingress;
• ConfigMaps;
• Secrets;
• Jobs e CronJobs;
• Requests e limits;
• Readiness e liveness probes;
• Horizontal Pod Autoscaler;
• Persistent Volumes;
• Helm;
• Namespaces;
• RBAC;
• Network Policies;
• Troubleshooting de pods;
• Diagnóstico de DNS e rede;
• Análise de consumo de CPU e memória;
• Estratégias de rollout e rollback;
• Gestão de logs e métricas;
• Atualização e manutenção de clusters.
Alerta-me sobre empregos como este
Responsável por prestar suporte às atividades de montagem eletromecânica, atuando sob orientação direta, com foco em tarefas básicas e apoio...
Candidatar-se a Este EmpregoAcompanhar o rendimento dos equipamentos e identificar oportunidades para redução de perdas e aumento da produtividade. Apoiar a elaboração e...
Candidatar-se a Este EmpregoA AndroClinic Brasil é uma empresa especializada em tratamentos personalizados para o público masculino. Desde a nossa fundação em 2016,...
Candidatar-se a Este EmpregoDescrição da Vaga Quando nossos clientes têm dúvidas ou problemas técnicos na funcionalidade dos nossos serviços, o time de Suporte...
Candidatar-se a Este EmpregoMonitorar o servidor e processos; Preparar o ambiente de trabalho e auxiliar os usuários de todos os setores da loja;...
Candidatar-se a Este EmpregoPromover a CIPA junto aos colaboradores montando todo o escopo do trabalho juntamente com o Engenheiro de Segurança do contrato...
Candidatar-se a Este Emprego