ZG Soluções
Analista SRE Sênior
Remoto
(Qualquer lugar)
Faixa de Remuneração
CLT
Nível de Experiência
Sênior
Requisitos
Conhecimentos Desejáveis
Tarefas e Responsabilidades
Buscamos um profissional Sênior de infraestrutura e confiabilidade, com estrada real em ambientes produtivos críticos.
Nossos ambientes são híbridos: cargas em cloud pública, cargas em datacenter com virtualização e cargas dentro da infraestrutura privada dos nossos clientes. Isso exige alguém que domine a base (rede, virtualização e Linux) e que automatize tudo o que sustenta essa base.
Atuando conosco, você será responsável por provisionar infraestrutura de forma automatizada, operar nossos clusters Kubernetes em produção e garantir a resiliência e a observabilidade das aplicações em todos esses ambientes.
Avaliamos profundidade técnica e capacidade de diagnóstico. Não avaliamos exposição, palestras ou presença em redes sociais.
RESPONSABILIDADES E ATRIBUIÇÕES
• Automatizar o provisionamento e a configuração da infraestrutura com Terraform e Ansible;
• Operar e evoluir clusters Kubernetes em produção, incluindo networking, storage, RBAC e estratégias de atualização;
• Construir e manter imagens e containers Docker enxutos e reprodutíveis;
• Sustentar a conectividade entre nossos ambientes e os dos clientes: roteamento, VPN, DNS, TLS, firewall e proxy reverso;
• Administrar e dimensionar a camada de virtualização e os sistemas Linux que suportam a plataforma;
• Manter e evoluir a arquitetura com foco em resiliência e alta disponibilidade;
• Evoluir a esteira de CI/CD e a entrega via GitOps (ArgoCD);
• Promover observabilidade e monitoramento com Prometheus, Grafana e Zabbix, reduzindo ruído de alerta;
• Conduzir a análise de incidentes até a causa raiz e transformá-la em correção estrutural documentada;
• Sustentar a operação de aplicações Java e de bancos de dados PostgreSQL em produção;
• Promover a gestão de segurança nos servidores e serviços do ecossistema.
REQUISITOS E QUALIFICAÇÕES
Os requisitos abaixo são inegociáveis para esta posição. Esperamos que você saiba explicar cada um em profundidade, com exemplos do que fez:
• Experiência sólida como SRE, DevOps ou Infraestrutura em ambientes produtivos críticos, com atuação direta em incidentes de impacto real;
• Domínio de redes: TCP/IP, roteamento, DNS, NAT, TLS/SSL, VPN, firewall e proxy reverso com NGINX;
• Experiência em administração de virtualização em produção, preferencialmente Proxmox (VMware, KVM ou equivalente também são considerados);
• Operação avançada de Linux e automação com Shell/Bash;
• Automação de provisionamento com Terraform e Ansible em uso real e mantidos ao longo do tempo;
• Gerenciamento de clusters Kubernetes em produção, com capacidade de investigar e resolver falhas de workload, tráfego e nó;
• Construção, atualização e gerenciamento de imagens e containers Docker;
• Experiência em processos de CI/CD e em entrega via GitOps (ArgoCD ou equivalente);
• Experiência com ferramentas de monitoramento e observabilidade (Prometheus, Grafana, Zabbix);
• Controle de versão com Git como prática diária;
• Autonomia para assumir um problema mal definido, investigar até o fim e entregar a solução;
• Comunicação clara e documentação técnica de qualidade, principalmente durante incidentes.
VOCÊ VAI SE DESTACAR SE TIVER
• Experiência em ambientes com exigência regulatória (saúde, financeiro ou setor público) e familiaridade com LGPD;
• Vivência em troubleshooting de sistemas distribuídos e falhas intermitentes;
• Experiência com middleware e servidores de aplicação Java, filas e API Gateways;
• Prática em hardening, gestão de segredos e de vulnerabilidades;
• PostgreSQL em nível de tuning, replicação e recuperação;
• Certificações que sustentem a prática (CKA/CKS, RHCE, LPIC, rede ou cloud);
• Capacidade de escrever a própria ferramenta quando não existe pronta (Python, Go ou equivalente);
• Uso de IA no dia a dia técnico, para construir ferramentas e automações e acelerar a resolução de problemas.
ESTA VAGA NÃO É PARA VOCÊ SE
• Sua experiência com Kubernetes se resume a aplicar manifestos escritos por outra pessoa;
• Você trata rede como caixa-preta e escala para terceiros o que não está na aplicação;
• Você provisiona por console gráfico e não versiona infraestrutura.
Compartilhar vaga:
Compartilhar vaga: