Dell Technologies | Radancy
Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage
Presencial
Eldorado do Sul, RS, Brasil
Faixa de Remuneração
CLT
Nível de Experiência
Sênior
Requisitos
Conhecimentos Desejáveis
Tarefas e Responsabilidades
Junte-se a nós como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Storage em nossa equipe de Engenharia de Infraestrutura em Eldorado do Sul/RS para fazer o melhor trabalho da sua carreira e gerar um impacto social profundo.
Você será responsável por projetar, desenvolver e administrar automações para todo o ciclo de vida dos serviços de armazenamento, garantindo escalabilidade, disponibilidade, desempenho e confiabilidade dos ambientes corporativos. Trabalhará com equipes de Engenharia de Storage, Automação de Plataforma, Observabilidade e Infraestrutura para entregar uma operação altamente automatizada, suportando cargas de trabalho críticas por meio de práticas modernas de SRE, automação e engenharia de confiabilidade.
O que você irá fazer
- Projetar, desenvolver e manter automações para todo o ciclo de vida dos serviços de armazenamento, incluindo provisionamento de volumes e LUNs, gerenciamento de snapshots e replicação, monitoramento de capacidade, gestão de firmware, descomissionamento e remediação automatizada utilizando Ansible, APIs REST e pipelines CI/CD.
- Definir e operar práticas de confiabilidade para serviços de storage por meio da criação e manutenção de SLIs, SLOs e error budgets, aprimorando a observabilidade, reduzindo ruídos operacionais, conduzindo análises pós-incidente e transformando problemas recorrentes em soluções automatizadas.
- Colaborar com equipes de Engenharia de Storage, Automação de Plataforma e Observabilidade para estabelecer requisitos operacionais, integrar automações à plataforma corporativa de IA, definir critérios de prontidão operacional e contribuir com políticas como código voltadas à proteção da disponibilidade, durabilidade e capacidade dos ambientes.
- Liderar iniciativas de melhoria contínua por meio da medição da cobertura de automação, aumento das taxas de resolução autônoma, manutenção da base de conhecimento estruturada, identificação de oportunidades de automação e avaliação de novas ferramentas para integração ao ecossistema corporativo.
- Participar da escala de plantão da torre de Storage, atuando como ponto de escalonamento quando mecanismos automatizados não resolverem incidentes críticos dentro dos níveis de serviço estabelecidos e utilizando diagnósticos previamente consolidados para acelerar a tomada de decisão e resolução.
Requisitos essenciais
- Ensino superior completo em Ciência da Computação, Tecnologia da Informação, Engenharia ou áreas correlatas, com experiência em Engenharia de Storage, SRE, Operações de Armazenamento ou Infraestrutura corporativa de grande porte.
- Inglês avançado ou fluente, com capacidade de colaborar efetivamente com equipes globais.
- Experiência prática avançada em pelo menos duas das seguintes áreas: armazenamento SAN/Block, NAS/File Storage, Object Storage ou plataformas corporativas equivalentes, incluindo soluções Dell, Pure Storage, NetApp, HPE ou similares.
- Experiência comprovada no desenvolvimento de automações para plataformas de armazenamento utilizando Ansible, Python, APIs REST, Git, pipelines CI/CD e práticas de GitOps, incluindo provisionamento, replicação, gerenciamento de capacidade e ciclo de vida dos ambientes.
- Conhecimento sólido em observabilidade, monitoramento, confiabilidade de serviços, análise de incidentes, troubleshooting e resolução de falhas complexas envolvendo desempenho, replicação, capacidade, controladoras, discos e arquiteturas distribuídas de armazenamento.
Requisitos desejáveis
- Experiência com ambientes multivendor de storage, plataformas de monitoramento como Zabbix ou vROps, ServiceNow CMDB, GitLab CI, serviços de armazenamento em nuvem, arquiteturas híbridas e práticas formais de Site Reliability Engineering (SRE).
- Familiaridade com plataformas corporativas de automação assistida por IA, soluções agentic AI, integração de LLMs em processos operacionais, ambientes regulados por requisitos de conformidade (SOX, PCI-DSS, ISO 27001) e geração de evidências para auditoria.
Compartilhar vaga:
Compartilhar vaga: