Geekhunter Logo

Soluções

Software de recrutamento

Divulgue vagas, importe perfis, pré-qualifique candidatos com perguntas personalizadas e controle todo o recrutamento em um só lugar.

Serviço de recrutamento

Confie em nós para encontrar seu talento tech. Com o nosso time especializado atuamos nas principais etapas de recrutamento.

Base de talentos

Os melhores talentos tech do Brasil, todos pré-selecionados e prontos para novas oportunidades.

Nossos planos

Descubra o plano perfeito para suas necessidades.

Login

Português

PT

Dell Technologies | Radancy

Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) – Server

Presencial

Eldorado do Sul, RS, Brasil

Faixa de Remuneração

Não informada

CLT

Nível de Experiência

Sênior

Requisitos

5+ anos de experiência na carreira
Inglês avançado
Ansible
Oracle Linux
Git
Windows Server
Observabilidade
VMware vSphere
GitOps
Monitoramento
SRE
RHEL
CI/CD
Linux
Python
vCenter

Conhecimentos Desejáveis

Zabbix
Kickstart
Packer
vROps
LLM
GitLab CI
Dynatrace
PCI-DSS
SOX
NetBox
ISO 27001
Preseed
Agentic AI
ServiceNow CMDB

Tarefas e Responsabilidades

Junte-se a nós como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE) em nossa equipe de Engenharia de Infraestrutura em Eldorado do Sul/RS para fazer o melhor trabalho da sua carreira e gerar um impacto social profundo.


Como Engenheiro(a) Sênior de Confiabilidade de Sites (SRE), você será responsável por projetar, desenvolver e administrar automações para todo o ciclo de vida da infraestrutura compute, garantindo escalabilidade, disponibilidade e confiabilidade dos serviços. Você trabalhará com equipes de Engenharia Compute, Automação de Plataforma, Observabilidade e Infraestrutura em uma plataforma corporativa baseada em automação, suportando cargas de trabalho críticas e impulsionando a excelência operacional por meio de práticas modernas de SRE e automação em larga escala.



O que você irá fazer


  • Projetar, desenvolver e manter automações para todo o ciclo de vida da infraestrutura compute, incluindo descoberta de servidores, provisionamento bare-metal, implantação de sistemas operacionais, gerenciamento de firmware e patches, configuração de hipervisores, descomissionamento e processos automatizados de diagnóstico e remediação utilizando Ansible, Python e pipelines CI/CD.
  • Definir e operar práticas de confiabilidade para serviços compute por meio da criação e manutenção de SLIs, SLOs e error budgets, além de aprimorar a observabilidade, reduzir ruídos de monitoramento, conduzir análises pós-incidente e transformar falhas recorrentes em soluções automatizadas.
  • Colaborar com equipes de Engenharia Compute, Automação de Plataforma e Observabilidade para definir requisitos operacionais, integrar automações à plataforma corporativa de IA e automação, garantir critérios de prontidão operacional e contribuir para políticas como código voltadas à operação segura e escalável de plataformas compute.
  • Liderar iniciativas de melhoria contínua por meio da medição da cobertura de automação, aumento das taxas de resolução autônoma, manutenção de bases de conhecimento estruturadas, identificação de oportunidades para eliminação de atividades manuais e avaliação de novas ferramentas para integração ao ecossistema corporativo.
  • Participar da escala de plantão da torre de Compute, atuando como ponto de escalonamento quando mecanismos automatizados não resolverem incidentes críticos dentro dos níveis de serviço definidos e utilizando informações de diagnóstico previamente consolidadas para acelerar a resolução.


Requisitos essenciais


  • Ensino superior completo em Ciência da Computação, Tecnologia da Informação, Engenharia ou áreas correlatas, com experiência em SRE, Engenharia de Infraestrutura, Engenharia de Servidores ou Operações de Plataformas em larga escala.
  • Inglês avançado ou fluente, com capacidade de colaborar efetivamente com equipes globais.
  • Experiência prática avançada em pelo menos duas das seguintes áreas: VMware vSphere/vCenter, plataformas de servidores bare-metal (Dell PowerEdge, HPE, Cisco UCS ou equivalentes), sistemas operacionais Linux (Oracle Linux, RHEL ou equivalentes) ou ambientes Windows Server.
  • Experiência comprovada no desenvolvimento de automações de infraestrutura utilizando Ansible, Python, Git, pipelines CI/CD e práticas de GitOps, incluindo gerenciamento automatizado do ciclo de vida de plataformas compute.
  • Conhecimento sólido em observabilidade, monitoramento de infraestrutura, confiabilidade de sistemas, troubleshooting, gestão de incidentes, análise de causa raiz e resolução de falhas complexas envolvendo hardware, hipervisores, sistemas operacionais e ambientes distribuídos.


Requisitos desejáveis


  • Experiência com vROps, Zabbix, Dynatrace, ServiceNow CMDB, NetBox, GitLab CI, ferramentas de gerenciamento de imagens (Kickstart, Preseed, Packer), automação de firmware, práticas formais de Site Reliability Engineering (SRE) e ambientes regulados por requisitos de conformidade, como SOX, PCI-DSS ou ISO 27001.
  • Familiaridade com plataformas corporativas de automação assistida por IA, soluções agentic AI, integração de LLMs em processos operacionais e ecossistemas avançados de observabilidade e automação empresarial.
Ver todas as vagas da empresa Dell Technologies | Radancy

Compartilhar vaga:

Compartilhar vaga: