Hand Talk

Ingeniero de ML III (Habilitación para Investigación)

Show original

Remoto

(Cualquier lugar)

Rango salarial

BRL

R$ 17.000,00 - R$ 17.300,00 / mes

Empleado(a)

Nivel de experiencia

Senior

Requisitos

Vacante afirmativa
4+ años de experiencia en la carrera
Inglés avanzado
CI/CD
Terraform
AWS
Kubernetes
Linux
Docker
Python
Pytorch

Habilidades deseadas

Infraestrutura como Código
Engenharia de plataforma
Computação distribuída
MLOps
Kernels de GPU customizados
Otimização de inferência
Clusters de GPU

Tareas y Responsabilidades

Show original

Sobre el rol

Acelere la investigación en machine learning construyendo las bases de ingeniería, flujos de trabajo y herramientas compartidas que los investigadores necesitan para iterar a escala. Integrado en el equipo de IA, trabajará con investigadores e ingenieros para convertir necesidades de investigación en evolución en capacidades confiables y reutilizables.

A diferencia de un rol convencional de MLOps enfocado en desplegar un único modelo o característica bien definida, este rol apoya un conjunto amplio y cambiante de flujos de trabajo de investigación en los que los modelos y los pipelines de ML son ellos mismos el producto. El candidato ideal tiene una sólida experiencia en ingeniería de plataforma, MLOps o DevOps/infraestructura, entiende el ciclo de vida de ML y está motivado para ayudar a los investigadores a resolver problemas ambiguos más rápido.

Responsabilidades clave

  • Colaborar con investigadores de ML en equipos de IA generativa para identificar cuellos de botella y mejorar la velocidad, la escala y la confiabilidad de la iteración de investigación
  • Diseñar, construir y mantener infraestructura de investigación reutilizable, flujos de trabajo, plantillas, interfaces y automatización para experimentación, entrenamiento, evaluación, procesamiento de datos y empaquetado de modelos
  • Habilitar experimentos reproducibles mediante entornos consistentes, gestión de dependencias, versionado de artefactos y modelos, configuración, observabilidad y prácticas de CI/CD
  • Apoyar cargas de trabajo de ML escalables que involucren grandes conjuntos de datos, clústeres de GPU, cómputo distribuido y múltiples modelos, servicios y componentes algorítmicos interconectados
  • Entregar capacidades prácticas de habilitación de investigación para necesidades inmediatas, manteniéndolas alineadas con la arquitectura y la hoja de ruta de la plataforma central de ML
  • Actuar como puente técnico entre investigadores y el equipo de la plataforma de ML: traducir puntos de dolor de la investigación en requisitos claros de plataforma, validar nuevas capacidades y ayudar a los equipos de investigación a adoptar la plataforma compartida
  • Mejorar el camino de la investigación al producto, haciendo que los resultados de investigación sean más fáciles de reproducir, integrar y probar
  • Contribuir a estándares y arquitectura de ingeniería de ML compartidos entre equipos, y fomentar sólidas prácticas de ingeniería mediante colaboración práctica, orientación técnica y compartir conocimiento
  • Evaluar e introducir tecnologías que mejoren sustancialmente la velocidad, la confiabilidad, la escalabilidad y la eficiencia de costos de la investigación

Requisitos

  • Grado en Ciencias de la Computación, Ingeniería en Computación o campo relacionado
  • 4+ años de experiencia en ingeniería de plataforma, DevOps, ingeniería de backend, infraestructura de ML, MLOps o campo relacionado
  • Experiencia comprobada construyendo infraestructura, herramientas o plataformas de desarrollo reutilizables que habilitan a múltiples ingenieros o investigadores, no solo un pipeline para un único modelo o característica predefinida
  • Sólida proficiencia en Python y Linux, incluida la escritura de software de fácil mantenimiento, automatización y servicios
  • Experiencia práctica con Docker, Kubernetes, pipelines de CI/CD, entornos en la nube como AWS e Infrastructure as Code como Terraform
  • Comprensión práctica del ciclo de vida de ML de extremo a extremo, incluida la preparación de datos, experimentación, entrenamiento, evaluación, gestión de modelos y artefactos, empaquetado, despliegue y monitoreo
  • Experiencia apoyando cargas de trabajo intensivas en cómputo o distribuidas y diagnosticando cuellos de botella de confiabilidad, rendimiento, recursos y costos
  • Conocimiento práctico de frameworks modernos de ML, como PyTorch, con suficiente familiaridad con el comportamiento y las restricciones de los modelos para colaborar efectivamente con investigadores (esto no es un rol de científico de investigación)
  • Capacidad para trabajar a partir de requisitos ambiguos y en evolución, descubrir la necesidad subyacente y convertirla en capacidades de ingeniería simples y reutilizables
  • Sólidas habilidades de comunicación y colaboración entre equipos de investigación, ingeniería y plataforma

Competencias esenciales

  • Pensamiento sistémico: ver los flujos de trabajo de investigación como un sistema interconectado que abarca datos, cómputo, experimentos, modelos, evaluación, plataformas y transiciones a producción
  • Habilitación de investigación: empatía con los investigadores y enfoque en eliminar fricciones sin imponer soluciones diseñadas para casos de uso más estrechos y fijos
  • Resolución de problemas: excelencia técnica y curiosidad al trabajar en problemas abiertos, requisitos incompletos y cuellos de botella operativos
  • Responsabilidad: identificar proactivamente brechas de alto impacto, llevar soluciones a su conclusión y mejorar el entorno más allá de las tareas asignadas
  • Adaptabilidad: comodidad para construir para necesidades inmediatas mientras se evolucionan soluciones hacia una plataforma compartida a largo plazo
  • Comunicación y colaboración: traducir efectivamente entre investigadores e ingenieros de plataforma, construir alineación y compartir conocimiento entre equipos

Deseable

  • Experiencia habilitando investigación en dominios de ML, como modelado de lenguaje, traducción de idiomas, visión por computadora, IA multimodal o generativa, robótica y sistemas autónomos
  • Experiencia escalando clústeres de GPU para entrenamiento, cómputo distribuido y procesamiento de datos a gran escala
  • Experiencia construyendo plataformas de ML orientadas a investigadores, entornos de experimentación de autoservicio y herramientas utilizadas en muchos flujos de trabajo de investigación en evolución
  • Experiencia ayudando a equipos de investigación a migrar a o adoptar una plataforma de ML compartida
  • Conocimiento de técnicas de optimización de inferencia, como kernels de GPU personalizados (valioso, pero secundario en relación con la experiencia en habilitación de investigación e infraestructura de ML)

Información adicional

  • Esta posición no tiene responsabilidades de supervisión

Cómo postularse

Las postulaciones se realizan en esta página, directamente con la empresa. Necesitas un currículum en PDF y un correo electrónico para confirmar la postulación.

Compartir vacante:

Cómo postularse

Las postulaciones se realizan en esta página, directamente con la empresa. Necesitas un currículum en PDF y un correo electrónico para confirmar la postulación.

Compartir vacante: