Empresa de Soluciones Informatica esta en la búsqueda de un Senior Principal SRE Engineer altamente cualificado y con una sólida trayectoria para unirse a nuestro equipo de Ingeniería de Confiabilidad del Sitio (SRE). El candidato ideal poseerá una profunda experiencia en la arquitectura, desarrollo y operación de sistemas complejos y distribuidos, con un enfoque particular en la integración de inteligencia artificial y aprendizaje automático. Este rol es fundamental para garantizar la escalabilidad, confiabilidad y eficiencia de nuestras plataformas.
Responsabilidades Principales:
- Diseñar, implementar y mantener arquitecturas de sistemas robustas y escalables, abarcando desde el front-end hasta el back-end, APIs, bases de datos y redes.
- Proporcionar liderazgo técnico y orientación en la adopción y optimización de plataformas e infraestructura en la nube, incluyendo AWS, Azure y Google Cloud, con especial énfasis en servicios de IA.
- Gestionar y mejorar continuamente los entornos de contenedores, Kubernetes y microservicios.
- Desarrollar y mantener pipelines de Integración Continua y Entrega Continua (CI/CD), aplicando principios de Infraestructura como Código (IaC) y automatización de despliegues.
- Establecer y supervisar métricas de observabilidad, incluyendo logging, alerting y dashboards, asegurando la preparación operativa de los sistemas.
- Implementar y optimizar prácticas de Gestión de Servicios de TI (ITSM) y marcos de cumplimiento normativo.
- Diseñar y ejecutar estrategias de preparación operativa, incluyendo ingeniería del caos, pruebas de resiliencia y planes de mitigación de riesgos.
- Supervisar y optimizar la infraestructura de red, incluyendo la configuración de firewalls, balanceadores de carga, proxies y la automatización de tareas de red.
- Gestionar el ciclo de vida de los certificados digitales utilizando herramientas como Venafi, ECMS, CerTIS, y OpenSSL, asegurando la seguridad de las comunicaciones.
- Aplicar un profundo conocimiento de los conceptos de Machine Learning (ML) y Deep Learning (DL), incluyendo algoritmos, redes neuronales y frameworks como TensorFlow y PyTorch.
- Diseñar arquitecturas de IA y planificar pipelines de ML/DL considerando la escalabilidad, tolerancia a fallos, rentabilidad y seguridad.