Buscamos un profesional altamente capacitado para ocupar el cargo de SRE (Site Reliability Engineer). El objetivo principal de esta posición es garantizar la disponibilidad ininterrumpida de nuestros servicios y proporcionar respuestas efectivas a los incidentes que se presenten.
Como parte de nuestro equipo, enfrentarás desafíos significativos que requieren una combinación de habilidades técnicas y una mentalidad orientada a la resolución de problemas. Buscamos un candidato que no solo cuente con al menos 3 años de experiencia en un entorno similar, sino que también esté motivado para aprender y mejorar continuamente.
Funciones principales:
- Construir y mantener la observabilidad de sistemas y aplicaciones.
- Construir y mantener la infraestructura usando infraestructura como código
- Gestionar y mitigar incidentes críticos, asegurando una pronta resolución y minimizando el impacto en los usuarios finales.
- Crear y mantener pipelines para los deployments automáticos de las aplicaciones en conjunto con los DevOps Champions.
- Construir y mantener herramientas que faciliten el trabajo del equipo de desarrollo
- Garantizar que los sistemas y aplicaciones sean altamente confiables.
- Automatizar tareas operativas y desarrollar herramientas para mejorar la eficiencia del equipo y reducir el tiempo de respuesta ante incidencias
- Colaborar con los equipos de desarrollo para implementar prácticas de ingeniería confiables desde el inicio del ciclo de vida del desarrollo de software
- Realizar análisis de capacidad y planificación para anticipar el crecimiento y los cambios en la demanda de los sistemas, garantizando la escalabilidad adecuada.
- Identificar cuellos de botella y proponer mejoras para garantizar una experiencia óptima para los usuarios.
- El cumplimiento de los KPI's (Key Performance Indicators) es importante en cualquier rol profesional, incluyendo el de un Site Reliability Engineer, de acuerdo con las metas específicas de la organización que sumen a los OKR's (Objectives and Key Results)