SRE-as-a-Service vs Equipo Interno: Cuándo Tiene Sentido Cada Uno
La mayoría de las organizaciones no sabe cuánto le cuesta una hora de parada. Cuándo compensa construir un equipo de fiabilidad interno, cuándo compensa contratar SRE-as-a-Service y dónde está el punto de inflexión entre ambos.
La decisión sobre cómo garantizar la fiabilidad de una operación crítica suele llegar tarde, y casi siempre después de un incidente. La pregunta que se plantea en ese momento es si la respuesta pasa por contratar personas o por contratar capacidad.
La discusión degenera con frecuencia en un debate sobre coste por persona. Es el enfoque equivocado. La pregunta útil no es cuánto cuesta cada opción, sino cuál de ellas resuelve el problema que la organización tiene de verdad.
¿Qué problema resuelve la fiabilidad?
Resuelve el coste de estar parado, y la mayoría de las organizaciones no sabe calcularlo. Ese es el punto ciego que vuelve difícil la decisión.
Sin esa cifra, cualquier inversión en fiabilidad parece cara, porque no hay término de comparación. Y el valor en juego rara vez es pequeño.
En una encuesta a mil líderes de negocio, responsables de tecnología y desarrolladores sénior en siete mercados, el 68% de las organizaciones pierde más de 300 mil dólares por hora durante interrupciones no planificadas, y el 8% pierde más de un millón por hora. Los valores se reportan en dólares estadounidenses, y 400 de los encuestados son europeos (PagerDuty, 2026 State of AI-First Operations).
La primera tarea de quien decide no es elegir entre equipo interno y servicio externo. Es calcular el coste de una hora de parada. Sin esa cifra, la decisión siguiente es una corazonada.
Qué hace un equipo de fiabilidad, más allá de estar disponible
La fiabilidad de sistemas, conocida por las siglas inglesas SRE y contratable como servicio bajo la denominación SRE-as-a-Service, no se reduce a atender llamadas fuera de horario. El trabajo tiene cuatro componentes que rara vez aparecen juntos en una contratación individual.
- Objetivos de servicio medibles: cuánto tiempo puede estar degradado el sistema antes de que haya consecuencia de negocio.
- Instrumentación: lo que hace observables esos objetivos en tiempo real, y no solo reconstruibles después del incidente.
- Operación de guardia: una rotación con personas suficientes para que la cobertura no se pague con el desgaste de quien está de servicio.
- Trabajo de ingeniería: eliminar las causas recurrentes, en lugar de mitigarlas todas las semanas.
El componente que casi siempre falla es la operación de guardia. Una rotación sostenible exige un mínimo de personas, y ese mínimo es mayor de lo que la mayoría de las organizaciones imagina.
Cuándo tiene sentido construir un equipo interno
Tiene sentido cuando la fiabilidad forma parte del producto vendido y la escala justifica la rotación. Tres condiciones deben darse a la vez.
La primera es volumen de operación suficiente para ocupar a un equipo a tiempo completo. Un equipo de fiabilidad infrautilizado pierde competencia, porque la competencia se mantiene por la exposición a incidentes reales.
La segunda es capacidad de reclutar y retener. Aquí es donde encalla la mayoría de los planes, y el obstáculo es mayor en Europa que en otros mercados.
En Portugal, el 82% de los empleadores reporta dificultad para encontrar talento, frente al 72% a nivel global, según la encuesta anual de ManpowerGroup para 2026.
La tercera condición es tolerancia al tiempo de arranque. En el mismo estudio de la Linux Foundation, los responsables europeos estiman que contratar e integrar personal nuevo lleva un 53% más de tiempo que recualificar a quien ya está en el equipo, y el 23% de los nuevos empleados se va en menos de seis meses. Para una función de guardia, cada salida no es una vacante: es un hueco en la rotación que sobrecarga a quien se queda.
Cuándo tiene sentido contratar capacidad en lugar de personas
Tiene sentido cuando la operación es crítica pero no tiene escala para sostener un equipo propio. Es la situación de la mayoría de las organizaciones con tecnología crítica y un equipo de tecnología pequeño.
En estos casos, construir internamente lleva a uno de dos resultados. O se contrata poca gente, y la rotación de guardia agota a las personas hasta que se van. O se contrata gente suficiente, y el coste fijo pasa a ser desproporcionado frente al volumen real de operación.
La alternativa es contratar la función en lugar del puesto, el modelo denominado SRE-as-a-Service: objetivos de servicio definidos, instrumentación montada, guardia cubierta por un equipo con rotación sostenible y trabajo de ingeniería continuado sobre las causas recurrentes. La organización mantiene la decisión y el conocimiento del negocio; la operación de fiabilidad pasa a tener responsable, sin pasar a tener plantilla.
El punto de inflexión, en cuatro preguntas
La elección se resuelve con cuatro preguntas concretas, respondidas con números y no con impresiones.
¿Cuánto cuesta una hora de parada? Sin esta cifra, ninguna de las preguntas siguientes tiene respuesta defendible.
¿Cuántas personas hacen falta para una rotación de guardia sostenible? Comparar ese total con el equipo actual, y no con la vacante que se piensa abrir.
¿Cuánto se tarda en tener a esas personas produciendo? Sumar el tiempo de reclutamiento al de integración, y asumir una tasa de salida realista en el primer año.
¿La fiabilidad es un diferenciador competitivo o un prerrequisito? Si es diferenciador, la competencia debe vivir dentro de casa. Si es prerrequisito, lo que importa es que funcione, y la propiedad de la función es una cuestión de eficiencia, no de estrategia.
El error más caro no es elegir mal
Hay un tercer camino que no es elección alguna, y es el más común: dejar la fiabilidad repartida entre todos, sin responsable nombrado ni objetivos definidos. El síntoma de esa situación es conocido.
Cuando nadie es responsable de la fiabilidad, la alerta que nadie investigó pasa a ser el fallo que comunicó el cliente. No es falta de herramientas: es falta de propiedad.
Preguntas frecuentes
¿Cuál es la diferencia entre SRE-as-a-Service y el soporte gestionado clásico? El soporte clásico responde a peticiones y resuelve averías. La fiabilidad de sistemas define objetivos de servicio medibles, instrumenta el sistema para medirlos y trabaja de forma continua en eliminar las causas recurrentes. Uno responde a lo que falló; el otro reduce la probabilidad de fallar.
¿Un equipo pequeño puede cubrir una guardia de 24 horas? Puede cubrirla, pero rara vez de forma sostenible. Una rotación que no sobrecarga a quien está de servicio exige un número mínimo de personas con competencia equivalente. Por debajo de ese mínimo, la cobertura existe sobre el papel y se desgasta en la práctica, con el coste previsible de las salidas.
¿El modelo externo no aleja el conocimiento del negocio? Lo aleja si se contrata como cesión de personas sueltas. No lo aleja si se contrata como función con objetivos definidos, con continuidad de equipo y con la organización manteniendo la decisión sobre prioridades y riesgo aceptable.
¿Tiene sentido empezar por un diagnóstico? Lo tiene, sobre todo cuando la respuesta a la primera de las cuatro preguntas todavía no existe. Un diagnóstico que produzca el coste real de la indisponibilidad y el inventario de lo que está instrumentado convierte la discusión de opinión en decisión.
Conclusión
La elección entre construir un equipo de fiabilidad interno y contratar SRE-as-a-Service no se decide por coste por persona. Se decide por escala de operación, por capacidad real de reclutar y retener en un mercado con falta declarada de personas, y por la naturaleza de la fiabilidad dentro del negocio.
Lo que no es opción es dejar la función sin responsable. Sobre este punto conviene leer también por qué tener copias de los datos no es lo mismo que poder volver a operar, y qué separa una plataforma que acelera de una que frena.
Para calcular el coste real de una hora de parada y entender qué modelo de fiabilidad sirve a la operación, xGrowth empieza por una reunión breve y sin compromiso sobre fiabilidad y operación: Reservar una Sesión de Orientación.
