Evidencia para el SLA
El monitoreo debe apoyar el diagnóstico, no solo mostrar el grupo en línea
Si solo muestra cámaras o arranque y parada, no permite diagnóstico al nivel del SLA. Los puntos deben cubrir grupo, ATS/STS, distribución, combustible, enfriamiento, transferencia del UPS, alarmas y pruebas.
Causas probables
Sin datos clave, el diagnóstico remoto queda en suposiciones
Si no se relacionan tensión, frecuencia, carga, presión, temperatura, alarmas, ATS/STS, interruptores, combustible, enfriamiento y pruebas, será difícil ubicar rápidamente el tramo de falla.
Los datos del grupo cubren solo una parte de la cadena
Horas, presión, temperatura, tensión y frecuencia son importantes, pero no prueban la recuperación de carga y enfriamiento.
Los datos de transferencia y distribución ubican el tramo de falla
ATS/STS, interruptores, tableros, PDU y medidores ayudan a determinar si la falla está en distribución.
Las tendencias históricas ayudan a prevenir fallas
Tendencias de temperatura, consumo, alarmas y carga revelan antes problemas de batería, enfriamiento, combustible y crecimiento de carga.
Proceso de diagnóstico
El ingeniero define puntos según la cadena de evidencia del SLA
- 01
Confirmar datos necesarios de grupo, ATS/STS, tableros, combustible, enfriamiento y UPS.
- 02
Verificar interfaces, frecuencia de datos, reglas de alarma, historial y campos de auditoría.
- 03
Determinar si los datos permiten ubicar a distancia fallas de grupo, distribución, enfriamiento o combustible.
- 04
Integrar pruebas y fallas reales en el mismo conjunto de evidencia operativa.
Cuándo se requiere revisión en sitio
Estas situaciones requieren inspección en sitio y no solo observación remota
- Faltan datos y no se puede determinar el impacto sobre TI, enfriamiento o redundancia.
- La pasarela, medidor, ATS/STS o interfaz del controlador está en estado anormal.
- La auditoría del SLA requiere completar pruebas, alarmas y evidencia de tiempos de recuperación.
Prevención y mantenimiento
Los registros de inspección ayudan a detectar anomalías antes de que provoquen una interrupción y permiten comparar cambios con el tiempo
Controles preventivos
- Cubrir generador, ATS/STS, distribución, combustible, enfriamiento y estado relacionado del UPS.
- Asignar nivel, notificación y cierre a alarmas críticas, no solo generar una lista.
- Validar periódicamente la precisión para no ignorar deriva de sensores o pérdida de comunicación.
Rutina de mantenimiento
- Ante una falla, revisar tendencias y tiempo antes de decidir soporte remoto o sitio.
- Después de cada prueba, cargar curvas, alarmas y resultados correctivos.
- Revisar periódicamente frecuencia de alarmas, carga, consumo y temperatura.
Recomendación de ingeniería
El valor del monitoreo no es una pantalla atractiva, sino permitir que el ingeniero delimite la falla en minutos y deje evidencia auditable.