Tiempo estimado de lectura: 4 min Publicado el 2 de octubre de 2026
Elija el viaje para proteger
Describa la acción esencial, la audiencia y las dependencias que puedan interrumpirla. Un sitio comercial puede necesitar visitantes para leer una oferta y enviar consultas; Una tienda necesita pedidos registrados correctamente. Carga de página separada, finalización de acciones y manejo posterior porque estos pasos pueden fallar de manera diferente.
Los Libro de trabajo de Google SRE Describe los objetivos del servicio basados en indicadores y acuerdos entre las partes interesadas. Adapte el enfoque al tamaño del sitio. Un equipo pequeño puede comenzar con un viaje, un indicador observable y un propietario en lugar de muchos tableros sin tomar decisiones asociadas.
Definir eventos y ventanas de observación
Escriba lo que cuenta como un intento y éxito, dónde se observa y qué exclusiones están justificadas. La entrada deliberadamente inválida difiere de la pérdida de una consulta válida. El monitoreo sintético y el uso real observan diferentes poblaciones; Mantenga sus resultados separados.
Defina la ventana de lectura y la evidencia útil mínima. Los porcentajes son inestables con pocos eventos en un sitio de poco tráfico. Mostrar recuentos de intentos y fallas junto con la tasa e investigar los casos reproducibles. Evite recopilar mensajes innecesarios o información personal para medir un resultado técnico.
Elige un objetivo antes de comprometerte
Un objetivo interno describe un nivel deseado y guía las decisiones. Un compromiso contractual tiene alcance y consecuencias que requieren un acuerdo por separado. Evite adoptar un alto porcentaje simplemente porque suena tranquilizador. Compare las necesidades de los visitantes, las restricciones operativas y los costos de recuperación.
En un cálculo ficticio, 10 fracasos entre 1.000 intentos producen un 99% de éxito. Esto no describe la duración, las personas afectadas o la gravedad: los recuentos idénticos pueden representar inconvenientes menores o órdenes perdidas. La disponibilidad basada en el tiempo requiere una definición diferente; No convierta indicadores sin explicar el método.
Conectar umbrales a acciones
Decida quién investiga las alertas, qué evidencia establece un incidente y cómo se informa a las personas afectadas. Una interrupción confirmada puede requerir una solución o una reversión. Una alerta aislada puede necesitar verificación antes de escalar. Reduzca la incertidumbre y el tiempo de respuesta en lugar de generar mensajes para cada fluctuación.
La calidad del documento disminuye durante los cambios. Los Capítulo de política de presupuesto de error Describe las respuestas acordadas a las brechas de fiabilidad. Un sitio pequeño podría simplemente retrasar un cambio opcional hasta que se resuelva un defecto crítico sin pretender implementar el modelo operativo de un servicio grande.
Verificar observadores y revisar incidentes
El monitoreo de pruebas en sí: ¿distingue la disponibilidad de la página de las acciones completadas? ¿Puede detectar una notificación perdida? ¿Emite una alerta comprensible que recibe una respuesta? Los escenarios disruptivos pertenecen a entornos autorizados. Los controles de producción deben evitar órdenes ficticias y mensajes accidentales.
Después de incidentes, conecte los cronogramas, el impacto, las correcciones y las comprobaciones de regresión. Revise los indicadores si fallas en la detección. Los Guía de respuesta a incidentes y Registro de aceptación ayudar a asignar acciones y retener los hallazgos. Los objetivos útiles evolucionan con los viajes y los riesgos observados.
Documentos de referencia
Contenido actualizado el 2 de octubre de 2026
Anote los controles y los resultados en el registro de pruebas web