Easy Book TranslationTraducir tu libro ↗
Fragmentos bilingües

Las copias no implican fallos independientes

Betsy Beyer, Niall Richard Murphy, David K. Rensin, Kent Kawahara and Stephen Thorne (editors) · Manual práctico de ingeniería de fiabilidad de sitios

Capítulo 2. Implementar SLO · Steven Thurgood y David Ferguson

Problema y método

El capítulo presenta los objetivos de nivel de servicio (SLO) como herramientas para decidir sobre fiabilidad. Parte de los resultados importantes para los usuarios, define indicadores, objetivos y periodos, y acuerda una política de presupuesto de errores entre producto, desarrollo y operaciones. Un juego ilustra las mediciones y sus compromisos. Después aborda ajustes continuos, recorridos de usuario y dependencias: varias copias no implican fallos independientes.

Original en inglés

It can be tempting to try to math your way out of these problems. If you have a service that offers 99.9% availability in a single zone, and you need 99.95% availability, simply deploying the service in two zones should solve that requirement. The probability that both services will experience an outage at the same time is so low that two zones should provide 99.9999% availability. However, this reasoning assumes that both services are wholly independent, which is almost never the case. The two instances of your app will have common dependencies, common failure domains, shared fate, and global control planes—all of which can cause an outage in both systems, no matter how carefully it is designed and managed. Unless each of these dependencies and failure patterns is carefully enumerated and accounted for, any such calculations will be deceptive.

Traducción al español

Puede resultar tentador intentar resolver estos problemas con cálculos. Si un servicio ofrece una disponibilidad del 99.9% en una zona y necesitas el 99.95%, desplegarlo en dos zonas debería bastar. La probabilidad de que ambos servicios fallen al mismo tiempo es tan baja que dos zonas deberían ofrecer un 99.9999% de disponibilidad. Sin embargo, este razonamiento supone que ambos servicios son totalmente independientes, algo que casi nunca ocurre. Las dos instancias de la aplicación tendrán dependencias comunes, dominios de fallo comunes, un destino compartido y planos de control globales. Todo ello puede interrumpir ambos sistemas, por cuidadosos que sean su diseño y gestión. Si no se enumeran y consideran todas estas dependencias y patrones de fallo, los cálculos resultarán engañosos.

Betsy Beyer, Niall Richard Murphy, David K. Rensin, Kent Kawahara and Stephen Thorne (editors) · Manual práctico de ingeniería de fiabilidad de sitios · Capítulo 2. Implementar SLO · Steven Thurgood y David Ferguson · ¶ 340

Traducción y notas preparadas con IA a partir del inglés para esta selección. No es una traducción oficial. Los resúmenes y comentarios no forman parte de las citas.

Traducir tu libro

Traducir tu libro ↗