Easy Book TranslationTraduzir seu livro ↗
Trechos bilíngues

Cópias não significam falhas independentes

Betsy Beyer, Niall Richard Murphy, David K. Rensin, Kent Kawahara and Stephen Thorne (editors) · Manual prático de engenharia de confiabilidade de sites

Capítulo 2. Implementar SLOs · Steven Thurgood e David Ferguson

Problema e método

O capítulo usa objetivos de nível de serviço (SLOs) para orientar decisões de confiabilidade. Parte dos resultados importantes para os usuários, define indicadores, metas e períodos, e estabelece uma política de orçamento de erros entre produto, desenvolvimento e operação. Um jogo exemplifica as medições e suas escolhas. Depois, aborda ajustes contínuos, jornadas de usuários e dependências: ter várias cópias não significa que as falhas sejam independentes.

Original em inglês

It can be tempting to try to math your way out of these problems. If you have a service that offers 99.9% availability in a single zone, and you need 99.95% availability, simply deploying the service in two zones should solve that requirement. The probability that both services will experience an outage at the same time is so low that two zones should provide 99.9999% availability. However, this reasoning assumes that both services are wholly independent, which is almost never the case. The two instances of your app will have common dependencies, common failure domains, shared fate, and global control planes—all of which can cause an outage in both systems, no matter how carefully it is designed and managed. Unless each of these dependencies and failure patterns is carefully enumerated and accounted for, any such calculations will be deceptive.

Tradução em português

Pode ser tentador tentar resolver esses problemas com cálculos. Se um serviço oferece 99.9% de disponibilidade em uma zona e você precisa de 99.95%, basta implantá-lo em duas zonas para, em princípio, atender ao requisito. A probabilidade de ambos os serviços falharem ao mesmo tempo é tão baixa que duas zonas deveriam oferecer 99.9999% de disponibilidade. Porém, esse raciocínio pressupõe que os serviços sejam inteiramente independentes, o que quase nunca acontece. As duas instâncias da aplicação terão dependências comuns, domínios de falha comuns, destino compartilhado e planos de controle globais. Tudo isso pode interromper ambos os sistemas, por mais cuidadosos que sejam o projeto e a gestão. Sem enumerar e considerar cada dependência e cada padrão de falha, esses cálculos serão enganosos.

Betsy Beyer, Niall Richard Murphy, David K. Rensin, Kent Kawahara and Stephen Thorne (editors) · Manual prático de engenharia de confiabilidade de sites · Capítulo 2. Implementar SLOs · Steven Thurgood e David Ferguson · ¶ 340

Tradução e notas preparadas com IA a partir do inglês para esta seleção. Não é uma tradução oficial. Os resumos e comentários não fazem parte das citações.

Traduzir seu livro

Traduzir seu livro ↗