Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Em ambientes cloud, as falhas são inevitáveis. Podem ocorrer falhas de hardware, defeitos de software, erros de configuração, picos de tráfego, interrupções em centros de dados e até interrupções regionais. Fiabilidade é a capacidade de uma carga de trabalho para continuar a cumprir as expectativas do negócio, mesmo durante falhas ou interrupções. Com a arquitetura e operações certas, falhas não precisam de resultar em tempo de inatividade.
O tempo de inatividade não planeado pode ter um enorme impacto. Tem custos financeiros e prejudica a confiança dos clientes e dos utilizadores. Para além destes impactos imediatos, a fraca fiabilidade afeta as obrigações de conformidade e o posicionamento competitivo. As suas equipas passam mais tempo a combater incêndios e menos tempo a entregar valor. Pode até desencadear penalizações contratuais pelo nível de serviço.
O Azure oferece infraestrutura resiliente e serviços geridos, mas a fiabilidade da sua carga de trabalho depende das decisões de design e operacionais que toma: como projeta a sua arquitetura, configura serviços, gere dependências, automatiza respostas a problemas e testa software e processos. Projetar para a fiabilidade desde cedo ajuda-o a minimizar falhas e garante que, quando ocorrem, a sua carga de trabalho se degrada de forma previsível e controlada, alinhada com as prioridades do negócio.
Uma carga de trabalho fiável tem duas propriedades essenciais:
- É resiliente, o que significa que pode absorver falhas e mudanças no ambiente enquanto continua a operar com um nível de serviço aceitável.
- Também é recuperável, o que significa que, quando ocorre interrupção, a carga de trabalho pode restaurar as operações normais dentro dos limites definidos de tempo e perda de dados.
É necessário que ambas as propriedades cumpram as expectativas de disponibilidade real e mantenham a continuidade do negócio.
A fiabilidade no Azure funciona através de três camadas interligadas:
- A sua aplicação: As suas escolhas arquitetónicas, práticas e processos, incluindo gestão de dependências, runbooks, automação e testes
-
Características de fiabilidade, incluindo:
- Serviços de carga de trabalho e configuração: Como configura os serviços Azure que executam a sua carga de trabalho e as capacidades de fiabilidade que configura dentro desses serviços
- Serviços da plataforma Azure: Serviços Azure que suportam especificamente a fiabilidade da carga de trabalho, como balanceamento de carga, DNS, encaminhamento de tráfego e monitorização
- Fundamentos de fiabilidade: a resiliência incorporada do Azure, como zonas de disponibilidade, regiões e práticas de implementação segura
Estas camadas trabalham em conjunto para determinar a fiabilidade global da carga de trabalho. Compreendê-los ajuda-o a distinguir entre o que o Azure fornece por defeito e o que precisa de desenhar, configurar e operar.
Este modelo ajuda-o a tirar partido do que o Azure oferece, assumindo a responsabilidade pelo que só você pode desenhar. Este artigo foca-se no que o Azure oferece nestas camadas. Para orientações abrangentes sobre a camada de design de carga de trabalho e operações (conceção de soluções resilientes e padrões arquitetónicos), consulte o Azure Well-Architected Framework e, especialmente, o pilar de fiabilidade.
Responsabilidade partilhada pela fiabilidade
A fiabilidade no Azure segue um modelo de responsabilidade partilhada. A Microsoft fornece a plataforma resiliente através do Azure. Tu desenhas a carga de trabalho resiliente.
A Microsoft detém as fundações da plataforma e os serviços de fiabilidade da plataforma. Esta propriedade inclui a infraestrutura resiliente (redundância física, isolamento de falhas e recuperação), zonas de disponibilidade, distribuição regional, práticas de implementação segura e serviços ao nível da plataforma como balanceamento de carga, roteamento de tráfego e monitorização. A Microsoft é responsável pela fiabilidade da plataforma Azure e pela fiabilidade dos serviços conforme definido pelo SLA publicado e documentação de cada serviço, como o seu guia de fiabilidade.
Tu és responsável pelo design e operações da carga de trabalho. És responsável por traduzir as capacidades do Azure em comportamento fiável da carga de trabalho através de decisões de arquitetura, escolhas de configuração, práticas operacionais e testes.
O Azure não pode saber os seus objetivos de disponibilidade, compromissos aceitáveis, contexto de negócio ou requisitos específicos da aplicação. Só tu podes definir esses requisitos e desenhar em conformidade. O Azure oferece funcionalidades, enquanto as seleciona e configura. Por exemplo, configura o comportamento de failover para serviços como bases de dados e define sondas de saúde do balanceador de carga que representam com precisão a saúde da aplicação para que as decisões de encaminhamento de tráfego estejam corretas, mesmo durante falhas.
Importante
A plataforma fornece blocos de construção, não garantias de ponta a ponta. As suas escolhas de design e operacionais determinam se essas capacidades se traduzem numa carga de trabalho fiável. Para uma explicação completa do modelo de responsabilidade partilhada, veja Responsabilidade partilhada na cloud.
Os acordos de nível de serviço (SLAs) definem compromissos e expectativas de fiabilidade entre os serviços Azure. Compreender os SLAs é essencial ao avaliar serviços e desenhar metas específicas de disponibilidade. Os serviços do Azure publicam compromissos SLA que podem variar consoante a configuração e o nível de redundância. Outros serviços que utilizas de outros fornecedores também podem publicar SLAs. Para orientações abrangentes sobre como funcionam os SLAs e se relacionam com as expectativas de disponibilidade da sua carga de trabalho, consulte Acordos de nível de serviço.
Fundações resilientes no Azure
O Azure foi concebido com múltiplas camadas de resiliência incorporadas na própria plataforma. Estas fundações fornecem as capacidades de base sobre as quais são construídas cargas de trabalho fiáveis:
Resiliência da infraestrutura física: Os datacenters Azure são concebidos com infraestruturas redundantes, como energia, arrefecimento e conectividade de rede. O controlador de fabric do Azure isola e gere automaticamente falhas de hardware. Detetaria falhas e orquestrava a migração da carga de trabalho para hardware saudável sem intervenção do cliente.
Regiões: O Azure opera em mais de 70 regiões em todo o mundo. Esta distribuição geográfica permite que as cargas de trabalho resistam a interrupções e interrupções regionais através de capacidades de failover planeado, cumprindo os requisitos de residência dos seus dados. Para mais informações, consulte a visão geral das regiões Azure.
Zonas de disponibilidade: Muitas regiões do Azure incluem centros de dados fisicamente separados dentro da mesma região. Estas zonas de disponibilidade estão ligadas por redes de alta velocidade e baixa latência. Cada zona dispõe de energia, arrefecimento e rede independentes para proteger contra falhas ao nível do centro de dados, mantendo as capacidades de replicação síncrona para muitos serviços Azure. Para obter mais informações, veja O que são zonas de disponibilidade?
Implementações seguras: O Azure implementa processos de implementação controlados e escalonados para atualizações de plataforma e alterações de serviço, minimizando o risco de interrupções generalizadas do serviço. A plataforma lança atualizações gradualmente, como em domínios de falha, zonas de disponibilidade e regiões, com capacidades automáticas de rollback quando detetar problemas. Esta abordagem garante que as alterações na plataforma não introduzem riscos de fiabilidade para as cargas de trabalho dos clientes.
O Azure fornece estas fundações ao nível da plataforma automaticamente. Formam a camada base sobre a qual constróis cargas de trabalho fiáveis. No entanto, deve configurar corretamente os seus serviços e combinar estas capacidades de forma a satisfazer os requisitos específicos do seu negócio.
Serviços Azure que suportam a sua fiabilidade
O Azure oferece capacidades de plataforma que traduzem conceitos de fiabilidade em blocos de construção acionáveis para a sua arquitetura. Estas capacidades trabalham em conjunto para permitir arquiteturas resilientes, e muitos serviços do Azure incluem implementações integradas destes padrões:
| Capability | Description |
|---|---|
|
|
Utiliza capacidades impulsionadas por IA para avaliar e melhorar a fiabilidade. Estas capacidades analisam padrões de carga de trabalho, identificam riscos potenciais e fornecem recomendações que ajudam as equipas a passar da resolução de problemas reativa para uma gestão proativa da fiabilidade. Estas capacidades revelam sinais de fiabilidade e traduzem-nos em recomendações acionáveis que ajudam as equipas a priorizar e melhorar a fiabilidade ao longo do tempo. O Azure fornece vários serviços de fiabilidade orientados por IA, incluindo: - Capacidades do Azure Resiliency - Capacidades de resiliência em Agentes (pré-visualização) em Azure Copilot - Azure SRE Agent Estes serviços analisam padrões de carga de trabalho e sugerem melhorias para otimizar a sua postura de fiabilidade em geral. |
|
|
Permite a fiabilidade ao encaminhar o tráfego entre instâncias redundantes e ao gerir automaticamente o failover. Esta capacidade é essencial para manter a disponibilidade do serviço quando componentes individuais falham. O Azure fornece balanceamento de carga em múltiplas camadas, incluindo: - Balanceador de Carga do Azure for Layer-4 TCP/UDP traffic distribution - Gateway de Aplicação do Azure para encaminhamento HTTP em Layer-7 com verificações de saúde conscientes da aplicação - Azure Front Door para balanceamento de carga HTTP global com failover rápido - Gestor de Tráfego do Azure for DNS based global endpoint distribution Se precisar de ajuda para decidir que balanceador de carga usar no seu cenário, consulte Opções de balanceamento de carga. |
|
|
Protege contra perda e corrupção de dados, e permite a recuperação após ocorrer um problema. O Azure oferece várias capacidades de backup e recuperação, incluindo: - Azure Backup para backup centralizado com retenção configurável para máquinas virtuais, contentores de blobs, ficheiros e algumas bases de dados - Funcionalidades nativas de backup e restauro em muitos serviços Azure, incluindo a maioria dos serviços de base de dados - Bicep e outras infraestruturas como ferramentas de código para backup de configuração, proteção contra derivas e rápida recriação ambiental Consulte o guia de fiabilidade de cada serviço Azure para compreender as abordagens de backup que o serviço suporta. |
|
|
Permite a recuperação de falhas regionais através de replicação de dados entre regiões e capacidades de failover automatizado. O Azure Site Recovery orquestra a recuperação de desastres para cargas de trabalho de máquinas virtuais com replicação automatizada e sequenciação por failover. Muitos serviços do Azure também oferecem funcionalidades de geo-replicação integradas, incluindo: - Azure Cosmos DB com capacidades nativas de replicação de dados entre regiões e failover - API Management do Azure com capacidades nativas de failover entre regiões Guias de fiabilidade de serviço detalham quaisquer opções de geo-replicação disponíveis para cada serviço. |
|
|
Proporciona uma visibilidade abrangente sobre a postura de fiabilidade e permite uma resposta proativa aos problemas. O Azure fornece múltiplos serviços de observabilidade, incluindo: - Azure Monitor e Application Insights para monitorização em tempo real, alertas e rastreio de dependências - Modelos de saúde no Azure Monitor para monitorizar a saúde de toda uma carga de trabalho - Azure Service Health para alertas personalizados e orientações sobre problemas de serviço Azure que possam afetar as suas cargas de trabalho Em conjunto, estas capacidades ajudam-no a perceber se está a cumprir os requisitos de fiabilidade e a responder rapidamente quando surgem problemas. |
|
|
Ajuda a verificar se as cargas de trabalho se comportam como esperado em condições de falha e ajuda a garantir que a sua solução cumpre os requisitos de fiabilidade antes que os problemas afetem os utilizadores. O Azure fornece serviços de testes de fiabilidade, incluindo: - Azure Chaos Studio para experiências controladas de injeção de falhas para validar comportamentos de auto-recuperação e resiliência face a falhas no mundo real - Teste de aplicativos do Azure para testes de desempenho e funcionais, para compreender como as aplicações se comportam, incluindo sob stress |
Ativar a fiabilidade nos serviços do Azure
A plataforma oferece capacidades de fiabilidade na camada de serviço através de dezenas de serviços Azure, cada um com pontos fortes e casos de uso específicos. O guia de fiabilidade de cada serviço fornece detalhes sobre como o serviço pode permanecer disponível em diferentes cenários, por exemplo:
- Falhas transitórias, que são falhas curtas e intermitentes. Os guias de serviço fornecem recomendações de melhores práticas para minimizar o seu impacto, como tentar novamente e usar SDKs fornecidos pela Microsoft.
- Falhas na zona de disponibilidade, para que o serviço possa redirecionar automaticamente os pedidos para manter alta disponibilidade.
- Falhas regionais, para que o serviço possa fazer failover para uma região secundária e continuar a operar durante uma perturbação regional.
Para consultar os guias de fiabilidade de muitos serviços Azure, consulte Guias de fiabilidade por serviço.
Conceber cargas de trabalho fiáveis
A fiabilidade surge de um ciclo contínuo de definição de alvos, design para falhas e recuperação rápida, teste de pressupostos e melhoria através da aprendizagem operacional. Use o Azure Well-Architected Framework e guias de fiabilidade de serviços para compreender o que cada serviço fornece por defeito e o que requer uma configuração explícita. Para uma abordagem estruturada à implementação da fiabilidade, consulte o modelo de maturidade da fiabilidade do Azure Well-Architected Framework.
Ao desenhar, ligue conceitos fundamentais a conceitos técnicos. Conceitos fundamentais como continuidade do negócio e responsabilidade partilhada definem os resultados que precisa de alcançar. Conceitos técnicos como redundância, replicação, backup, failover e failback definem como implementa esses resultados na sua arquitetura e operações. Os acordos de nível de serviço ajudam-no a compreender as garantias que recebe dos seus prestadores de serviços.
Soberania e residência de dados
Ao desenhar fiabilidade, inclua cedo os requisitos de soberania e residência de dados porque afetam a seleção de regiões, a estratégia de replicação e os caminhos de failover. Uma arquitetura resiliente pode ainda falhar nos requisitos de conformidade se o failover ou o movimento de dados ultrapassar limites restritos. Para mais informações, consulte Fiabilidade e soberania.
A fiabilidade no Azure é alcançada combinando bases de plataforma resilientes com um design e operações de carga de trabalho cuidadosos. Ao compreender o que o Azure oferece e onde precisa de tomar decisões de design e configuração, pode construir sistemas que continuem a corresponder às expectativas de negócio, mesmo na presença de falhas.