Zuverlässigkeit in Azure

In Cloudumgebungen sind Fehler unvermeidlich. Hardwarefehler, Softwarefehler, Konfigurationsfehler, Datenverkehrsspitzen, Rechenzentrumsausfälle und sogar regionsweite Ausfälle können auftreten. Zuverlässigkeit ist die Fähigkeit einer Arbeitsauslastung, geschäftliche Erwartungen zu erfüllen, auch bei Fehlern oder Unterbrechungen. Mit der richtigen Architektur und den richtigen Vorgängen müssen Fehler nicht zu Ausfallzeiten führen.

Ungeplante Ausfallzeiten können große Auswirkungen haben. Es trägt finanzielle Kosten und schaden Kunden- und Nutzervertrauen. Über diese unmittelbaren Auswirkungen hinaus wirkt sich schlechte Zuverlässigkeit auf Complianceverpflichtungen und wettbewerbsorientierte Positionierung aus. Ihre Teams verbringen mehr Zeit mit Feuerbekämpfung und weniger Zeit, um Wert zu erzielen. Sie kann sogar vertragsrechtliche Sanktionen auslösen.

Azure bietet robuste Infrastruktur und verwaltete Dienste, die Zuverlässigkeit Ihrer Workload hängt jedoch von Design- und Betriebsentscheidungen ab, die Sie treffen: wie Sie Ihre Architektur entwerfen, Dienste konfigurieren, Abhängigkeiten verwalten, Antworten auf Probleme automatisieren sowie Software und Prozesse testen. Durch das frühzeitige Entwerfen für Zuverlässigkeit können Sie Fehler minimieren und sicherstellen, dass ihre Arbeitsauslastung in vorhersehbarer und kontrollierter Weise beeinträchtigt wird, die den Geschäftsprioritäten entspricht.

Eine zuverlässige Workload verfügt über zwei wesentliche Eigenschaften:

  • Es ist robust, d. h., es kann Fehler und Änderungen in der Umgebung aufnehmen und weiterhin auf akzeptabler Serviceebene arbeiten.
  • Es kann auch wiederhergestellt werden, was bedeutet, dass die Arbeitsauslastung bei Unterbrechungen normale Vorgänge innerhalb definierter Zeit- und Datenverlustgrenzwerte wiederherstellen kann.

Sie benötigen beide Eigenschaften, um die Erwartungen der realen Verfügbarkeit zu erfüllen und die Geschäftskontinuität aufrechtzuerhalten.

Zuverlässigkeit in Azure funktioniert über drei miteinander verbundene Ebenen:

  • Ihre Anwendung: Ihre Architekturauswahl, Methoden und Prozesse, einschließlich Abhängigkeitsverwaltung, Runbooks, Automatisierung und Tests
  • Zuverlässigkeitsfeatures, einschließlich:
    • Workloaddienste und Konfiguration: Konfigurieren der Azure Dienste, die Ihre Workload ausführen, und die Zuverlässigkeitsfunktionen, die Sie in diesen Diensten konfigurieren
    • Azure Plattformdienste: Azure Dienste, die die Zuverlässigkeit der Workload speziell unterstützen, z. B. Lastenausgleich, DNS, Datenverkehrsrouting und Überwachung
  • Zuverlässigkeitsgrundlagen: Azure integrierte Resilienz wie Verfügbarkeitszonen, Regionen und sichere Bereitstellungsmethoden

Diese Ebenen arbeiten zusammen, um die Zuverlässigkeit der Gesamtauslastung zu bestimmen. Wenn Sie sie verstehen, können Sie unterscheiden, was Azure standardmäßig bereitstellt, und was Sie zum Entwerfen, Konfigurieren und Arbeiten benötigen.

Mit diesem Modell können Sie nutzen, was Azure bietet, während Sie dafür verantwortlich sind, was nur Sie entwerfen können. In diesem Artikel wird erläutert, was Azure auf diesen Ebenen bereitstellt. Umfassende Anleitungen zur Arbeitsauslastungsentwurfs- und Betriebsebene (Entwerfen robuster Lösungen und Architekturmuster) finden Sie im Azure Well-Architected Framework und insbesondere in der Zuverlässigkeitssäule.

Gemeinsame Zuständigkeit für Zuverlässigkeit

Zuverlässigkeit in Azure folgt einem Modell der gemeinsamen Verantwortung. Microsoft bietet die robuste Plattform durch Azure. Sie entwerfen die robuste Workload.

Diagramm, das die Ebenen der Zuverlässigkeit in Azure zeigt.

  • Microsoft besitzt die Plattformgrundlagen und Plattformsicherheitsdienste. Dieser Besitz umfasst die robuste Infrastruktur (physische Redundanz, Fehlerisolation und Heilung), Verfügbarkeitszonen, regionale Verteilung, sichere Bereitstellungspraktiken und Dienste auf Plattformebene wie Lastenausgleich, Datenverkehrsrouting und Überwachung. Microsoft ist für die Zuverlässigkeit der Azure-Plattform und für die Zuverlässigkeit von Diensten gemäß den veröffentlichten SLA- und Dokumentationen der einzelnen Dienste, z. B. deren Zuverlässigkeitsleitfaden, verantwortlich.

  • Sie besitzen den Workload-Entwurf und -Betrieb. Sie sind dafür verantwortlich, die Funktionen Azure durch Architekturentscheidungen, Konfigurationsoptionen, Betriebspraktiken und Tests in ein zuverlässiges Workloadverhalten zu übersetzen.

    Azure können Ihre Verfügbarkeitsziele, akzeptable Kompromisse, Geschäftskontexte oder anwendungsspezifische Anforderungen nicht kennen. Nur Sie können diese Anforderungen definieren und entsprechend entwerfen. Azure bietet Funktionen, während Sie sie auswählen und konfigurieren. Beispielsweise konfigurieren Sie das Failoververhalten für Dienste wie Datenbanken, und Sie definieren Integritätstests für den Lastenausgleich, die den Anwendungsstatus genau darstellen, sodass Datenverkehrsroutingentscheidungen korrekt sind, auch bei Fehlern.

    Important

    Die Plattform bietet Bausteine und keine End-to-End-Garantien. Ihre Design- und Betriebsentscheidungen bestimmen, ob diese Funktionen in eine zuverlässige Workload übersetzt werden. Eine vollständige Aufschlüsselung des Modells der gemeinsamen Verantwortung finden Sie unter "Gemeinsame Verantwortung" in der Cloud.

Vereinbarungen auf Servicelevel (Service Level Agreements, SLAs) definieren Zuverlässigkeitsverpflichtungen und Erwartungen in Azure Dienstleistungen. Das Verständnis von SLAs ist bei der Bewertung von Diensten und beim Entwerfen für bestimmte Verfügbarkeitsziele unerlässlich. Azure Dienste veröffentlichen SLA-Verpflichtungen, die je nach Konfiguration und Redundanzstufe variieren können. Andere Dienste, die Sie von anderen Anbietern verwenden, veröffentlichen möglicherweise auch SLAs. Umfassende Anleitungen dazu, wie SLAs funktionieren und sich auf die Verfügbarkeitserwartungen Ihrer Workload beziehen, finden Sie unter Vereinbarungen zum Servicelevel.

Robuste Grundlagen in Azure

Azure wurde mit mehreren Ebenen von Resilienz entwickelt, die in die Plattform selbst integriert sind. Diese Grundlagen bieten die Basisfunktionen, auf denen zuverlässige Workloads basieren:

  • Resilienz der physischen Infrastruktur: Azure Rechenzentren sind mit redundanter Infrastruktur wie Energie, Kühlung und Netzwerkkonnektivität konzipiert. Der Azure Fabric-Controller isoliert und verwaltet Hardwarefehler automatisch. Es erkennt Fehler und koordiniert die Workloadmigration auf gesunde Hardware ohne Eingreifen des Kunden.

  • Regionen: Azure arbeitet weltweit in über 70 Regionen. Mit dieser geografischen Verteilung können Workloads regionsweite Unterbrechungen und Ausfällen durch geplante Failoverfunktionen standhalten, während Sie ihren Anforderungen an die Datenhaltung folgen. Weitere Informationen finden Sie unter Azure Regionsübersicht.

  • Verfügbarkeitszonen: Viele Azure Regionen umfassen physisch getrennte Rechenzentren innerhalb derselben Region. Diese Verfügbarkeitszonen werden durch Hochgeschwindigkeitsnetzwerke mit geringer Latenz verbunden. Jede Zone verfügt über unabhängige Energie-, Kühl- und Netzwerkfunktionen, um vor Fehlern auf Rechenzentrumsebene zu schützen und gleichzeitig synchrone Replikationsfunktionen für viele Azure Dienste aufrechtzuerhalten. Weitere Informationen finden Sie unter Was sind Verfügbarkeitszonen?

  • Sichere Bereitstellungen: Azure implementiert kontrollierte, gestaffelte Bereitstellungsprozesse für Plattformupdates und Dienständerungen, um das Risiko einer weit verbreiteten Dienstunterbrechung zu minimieren. Die Plattform führt Updates schrittweise aus, z. B. über Fehlerdomänen, Verfügbarkeitszonen und Regionen hinweg mit automatisierten Rollbackfunktionen, wenn Probleme erkannt werden. Dieser Ansatz stellt sicher, dass Plattformänderungen keine Zuverlässigkeitsrisiken für Kundenworkloads verursachen.

Azure bietet diese plattformbasierten Grundlagen automatisch. Sie bilden die Basisebene, auf der Sie zuverlässige Workloads erstellen. Sie müssen Ihre Dienste jedoch weiterhin ordnungsgemäß konfigurieren und diese Funktionen auf Eine Weise kombinieren, die Ihren spezifischen Geschäftsanforderungen entspricht.

Azure Dienste, die Ihre Zuverlässigkeit unterstützen

Azure bietet Plattformfunktionen, die Zuverlässigkeitskonzepte in umsetzbare Bausteine für Ihre Architektur übersetzen. Diese Funktionen arbeiten zusammen, um robuste Architekturen zu ermöglichen, und viele Azure Dienste umfassen integrierte Implementierungen dieser Muster:

Capability Description
KI-gestützte Zuverlässigkeitsoptimierung KI-gestützte Zuverlässigkeitsoptimierung Verwendet KI-gesteuerte Funktionen, um Zuverlässigkeit zu bewerten und zu verbessern. Diese Funktionen analysieren Arbeitsauslastungsmuster, identifizieren potenzielle Risiken und bieten Empfehlungen, die Teams dabei unterstützen, von der reaktiven Problembehandlung zur proaktiven Zuverlässigkeitsverwaltung zu wechseln. Diese Funktionen weisen Zuverlässigkeitssignale auf und übersetzen sie in umsetzbare Empfehlungen, mit denen Teams die Zuverlässigkeit im Laufe der Zeit priorisieren und verbessern können.

Azure bietet mehrere KI-gesteuerte Zuverlässigkeitsdienste, darunter:
- Azure Resilienzfunktionen
- Resilienzfunktionen in Agents (Vorschau) in Azure Copilot
- Azure SRE-Agent

Diese Dienste analysieren Arbeitsauslastungsmuster und schlagen Verbesserungen vor, um Ihren Zuverlässigkeitsstatus im Gesamten zu optimieren.
Lastenausgleich und Datenverkehrsverwaltung Lastenausgleich und Datenverkehrsverwaltung Ermöglicht Zuverlässigkeit durch routing des Datenverkehrs zwischen redundanten Instanzen und automatisches Behandeln von Failover. Diese Funktion ist für die Aufrechterhaltung der Dienstverfügbarkeit unerlässlich, wenn einzelne Komponenten fehlschlagen.

Azure bietet Lastenausgleich auf mehreren Ebenen, einschließlich:
- Azure Load Balancer für layer-4 TCP/UDP-Datenverkehrsverteilung
- Azure Application Gateway für Das Layer-7-HTTP-Routing mit anwendungsfähigen Integritätsprüfungen
- Azure Front Door für den globalen HTTP-Lastenausgleich mit schnellem Failover
- Azure Traffic Manager für die DNS-basierte globale Endpunktverteilung

Wenn Sie Hilfe bei der Entscheidung benötigen, welches Lastenausgleichsmodul für Ihr Szenario verwendet werden soll, finden Sie unter " Lastenausgleichsoptionen".
Sicherung und Datenschutz sicherung und Datenschutz Schutz vor Datenverlust und Beschädigung und ermöglicht die Wiederherstellung nach auftreten eines Problems.

Azure bietet mehrere Sicherungs- und Wiederherstellungsfunktionen, darunter:
- Azure Backup für die zentrale Sicherung mit konfigurierbarer Aufbewahrung für virtuelle Computer, BLOB-Container, Dateien und einige Datenbanken
- Systemeigene Sicherungs- und Wiederherstellungsfeatures in vielen Azure-Diensten, einschließlich der meisten Datenbankdienste
- Bicep und andere Infrastruktur als Codetools für Konfigurationssicherung, Driftschutz und schnelle Umgebungserholung

Überprüfen Sie den Zuverlässigkeitsleitfaden jedes Azure Diensts, um die Sicherungsansätze zu verstehen, die der Dienst unterstützt.
Geografische Replikation und Failover Geografische Replikation und Failover Ermöglicht die Wiederherstellung von regionalen Fehlern über die regionsübergreifende Datenreplikation und automatisierte Failoverfunktionen.

Azure Site Recovery koordiniert die Notfallwiederherstellung für Arbeitsauslastungen virtueller Computer mit automatisierter Replikation und Failoversequenzierung. Viele Azure-Dienste bieten auch integrierte Georeplikationsfeatures, darunter:
- Azure Cosmos DB mit systemeigenen regionsübergreifenden Datenreplikations- und Failoverfunktionen
- Azure API Management mit systemeigenen standortübergreifenden Failoverfunktionen

Die Zuverlässigkeitsleitfaden der Dienste erläutern alle für jeden Dienst verfügbaren Georeplikationsoptionen.
Monitoring und Observability Monitoring und Observability Bietet umfassende Einblicke in den Zuverlässigkeitsstatus und ermöglicht eine proaktive Reaktion auf Probleme.

Azure bietet mehrere Observability-Dienste, einschließlich:
- Azure Monitor und Application Insights für Echtzeitüberwachung, Warnungen und Abhängigkeitsnachverfolgung
- Integritätsmodelle in Azure Monitor, um die Integrität einer gesamten Workload zu überwachen
- Azure Service Health für personalisierte Warnungen und Anleitungen für Azure Dienstprobleme, die sich auf Ihre Workloads auswirken können

Zusammen helfen Ihnen diese Funktionen zu verstehen, ob Sie zuverlässigkeitsanforderungen erfüllen und schnell reagieren, wenn Probleme auftreten.
Zuverlässigkeitstests und Validierung von Zuverlässigkeitstests und -validierungen Hilft bei der Überprüfung, dass Arbeitslasten unter Fehlerbedingungen wie erwartet verhalten, und stellt sicher, dass Ihre Lösung zuverlässigkeitsanforderungen erfüllt, bevor Probleme sich auf Benutzer auswirken.

Azure bietet Zuverlässigkeitstests, einschließlich:
- Azure Chaos Studio für kontrollierte Fehlerinjektionsexperimente zur Überprüfung des Selbstheilungsverhaltens und der Resilienz gegenüber realen Fehlern
- Azure App Testing für Leistungs- und Funktionstests, um zu verstehen, wie sich Anwendungen verhalten, einschließlich unter Stress

Aktivieren der Zuverlässigkeit in Azure-Diensten

Die Plattform bietet Zuverlässigkeitsfunktionen auf Serviceebene über Dutzende von Azure-Diensten, die jeweils spezifische Stärken und Anwendungsfälle aufweisen. Der Zuverlässigkeitsleitfaden jedes Diensts enthält Details dazu, wie der Dienst während verschiedener Szenarien verfügbar bleiben kann, z. B.:

  • Vorübergehende Fehler, bei denen es sich um kurze zeitweilige Fehler handelt. Die Dienstleitfäden enthalten Empfehlungen für bewährte Methoden, um ihre Auswirkungen zu minimieren, z. B. das Wiederholen und Verwenden von Microsoft bereitgestellten SDKs.
  • Verfügbarkeitszonenfehler, sodass der Dienst Anforderungen automatisch umleiten kann, um hohe Verfügbarkeit aufrechtzuerhalten.
  • Regionsweite Fehler, sodass der Dienst an eine sekundäre Region fehlschlägt und während einer Regionsunterbrechung weiter ausgeführt wird.

Informationen zum Anzeigen der Zuverlässigkeitsleitfäden für viele Azure Dienste finden Sie in den Zuverlässigkeitsleitfäden nach Dienst.

Entwerfen von zuverlässigen Arbeitslasten

Zuverlässigkeit entsteht aus einem kontinuierlichen Zyklus der Definition von Zielen, entwurf für Fehler und schnelle Wiederherstellung, Testannahmen und Verbesserung durch operatives Lernen. Verwenden Sie die Azure Well-Architected Framework- und Dienstzuverlässigkeitsleitfäden, um zu verstehen, was jeder Dienst standardmäßig bereitstellt und was eine explizite Konfiguration erfordert. Einen strukturierten Ansatz zur Implementierung von Zuverlässigkeit finden Sie im Azure Well-Architected Framework-Zuverlässigkeitsfälligkeitsmodell.

Verbinden Sie bei der Gestaltung grundlegende Konzepte mit technischen Konzepten. Grundlegende Konzepte wie Geschäftskontinuität und gemeinsame Verantwortung definieren, welche Ergebnisse Sie erreichen müssen. Technische Konzepte wie Redundanz, Replikation, Sicherung, Failover und Failback definieren, wie Sie diese Ergebnisse in Ihrer Architektur und Ihren Vorgängen implementieren. Vereinbarungen auf Serviceebene helfen Ihnen, die Garantien zu verstehen, die Sie von Ihren Dienstleistern erhalten.

Souveränität und Datenresidenz

Wenn Sie Zuverlässigkeit entwerfen, schließen Sie die Anforderungen an die Souveränität und die Datenhaltung frühzeitig ein, da sie sich auf die Auswahl der Region, die Replikationsstrategie und failoverpfade auswirken. Eine robuste Architektur kann dennoch Compliance-Anforderungen verfehlen, wenn Failover oder Datenverschiebungen unzulässige Grenzen überschreiten. Weitere Informationen finden Sie unter Zuverlässigkeit und Souveränität.

Zuverlässigkeit in Azure wird erreicht, indem robuste Plattformgrundlagen mit durchdachtem Workload-Design und -Betrieb kombiniert werden. Indem Sie verstehen, was Azure bietet und wo Sie Entwurfs- und Konfigurationsentscheidungen treffen müssen, können Sie Systeme erstellen, die weiterhin die Geschäftlichen Erwartungen erfüllen, auch wenn Fehler auftreten.