Bei einem Ausfall können ein IT-System, ein Dienst oder ein davon abhängiger Geschäftsprozess vorübergehend oder dauerhaft nicht wie vorgesehen genutzt werden. Ein Ausfall beeinträchtigt damit unmittelbar das Schutzziel der Verfügbarkeit. Er kann vollständig sein oder sich durch starke Verzögerungen, Fehlfunktionen und nur teilweise erreichbare Funktionen zeigen.
Ausfälle entstehen durch Hardwaredefekte, Strom- oder Netzstörungen, Überlastung, fehlerhafte Updates, menschliche Bedienfehler oder einen Konfigurationsfehler. Cyberangriffe wie DDoS und Ransomware können Dienste gezielt lahmlegen. Fällt ein kritischer Cloud-Anbieter oder Lieferant aus, kann sich die Störung zudem entlang der gesamten Lieferkette auswirken.
Entscheidend ist nicht allein die technische Dauer. Auch ein kurzer Ausfall kann gravierend sein, wenn dadurch Produktion, medizinische Versorgung, Kommunikation oder andere zeitkritische Abläufe stillstehen. Eine Business-Impact-Analyse bestimmt deshalb, welche Prozesse besonders kritisch sind, wie schnell sie wieder anlaufen müssen und wie viel Datenverlust noch vertretbar ist.
Redundante Komponenten und Verbindungen, Kapazitätsreserven, Monitoring sowie getrennte und getestete Backups verringern das Risiko. Notfallpläne legen Ersatzverfahren, Verantwortlichkeiten, Kommunikationswege und die Reihenfolge der Wiederherstellung fest. Änderungen an kritischen Systemen sollten über einen Change-Management-Prozess getestet, freigegeben und mit einem Rückfallplan versehen werden.
Zunächst muss geklärt werden, welche Dienste und Abhängigkeiten betroffen sind und ob eine technische Störung oder ein Angriff vorliegt. Danach werden Notbetrieb oder Ausweichsysteme aktiviert, Betroffene informiert und Systeme kontrolliert wiederhergestellt. Eine Ursachenanalyse nach dem Vorfall dient dazu, Wiederholungen zu verhindern und die tatsächlichen Wiederanlaufzeiten mit den festgelegten Zielen abzugleichen.