Zurück zur Statusseite

Störung · Große Auswirkung

Störung an einem Compute-Knoten (PAR01)

Betroffene Komponenten : Virtuelle Server (Teilausfall)

  1. Behoben

    Post-mortem zum Vorfall vom 05/11/2023, der einen Compute-Knoten im Rechenzentrum Paris-Saint Denis beeinträchtigt hat:

    Unser Betriebsteam hat heute um 00H17 einen Vorfall an einem unserer Racks im Rechenzentrum Paris-Saint Denis festgestellt, der zum Ausfall einer der beiden Stromversorgungen führte.

    Dieser Vorfall hatte zu diesem Zeitpunkt keine Auswirkungen auf unsere Produktion, da alle Geräte unserer Architektur über eine redundante Stromversorgung auf zwei getrennten Wegen verfügen.

    Gegen 00H35 hat unser Team den Betreiber des Rechenzentrums beauftragt, die Ursache dieses Ausfalls zu prüfen und gegebenenfalls den betreffenden Schutzschalter wieder zu aktivieren.

    Um 01H26 haben wir während des Eingriffs des Betreibers den Ausfall eines unserer Compute-Knoten festgestellt, und gleichzeitig kehrte die Hilfsstromversorgung zurück, sodass die Stromversorgung wieder nominal hergestellt war.

    Dieses Problem hat uns sofort darauf aufmerksam gemacht, dass eine Handhabung beim Wiedereinschalten des Hilfsschutzschalters möglicherweise das Lösen eines oder mehrerer Stromkabel im Rack verursacht haben könnte.

    Um 01H57 haben wir, da keine schnelle Lösung in Sicht war, beschlossen, die gehosteten VMs auf andere Knoten des Clusters zu verlagern, um den Dienst für die betroffenen Kunden ohne Verzögerung wiederherzustellen.

    Um 02H26 wurde die Verlagerung und Wiederinbetriebnahme aller von diesem Vorfall betroffenen VMs bestätigt, und wir beschlossen, Mitglieder unseres Teams vor Ort zu entsenden, um den weiterhin nicht verfügbaren Knoten zu diagnostizieren.

    Um 03H01 hat unser Team vor Ort unsere Geräte überprüft und festgestellt, dass mehrere Stromstecker offenbar nicht korrekt in die PDUs eingesteckt waren, und diese entsprechend justiert.

    Um 03H11 hat unser Systemteam die Kontrolle über den vom Vorfall betroffenen Knoten zurückerlangt und ihn wieder in den Ressourcenpool integriert. Unsere Teams haben das gesamte Rack überprüft, um sicherzustellen, dass die Verbindungen ordnungsgemäß waren und keine weiteren Stromversorgungsprobleme bestanden.

    Wir bestätigen, dass dieser Vorfall auf unserer Seite vollständig behoben ist. Wir haben eine Dienstunterbrechung für einige Kunden von 01H26 bis 01H57 für die Mehrheit festgestellt, und für die letzten Kunden eine vollständige Wiederherstellung gegen 02H26.

    Wir entschuldigen uns für die entstandenen Unannehmlichkeiten und stehen Ihnen bei Fragen über den Ticket-Support zur Verfügung.

  2. Identifiziert

    Alle VMs wurden auf die funktionierenden Knoten des Hosting-Clusters verlagert und sind jetzt wiederhergestellt.

    Falls Ihr VPS dennoch weiterhin nicht betriebsbereit ist, führen Sie bitte einen Neustart über den Kundenbereich durch oder wenden Sie sich an den technischen Support.

    Parallel dazu schicken wir ein Teammitglied vor Ort, um eine gründlichere Diagnose des Hosting-Knotens durchzuführen, der trotz der Wiederinbetriebnahme des elektrischen Hilfswegs weiterhin nicht verfügbar ist.

  3. Identifiziert

    Wir haben soeben die Mehrheit der VMs auf andere Knoten der Architektur migriert, um den Dienst für die meisten Kunden wiederherzustellen.

    Einige VMs sind weiterhin nicht verfügbar, und unsere Teams arbeiten an deren Wiederherstellung.

    Das nächste Update folgt in 15 Minuten.

  4. Identifiziert

    Dieser Vorfall trat infolge eines Ereignisses ohne Auswirkung auf eines unserer Racks im Rechenzentrum Paris-Saint Denis auf, das um 00H17 zum Ausfall eines Stromkreises führte.

    Wir haben um 00H35 die Teams des Rechenzentrums mobilisiert, um den Hilfsstromkreis wiederherzustellen.

    Nach derzeitigen Erkenntnissen könnte ein menschlicher Fehler dazu geführt haben, dass das Stromkabel eines unserer Rechenserver während der Bemühungen zur Wiederherstellung des Hilfskreises abgezogen wurde, wodurch die letzte funktionierende Stromversorgung dieses Servers unterbrochen wurde.

    Wir erwarten ein Update vom Team des Rechenzentrums.

    Das nächste Update folgt in 15 Minuten.

  5. Untersuchung

    Wir haben derzeit einen Vorfall auf einem Compute-Knoten im Rechenzentrum Paris-Saint Denis, unsere Teams untersuchen die Ursache.

    Einige VMs sind derzeit nicht erreichbar.

    Das nächste Update folgt in 15 Minuten.

Beginn
Behoben
Störung an einem Compute-Knoten (PAR01) | PulseHeberg Status