Niemand ruft an, wenn die Platte stirbt
Die Hardware war vom Feinsten. Server mit viel mehr Arbeitsspeicher, als je genutzt wurde, ein schnelles SAN, alles mit Wartungsvertrag. Bei der Bestandsaufnahme fragten wir trotzdem: Wenn hier nachts eine Platte stirbt, wer erfährt davon?
Die Antwort: wer zufällig hinschaut.
Was gefehlt hat
Moderne Server und Speichersysteme können sich selbst melden. Bei HPE heißt das über iLO und OneView, bei Dell über iDRAC und die zugehörige Verwaltung, bei den großen Storage-Herstellern über ihre eigene Call-Home-Funktion. Ist eine Platte defekt oder kündigt sich ein Ausfall an, schickt das System eine Meldung an den Hersteller. Der verschickt eine Ersatzplatte oder einen Techniker, oft bevor jemand im Haus etwas bemerkt hat.
Eingerichtet war davon nichts. Kein Server, kein Storage meldete irgendetwas nach draußen. Ein Monitoring war zwar lizenziert, aber nur für einen kleinen Teil eingerichtet und seitdem nicht gepflegt.
Warum das gefährlich ist, auch wenn alles redundant ist
Gerade weil alles redundant ist. Ein RAID verkraftet den Ausfall einer Platte, ein Cluster den Ausfall eines Hosts. Das System läuft weiter, und genau deshalb fällt der erste Ausfall nicht auf. Die Redundanz ist dann aufgebraucht, und niemand weiß es.
Der zweite Ausfall ist der, den man bemerkt. Dann ist es zu spät.
Die billigste Lücke
Unter allen Befunden dieser Bestandsaufnahme war das der mit dem besten Verhältnis von Aufwand zu Wirkung. Kein Projekt, keine Neubeschaffung. Die Funktion ist in der vorhandenen Hardware drin und im Wartungsvertrag meist schon bezahlt. Es fehlt nur, dass jemand sie einschaltet.
Was wir als Erstes einrichten
- Call Home an jedem Server und jedem Storage. Über die Verwaltungsschnittstelle des Herstellers, mit Kontaktdaten, die tatsächlich jemand liest.
- Eine Testmeldung auslösen. Erst wenn beim Hersteller und bei uns etwas ankommt, funktioniert es.
- Wartungsverträge abgleichen. Call Home nützt nur etwas, wenn der Vertrag zur Seriennummer passt und noch läuft.
- Das eigene Monitoring dazu. Der Hersteller schickt Ersatz, aber er sagt nicht unbedingt dem eigenen Team Bescheid. Die Hardwaremeldungen gehören zusätzlich ins Monitoring, das ohnehin jemand im Blick hat.
Das ist an einem Nachmittag erledigt. Danach ruft jemand an, wenn die Platte stirbt.
