True IT Stories

Die Platte war noch nicht voll

Eine Geschichte, die uns bei einer Bestandsaufnahme erzählt wurde, und die so oder ähnlich in vielen Häusern passiert ist: Der Exchange-Server nahm plötzlich keine Mails mehr an. Die Ursache war lange unklar, denn das Laufwerk sah nicht voll aus. Da war noch Platz.

Die Datenbank lag auf Laufwerk C:, zusammen mit allem anderen. Und C: war zwar nicht voll, aber voll genug für Exchange.

Exchange zieht die Grenze selbst

Der Transportdienst von Exchange überwacht seine eigenen Ressourcen. Microsoft nennt das Back Pressure . Wird der Platz auf dem Laufwerk mit der Warteschlange knapp, wartet Exchange nicht, bis Windows „Datenträger voll" meldet. Es fängt vorher an, sich zu schützen.

Bei Exchange 2016 und 2019 sieht das für das Laufwerk mit den Transaktionslogs der Warteschlange so aus:

  • Ab 89 % Belegung ist der Druck „mittel". Exchange lehnt Mails von außen ab. Mail innerhalb der Organisation läuft noch.
  • Ab 99 % Belegung ist er „hoch". Dann steht der Mailfluss komplett.

Für das Laufwerk mit der Warteschlangendatenbank selbst liegen die Schwellen höher, bei 96 und 99 %. Ältere Exchange-Versionen hatten zum Teil andere Werte.

Und dann gibt es noch eine Zahl, die viele im Kopf haben: 80 %. Sie ist keine Sperrschwelle, sondern die Schwelle für den Rückweg. Steht das Log-Laufwerk einmal auf „mittel“, nimmt Exchange erst wieder Mail von außen an, wenn die Belegung unter 80 % gefallen ist. Wer im Störfall ein paar Gigabyte freiräumt und von 90 auf 85 % kommt, wartet weiter. Für die Warteschlangendatenbank liegt dieser Rückweg bei 94 %.

Elf Prozent frei klingt nach viel. Auf einem großen Laufwerk sind das etliche Gigabyte. Für Exchange ist es trotzdem der Punkt, an dem die Mail von draußen nicht mehr ankommt.

Warum das so schwer zu sehen ist

Weil jedes andere Werkzeug sagt, dass alles in Ordnung ist. Der Explorer zeigt Platz an, das Monitoring warnt erst bei 90 oder 95 %, wenn überhaupt. Die Absender bekommen eine Ablehnung, die beim Empfänger nicht auftaucht. Intern läuft die Mail weiter, also merkt man es im Haus zuerst gar nicht.

Die Spur steht im Ereignisprotokoll, unter der Quelle MSExchangeTransport:

  • Ereignis 15004: Der Ressourcendruck ist gestiegen.
  • Ereignis 15006: Der Transportdienst lehnt Nachrichten ab, weil der freie Plattenplatz unter der Schwelle liegt.

Wer bei „Exchange nimmt keine Mails an" zuerst dort nachsieht, spart sich die lange Suche.

Den aktuellen Zustand zeigt die Exchange Management Shell:

[xml]$bp=Get-ExchangeDiagnosticInfo -Process EdgeTransport -Component ResourceThrottling; $bp.Diagnostics.Components.ResourceThrottling.ResourceTracker.ResourceMeter

Was daraus folgt

  1. Exchange-Daten gehören nicht auf C:. Datenbanken, Logs und Warteschlange auf eigene Laufwerke, damit ein volles Systemlaufwerk nicht den Mailfluss mitnimmt.
  2. Das Monitoring an Exchange ausrichten, nicht an Windows. Eine Warnung bei 85 % auf den Exchange-Laufwerken kommt rechtzeitig. Eine bei 95 % kommt, wenn die Mail schon abgelehnt wird.
  3. Die Ereignisse 15004 und 15006 überwachen. Sie sagen genau das, was man wissen will, bevor es ein Anwender meldet.
  4. Die Schwellen nicht hochdrehen. Microsoft rät ausdrücklich davon ab. Back Pressure ist der Schutz, nicht das Problem.