Tutoriel Linux

Smartctl unter Linux: Eine Festplatte prüfen, bevor sie ausfällt

Débutant5 min de lecture
À retenirLinux n'est pas réservé aux experts. Le bon point de départ : une distribution accessible, une sauvegarde propre et quelques commandes comprises.

Eine Festplatte kann auch dann noch auf Befehle reagieren, wenn sich instabile Sektoren, Medienfehler oder fortgeschrittener Verschleiß ansammeln. Wenn Sie erst beim ersten E/A-Fehler ihren Status überprüfen, kann der Sicherungsprozess bereits kompliziert werden.

smartctlim Paket enthalten smartmontoolsEs liest SMART-Informationen von SATA-, SAS- und NVMe-Laufwerken aus. Ich nutze es, um Zweifel auszuräumen, aber niemals als Garantie: ein Status Dies verhindert keinen plötzlichen Ausfall. Ziel ist es, den Gesamtzustand, hilfreiche Zähler, einen Selbsttest und Kernel-Protokolle abzugleichen, bevor eine Entscheidung getroffen wird.

Tux überprüft den SMART-Status einer Festplatte, bevor diese ausfällt.
Smartctl hilft dabei, SMART-Status, Medienfehler und Selbsttests vor dem Sichern oder Austauschen einer Festplatte abzugleichen.

Identifizieren Sie die Festplatte, bevor Sie smartctl starten.

Gehen Sie nicht davon aus, dass die betreffende CD /dev/sdaDer Name kann sich nach einem Neustart oder dem Hinzufügen eines Geräts ändern. Modelle, Seriennummern und Verbindungstypen anzeigen:

lsblk -d -o NAME,SIZE,MODEL,SERIAL,TRAN,TYPE
lsblk -o NAME,SIZE,FSTYPE,MOUNTPOINTS,MODEL,SERIAL

Der erste Befehl listet die physischen Blockgeräte auf. Mit dem zweiten Befehl können Sie eine Festplatte mit ihren Partitionen und Mountpunkten verknüpfen. Wenn mehrere Modelle die gleiche Kapazität haben, verhindert die Seriennummer einen kostspieligen Fehler. Die Anleitung dazu finden Sie hier. lsblk unter Linux Diese Identifizierung erfolgt vor der Montage oder Formatierung.

Einmal smartmontools Nach der Installation sollten Sie das Tool auch fragen, welche Geräte es öffnen kann:

sudo smartctl --scan-open

Bearbeiten Sie beispielsweise die gesamte Festplatte. /dev/sda /dev/nvme0 /dev/sda1.

Installieren Sie smartmontools und überprüfen Sie die SMART-Unterstützung.

Unter Debian oder Ubuntu:

sudo apt update
sudo apt install smartmontools

Auf Fedora, Rocky Linux oder AlmaLinux:

sudo dnf install smartmontools

Unter Arch Linux:

sudo pacman -S smartmontools

Überprüfen Sie als Nächstes die Datenträgeridentität und die SMART-Verfügbarkeit:

sudo smartctl -i /dev/sda

Sie müssen die Modell- und Seriennummer finden, die auf dem Foto zu sehen ist. lsblkBei einem USB-zu-SATA-Gehäuse kann SMART durch die Brücke verdeckt werden. Diese Variante funktioniert mit bestimmten Adaptern:

Wählen Sie den Gerätetyp nicht willkürlich aus. Überprüfen Sie das Ergebnis von --scan-open und die Dokumentation für das RAID-Gehäuse oder den Controller. Einige Controller erfordern eine spezielle Option, um auf jede physische Festplatte zuzugreifen.

Betrachten Sie das Gesamtbild, ohne einem einzigen Wort zu vertrauen.

Beginnen Sie mit dem allgemeinen Gesundheitstest:

sudo smartctl -H /dev/sda

Ein Ergebnis BESTANDEN Das bedeutet, dass die Festplatte die vom Hersteller festgelegte Ausfallschwelle noch nicht überschritten hat. Es bedeutet nicht, dass sie neu, fehlerfrei oder nicht morgen ausfallen kann. FEHLGESCHLAGEN Erfordert sofortige Datensicherung und -ersetzung, nicht eine neue Testreihe zur Beruhigung.

Anschließend wird der vollständige Bericht angezeigt:

sudo smartctl -a /dev/sda
sudo smartctl -a /dev/nvme0

Prüfen Sie zunächst, ob Modell, Seriennummer und Kapazität mit dem Ziellaufwerk übereinstimmen. Überprüfen Sie anschließend Temperatur, Betriebsstunden, Fehlerprotokoll und Selbsttestergebnisse. -X liefert weitere Details wann -hat ist nicht genug:

sudo smartctl -x /dev/sda

Identifizieren Sie die Kennzahlen, die die Entscheidung beeinflussen.

Neuzugeordneter Sektor_Ct, Aktueller_Anhängiger_Sektor Und Offline nicht korrigierbarAusstehende oder nicht korrigierbare Sektoren, insbesondere wenn deren Anzahl zunimmt, erfordern Datensicherungen und die Vorbereitung eines Austauschs. Ein stabiler Zähler für neu zugewiesene Sektoren deutet nicht automatisch auf einen Fehler hin, sollte aber überwacht werden.

Dies deutet häufig auf ein Problem mit der SATA-Verbindung hin: Kabel, Stecker, Netzteil oder Controller. Steigt dieser Zähler, überprüfen Sie die Verbindungen und lesen Sie den Bericht erneut. Verwechseln Sie einen Übertragungsfehler nicht mit einem defekten Sektor.

Bei einer NVMe-SSD, siehe Kritische Warnung Verfügbar als Ersatzteil Prozentsatz der Nutzung Und Medien- und Datenintegritätsfehler Prozentsatz der Nutzung stellt eine Schätzung des verbrauchten Kraftaufwands dar, keinen präzisen Countdown.

Bezeichnungen, Schwellenwerte und Rohwerte variieren je nach Hersteller. Vergleichen Sie immer mehrere Messwerte desselben Laufwerks. Das Kopieren eines Rohwerts von einem anderen Modell kann leicht zu einer Fehldiagnose führen.

Führen Sie einen kurzen Test durch und rufen Sie anschließend das Ergebnis ab.

sudo smartctl -t short /dev/sda

smartctl Zeigt die ungefähre Fertigstellungszeit an. Der Test wird auf der Festplatte ausgeführt und die Kontrolle wird sofort zurückgegeben. Vermeiden Sie jedoch die Ausführung bei hoher Speicherauslastung. Überprüfen Sie nach Ablauf des Timeouts das Protokoll.

sudo smartctl -l selftest /dev/sda
sudo smartctl -a /dev/sda

Das Ergebnis sollte fehlerfrei angezeigt werden. Ein abgebrochener Test kann durch Herunterfahren, Ruhemodus oder einen anderen Testbefehl verursacht werden. Ein fehlgeschlagener Test in Verbindung mit instabilen Sektoren oder Kernelfehlern bestärkt die Entscheidung, die Festplatte auszutauschen.

Der lange Test mit smartctl -t long Es deckt zwar einen größeren Bereich ab, dauert aber deutlich länger. Verwenden Sie es nicht als erste Maßnahme auf einer bereits defekten Festplatte. Sichern Sie in diesem Fall alle noch lesbaren Daten, bevor Sie weitere Arbeitsstunden hinzufügen.

sudo journalctl -k -b -p warning..alert --no-pager
sudo dmesg -T | grep -Ei 'ata|nvme|i/o error|reset|medium error'

Das Tutorial zu dmesg- und Kernelmeldungen Es hilft, eine defekte Festplatte von einem instabilen USB-Kabel, Controller oder Netzteil zu unterscheiden. Ein mit iostat gemessener Sättigungswert beweist jedoch keinen physischen Defekt: Er beschreibt die Auslastung, nicht den Zustand des Speichermediums.

Sichern Sie Ihre Daten, bevor Sie das Dateisystem reparieren.

Wenn SMART fehlschlägt, Medienfehler zunehmen oder der Kernel Ein-/Ausgabefehler meldet, reduzieren Sie Schreibvorgänge und sichern Sie wichtige Daten. Überprüfen Sie auf einem Remote-Server vor jedem Neustart, ob die Kopie verwendbar ist.

Nicht werfen fsck um die Ausrüstung zu testen. fsck Es basiert auf Dateisystemkonsistenz und kann bereits empfindliche Hardware stark belasten. Die Anleitung dazu finden Sie hier. fsck unter Linux beginnt absichtlich mit Identifizierung, Demontage und einer nicht-schreibenden Inspektion.

Für ein NAS oder einen Server sollten Sie aktuelle SMART-Berichte führen und deren Entwicklung überwachen. Der Leitfaden Linux für ein Heim-NAS Man sollte außerdem bedenken, dass ein RAID-System kein Backup ersetzt. Eine Festplatte lässt sich zwar austauschen, Kopien Ihrer Daten jedoch nicht.

Dort smartctl-Handbuchseite dokumentiert die Optionen, Gerätetypen und Selbsttests. Beispiele aus dem Projekt smartmontools Zeigen Sie die Hauptberichte für SATA und NVMe an. Gehen Sie dabei wie folgt vor: Identifizieren Sie das richtige Laufwerk, lesen Sie den vollständigen Status aus, führen Sie einen kurzen Test durch, wenn das Laufwerk stabil läuft, und sichern oder ersetzen Sie es, sobald die Signale übereinstimmen.

sudo apt update && sudo apt upgrade