Tutoriel Linux

Smartctl en Linux: comprobación de un disco antes de que falle

Débutant6 min de lecture
À retenirLinux n'est pas réservé aux experts. Le bon point de départ : une distribution accessible, une sauvegarde propre et quelques commandes comprises.

Un disco puede seguir respondiendo a comandos incluso acumulando sectores inestables, errores de almacenamiento o desgaste avanzado. Si esperas al primer error de E/S para comprobar su estado, el proceso de copia de seguridad puede complicarse rápidamente.

inteligentectl herramientas inteligentesLee información SMART de unidades SATA, SAS y NVMe. La uso para confirmar una duda, pero nunca como garantía: un estado APROBADO Esto no evita un fallo repentino. El objetivo es contrastar el estado general, los contadores útiles, una autocomprobación y los registros del kernel antes de tomar una decisión.

Tux inspecciona el estado SMART de un disco duro antes de que falle.
Smartctl ayuda a cotejar el estado SMART, los errores de los medios y las autocomprobaciones antes de realizar una copia de seguridad o reemplazar un disco.

Identifique el disco antes de ejecutar smartctl.

No asuma que el disco en cuestión es /dev/sdaSu nombre puede cambiar después de un reinicio o la adición de un dispositivo. Ver modelos, números de serie y tipos de conexión:

lsblk -d -o NOMBRE,TAMAÑO,MODELO,NÚMERO DE SERIE,TRANSMISIÓN,TIPO

El primer comando enumera los dispositivos de bloques físicos. El segundo permite vincular un disco a sus particiones y puntos de montaje. Si varios modelos tienen la misma capacidad, el número de serie evita un error costoso. La guía sobre detalla esta identificación antes del ensamblaje o el formateo.

Una vez Una vez instalada, pregúntele también a la herramienta qué dispositivos puede abrir:

sudo smartctl --scan-open

Trabajar en todo el disco, por ejemplo /dev/sda /dev/nvme0, no en una puntuación como /dev/sda1.

En Debian o Ubuntu:

sudo apt update
sudo apt install smartmontools

En Fedora, Rocky Linux o AlmaLinux:

sudo dnf install smartmontools

En ArchLinux:

sudo pacman -S smartmontools

A continuación, compruebe la identidad del disco y la disponibilidad SMART:

sudo smartctl -i /dev/sda

Necesitas encontrar el modelo y el número de serie que se ve con lsblkEn una carcasa USB a SATA, SMART puede quedar oculto por el puente. Esta variante funciona con ciertos adaptadores:

sudo smartctl -a -d sat /dev/sdb

No fuerce un tipo de dispositivo al azar. Compruebe el resultado de y la documentación del gabinete o controlador RAID. Algunos controladores requieren una opción específica para acceder a cada disco físico.

Lee el panorama general sin fiarte de una sola palabra.

Comience con la prueba de salud general:

sudo smartctl -H /dev/sda

un resultado APROBADO Esto significa que el disco no ha superado el umbral de fallo definido por su fabricante. No significa que sea nuevo, que esté libre de errores o que sea incapaz de fallar mañana. Un resultado FALLIDO Requiere una copia de seguridad y un reemplazo inmediatos, no una nueva serie de pruebas para mayor tranquilidad.

A continuación, muestre el informe completo:

sudo smartctl -a /dev/sda

Primero, verifique que el modelo, el número de serie y la capacidad coincidan con la unidad de destino. Luego, compruebe la temperatura, las horas de funcionamiento, el registro de errores y los resultados de la autoprueba. La opción proporciona más detalles cuando no es suficiente:

sudo smartctl -x /dev/sda

Identificar las métricas que cambian la decisión

En una unidad SATA, preste especial atención a Sector_Reasignado_Ct, Sector pendiente actual Y Sin conexión, incorregibleLos sectores pendientes o irrecuperables, especialmente si su número aumenta, justifican la realización de copias de seguridad y la preparación para su reemplazo. Un contador estable de sectores reasignados no indica automáticamente un fallo, pero debe ser monitoreado.

Recuento de errores CRC de UDMA Esto suele indicar un problema con la conexión SATA: cable, conector, fuente de alimentación o controlador. Si este contador aumenta, revise las conexiones y vuelva a leer el informe. No confunda un error de transmisión con un sector defectuoso.

Advertencia crítica, Repuesto disponible Porcentaje utilizado Y Una reserva por debajo del umbral, una advertencia crítica o un aumento de los errores en los medios deberían dar lugar a medidas correctivas. Representa una estimación de la resistencia consumida, no una cuenta regresiva precisa.

Los nombres, umbrales y valores brutos varían según el fabricante. Compare siempre varias lecturas de la misma unidad. Copiar un valor bruto de un modelo diferente puede llevar fácilmente a un diagnóstico erróneo.

Realiza una prueba corta y luego obtén el resultado.

Si el disco sigue siendo accesible y no está devolviendo errores de entrada/salida, ejecute una breve autocomprobación:

sudo smartctl -t short /dev/sda

inteligentectl Indica el tiempo de finalización aproximado. La prueba se ejecuta en disco y el comando devuelve el control inmediatamente. Sin embargo, evite ejecutarla durante períodos de alta carga de almacenamiento. Una vez transcurrido el tiempo de espera, revise el registro:

sudo smartctl -l autoprueba /dev/sda
sudo smartctl -a /dev/sda

El resultado debería mostrarse como completado sin errores. Una prueba interrumpida puede deberse a un apagado, al modo de suspensión o a otro comando de prueba. Una prueba fallida, junto con sectores inestables o errores del núcleo, refuerza la decisión de reemplazar el disco.

La larga prueba con smartctl -t largo

Comparación de SMART con errores del kernel

SMART no reemplaza los registros de Linux. Busque errores de enlace, reinicios y errores de E/S durante el proceso de arranque actual:

sudo journalctl -k -b -p warning..alert --no-pager
sudo dmesg -T | grep -Ei 'ata|nvme|error de E/S|restablecer|error medio'

el tutorial sobre Mensajes de dmesg y del kernel

Si SMART falla, si aumentan los errores de medios o si el kernel informa errores de entrada/salida, reduzca las escrituras y realice una copia de seguridad de los datos importantes. En un servidor remoto, verifique que la copia sea utilizable antes de reiniciar el sistema.

fsck para probar el equipo. fsck Funciona en la consistencia del sistema de archivos y puede ejercer una presión significativa sobre un hardware ya frágil. La guía sobre Comienza intencionalmente con la identificación, el desmontaje y una inspección sin escritura.

Para un NAS o servidor, mantenga actualizados los informes SMART y supervise su evolución. La guía Linux para un NAS doméstico También conviene recordar que una matriz RAID no reemplaza una copia de seguridad. Un disco se puede reemplazar, pero las copias de tus datos no.

Allá Página del manual de smartctl Documenta las opciones, los tipos de dispositivos y las autopruebas. ejemplos del proyecto smartmontools Muestra los informes principales de SATA y NVMe. Sigue este orden: identifica la unidad correcta, lee el estado completo, ejecuta una prueba corta si la unidad permanece estable y, a continuación, realiza una copia de seguridad o reemplaza la unidad en cuanto las señales converjan.

sudo apt update && sudo apt upgrade