Hay mucha información en línea sobre SMART y los valores de sus atributos. Sin embargo, no he encontrado menciones sobre varios puntos importantes que conozco de personas que investigan medios de almacenamiento.
Cuando una vez más le explicaba a un conocido por qué no se debe confiar ciegamente en las lecturas de SMART y por qué es mejor no utilizar monitores SMART de forma continua, se me ocurrió la idea de registrar lo que había dicho en forma de un conjunto de tesis con explicaciones. Así podría dar referencias, en lugar de tener que explicar todo cada vez. Y para informar al público en general.
1) Debe usarse con gran precaución programas que monitorean automáticamente los atributos SMART.
Lo que usted conoce como atributos SMART no se almacena en forma preparada, sino que se genera en el momento en que los solicita. Se calcula en función de la estadística interna que el firmware del dispositivo acumula y utiliza durante su funcionamiento.
Parte de estos datos no es necesaria para que el dispositivo realice su funcionalidad básica. Y no se almacena, sino que se genera cada vez que es requerido. Por lo tanto, cuando se solicita los atributos SMART, el firmware inicia una gran cantidad de procesos necesarios para obtener los datos faltantes.
Pero estos procesos son incompatibles con los procedimientos que se realizan bajo carga en el dispositivo con operaciones de lectura y escritura.
En un mundo ideal, esto no debería causar problemas. Pero en la realidad, las versiones de firmware de los discos duros son escritas por personas comunes. Que pueden cometer errores y efectivamente lo hacen. Por lo tanto, si solicita los atributos SMART mientras el dispositivo está realizando activamente operaciones de lectura y escritura, aumenta drásticamente la probabilidad de que algo salga mal. Por ejemplo, los datos en el búfer de lectura o escritura del usuario pueden corromperse.
La afirmación sobre el aumento de riesgos no es una deducción teórica, sino una observación práctica. Por ejemplo, se conoce un error que ocurrió en el firmware del HDD Samsung 103UI, donde durante la ejecución de una solicitud de atributos SMART, los datos del usuario se corrompían.
Por lo tanto, no configures la verificación automática de los atributos SMART. A menos que sepas con certeza que se está enviando un comando de vaciado de caché (Flush Cache) antes de ello. O, si no hay más remedio, configura la verificación para que se realice lo menos posible. En muchos programas de monitoreo, el tiempo entre verificaciones configurado por defecto es de aproximadamente 10 minutos. Eso es demasiado frecuente. Aún así, tales verificaciones no son una panacea para la falla inesperada del disco (la panacea es solo la redundancia). Una vez al día considero que es más que suficiente.
La solicitud de temperatura para iniciar los procesos de cálculo de los atributos no provoca ninguna consecuencia y puede realizarse con frecuencia. Dado que, con una implementación adecuada, esto se realiza a través del protocolo SCT. A través de SCT solo se devuelve lo que ya se conoce. Estos datos se actualizan automáticamente en segundo plano.
2) Los datos de los atributos SMART a menudo son poco confiables.
El firmware del disco duro te muestra lo que considera necesario mostrar, no lo que realmente está ocurriendo. El ejemplo más claro es el quinto atributo, la cantidad de sectores reasignados. A los especialistas en recuperación de datos les resulta bien conocido que un disco duro puede mostrar cero reasignaciones en el quinto atributo, mientras que en realidad existen y siguen apareciendo.
Hice una pregunta a un especialista que estudia discos duros y investiga sus firmware. Le pregunté cuál es el principio según el cual el firmware del dispositivo decide que, en este momento, debe ocultar el hecho de la reasignación de sectores, y en este momento puede informarlo a través de los atributos SMART.
Él respondió que no existe una regla general según la cual los dispositivos muestran u ocultan la realidad. Y la lógica de los programadores que escriben el firmware de los discos duros a veces parece muy extraña. Al estudiar el firmware de diferentes modelos, notó que a menudo la decisión de «ocultar o mostrar» se toma en base a un conjunto de parámetros que no se entiende cómo están relacionados entre sí y con el recurso restante del disco duro.
3) La interpretación de las métricas SMART es específica del proveedor.
Por ejemplo, en los SIGEITs no vale la pena prestar atención a los valores «malos» en bruto de los atributos 1 y 7, mientras que los demás estén en orden. En los discos de este fabricante, sus valores absolutos pueden aumentar durante un funcionamiento normal.

Para evaluar el estado y la vida útil restante del disco duro, en primer lugar se recomienda prestar atención a los parámetros 5, 196, 197, 198. Además, tiene sentido orientarse precisamente en los valores absolutos, en bruto (raw), y no en los valores ajustados. La conversión de los atributos puede llevarse a cabo de maneras no evidentes, que varían entre diferentes algoritmos y firmware.
En general, entre los especialistas en medios de información, cuando se habla del valor de un atributo, generalmente se refiere al valor absoluto.
Fuente: habr.com
