Een beetje over SMART en monitoringtools

Er is veel informatie beschikbaar over SMART en de betekenis van de attributen. Maar ik heb niet veel vermeldingen gezien van verschillende belangrijke momenten, die ik ken van mensen die zich bezighouden met onderzoek naar gegevensdragers.

Toen ik een keer aan een kennis uitlegde waarom de SMART-gegevens niet zondermeer vertrouwd moeten worden en waarom het beter is om klassieke "SMART-monitoringsprogramma's" niet continu te gebruiken, kreeg ik het idee om de gesproken woorden in de vorm van een set van stellingen met toelichtingen op te tekenen. Zodat ik verwijzingen kan geven in plaats van steeds opnieuw hetzelfde verhaal te vertellen. En om een breder publiek te informeren.

1) Programma's voor automatische monitoring van SMART-attributen moeten met grote voorzichtigheid worden gebruikt.

Wat jij als SMART-attributen kent, wordt niet in een vaste vorm opgeslagen, maar wordt gegenereerd op het moment dat je erom vraagt. Ze worden berekend op basis van interne statistieken die door de firmware van de opslagapparatuur tijdens het gebruik worden verzameld en gebruikt.

Een deel van deze gegevens is niet nodig voor de basisfunctionaliteit van het apparaat. En deze worden niet opgeslagen, maar worden elke keer gegenereerd wanneer dat nodig is. Daarom, wanneer je om SMART-attributen vraagt, start de firmware een groot aantal processen die nodig zijn om de ontbrekende gegevens te verkrijgen.

Maar deze processen zijn slecht compatibel met de procedures die worden uitgevoerd tijdens het belasten van de opslagapparatuur met lees- en schrijfoperaties.

In een ideale wereld zou dit niet tot problemen moeten leiden. Maar in de werkelijkheid schrijven gewone mensen de firmware van harde schijven. Die kunnen fouten maken en doen dat ook. Daarom, als je SMART-attributen opvraagt tijdens actieve lees- en schrijfoperaties van het apparaat, neemt de kans dat er iets misgaat aanzienlijk toe. Bijvoorbeeld, gegevens in de gebruikerslees- of schrijfbuffer kunnen beschadigd raken.

De bewering over de toename van risico's is geen theoretische conclusie, maar een praktische observatie. Een voorbeeld hiervan is een bug die voorkwam in de firmware van de HDD Samsung 103UI, waarbij tijdens het opvragen van SMART-attributen, gebruikersgegevens werden beschadigd.

Stel daarom de automatische controle van SMART-attributen niet in. Tenzij je zeker weet dat er vooraf een flush-cache-opdracht is gegeven. Of, als het echt niet anders kan, stel de controle zo zeldzaam mogelijk in. In veel monitoringprogramma's is de standaard tijd tussen controles ongeveer 10 minuten. Dat is te vaak. Dergelijke controles zijn hoe dan ook geen garantie tegen plotselinge schijfuitval (de garantie is alleen reservekopieƫn). EƩn keer per dag vind ik volstaan.

Het opvragen van temperatuur voor het starten van attributenberekeningen leidt niet tot problemen en kan vaak worden uitgevoerd. Want bij correcte implementatie gebeurt dit via het SCT-protocol. Via SCT wordt alleen datgene verzonden wat al bekend is. Deze gegevens worden automatisch op de achtergrond bijgewerkt.

2) SMART-attribuutgegevens zijn vaak onbetrouwbaar.

De firmware van de harde schijf toont wat deze nodig acht om te tonen, en niet wat er in werkelijkheid gebeurt. Een van de meest duidelijke voorbeelden is de 5e parameter, het aantal verplaatste sectoren. Dataherstelexperts weten goed dat een harde schijf in de vijfde parameter een nul aantal verplaatste sectoren kan tonen, terwijl deze er wel degelijk zijn en blijven verschijnen.

Ik stelde een vraag aan een specialist die harde schijven bestudeert en hun firmware onderzoekt. Ik vroeg hoe de firmware van het apparaat beslist wat wel of niet moet worden verborgen over het verplaatsen van sectoren, en wanneer dit via SMART-attributen kan worden verteld.

Hij antwoordde dat er geen algemene regel is volgens welke apparaten de werkelijke situatie tonen of verbergen. En de logica van de programmeurs die de firmware van harde schijven schrijven, lijkt soms heel vreemd. Bij het bestuderen van firmware van verschillende modellen zag hij dat de beslissing om 'te verbergen of te tonen' vaak wordt genomen op basis van een reeks parameters die op geen enkele duidelijke manier met elkaar of met de resterende levensduur van de harde schijf zijn verbonden.

3) De interpretatie van SMART-gegevens is leveranciers-specifiek.

Bijvoorbeeld, op de Seagate-schijven moet je geen aandacht besteden aan de "slechte" raw-waarden van attributen 1 en 7, zolang de andere normaal zijn. Bij de schijven van deze fabrikant kunnen hun absolute waarden toenemen tijdens normaal gebruik.

Een beetje over SMART en monitoringtools

Voor het beoordelen van de staat en de resterende levensduur van de harde schijf, is het in eerste instantie aan te raden om je te concentreren op de parameters 5, 196, 197, 198. Bovendien zou je je vooral moeten richten op de absolute, ruwe waarden (raw), en niet op de afgeleide. De afleiding van attributen kan op niet-voor de hand liggende manieren worden uitgevoerd, variƫrend in verschillende algoritmes en firmware.

Over het algemeen, in de kring van informatieopslag specialisten, als men spreekt over de waarde van een attribuut, dan wordt meestal het absolute getal bedoeld.

Bron: habr.com

Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers šŸ”„ Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers | ProHoster