S.M.A.R.T. (Self-Monitoring, Analysis and Reporting Technology) часто читают как единый «процент здоровья» — но это не так. Согласно официальной документации Seagate, набор отслеживаемых атрибутов, их пороги и способ кодирования raw-значений производитель определяет сам: строгого стандарта, какой именно атрибут обязателен и как именно его считать, не существует.
В этой статье — как читать показания без универсальных мифов: что означают флаги Pre-fail и Advisory, какие пять атрибутов сильнее всего связаны с отказом по опубликованной статистике парка дисков Backblaze, почему «порог безопасности» нельзя взять одним числом для всех дисков, и практический алгоритм — когда показания говорят «пора делать бэкап и планировать замену». Как выбрать сам диск для сервера — в гайде по серверным HDD.
Если диагностика уже показывает тревожные значения — не откладывайте копирование данных: сначала сделайте резервную копию и проверьте её восстановление, затем планируйте замену диска.
Что разобрано в статье
Как устроен S.M.A.R.T.
Nominal/Worst/Threshold по каждому атрибуту, команда «Return SMART Status» pass/fail — и почему производитель сам решает, что и как отслеживать.
Pre-fail и Advisory
Два класса флагов атрибутов у Seagate: предупреждение о вероятном скором отказе — и справочное старение, не указывающее на отказ.
Пять ключевых атрибутов
Reallocated Sectors, Pending Sectors, Uncorrectable Errors и ещё два — с реальной статистикой отказов из парка дисков Backblaze.
Нет единого порога
Пороги и кодирование raw-значений — вендор-специфичны; число «X — это плохо» для одной модели может ничего не значить для другой.
Алгоритм проверки
Что смотреть по порядку: статус pass/fail, конкретные атрибуты, динамику во времени — а не разовый снимок «в моменте».
После тревожных показаний
Первый шаг — не диагностика точнее, а копия данных; план замены диска и связь с правилом 3-2-1.
Что на самом деле измеряет S.M.A.R.T.
S.M.A.R.T. — служебная подсистема жёсткого диска, которая ведёт набор внутренних счётчиков (атрибутов) и позволяет прочитать их снаружи. Официальная документация Seagate (вики проекта openSeaChest) описывает структуру данных так: у каждого атрибута есть текущее значение (Nominal, иногда его называют «Current» или «Normalized»), «худшее» значение за историю (Worst) и пороговое значение (Threshold), заданное производителем для этого конкретного атрибута.
Отдельно от таблицы атрибутов диск поддерживает команду проверки общего статуса — «Return SMART Status», которая возвращает бинарный результат: диск считает, что сам находится в норме, либо превысил собственный порог по одному или нескольким атрибутам и сигнализирует об этом. Это тот самый флаг, который системные утилиты показывают как «PASSED» или «FAILED».
Ключевая оговорка из того же источника: нет требования, что какой-либо конкретный атрибут вообще присутствует или отслеживается каким-то определённым образом — набор атрибутов, их количество и смысл raw-значений производитель определяет сам. Это не изъян реализации, а особенность технологии с момента её появления: S.M.A.R.T. — это интерфейс для отчёта производителя о собственной телеметрии, а не единый промышленный стандарт измерения «здоровья» диска.
Pre-fail и Advisory: как читать флаг атрибута
Помимо числовых значений, у каждого атрибута в схеме Seagate есть тип — им говорят, что́ вообще значит ухудшение этого конкретного счётчика:
Pre-fail (предотказный). Атрибут этого типа предупреждает о вероятности скорого физического отказа диска. Именно такие атрибуты чаще всего покрываются гарантийной заменой производителя, если истинность предупреждения подтверждается: логика в том, что деградация конкретно этого параметра статистически связана с приближающимся выходом диска из строя.
Advisory (справочный). Атрибут этого типа фиксирует старение или условия эксплуатации — например, число включений/выключений или общее время наработки — и сам по себе не является сигналом надвигающегося отказа. Рост такого счётчика — это факт истории использования диска, а не диагноз.
Практический вывод: прежде чем реагировать на «покрасневший» атрибут в любой утилите мониторинга, стоит понимать, к какому из двух классов он относится по документации конкретного производителя — иначе легко принять безобидное справочное значение за предвестник отказа, или наоборот.
Пять атрибутов, на которые стоит смотреть в первую очередь
Официальная вики Seagate называет несколько атрибутов, которые на практике встречаются чаще всего и типично относятся к предотказным: пересчитанные секторы, ожидающие пересчёта секторы, некорректируемые ошибки, температура, ошибки поиска/чтения. Отдельно, независимо от Seagate, компания Backblaze опубликовала в собственном блоге статистику по своему парку дисков дата-центров, сопоставив уровни конкретных атрибутов с годовой частотой отказов (AFR) внутри своего парка. Это данные одного конкретного облачного оператора за указанный период, а не универсальный прогноз для любой модели диска — но именно это делает их полезными как ориентир, а не как норматив:
| ID | Атрибут | Тип (Seagate) | Что показывает статистика Backblaze |
|---|---|---|---|
| 5 | Reallocated Sector Count (пересчитанные секторы) | Pre-fail | В парке Backblaze диски с самыми высокими уровнями (диапазон порядка 17 000–70 000 пересчитанных секторов) показывали годовую частоту отказов, превышающую 250% |
| 197 | Current Pending Sector (секторы, ожидающие пересчёта) | Pre-fail | При самых высоких уровнях (порядка 650–1600 ожидающих секторов) годовая частота отказов превышала 600% |
| 198 | Offline Uncorrectable (некорректируемые ошибки в offline-тесте) | Pre-fail | На пиковых значениях годовая частота отказов приближалась к 1000% |
| 187 | Reported Uncorrectable Errors | Pre-fail | Вторичный индикатор: рост коррелирует с повышенной частотой отказов, но использовался Backblaze как дополняющий, а не основной сигнал |
| 188 | Command Timeout | — | Вторичный индикатор с растущей корреляцией к отказу при увеличении значения |
Важное методологическое замечание из той же публикации Backblaze: raw-значения этих атрибутов коррелируют с отказом заметно сильнее, чем «нормализованные» (Normalized/Nominal) значения — то есть смотреть стоит именно на сырой счётчик (например, фактическое число пересчитанных секторов), а не только на итоговый «нормализованный балл» утилиты.
Почему нет универсального «безопасного» порога
Соблазн после таблицы выше — завести собственное «красная зона: больше N секторов». Это будет ошибкой ровно по той причине, которую называет сама Seagate: пороги и способ кодирования raw-значений специфичны для производителя и модели и не сравнимы напрямую между вендорами. Одно и то же числовое значение атрибута у разных производителей — а иногда и у разных линеек одного производителя — может кодироваться по-разному и означать разную степень серьёзности.
Отсюда следует практическое правило: числа из таблицы Backblaze — это иллюстрация того, что рост этих конкретных атрибутов связан с отказом, а не таблица «безопасных лимитов» для вашего конкретного диска. Надёжный сигнал — это динамика (растут ли счётчики со временем) и собственный статус диска (pass/fail по «Return SMART Status»), а не сравнение сырого числа с чужим порогом.
Когда показания говорят «готовьтесь менять диск»
Без универсального порога решение принимается по совокупности признаков, а не по одному числу:
Статус «Return SMART Status» = FAILED. Это самый однозначный сигнал: диск сам превысил собственный порог по одному или нескольким атрибутам. По методологии Seagate такие атрибуты чаще всего относятся к Pre-fail — то есть диск буквально сообщает о повышенной вероятности скорого отказа.
Ненулевые и особенно растущие Reallocated Sectors (5) или Pending Sectors (197). По данным Backblaze именно рост этих двух атрибутов сильнее всего связан с последующим отказом в их парке. Единичное старое стабильное значение — не то же самое, что счётчик, увеличивающийся от проверки к проверке.
Появление ненулевых Offline Uncorrectable (198). В статистике Backblaze это атрибут с самой высокой связанной частотой отказов среди рассмотренных пяти.
Если совпадает хотя бы одно из первых двух условий — не дожидаясь третьего, стоит сначала обеспечить актуальную резервную копию данных с этого диска, а уже потом разбираться дальше: диагностика точнее не заменяет своевременный бэкап.
Чего S.M.A.R.T. не предсказывает
S.M.A.R.T. по своей конструкции — это набор счётчиков, которые производитель посчитал полезными для раннего предупреждения, а не полная модель предсказания любого возможного отказа. Из самого определения технологии (набор атрибутов не стандартизован, производитель сам решает, что отслеживать) следует прямое ограничение: событие, для которого производитель не завёл отдельный счётчик, или внезапный отказ электроники/контроллера, не связанный с постепенной деградацией поверхности, не обязан отражаться в показаниях заранее.
Практический вывод: чистые показания S.M.A.R.T. — это основание для спокойствия «на сегодня», а не гарантия на будущее, и не повод откладывать базовую гигиену резервного копирования только потому, что диагностика ничего не показала. S.M.A.R.T. — дополнение к правилу 3-2-1, а не замена ему.
Практический алгоритм проверки
Порядок действий, который следует из разобранных выше принципов, а не из абсолютных чисел:
1. Проверить общий статус диска (pass/fail). Это самый быстрый и однозначный шаг — статус «FAILED» не требует дальнейшей интерпретации.
2. Прочитать raw-значения пяти атрибутов из таблицы выше. Смотреть именно на сырые счётчики, а не только на нормализованный балл утилиты — по данным Backblaze raw-значения информативнее.
3. Сравнить текущий снимок с предыдущим, а не оценивать разово. Стабильный ненулевой Reallocated Sectors, который не растёт месяцами, — не то же самое, что счётчик, увеличивающийся при каждой новой проверке. Регулярный (например, еженедельный) снимок показаний — единственный способ увидеть именно динамику.
4. Не сравнивать сырые значения между разными моделями/производителями как «норму». Порог, посчитанный приемлемым для одной модели, ничего не говорит о другой — используйте прежде всего собственную историю показаний этого диска.
5. При срабатывании статуса FAILED или росте Reallocated/Pending Sectors — сразу к следующему разделу. Не откладывать копирование данных ради «более точной» диагностики.
После тревожных показаний: бэкап и план замены
Первый шаг при тревожных показаниях S.M.A.R.T. — не более глубокая диагностика, а актуальная резервная копия данных с этого диска. Как устроена минимально надёжная схема резервного копирования — три копии, два типа носителей, одна копия вне офиса — разобрано в статье «Правило 3-2-1 для бэкапов на практике»; там же — почему RAID сам по себе не заменяет резервную копию, что особенно важно, если тревожный диск стоит в массиве.
Второй шаг — не полагаться на непроверенную копию: как убедиться, что резервная копия действительно восстанавливается, а не просто существует, — в статье «Проверка резервных копий: тестовое восстановление». Если у диска уже есть growing pending-sectors или статус FAILED, дожидаться планового ежемесячного теста не стоит — тестовое восстановление имеет смысл сделать внепланово, сразу после копирования.
Третий шаг — подбор диска на замену: серверные HDD различаются по классу нагрузки, интерфейсу и другим параметрам, которые стоит сверять по документации конкретной модели, а не по общим ожиданиям — с этого и начинается гайд по выбору жёсткого диска для сервера.
Частые вопросы
Утилита показывает «здоровье диска: 100%» — это значит, что диск точно исправен?
Это упрощённое представление одного производителя утилиты поверх набора атрибутов S.M.A.R.T., а не гарантия производителя диска. Официальная документация Seagate описывает саму технологию как набор Nominal/Worst/Threshold значений по атрибутам, которые производитель диска выбирает сам — единого «процента здоровья» в самой технологии нет. Надёжнее смотреть на официальный статус pass/fail и на конкретные raw-значения атрибутов, а не только на сводный процент стороннего приложения.
Один атрибут стал ненулевым — диск точно скоро умрёт?
Не обязательно. Значение важно смотреть в динамике и с учётом типа атрибута: справочные (Advisory) атрибуты, например счётчик включений/выключений, не сигнализируют об отказе сами по себе — это факт истории эксплуатации. Для предотказных (Pre-fail) атрибутов, таких как Reallocated Sectors или Pending Sectors, по статистике Backblaze риск растёт вместе с ростом значения — то есть тревожный сигнал это именно рост, а не сам факт единичного ненулевого значения на старом диске.
Можно ли использовать один и тот же числовой порог для дисков разных производителей?
Нет. Seagate прямо указывает, что пороги и способ кодирования raw-значений специфичны для производителя и модели и не сравнимы напрямую между вендорами. Одно и то же число может означать разную степень серьёзности у разных дисков. Ориентируйтесь на официальный статус диска (pass/fail) и на динамику показаний именно этого диска, а не на «общеизвестный» порог из интернета.
Что делать, если статус S.M.A.R.T. показывает FAILED?
Прежде всего — незамедлительно сделать резервную копию данных с этого диска, если это ещё не сделано, и проверить, что копия действительно восстанавливается. Затем — планировать замену диска: статус FAILED означает, что сам диск превысил собственный порог по одному или нескольким атрибутам и сигнализирует о повышенной вероятности отказа.
Применимо ли всё это к SSD-накопителям так же, как к HDD?
Оба источника этой статьи — официальная документация Seagate и статистика Backblaze — описывают именно жёсткие диски (HDD). У SSD своя, во многом отдельная система атрибутов (например, счётчики износа NAND и оставшегося ресурса записи), которая в этом материале не разбирается и требует отдельной проверки по документации конкретного контроллера/производителя SSD.
Авторство и ответственность
Материал подготовлен для блога ANDPRO / ООО «АНД-Системс» как информационная статья о чтении S.M.A.R.T.-атрибутов жёсткого диска: устройство технологии (Nominal/Worst/Threshold, статус pass/fail), флаги Pre-fail и Advisory, пять атрибутов с наибольшей связью с отказом по официальным данным Seagate и Backblaze, отсутствие универсального порога между производителями, практический алгоритм проверки и рекомендации после тревожных показаний. Статья не заменяет диагностику конкретного диска штатными или специализированными инструментами производителя и не является гарантией предсказания отказа.
Материал подготовлен при участии AI-ассистента, прошёл фактчекинг и редакторскую вычитку. Определения S.M.A.R.T., атрибутов, флагов Pre-fail/Advisory и оговорка об отсутствии универсальных порогов проверены против официальной вики Seagate/openSeaChest; статистика связи атрибутов с отказами — против официального блога Backblaze с публикацией данных их парка дисков. Числовые показатели отказов приведены как иллюстрация связи, а не как норматив для произвольного диска.
Если после резервного копирования требуется замена, подобрать подходящий жёсткий диск можно в каталоге HDD ANDPRO.
Фактическую дату обновления проставляет site-acceptor после публикации.