Основателно аргументираме какво прави OceanStor Dorado 18000 V6 наистина високоендова система за съхранение на данни с добър запас за близките години. Също така развенчаваме разпространените опасения относно All-Flash хранилищата и показваме как Huawei изтича максимума от тях: end-to-end NVMe, допълнително кеширане на SCM и цяла поредица от други решения.


Новият ландшафт на данни — ново съхранение на данни
Интензивността на работа с данни нараства във всички индустрии. И банковият сектор е най-очевидният пример. През последните няколко години броят на банковите транзакции се е увеличил повече от десетократно. Както показва , само в Русия през периода от 2010 до 2018 година броят на безналичните транзакции с помощта на пластмасови карти е показал повече от традиционен растеж — от 5,8 до 172 на човек на година. Причината е преди всичко триумфът на микроплащанията: повечето от нас са свикнали с онлайн банкирането и банката вече е в ръката ни — в телефона.
IT инфраструктурата на кредитната институция трябва да бъде готова за такова предизвикателство. А това наистина е предизвикателство. Освен всичко друго, ако преди е било достатъчно банката да осигури достъпност на данните само в работните си часове, то сега — 24/7. Още неотдавна 5 мс се считаха за приемлива норма на закъснение, а какво да кажем? Сега дори 1 мс е прекалено. За съвременна система за съхранение на данни целевата стойност е 0,5 мс.
Същото важи и за надеждността: през 2010-те години се формира опитно разбиране, че е достатъчно да се доведе нивото ѝ до 'пет десети' — 99,999%. Но това разбиране вече е остаряло. През 2020 година за бизнеса е абсолютно нормално да изисква 99,9999% за хранилището и 99,99999% за архитектурното решение като цяло. И това не е каприз, а наложителна необходимост: или времевото окно за поддръжка на инфраструктурата не съществува, или е много малко.

За по-визуално представяне е удобно да се проектират тези показатели върху плоскостта на финансите. Най-просто е да се вземе за пример финансовите институции. На диаграмата по-горе е показано колко пари печелят всеки от топ-10 световни банки за един час. Само една банка – Промишленият и търговски банк на Китай, печели ни повече ни по-малко $5 млн. Толкова ще струва часовият просто на IT-инфраструктурата на най-голямата кредитна институция в КНР (качеството включва само пропуснатата печалба!). При такъв ъгъл е видно, че намаляването на нарастващото време без достъп и увеличаването на надеждността, не само, че е рационално обосновано, но дори и за предприятията е важно за запазване на пазарните позиции.
Сравними изменения се случват и в други индустрии. Например, в авиационния транспорт: преди пандемията, авиосъобщението годишно набираше инерция, и много хора започнаха да го използват почти като такси. Засега говорим за потребителските модели, обществото е свикнало с тоталната достъпност на услугите: при пристигане в летището, ни е необходимо да се свържем с Wi-Fi, да имаме достъп до платежни услуги, до карти на местността и т.н. Като следствие, натоварването на инфраструктурата и услугите в публичните пространства се е увеличило многократно. А подходите за построяване на инфраструктурата, които смятахме за приемливи дори преди година, бързо остаряват.

Не е ли твърде рано да преминем на All-Flash?
За решаване на задачите, споменати по-горе, от гледна точка на производителността AFA – all-flash масивите, т.е. напълно изградени на флаш технологии, са най-доброто решение. Освен това, доскоро имаше съмнения относно това, дали те са сравними по надеждност с базираните на HDD и хибридните. В крайна сметка, твердотелната флаш памет има показател, известен като средно време между откази, или MTBF (mean time between failures). Увреждането на клетките поради операции по вход-изход, за съжаление, е неизменна част от реалността.
Така че перспективите на All-Flash бяха помрачени от въпроса как да се предотврати загубата на данни в случай, че SSD реши да не работи повече. Резервното копиране е обичайно решение, но времето за възстановяване би било неприемливо дълго, като се вземат предвид съвременните изисквания. Алтернативен вариант е да се настрои втори ниво за съхранение на шпиунски дискове, но при тази схема част от предимствата на ''строго флашовата'' система се губят.
Обаче цифрите говорят друго: статистиката на гигантите в дигиталната икономика, включително Google, през последните години показва, че флаш паметта е многократно по-надеждна от твърдите дискове. Освен това както на кратки интервали, така и на дълги: средно до излизането на флаш носителите от експлоатация минават четири-шест години. Въпреки всичко, по отношение на надеждността на съхранение на данни, те не отстъпват на носителите на шпиунски магнитни дискове, а дори ги превъзхождат.

Още един традиционен аргумент в полза на шпиунските дискове е тяхната ценова достъпност. Безспорно, цената за съхранение на един терабайт на твърд диск все още е сравнително ниска. И ако вземем предвид само разходите за оборудване, поддържането на един терабайт на шпиунски носител е по-евтино, отколкото на твърдата памет. Въпреки това, в контекста на финансовото планиране, има значение не само колко е струвало конкретното устройство, но и каква е общата цена на притежаването му в дългосрочен план — от три до седем години.
От такава гледна точка всичко изглежда съвсем различно. Дори ако изключим дедупликацията и компресията, които обикновено се прилагат на флаш масиви и правят тяхната експлоатация икономически изгодна, остава въпросът за заето пространство в шкафовете, отделяне на топлина и енергийна консумация. А по тези показатели флаш технологията печели пред своите предшественици. В резултат на това TCO системите за съхранение на данни на флаш с оглед на всички параметри често е почти наполовина по-ниска в сравнение с масивите на шпиунски носители или с хибридни решения.
Според докладите на агенцията ESG, при All-Flash системите за съхранение на данни Dorado V6 наистина може да се постигне намаление на общите разходи за притежание до 78% в петгодишен период — благодарение на ефективната дедупликация и компресия, както и на ниското енергийно потребление и топлоотдаване. Немската аналитична компания DCIG също ги препоръчва като оптимални по отношение на TCO сред наличните в момента на пазара.
Използването на твърдотелни дискове позволява да се спести полезно пространство, намалява броя на отказите, съкращава времето за обслужване на решението, намалява енергийното потребление и топлоотдаването на СХД. И се оказва, че AFA в икономически аспект е поне сравняем с традиционните масиви на шпинделни дискове, а често ги превъзхожда.

Royal Flash от Huawei
Сред нашите All-Flash хранилища, водещо място заема hi-end системата OceanStor Dorado 18000 V6. И не само сред нашите: на индустриалната сцена тя държи рекорда за скорост — до 20 млн IPOS в максимална конфигурация. Освен това, тя е изключително надеждна: дори да се провалят два контролера едновременно, или до седем контролера един след друг, или цял двигател — данните ще оцелеят. Значителни предимства на „осемнадесетхилядната“ предлага вграденият изкуствен интелект, включително гъвкавостта в управлението на вътрешните процеси. Нека разгледаме как всичко това се постига.

В значителна степен предимството на компания Huawei произтича от факта, че тя е единственият производител на пазара, който произвежда системи за съхранение на данни сам — напълно и изцяло. Имаме собствена схема, собствен микрокод, собствено сервизно обслужване.
Контролерът в системите OceanStor Dorado е построен на процесор с собствено разработване и производство от Huawei — Kunpeng 920. В него е внедрен модул за управление Intelligent Baseboard Management Controller (iBMC), също наш. Чиповете за изкуствен интелект, а именно Ascend 310, които оптимизират прогнозите за откази и дават препоръки за настройки, също са от Huawei, както и платките за вход-изход — модул Smart I/O. Накрая, контролерите в твърдотелните дискове са проектирани и произведени от нашите специалисти. Всичко това е основа за създаването на интегрално балансирано и високопроизводително решение.

През последната година реализирахме проект за внедряване на това, най-добро от нашата СХД в една от големите руски банки. В резултат на това над 40 единици OceanStor Dorado 18000 V6 в метрокластера демонстрират стабилна производителност: от всяка система успяваме да свалим над един милион IOPS, и то с оглед на забавянията, причинени от разстоянието.

Пряк NVMe
Най-новите системи за съхранение на данни на Huawei поддържат end-to-end NVMe, на което ние акцентираме основателно. Традиционно използваните протоколи за достъп до носители са разработени в далечното минало на IT: в основата им стоят SCSI команди (здравей, 80-те години!), които изискват множество функции за осигуряване на обратна съвместимост. Какъвто и начин за достъп да избереш, протоколният overhead в такъв случай е колосален. В резултат на това хранилищата, които използват свързани към SCSI протоколи, не могат да постигнат по-малко от 0,4-0,5 мс закъснение при вход-изход. От своя страна, като протокол, създаден за работа с флаш памет и освободен от усложненията, свързани с обратната съвместимост, NVMe – Non-Volatile Memory Express – намалява закъснението до 0,1 мс, и то не само на СХД, а на целия стек, от хоста до носителите. Не е изненада, че NVMe е в крак с тенденциите за развитие на data storages в обозримо бъдеще. Заложихме на NVMe и ние – и постепенно се отдалечаваме от SCSI. Всички произведени днес системи за съхранение на данни на Huawei, включително серията Dorado, поддържат NVMe (въпреки че като end-to-end е реализиран само в напредналите модели от серия Dorado V6).

FlashLink: шепа технологии
Краеугълна за цялата линия OceanStor Dorado технология – FlashLink. Всъщност, това е термин, обединяващ интегриран набор от технологии, които служат за осигуряване на висока производителност и надеждност. Включени са технологии за дедупликация и компресия, функциониране на системата за разпределение на данни RAID 2.0+, разделяне на „студени“ и „горещи“ данни, целострайпова последователна запис на данни (случайни записи, с нови и променени данни, се агрегатизират в голям стек и записват последователно, което повишава скоростта на четене-запис).
Освен всичко друго, FlashLink включва две важни съставки – Wear Leveling и Global Garbage Collection. Струва си да спрем на тях отделно.
На практика все твердотельные накопители представлявают собой малые СХД, состоящие из множества блоков и контроллера, который обеспечивает доступность данных. Это достигается в том числе путем переноса данных с «поврежденных» ячеек на «не поврежденные». Так гарантируется, что данные можно будет прочитать. Существуют различные алгоритмы этого переноса. Обычно контроллер старается сбалансировать износ всех ячеек накопителя. У этого подхода есть недостаток: при перемещении данных внутри SSD количество операций ввода-вывода резко сокращается. На данный момент это неизбежное зло.
Таким образом, если в системе много твердотельных накопителей, на графике производительности возникает эффект «пилы» с резкими подъемами и спадами. Проблема в том, что любой один накопитель из пула может запустить миграцию данных в любой момент, а общий производительность снимается одновременно со всех SSD в массиве. Однако инженеры Huawei нашли способ избежать возникновения «пилы».
К счастью, как контроллеры в накопителях, так и контроллер хранилища, а также микрокод у Huawei являются «родными», и эти процессы в OceanStor Dorado 18000 V6 запускаются централизованно, синхронно на всех накопителях массива. Причем это происходит по команде контроллера СХД и именно тогда, когда нет высокой нагрузки по вводу-выводу.
Чип искусственного интеллекта также принимает участие в выборе правильного момента для переноса данных: основываясь на статистике обращений за предыдущие несколько месяцев, он с высокой вероятностью может спрогнозировать, ожидается ли в ближайшее время активный ввод-вывод, и если ответ отрицательный, а нагрузка на систему в этот момент небольшая, то контроллер командует всем накопителям: кому нужно выравнивание износа, произвести его одновременно и синхронно.
Кроме того, контроллер системы видит, что происходит в каждой ячейке накопителя, в отличие от СХД конкурентов: они вынуждены закупать твердотельные носители у сторонних вендоров, из-за чего детализация на уровне ячейки для контроллеров таких хранилищ недоступна.
В резултат на това OceanStor Dorado 18000 V6 има много кратък период на спад в производителността при операции по износване, който се извършва предимно, когато не пречи на други процеси. Това осигурява висока стабилна производителност в постоянна основа.

От какво се състои надеждността на OceanStor Dorado 18000 V6
В съвременните системи за съхранение на данни се открояват четири нива на надеждност:
- хардуерно, на ниво носител;
- архитектурно, на ниво оборудване;
- архитектурно заедно с софтуерната част;
- общо, отнасяща се до решението като цяло.
Тъй като, да припомним, всички съставни част на СХД нашата компания проектира и произвежда сама, ние осигуряваме надеждност на всяко от четирите нива, с възможност подробно да проследяваме какво се случва на всяко от тях в момента.

Надеждността на носителите се гарантира преди всичко от предходно описаните операции по износване и глобално събиране на ненужни данни. Когато SSD изглежда за системата като черна кутия, тя не знае как точно се износват клетките в него. За OceanStor Dorado 18000 V6 носителите са прозрачни, което позволява равномерно балансиране по всички носители на масива равномерно. По този начин срокът на експлоатация на SSD значително се удължава и осигурява висок уровень на надеждност на тяхното функциониране.

Също така, на надеждността на носителя влияят допълнителните излишни клетки в него. Наред с простия резерв в СХД, се използват така наречените DIF-клетки, в които се съдържат контролни суми, както и допълнителни кодове, които позволяват да се предпази всеки блок от единична грешка, в допълнение към защитата на ниво RAID-масив.

Залогът на архитектурната надеждност е решението SmartMatrix. В кратце, това са четири контролера, които се намират на пасивен бекплейн в състава на един двигател (engine). Два такива двигателя — съответно с осем контролера — са свързани с общи рафтове с носители. Благодарение на SmartMatrix, дори ако спрат да функционират седем контролера от осем, достъпът до всички данни ще остане запазен както за четене, така и за запис. А при загуба на шест контролера от осем, ще е възможно дори да се продължат операциите с кеширане.

Интерфейсите за вход и изход на същата пасивна бекплейн схема са достъпни за всички контролери, както за фронтенда, така и за бекенда. При такава схема на свързване full-mesh, каквото и да се случи, достъпът до хранилищата винаги остава.

Надеждността на архитектурата е най-уместно да се обсъжда в контекста на вариантите на отказ, предпазени от които системата за съхранение на данни може да осигури.
Съхранението ще оцелее без загуби в ситуация, когато два контролера "изчезнат", включително и едновременно. Тази устойчивост се постига чрез факта, че всеки блок кеш безусловно има две копия на различни контролери, т.е. общо съществува в три копия. Важно е, поне едно от тях да е на друг двигател. Така дори ако целият двигател спре да работи — с всичките си четири контролера — е гарантирано запазването на всички данни, които са били в кеш паметта, защото поне един контролер от останалия двигател ще дублира кеша. Накрая, при последователно свързване може да бъдат изгубени до седем контролера, и дори когато те излизат на блокове по два, отново ще се запази целият вход-изход и всички данни от кеш паметта.

При сравнение с хранилищата от клас hi-end на други производители е видно, че само Huawei осигурява пълна защита на данните и тяхната пълна достъпност дори след изчезването на два контролера или целия двигател. Повечето вендори използват схема с така наречените контролерни двойки, към които се свързват хранилищата. За съжаление, в такава конфигурация, при отказ на два контролера, съществува риск от загуба на достъп до хранилището по вход-изход.

За съжаление, обективно не е изключено отказването на единичен компонент. В такъв случай производителността временно ще намалее: необходимо е да се престроят пътищата и да се възобнови достъпът до операции по вход-изход относно блоковете, които или са пристигнали за запис, но все още не са били записани, или са били поискани за четене. При OceanStor Dorado 18000 V6 средният тайминг за престройка е около една секунда — значително по-малко, отколкото при най-близкия аналог в индустрията (4 сек). Това се постига благодарение на все същия пасивен бекплейн: когато контролерът спре да работи, останалите веднага виждат неговия вход-изход и по-специално кой блок данни не е бил дописан; в крайна сметка, най-близкият контролер поема процеса. Оттук и възможността за възстановяване на производителността буквално за секунда. Трябва да се добави, че интервалът е стабилен: секунда за един контролер, секунда за друг и т.н.

В пасивния бекплейн на OceanStor Dorado 18000 V6 всички платки са достъпни за всички контролери без никаква допълнителна адресация. А следователно, всеки контролер може да поеме вход-изхода по който и да е порт. Във всеки фронтенд порт, в който дойде вход-изход, контролерът ще бъде готов да го обработи. Оттук следва минималният брой вътрешни преноски и значителното опростяване на балансирането.
Балансировката по фронтенда се извършва с помощта на драйвера multipathing, а допълнително се осъществява балансировка вътре в самата система, тъй като всички контролери виждат всички портове за вход-изход.

Традиционно, всички масиви на Huawei са изградени по такъв начин, че нямат единична точка на отказ. Замените "на горещо", без рестартиране на системата, подлежат на всички нейни компоненти: контролери, модули за захранване, модули за охлаждане, платки за вход-изход и т.н.

Подобрява надеждността на системата като цяло и такава технология като RAID-TP. Това е името на RAID група, която позволява да се защити при едновременен отказ на до три накопителя. При това ребилд на 1 Тбайт стабилно отнема по-малко от 30 минути. Най-добрият регистриран резултат е осем пъти по-бърз от същия обем данни на шпинделен носител. По този начин, има възможност да се използват изключително обемни хранилища, например на 7,68 или дори 15 Тбайт, и да не се притеснявате за надеждността на системата.
Важно е, че ребилдът се извършва не на spare drive, а на spare space — резервна емкость. Във всеки носител е отделено място, използвано за възстановяване на данни след отказ. По този начин, възстановяването се извършва не по схемата „много в един“, а по схемата „много в много“, благодарение на което е възможно значително да се ускори процесът. И дотогава, докато има свободна емкость, възстановяването може да продължи.

Отделно следва да се спомене за надеждността на решението от няколко хранилища — в метро-кластера, или, в терминологията на Huawei, HyperMetro. Такива схеми се поддържат на целия модел на нашите системи за съхранение на данни и допускат работа както с файлов, така и с блоков достъп. Освен това, на блоковият достъп функционира както по Fibre Channel, така и по Ethernet (включително по iSCSI).
Същността е в двустранно репликиране от една СХД на друга, при което на репликирания LUN е присвоен същият LUN-ID, какъвто има основният. Технологията работи предимно благодарение на консистентността на кешовете от две различни системи. По този начин, за хоста абсолютно всичко е равно, от коя страна се намира: тук и там той вижда един и същ логически диск. Следователно, нищо не пречи да се разгръне клъстер за отказоустойчивост, разположен на две площадки.
За кворума се използва физическа или виртуална Linux-машина. Тази машина може да бъде разположена на трета площадка, и изискванията към нейните ресурси не са големи. Разпространен сценарий е да се наеме виртуална площадка изключително за разполагане на кворумна VM.
Технологията допуска и разширение: две хранилища — в метро-кластера, допълнителна площадка — с асинхронна репликация.

Исторически за много клиенти се формира "зоопарк за съхранение": куп от СХД от различни производители, различни модели, различни поколения, с различна функционалност. В същото време броят на хостовете е внушителен и често те са виртуализирани. При подобни условия една от приоритетните задачи на администрирането е бързо, еднообразно и удобно да предоставя логически дискове за хостовете, като е желателно да не се налага да се задълбочават в това къде физически се намират тези дискове. За целта е предназначено нашето софтуерно решение OceanStor DJ, което може унифицирано да управлява различни системи за съхранение на данни и да предоставя услуги от тях, без да е привързано към конкретен модел на хранилището.

Същите и ИИ
Както вече беше споменато, в OceanStor Dorado 18000 V6 са вградени процесори с алгоритми за изкуствен интелект — Ascend. Те се използват, първо, за прогнозиране на откази и, второ, за формулиране на препоръки относно настройките, което също увеличава производителността и надеждността на хранилището.
Хоризонтът на предсказанията е два месеца: ИИ-машинерията предполага с висока вероятност какво ще се случи през това време, дали е време да се направят разширения, да се променят политиките за достъп и т.н. Препоръките се издават предварително, което позволява да се планират предварително прозорците за обслужване на системата.

Следващият етап в развитието на ИИ от Huawei предполага неговото издигане на глобално ниво. По време на сервизното обслужване — обработка на откази или препоръки — Huawei агрегира сведения от системите за логиране от всички хранилища на нашите клиенти. На базата на събраната информация се прави анализ на възникналите или потенциално възможни откази и се правят глобални препоръки — независимо от функционирането на едно конкретно СХД или дори десетина, а от това, което се случва и е случвало с хиляди такива устройства. Извадката е огромна и, опирайки се на нея, алгоритмите на ИИ започват да се обучават изключително бързо, което увеличава значително точността на предсказанията.
Съвместимост

През 2019–2020 година имаше много спекулации относно взаимодействието на нашето оборудване с продуктите на VMware. За да сложим край на тях, отговорно заявяваме: VMware е партньор на Huawei. Проведени са всички възможни тестове за съвместимост на нашия хардуер с нейния софтуер и в крайна сметка на сайта на VMware в списъка с хардуерна съвместимост са посочени наличните към днешна дата СХД, произведени от нас, без никакви уговорки. С други думи, с програмната среда на VMware могат да се използват хранилища на Huawei, включително Dorado V6, с пълна поддръжка.

Същото се отнася и за нашето сътрудничество с Brocade. Продължаваме да взаимодействаме и провеждаме тестове за съвместимост на нашата продукция — и на база техните резултати с пълна увереност твърдим, че нашите системи за съхранение на данни са напълно съвместими с най-новите FC комутатори на Brocade.

Какво следва?
Продължаваме да развиваме и усъвършенстваме нашите процесори: те стават по-бързи, по-надеждни, тяхната производителност нараства. Подобряваме и чиповете за ИИ — на тяхна основа включително се произвеждат модули, които ускоряват дедупликацията и компресията. Тези, които имат достъп до нашия конфигуратор, сигурно са забелязали, че в моделите Dorado V6 тези карти вече са налични за поръчка.
Също така напредваме в посока на допълнително кеширане на Storage Class Memory — енергонезависима памет с изключително ниски закъснения, около десет микросекунди за четене. Освен всичко друго, SCM предоставя увеличение на производителността, предимно при работа с големи данни и при решаване на OLTP задачи. След най-близкото обновление, SCM картите трябва да станат налични за поръчка.
И разбира се, функционалността за файлов достъп ще се разширява на целия модел на хранилища за данни на Huawei — следете нашите актуализации.
Източник: habr.com
