Network-as-a-Service за голяма корпорация: нестандартен случай

Network-as-a-Service за голяма корпорация: нестандартен случай
Как да актуализираме мрежовото оборудване в голямо предприятие без спиране на производството? За мащабен проект в режим „сърдечна операция“ разказва мениджърът по управление на проекти в Linxdatacenter Олег Федоров. 

През последните няколко години наблюдаваме повишен интерес от страна на клиентите към услуги, свързани с мрежовия компонент на ИТ-инфраструктурата. Нуждата от свързаност на ИТ-системите, услугите, приложенията, задачите по мониторинг и оперативно управление на бизнеса практически във всяка сфера принуждава компаниите днес да обръщат засилено внимание на мрежите.  

Диапазонът на запитванията обхваща всичко – от осигуряване на отказоустойчивост на мрежата до създаване и управление на клиентска автономна система с придобиване на блок, IP адресинастройка на маршрутизационни протоколи и управление на трафика в съответствие с организационните политики.

Също така нараства търсенето на комплексни решения за изграждане и обслужване на мрежова инфраструктура, предимно от страна на клиенти, чиято мрежова инфраструктура се изгражда от нулата или е морално остаряла и изисква сериозни модификации. 

Тази тенденция по времето съвпадна с периода на развитие и усложняване на собствената мрежова инфраструктура на Linxdatacenter. Разширихме географията на присъствието си в Европа чрез свързване на отдалечени площадки, което от своя страна изискваше и усъвършенстване на мрежовата инфраструктура. 

Компанията пусна нова услуга за клиенти, Network-as-a-Service: ние поемаме решаването на всички мрежови задачи на клиентите, позволявайки им да се фокусират върху основния бизнес.

През лятото на 2020 година завърши първият голям проект в тази посока, за който искаме да разкажем. 

В началото 

Голям промишлен комплекс се обърна към нас за модернизация на мрежовата част на инфраструктурата в едно от предприятията си. Необходимо беше да се замени старото оборудване с ново, включително ядрото на мрежата.

Последната модернизация на оборудването в предприятието е била преди около 10 години. Новото ръководство на предприятието реши да подобри свързаността, започвайки от обновлението на инфраструктурата на най-базовото, физическо ниво. 

Проектът беше разделен на две части: ъпгрейд на сървърния парк и мрежово оборудване. Ние отговаряхме за втората част. 

Основните изисквания за работа включваха минимизиране на престоя на производствените линии на предприятието по време на изпълнението на работите (и на някои участъци пълно изключване на престоя). Всяко спиране е директни парични загуби за клиента, което не трябваше да се случва при никакви обстоятелства. Във връзка с режима на работа на обекта 24х7х365, а също така и предвид пълното отсъствие на периоди на планиран престой в практиката на предприятието, пред нас беше поставена задача, по същество, да извършим операция на „отворено сърце“. Това стана основната отличителна черта на проекта.

Да тръгваме

Работите бяха планирани по принципа на движение от отдалечените от ядрото възли на мрежата към по-близките, както и от по-малко влияещите на работата на производствените линии към тези, влияещи пряко на работата. 

Например, ако вземем възел на мрежата в отдела за продажби, то прекъсването на връзката в резултат на работите в този отдел по никакъв начин няма да засегне производството. В същото време, такъв инцидент ще ни помогне като подизпълнител да проверим правилността на избрания подход към работата по такива възли и, коригирайки действията, да работим на следващите етапи на проекта. 

Необходимо е не само да се заменят възлите и кабелите в мрежата, но и да се конфигурират правилно всички компоненти за коректна работа на решението като цяло. Именно конфигурацията беше проверявана по този начин: започвайки работите в отдалеченост от ядрото, ние по същество си давахме „право на грешка“, не поставяйки в риск критично важни участъци за работата на предприятието. 

Определихме зони, които не влияят на производствения процес, както и критични участъци – цехове, блок за товарене и разтоварване, складове и т.н. На ключовите участъци с клиента беше уговорено допустимо време на престой за всеки възел на мрежата поотделно: от 1 до 15 минути. Напълно да избегнем изключването на отделни възли на мрежата не беше възможно, тъй като кабелът трябва да бъде физически превключен от старото оборудване на новото, а в процеса на превключване е необходимо също така да се разплете „брадата“ на кабелите, която се е образувала в процеса на няколко години експлоатация без необходимата поддръжка (едно от последствията от аутсорсинга на работите по монтаж на кабелни линии).

Работите бяха разделени на няколко етапа.

Стъпка 1 – Аудит. Подготовка и съгласуване на подхода за планиране на работа и оценка готовността на екипите: клиента, подизпълнителя, който извършва монтажа, и нашия екип.

Стъпка 2 – Разработка на формат за провеждане на работите, с дълбок детайлен анализ и планиране. Избран е формат на контролен списък с точно указание за реда и последователността на действията, до последователността на превключване на патч-кордове по портовете.

Стъпка 3 – Провеждане на работи в шкафове, които не влияят на производството. Оценка и коригиране на времето на престой за следващите етапи на работа.

Стъпка 4 – Провеждане на работи в шкафове, които пряко влияят на производството. Оценка и коригиране на времето на престой за финалния етап на работа.

Етап 5 – Провеждане на работи в сървърната стая по превключване на оставащото оборудване. Стартиране на маршрутизацията на новото ядро.

Етап 6 – Последователно превключване на ядрата на системата от старите мрежови конфигурации към новите за плавен преход на целия комплекс на системата (VLAN, маршрутизация и т.н.). На този етап свързахме всички потребители и преместихме всички услуги на новото оборудване, проверихме правилността на свързването, уверихме се, че нито една от услугите на предприятието не е спряно, гарантирахме, че в случай на възникване на проблеми те ще са свързани непосредствено с ядрото, което направи лесно отстраняването на възможни неизправности и финалната настройка. 

Прическа на 'бордата' на проводите

Проектът се оказа сложен и заради трудните условия на стартиране. 

На първо място, това е огромно количество възли и участъци от мрежата, с объркана топология и класификация на проводите по предназначението им. Такива 'борди' трябваше да се извадят от шкафовете и старателно 'причесват', разбирайки кой проводник откъде идва и къде отива. 

Изглеждаше това по следния начин:

Network-as-a-Service за голяма корпорация: нестандартен случай
така:

Network-as-a-Service за голяма корпорация: нестандартен случай
или така: 

Network-as-a-Service за голяма корпорация: нестандартен случай
На второ място, за всяка такава задача е необходимо да се подготви файл с описание на процеса. «Взимаме кабел Х от порт 1 на старото оборудване и го вкарваме в порт 18 на новото оборудване». Звучи просто, но когато имаш 48 напълно запълнени порта в изходните данни, и опцията за престой не съществува (помним за 24х7х365), единственият вариант е да работиш по блокове. Колкото повече кабели може да извадиш от старото оборудване наведнъж, толкова по-бързо може да ги организираш и вкараш в новото мрежово «желязо», избегвайки сривове и престои в работата на мрежата. 

Затова в подготовителния етап проведохме разбивка на мрежата по блокове – всеки от тях се отнасяше за определен VLAN. Всеки порт (или тяхно подмножество) на старото оборудване представляваше някой от VLAN в новата топология на мрежата. Групирахме ги така: в първия порт на комутатора се намираха потребителските мрежи, в средата – производствени мрежи, а в последните – точки на достъп и uplinks. 

Тези подходи позволиха да се изваждат и организират от старото оборудване не 1 кабел, а 10-15 наведнъж. Това значително ускори работния процес.  

Между другото, ето как изглеждат кабелите в шкафовете след организирането: 

Network-as-a-Service за голяма корпорация: нестандартен случай
или, например, така: 

Network-as-a-Service за голяма корпорация: нестандартен случай
След завършване на втория етап направихме пауза за анализ на грешките и динамиката на проекта. Например, веднага изникнаха дребни неточности заради неточности в предоставените ни схеми на мрежата (грешен конектор на схемата – грешен закупен patch cord и необходимост от неговата смяна). 

Паузата беше необходима, тъй като при работа със сървъри дори малка грешка в процеса беше недопустима. Ако целта е да се осигури време за престой на участъка на мрежата не повече от 5 минути, то не трябваше да се превишава. Всяко възможно отклонение от графика трябваше да бъде одобрено от клиента. 

Въпреки това, предварителното планиране и разбивката на проекта на блокове ни позволиха да се вместим в планираното време за престой на всички участъци, а в повечето случаи дори да го избегнем напълно. 

Предизвикателствата на времето – проект под COVID-19 

Без допълнителни сложности, разбира се, не мина. Разбира се, един от препятствията беше коронавирусът. 

Работата стана по-сложна, тъй като започна пандемията и е невъзможно всички специалисти, участващи в процеса, да присъстват на място. На площадката бяха допуснати само служителите на монтажната организация, а контролът се осъществяваше чрез стая в Zoom – в нея бяха мрежовият инженер от Linxdatacenter, аз като ръководител на проекта, мрежовият инженер от страна на клиента, отговорен за извършването на работата, и екипът, извършващ монтажните работи.

По време на работата възникваха неотчетени проблеми и се налагаше да правим корекции на място. Така успявахме бързо да предотвратяваме влиянието на човешкия фактор (грешки в схемата, грешки в определянето на статуса на активността на интерфейса и т.н.).

Въпреки че дистанционният формат на работа изглеждаше непривичен в началото на проекта, ние сравнително бързо се адаптирахме към новите условия и достигнахме до финалния етап на работата. 

Стартирахме времечна конфигурация на настройките на мрежата за паралелна работа на две мрежови ядра – старото и новото – с цел плавен преход. Обаче се оказа, че не е премахнато едно излишно ред след промените в конфигурацията на новото ядро, и преход не се състоя. Това ни накара да отделим определено време за търсене на проблема. 

Изясни се, че основният трафик се предава правилно, а управленският трафик не достига до възела през новото ядро. Благодарение на ясното разделяне на проекта на етапи, успяхме доста бързо да идентифицираме участъка от мрежата, където възникна затруднение, да открием проблема и да го отстраним. 

А в резултат

Технически резултати на проекта 

На първо място, беше създадено ново ядро на новата мрежа на предприятието, за което изградихме физически/логически пръстени. Направено е по такъв начин, че при всеки комутатор в мрежата да се появи "второ рамо". В старата мрежа много комутатори бяха свързани към ядрото по един маршрут, с едно рамо (аплинк). Ако то се скъсаше, комутаторът ставаше напълно недостъпен. А ако през един аплинк бяха свързани няколко комутатора, то аварията извеждаше от строя цял отдел или производствена линия в предприятието. 

В новата мрежа дори доста сериозен мрежов инцидент при никакъв сценарий не може да "положи" цялата мрежа или значителна нейна част. 

90% от цялото мрежово оборудване е обновено, медийните конвертори (преобразуватели на сигнала) са изведени от експлоатация, а необходимостта от специализирани захранващи линии за захранване на оборудването е премахната чрез свързване към PoE комутатори, където захранването се осъществява през Ethernet кабели. 

Също така, всички оптични връзки в сървърната и в шкафовете на място са маркирани – във всички ключови комуникационни точки. Това позволи да бъде подготвена топологична схема на оборудването и свързванията в мрежата, отразяваща неговото актуално състояние днес. 

Схема на мрежата
Network-as-a-Service за голяма корпорация: нестандартен случай
Най-важният резултат от техническа гледна точка: значителни инфраструктурни работи бяха извършени бързо, без да създават затруднения в работата на предприятието и почти незабелязано за неговия персонал. 

Бизнес резултати от проекта

Според мен, този проект е интересен най-вече не от техническа, а от организационна гледна точка. Сложността беше най-вече в планирането и внимателното обмисляне на стъпките за реализиране на проектните задачи. 

Успехът на проекта позволява да говорим, че нашата инициатива за развитие на мрежовото направление в рамките на портфейла на услугите на Linxdatacenter – е верен избор за развитието на компанията. Отговорният подход към управлението на проектите, правилната стратегия и ясното планиране ни позволиха да извършим работата на високо ниво. 

Потвърждение на качеството на работата – заявка от клиента за продължаване на услугите по модернизиране на мрежата на другите му локации в Русия.

Източник: habr.com

Купете надежден хостинг за сайтове със защита от DDoS, VPS и VDS сървъри 🔥 Купете надежден хостинг за сайтове със защита от DDoS, VPS и VDS сървъри | ProHoster