{"id":84108,"date":"2020-06-05T07:42:44","date_gmt":"2020-06-05T05:42:44","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra"},"modified":"2020-06-05T07:42:44","modified_gmt":"2020-06-05T05:42:44","slug":"tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","status":"publish","type":"post","link":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","title":{"rendered":"Czy \u00abgasi\u0107\u00bb serwery, je\u015bli \u00abzapali\u0142 si\u0119\u00bb test smaku w centrum danych?","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>Co by\u015bcie poczuli, gdyby pewnego pi\u0119knego letniego dnia centrum danych z waszym sprz\u0119tem wygl\u0105da\u0142o tak?<\/p>\n<p><img decoding=\"async\" alt=\"Czy \u00abgasi\u0107\u00bb serwery, je\u015bli \u00abzapali\u0142 si\u0119\u00bb test smaku w centrum danych?\" src=\"\/wp-content\/uploads\/2020\/06\/1e73d15d474bc8326a7d5f15239bc20d.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nCze\u015b\u0107 wszystkim! Nazywam si\u0119 Dmitrij Samsonow, pracuj\u0119 jako g\u0142\u00f3wny administrator system\u00f3w w \u201e<noindex><a rel=\"nofollow\" href=\"https:\/\/ok.ru\/\">Odnoklassnikach<\/a><\/noindex>\u201d. Na zdj\u0119ciu jedno z czterech centr\u00f3w danych, w kt\u00f3rych zainstalowany jest sprz\u0119t obs\u0142uguj\u0105cy nasz projekt. Za tymi \u015bcianami znajduje si\u0119 oko\u0142o 4 tys. jednostek sprz\u0119tu: serwery, systemy pami\u0119ci masowej, sprz\u0119t sieciowy itd. \u2014 prawie \u2153 ca\u0142ego naszego wyposa\u017cenia.<br \/>\nWi\u0119kszo\u015b\u0107 serwer\u00f3w to Linux. Jest te\u017c kilka dziesi\u0105tek serwer\u00f3w na Windows (MS SQL) \u2014 nasze dziedzictwo, od kt\u00f3rego stopniowo si\u0119 zwalniamy.<br \/>\n6 czerwca 2019 r. o 14:35 in\u017cynierowie jednego z naszych centr\u00f3w danych poinformowali o alarmie po\u017carowym.<br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><\/p>\n<h4>Zaprzeczenie<\/h4>\n<p>\n14:45. Drobne incydenty z zadymieniem w centrach danych zdarzaj\u0105 si\u0119 cz\u0119\u015bciej, ni\u017c si\u0119 wydaje. Wska\u017aniki wewn\u0105trz sal by\u0142y w normie, wi\u0119c nasza pierwsza reakcja by\u0142a stosunkowo spokojna: wprowadzili\u015bmy zakaz prac z produkcj\u0105, tj. jakichkolwiek zmian w konfiguracji, wdra\u017cania nowych wersji itp., z wyj\u0105tkiem prac zwi\u0105zanych z napraw\u0105 czegokolwiek.<\/p>\n<h4>Gniew<\/h4>\n<p>\nCzy kiedykolwiek pr\u00f3bowali\u015bcie zapyta\u0107 stra\u017cak\u00f3w, w kt\u00f3rym dok\u0142adnie miejscu na dachu wybuch\u0142 po\u017car, albo sami dosta\u0107 si\u0119 na pal\u0105cy dach, aby oceni\u0107 sytuacj\u0119? Jakie zaufanie mo\u017cna mie\u0107 do informacji uzyskanej od pi\u0119ciu os\u00f3b?<\/p>\n<p>14:50. <b>Pojawi\u0142y si\u0119 doniesienia, \u017ce ogie\u0144 zbli\u017ca si\u0119 do systemu ch\u0142odzenia<\/b>. Ale czy dotrze? Dy\u017curny administrator system\u00f3w kieruje ruch zewn\u0119trzny z front\u00f3w tego centrum danych.<\/p>\n<blockquote><p>Na chwil\u0119 obecn\u0105 fronty wszystkich naszych us\u0142ug s\u0105 zdublowane w trzech centrach danych, stosujemy r\u00f3wnowa\u017cenie na poziomie DNS, co pozwala usun\u0105\u0107 adresy jednego centrum danych z DNS, w ten spos\u00f3b chroni\u0105c u\u017cytkownik\u00f3w przed potencjalnymi problemami z dost\u0119pem do us\u0142ug. W przypadku, gdy w danym centrum danych ju\u017c wyst\u0105pi\u0142y problemy, automatycznie wychodzi ono z rotacji. Wi\u0119cej mo\u017cna przeczyta\u0107 tutaj: <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/321448\/\">R\u00f3wnowa\u017cenie obci\u0105\u017cenia i niezawodno\u015b\u0107 w \u201eOdnoklassnikach\u201d.<\/a><\/noindex><\/p><\/blockquote>\n<p>\nNa nas po\u017car jak dot\u0105d w \u017caden spos\u00f3b nie wp\u0142yn\u0105\u0142 \u2014 ani u\u017cytkownicy, ani sprz\u0119t nie ucierpieli. Czy to awaria? Pierwsza cz\u0119\u015b\u0107 dokumentu \u201ePlan dzia\u0142ania w przypadku awarii\u201d definiuje poj\u0119cie \u201eawaria\u201d, a ko\u0144czy si\u0119 cz\u0119\u015b\u0107 tak:<br \/>\n<b>\u00ab<u>Je\u015bli s\u0105 w\u0105tpliwo\u015bci, czy to awaria, czy nie, to jest to awaria!<\/u>\u00bb<\/b><\/p>\n<p>14:53. Wyznaczany jest koordynator awarii.<\/p>\n<blockquote><p>Koordynator to osoba, kt\u00f3ra kontroluje komunikacj\u0119 mi\u0119dzy wszystkimi uczestnikami, ocenia skal\u0119 awarii, korzysta z 'Planu dzia\u0142a\u0144 w przypadku awarii', anga\u017cuje niezb\u0119dny personel, nadzoruje zako\u0144czenie naprawy, a co najwa\u017cniejsze \u2014 deleguje wszelkie zadania. Innymi s\u0142owy, to osoba, kt\u00f3ra zarz\u0105dza ca\u0142ym procesem usuwania skutk\u00f3w awarii.<\/p><\/blockquote>\n<p><\/p>\n<h4>Targ<\/h4>\n<p>\n15:01. Zaczynamy wy\u0142\u0105cza\u0107 serwery, kt\u00f3re nie s\u0105 powi\u0105zane z produkcj\u0105.<br \/>\n15:03. Poprawnie wy\u0142\u0105czamy wszystkie zarezerwowane us\u0142ugi.<br \/>\nWchodz\u0105 tu nie tylko fronty (na kt\u00f3re w tym momencie u\u017cytkownicy ju\u017c nie wchodz\u0105) i ich us\u0142ugi pomocnicze (logika biznesowa, cache itd.), ale tak\u017ce r\u00f3\u017cne bazy danych z czynnikiem replikacji 2 i wi\u0119cej (<noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/465475\/\">Cassandra<\/a><\/noindex>, <noindex><a rel=\"nofollow\" href=\"http:\/\/profyclub.ru\/docs\/174\">magazyn danych binarnych<\/a><\/noindex>, <noindex><a rel=\"nofollow\" href=\"http:\/\/www.highload.ru\/2017\/abstracts\/2844.html\">magazyn zimny<\/a><\/noindex>, <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/417593\/\">NewSQL<\/a><\/noindex> i inne).<br \/>\n15:06. <b>Otrzymano informacj\u0119, \u017ce po\u017car zagra\u017ca jednej z sal centrum danych.<\/b> W tej sali nie mamy sprz\u0119tu, ale fakt, \u017ce ogie\u0144 mo\u017ce przerzuci\u0107 si\u0119 z dachu na sale, znacznie zmienia sytuacj\u0119.<br \/>\n(P\u00f3\u017aniej okaza\u0142o si\u0119, \u017ce fizyczne zagro\u017cenie dla sali nie istnia\u0142o, poniewa\u017c by\u0142a ona hermetycznie izolowana od dachu. Zagro\u017cenie dotyczy\u0142o jedynie systemu ch\u0142odzenia tej sali.)<br \/>\n15:07. Zezwalamy na wykonywanie polece\u0144 na serwerach w przyspieszonym trybie bez dodatkowych kontroli (<noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/342300\/\">bez naszego ukochanego kalkulatora<\/a><\/noindex>).<br \/>\n15:08. Temperatura w salach jest w normie.<br \/>\n15:12. <b>Odnotowano wzrost temperatury w salach.<\/b><br \/>\n15:13. Wi\u0119cej ni\u017c po\u0142owa serwer\u00f3w w centrum danych zosta\u0142a wy\u0142\u0105czona. Kontynuujemy.<br \/>\n15:16. Podj\u0119to decyzj\u0119 o wy\u0142\u0105czeniu ca\u0142ego sprz\u0119tu.<br \/>\n15:21. Zaczynamy wy\u0142\u0105cza\u0107 zasilanie na serwerach bezstanowych bez poprawnego wy\u0142\u0105czenia aplikacji i systemu operacyjnego.<br \/>\n15:23. Wyodr\u0119bniona zostaje grupa odpowiedzialna za MS SQL (jest ich ma\u0142o, zale\u017cno\u015b\u0107 us\u0142ug od nich nie jest du\u017ca, ale procedura przywracania sprawno\u015bci zajmuje wi\u0119cej czasu i jest bardziej skomplikowana ni\u017c na przyk\u0142ad w przypadku Cassandry).<\/p>\n<h4>Depresja<\/h4>\n<p>\n15:25. <b>Otrzymano informacj\u0119 o wy\u0142\u0105czeniu zasilania w czterech salach z 16 (nr 6, 7, 8, 9).<\/b> W salach 7 i 8 znajduje si\u0119 nasz sprz\u0119t. Nie ma jeszcze informacji o dw\u00f3ch naszych salach (nr 1 i 3).<br \/>\nZazwyczaj podczas po\u017car\u00f3w zasilanie od razu si\u0119 wy\u0142\u0105cza, ale w tym przypadku, dzi\u0119ki skoordynowanej pracy stra\u017cak\u00f3w i personelu technicznego centrum danych, nie wy\u0142\u0105czano go wsz\u0119dzie i nie od razu, a w razie potrzeby.<br \/>\n(P\u00f3\u017aniej okaza\u0142o si\u0119, \u017ce zasilanie w salach 8 i 9 nie zosta\u0142o wy\u0142\u0105czone.)<br \/>\n15:28. Zaczynamy przywracanie baz MS SQL z kopii zapasowych w innych centrach danych.<br \/>\nIle czasu to zajmie? Czy przepustowo\u015bci sieci wystarczy na ca\u0142ej trasie?<br \/>\n15:37. <b>Zarejestrowano wy\u0142\u0105czenie niekt\u00f3rych odcink\u00f3w sieci.<\/b><br \/>\nZarz\u0105dzanie i sie\u0107 produkcyjna s\u0105 fizycznie odizolowane od siebie. Je\u015bli sie\u0107 produkcyjna jest dost\u0119pna, mo\u017cesz zalogowa\u0107 si\u0119 na serwer, zatrzyma\u0107 aplikacj\u0119 i wy\u0142\u0105czy\u0107 system operacyjny. Je\u015bli nie jest dost\u0119pna, mo\u017cna zalogowa\u0107 si\u0119 przez IPMI, zatrzyma\u0107 aplikacj\u0119 i wy\u0142\u0105czy\u0107 system operacyjny. Je\u015bli \u017cadna z sieci nie dzia\u0142a, nic nie mo\u017cesz zrobi\u0107. \"Dzi\u0119ki, kapitanie!\" \u2013 pomy\u015blisz.<br \/>\n\"A tak w og\u00f3le, to jako\u015b jest zbyt du\u017co zamieszania\" \u2013 pomy\u015blisz r\u00f3wnie\u017c.<br \/>\nChodzi o to, \u017ce serwery nawet bez po\u017caru generuj\u0105 ogromne ilo\u015bci ciep\u0142a. A dok\u0142adniej, gdy maj\u0105 ch\u0142odzenie, generuj\u0105 ciep\u0142o, a gdy go nie ma, tworz\u0105 piek\u0142o, kt\u00f3re w najlepszym przypadku stopi cz\u0119\u015b\u0107 sprz\u0119tu i wy\u0142\u0105czy inn\u0105, a w najgorszym... spowoduje po\u017car wewn\u0105trz sali, co praktycznie na pewno zniszczy wszystko.<\/p>\n<p><img decoding=\"async\" alt=\"Czy \u00abgasi\u0107\u00bb serwery, je\u015bli \u00abzapali\u0142 si\u0119\u00bb test smaku w centrum danych?\" src=\"\/wp-content\/uploads\/2020\/06\/83313a55926ffe0e78cdab97aa4f43d6.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n15:39. Zauwa\u017cone problemy z baz\u0105 conf.<\/p>\n<blockquote><p>Baza conf jest backendem dla tego samego serwisu, kt\u00f3ry jest u\u017cywany przez wszystkie aplikacje produkcyjne do bie\u017c\u0105cej zmiany ustawie\u0144. Bez tej bazy nie mo\u017cemy zarz\u0105dza\u0107 dzia\u0142aniem portalu, ale sam portal mo\u017ce dzia\u0142a\u0107.<\/p><\/blockquote>\n<p>\n15:41. Czujniki temperatury w urz\u0105dzeniach sieciowych Core rejestruj\u0105 warto\u015bci bliskie do maksymalnych. To pude\u0142ko zajmuj\u0105ce ca\u0142\u0105 szaf\u0119, kt\u00f3re zapewnia dzia\u0142anie wszystkich sieci wewn\u0105trz centrum danych.<\/p>\n<p><img decoding=\"async\" alt=\"Czy \u00abgasi\u0107\u00bb serwery, je\u015bli \u00abzapali\u0142 si\u0119\u00bb test smaku w centrum danych?\" src=\"\/wp-content\/uploads\/2020\/06\/e716b26f2a66f6d5f4c794a8dfbe0f7f.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n15:42. Issue tracker i wiki s\u0105 niedost\u0119pne, przechodzimy na tryb awaryjny.<br \/>\nTo nie jest produkcja, ale w przypadku awarii dost\u0119pno\u015b\u0107 ka\u017cdej bazy wiedzy mo\u017ce by\u0107 krytyczna.<br \/>\n15:50. Jedna z system\u00f3w monitorowania przesta\u0142a dzia\u0142a\u0107.<br \/>\nJest ich kilka i odpowiadaj\u0105 za r\u00f3\u017cne aspekty dzia\u0142ania us\u0142ug. Cz\u0119\u015b\u0107 z nich jest skonfigurowana do dzia\u0142ania autonomicznego wewn\u0105trz ka\u017cdego centrum danych (monitoruj\u0105 tylko swoje centrum danych), inne sk\u0142adaj\u0105 si\u0119 z rozproszonych komponent\u00f3w, bezproblemowo przetrwaj\u0105cych utrat\u0119 dowolnego centrum danych.<br \/>\nW tym przypadku przesta\u0142a dzia\u0142a\u0107 <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/321402\/\">system wykrywania anomalii wska\u017anik\u00f3w logiki biznesowej<\/a><\/noindex>, kt\u00f3ry dzia\u0142a w trybie master-standby. Prze\u0142\u0105czyli\u015bmy si\u0119 na standby.<\/p>\n<h4>Przyj\u0119cie<\/h4>\n<p>\n15:51. Przez IPMI wy\u0142\u0105czono wszystkie serwery bez prawid\u0142owego zako\u0144czenia pracy, z wyj\u0105tkiem MS SQL.<br \/>\nCzy jeste\u015bcie gotowi do masowego zarz\u0105dzania serwerami przez IPMI w razie potrzeby?<\/p>\n<p><i>To moment, w kt\u00f3rym uratowanie sprz\u0119tu w centrum danych na tym etapie zosta\u0142o zako\u0144czone. Wszystko, co mo\u017cna by\u0142o zrobi\u0107, zosta\u0142o zrobione. Niekt\u00f3rzy koledzy mog\u0105 odpocz\u0105\u0107.<\/i><br \/>\n16:13. <b>Otrzymali\u015bmy informacj\u0119, \u017ce na dachu p\u0119k\u0142y rury freonowe od klimatyzator\u00f3w \u2013 to op\u00f3\u017ani uruchomienie centrum danych po usuni\u0119ciu po\u017caru.<\/b><br \/>\n16:19. Z danych otrzymanych od personelu technicznego centrum danych wynika, \u017ce wzrost temperatury w salach usta\u0142.<br \/>\n17:10. Przywr\u00f3cono dzia\u0142anie bazy conf. Teraz mo\u017cemy zmieni\u0107 ustawienia aplikacji.<br \/>\nDlaczego to jest takie wa\u017cne, skoro wszystko jest odporne na awarie i dzia\u0142a nawet bez jednego centrum danych?<br \/>\nPo pierwsze, nie wszystko jest odporne na awarie. S\u0105 r\u00f3\u017cne drugorz\u0119dne us\u0142ugi, kt\u00f3re wci\u0105\u017c nie radz\u0105 sobie dobrze z awari\u0105 centrum danych, oraz bazy w trybie master-standby. Mo\u017cliwo\u015b\u0107 zarz\u0105dzania ustawieniami pozwala na zrobienie wszystkiego, co konieczne, aby nawet w trudnych warunkach zminimalizowa\u0107 wp\u0142yw konsekwencji awarii na u\u017cytkownik\u00f3w.<br \/>\nPo drugie, sta\u0142o si\u0119 jasne, \u017ce w najbli\u017cszych godzinach praca centrum danych nie zostanie ca\u0142kowicie przywr\u00f3cona, dlatego nale\u017ca\u0142o podj\u0105\u0107 kroki, aby d\u0142ugotrwa\u0142a niedost\u0119pno\u015b\u0107 replik nie doprowadzi\u0142a do dodatkowych problem\u00f3w, takich jak przepe\u0142nienie dysk\u00f3w w pozosta\u0142ych centrach danych.<br \/>\n17:29. Czas na pizz\u0119! Mamy ludzi, a nie robot\u00f3w.<\/p>\n<p><img decoding=\"async\" alt=\"Czy \u00abgasi\u0107\u00bb serwery, je\u015bli \u00abzapali\u0142 si\u0119\u00bb test smaku w centrum danych?\" src=\"\/wp-content\/uploads\/2020\/06\/b3cf24ff0774ba9c1b11e0f20728b3c9.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<\/p>\n<h4>Rehabilitacja<\/h4>\n<p>\n18:02. W salach nr 8 (nasza), 9, 10 i 11 temperatura ustabilizowa\u0142a si\u0119. W jednej z tych, kt\u00f3re pozostaj\u0105 wy\u0142\u0105czone (nr 7), znajduje si\u0119 nasz sprz\u0119t, a temperatura tam nadal wzrasta.<br \/>\n18:31. Dano zielone \u015bwiat\u0142o na uruchomienie sprz\u0119tu w salach nr 1 i 3 \u2013 te sale ogie\u0144 nie dotkn\u0105\u0142.<\/p>\n<p><i>Na chwil\u0119 obecn\u0105 uruchamiamy serwery w salach nr 1, 3, 8, zaczynaj\u0105c od najwa\u017cniejszych. Sprawdzana jest poprawno\u015b\u0107 dzia\u0142ania wszystkich uruchomionych us\u0142ug. Wci\u0105\u017c s\u0105 problemy z sal\u0105 nr 7.<\/i><\/p>\n<p>18:44. Personel techniczny centrum danych odkry\u0142, \u017ce w sali nr 7 (gdzie znajduje si\u0119 tylko nasz sprz\u0119t) wiele serwer\u00f3w nie zosta\u0142o wy\u0142\u0105czonych. Wed\u0142ug naszych danych, pozostaje w\u0142\u0105czonych 26 serwer\u00f3w. Po ponownym sprawdzeniu odkrywamy 58 serwer\u00f3w.<br \/>\n20:18. Personel techniczny centrum danych przepuszcza powietrze w sali bez klimatyzator\u00f3w przez mobilne przewody powietrzne prowadzone przez korytarze.<br \/>\n23:08. Pierwszy administrator zosta\u0142 wys\u0142any do domu. Kto\u015b musi si\u0119 przespa\u0107 w nocy, by jutro kontynuowa\u0107 prace. Nast\u0119pnie zwalniamy kolejn\u0105 cz\u0119\u015b\u0107 administrator\u00f3w i deweloper\u00f3w.<br \/>\n02:56. Uruchomili\u015bmy wszystko, co mo\u017cna by\u0142o uruchomi\u0107. Przeprowadzamy du\u017c\u0105 kontrol\u0119 wszystkich us\u0142ug za pomoc\u0105 test\u00f3w automatycznych.<\/p>\n<p><img decoding=\"async\" alt=\"Czy \u00abgasi\u0107\u00bb serwery, je\u015bli \u00abzapali\u0142 si\u0119\u00bb test smaku w centrum danych?\" src=\"\/wp-content\/uploads\/2020\/06\/b86a9001068ef06a91d6544262299d85.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n03:02. Klimatyzacja w ostatniej, si\u00f3dmej sali zosta\u0142a przywr\u00f3cona.<br \/>\n03:36. Wprowadzili\u015bmy fronty do DNS w centrum danych do rotacji. Od teraz zaczyna przychodzi\u0107 ruch u\u017cytkownik\u00f3w.<br \/>\nZwalniamy wi\u0119kszo\u015b\u0107 zespo\u0142u administrator\u00f3w do domu. Pozostawiamy jednak kilka os\u00f3b.<\/p>\n<blockquote><p>Ma\u0142e FAQ:<br \/>\nQ: Co dzia\u0142o si\u0119 od 18:31 do 02:56?<br \/>\nA: Zgodnie z \u201ePlanem dzia\u0142ania w przypadku awarii\u201d, uruchamiamy wszystkie us\u0142ugi, zaczynaj\u0105c od najwa\u017cniejszych. W mi\u0119dzyczasie koordynator w czacie przekazuje us\u0142ug\u0119 wolnemu administratorowi, kt\u00f3ry sprawdza, czy systemy i aplikacje uruchomi\u0142y si\u0119 poprawnie, czy nie ma b\u0142\u0119d\u00f3w oraz czy metryki s\u0105 w normie. Po zako\u0144czeniu uruchamiania informuje na czacie, \u017ce jest wolny, i otrzymuje od koordynatora now\u0105 us\u0142ug\u0119.<br \/>\nProces dodatkowo op\u00f3\u017ania niesprawny sprz\u0119t. Nawet je\u015bli zatrzymanie systemu operacyjnego i wy\u0142\u0105czenie serwer\u00f3w przebieg\u0142y prawid\u0142owo, cz\u0119\u015b\u0107 serwer\u00f3w nie wraca z powodu nagle uszkodzonych dysk\u00f3w, pami\u0119ci, obudowy. Przy utracie zasilania procent awarii wzrasta.<br \/>\nQ: Dlaczego nie mo\u017cna po prostu uruchomi\u0107 wszystkiego na raz, a potem naprawi\u0107 to, co wyjdzie w monitorowaniu?<br \/>\nA: Wszystko nale\u017cy robi\u0107 stopniowo, poniewa\u017c istniej\u0105 zale\u017cno\u015bci mi\u0119dzy us\u0142ugami. Ponadto, wszystko powinno by\u0107 sprawdzone od razu, nie czekaj\u0105c na monitorowanie \u2014 poniewa\u017c lepiej zaj\u0105\u0107 si\u0119 problemami od razu, nie czekaj\u0105c na ich pogorszenie.<\/p><\/blockquote>\n<p>\n7:40. Ostatni administrator (koordynator) poszed\u0142 spa\u0107. Prace pierwszego dnia zako\u0144czone.<br \/>\n8:09. Pierwszy deweloperzy, in\u017cynierowie w centrach danych oraz administratorzy (w tym nowy koordynator) przyst\u0105pili do prac naprawczych.<br \/>\n09:37. Rozpoczynamy podnoszenie sali nr 7 (ostatniej).<br \/>\nR\u00f3wnolegle kontynuujemy przywracanie tego, co nie zosta\u0142o naprawione w innych salach: wymiana dysk\u00f3w\/pami\u0119ci\/serwer\u00f3w, naprawa wszystkiego, co 'pali si\u0119' w monitorowaniu, odwracanie r\u00f3l w schematach master-standby oraz inne drobiazgi, kt\u00f3rych jednak jest do\u015b\u0107 du\u017co.<br \/>\n17:08. Zezwalamy na wszystkie rutynowe prace w \u015brodowisku produkcyjnym.<br \/>\n21:45. Prace drugiego dnia zako\u0144czone.<br \/>\n09:45. Dzisiaj jest pi\u0105tek. W monitorowaniu wci\u0105\u017c wyst\u0119puje do\u015b\u0107 du\u017co drobnych problem\u00f3w. Przed nami weekend, wszyscy chc\u0105 odpocz\u0105\u0107. Kontynuujemy masowe naprawy wszystkiego, co mo\u017cna. Zaleg\u0142e zadania administracyjne zosta\u0142y od\u0142o\u017cone. Nowy koordynator.<br \/>\n15:40. Nagle po\u0142owa stosu sprz\u0119tu sieciowego w INNYM centrum danych si\u0119 zrestartowa\u0142a. Wycofali\u015bmy fronty, aby zminimalizowa\u0107 ryzyko. U\u017cytkownicy nie zauwa\u017cyli \u017cadnych efekt\u00f3w. P\u00f3\u017aniej okaza\u0142o si\u0119, \u017ce to by\u0142a uszkodzona obudowa. Koordynator pracuje nad napraw\u0105 od razu dw\u00f3ch awarii.<br \/>\n17:17. Praca sieci w innym centrum danych zosta\u0142a przywr\u00f3cona, wszystko sprawdzone. Centrum danych zosta\u0142o w\u0142\u0105czone do rotacji.<br \/>\n18:29. Prace trzeciego dnia oraz og\u00f3lnie odbudowa po awarii zako\u0144czone.<\/p>\n<h4>Epilog<\/h4>\n<p>\n04.04.2013 r., <noindex><a rel=\"nofollow\" href=\"https:\/\/www.checkiday.com\/01bb4461b7595228127b36bbd62b9c61\/404-day\">w dniu 404. b\u0142\u0119du<\/a><\/noindex>, \u201eOdklasowicze\u201d <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/268413\/\">do\u015bwiadczyli najwi\u0119kszej awarii<\/a><\/noindex> \u2014 przez trzy dni portal by\u0142 ca\u0142kowicie lub cz\u0119\u015bciowo niedost\u0119pny. Przez ca\u0142y ten czas ponad 100 os\u00f3b z r\u00f3\u017cnych miast, z r\u00f3\u017cnych firm (jeszcze raz wielkie dzi\u0119ki!), naprawia\u0142o zdalnie i bezpo\u015brednio w centrach danych tysi\u0105ce serwer\u00f3w, zar\u00f3wno r\u0119cznie, jak i automatycznie.<br \/>\nWyci\u0105gn\u0119li\u015bmy wnioski. Aby do podobnych sytuacji nie dochodzi\u0142o, przeprowadzili\u015bmy i wci\u0105\u017c prowadzimy rozleg\u0142e prace.<\/p>\n<p>Jakie s\u0105 g\u0142\u00f3wne r\u00f3\u017cnice mi\u0119dzy obecn\u0105 awari\u0105 a 404?<\/p>\n<ul>\n<li>Mamy teraz \u201ePlan dzia\u0142ania na wypadek awarii\u201d. Co kwarta\u0142 przeprowadzamy \u0107wiczenia \u2014 odgrywamy sytuacj\u0119 kryzysow\u0105, kt\u00f3r\u0105 grupa administrator\u00f3w (wszyscy po kolei) musi usun\u0105\u0107, korzystaj\u0105c z \u201ePlanu dzia\u0142ania na wypadek awarii\u201d. Wiod\u0105cy administratorzy systemu na zmian\u0119 \u0107wicz\u0105 rol\u0119 koordynatora.<\/li>\n<li>Co kwarta\u0142 w trybie testowym izolujemy centra danych (wszystkie po kolei) w sieci LAN i WAN, co pozwala na wczesne wykrywanie w\u0105skich garde\u0142.<\/li>\n<li>Mniej uszkodzonych dysk\u00f3w, poniewa\u017c zaostrzili\u015bmy normy: mniej godzin pracy, surowsze warto\u015bci progowe dla S.M.A.R.T.<\/li>\n<li>Ca\u0142kowicie zrezygnowali\u015bmy z BerkeleyDB \u2014 starej i niestabilnej bazy danych, kt\u00f3ra wymaga\u0142a du\u017co czasu na przywr\u00f3cenie po restarcie serwera.<\/li>\n<li>Zredukowali\u015bmy liczb\u0119 serwer\u00f3w z MS SQL i zmniejszyli\u015bmy zale\u017cno\u015b\u0107 od pozosta\u0142ych.<\/li>\n<li>Mamy swoje <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/346868\/\">chmury \u2014 one-cloud<\/a><\/noindex>, do kt\u00f3rej ju\u017c od dw\u00f3ch lat aktywnie migrujemy wszystkie us\u0142ugi. Chmura znacznie upraszcza ca\u0142y cykl pracy z aplikacj\u0105, a w przypadku awarii oferuje takie unikalne narz\u0119dzia, jak:\n<ul>\n<li>Jedno klikni\u0119cie do poprawnego zatrzymania wszystkich aplikacji;<\/li>\n<li>\u0141atwa migracja aplikacji z awaryjnych serwer\u00f3w;<\/li>\n<li>Automatyczne uruchamianie ca\u0142ego centrum danych w kolejno\u015bci priorytet\u00f3w us\u0142ug.<\/li>\n<\/ul>\n<\/li>\n<\/ul>\n<p>\nAwaria opisana w tym artykule by\u0142a najwi\u0119ksza od czasu 404. Oczywi\u015bcie nie wszystko posz\u0142o g\u0142adko. Na przyk\u0142ad, podczas niedost\u0119pno\u015bci centrum danych po po\u017carze, w innym centrum danych pad\u0142 dysk na jednym z serwer\u00f3w, co oznacza, \u017ce tylko jedna z trzech replik w klastrze Cassandra by\u0142a dost\u0119pna, przez co 4,2% u\u017cytkownik\u00f3w aplikacji mobilnych nie mog\u0142o zalogowa\u0107 si\u0119. Wszyscy jednak u\u017cytkownicy ju\u017c zalogowani mogli korzysta\u0107 z us\u0142ug. W sumie w wyniku awarii zidentyfikowano ponad 30 problem\u00f3w \u2014 od bana\u0142\u00f3w po wady architektury us\u0142ug.<\/p>\n<p>Jednak najwa\u017cniejsz\u0105 r\u00f3\u017cnic\u0105 mi\u0119dzy obecn\u0105 awari\u0105 a 404 jest to, \u017ce podczas usuwania skutk\u00f3w po\u017caru, u\u017cytkownicy wci\u0105\u017c rozmawiali i wykonywali wideorozmowy w <noindex><a rel=\"nofollow\" href=\"https:\/\/about.tamtam.chat\/ru\/\">Tamtam<\/a><\/noindex>, grali w gry, s\u0142uchali muzyki, wymieniali si\u0119 prezentami, ogl\u0105dali filmy, seriale i kana\u0142y telewizyjne w <noindex><a rel=\"nofollow\" href=\"https:\/\/ok.ru\/\">OK<\/a><\/noindex>, a tak\u017ce streamowali w <noindex><a rel=\"nofollow\" href=\"https:\/\/live.ok.ru\/\">OK Live<\/a><\/noindex>.<\/p>\n<p>Jak wygl\u0105daj\u0105 twoje awarie?<br \/>\n<br \/>\u0179r\u00f3d\u0142o: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/472812\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a? \u0412\u0441\u0435\u043c \u043f\u0440\u0438\u0432\u0435\u0442! \u041c\u0435\u043d\u044f \u0437\u043e\u0432\u0443\u0442 \u0414\u043c\u0438\u0442\u0440\u0438\u0439 \u0421\u0430\u043c\u0441\u043e\u043d\u043e\u0432, \u044f \u0440\u0430\u0431\u043e\u0442\u0430\u044e \u0432\u0435\u0434\u0443\u0449\u0438\u043c \u0441\u0438\u0441\u0442\u0435\u043c\u043d\u044b\u043c \u0430\u0434\u043c\u0438\u043d\u0438\u0441\u0442\u0440\u0430\u0442\u043e\u0440\u043e\u043c \u0432 \u00ab\u041e\u0434\u043d\u043e\u043a\u043b\u0430\u0441\u0441\u043d\u0438\u043a\u0430\u0445\u00bb. \u041d\u0430 \u0444\u043e\u0442\u043e\u0433\u0440\u0430\u0444\u0438\u0438 \u043e\u0434\u0438\u043d \u0438\u0437 \u0447\u0435\u0442\u044b\u0440\u0451\u0445 \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440\u043e\u0432, \u0433\u0434\u0435 \u0443\u0441\u0442\u0430\u043d\u043e\u0432\u043b\u0435\u043d\u043e \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435, \u043e\u0431\u0441\u043b\u0443\u0436\u0438\u0432\u0430\u044e\u0449\u0435\u0435 \u043d\u0430\u0448 \u043f\u0440\u043e\u0435\u043a\u0442. \u0417\u0430 \u044d\u0442\u0438\u043c\u0438 \u0441\u0442\u0435\u043d\u0430\u043c\u0438 \u043d\u0430\u0445\u043e\u0434\u0438\u0442\u0441\u044f \u043e\u043a\u043e\u043b\u043e 4 \u0442\u044b\u0441. \u0435\u0434\u0438\u043d\u0438\u0446 \u0442\u0435\u0445\u043d\u0438\u043a\u0438: \u0441\u0435\u0440\u0432\u0435\u0440\u044b, \u0441\u0438\u0441\u0442\u0435\u043c\u0430 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":84109,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-84108","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.1.1 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a?\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.1.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"pl_PL\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u00ab\u0422\u0443\u0448\u0438\u0442\u044c\u00bb \u043b\u0438 \u0441\u0435\u0440\u0432\u0435\u0440\u0430, \u0435\u0441\u043b\u0438 \u00ab\u0437\u0430\u0433\u043e\u0440\u0435\u043b\u0441\u044f\u00bb \u0441\u043c\u043e\u0443\u043a \u0442\u0435\u0441\u0442 \u0434\u0430\u0442\u0430\u0446\u0435\u043d\u0442\u0440\u0430? | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a?\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-06-05T05:42:44+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-06-05T05:42:44+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Czy \u201egasimy\u201d serwery, gdy \u201ezapali\u0142 si\u0119\u201d test smako\u0142yk\u00f3w w centrum danych? | ProHoster","description":"Co by\u015bcie poczuli, gdyby pewnego pi\u0119knego letniego dnia centrum danych z waszym sprz\u0119tem wygl\u0105da\u0142o tak?","canonical_url":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"pl_PL","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u00ab\u0422\u0443\u0448\u0438\u0442\u044c\u00bb \u043b\u0438 \u0441\u0435\u0440\u0432\u0435\u0440\u0430, \u0435\u0441\u043b\u0438 \u00ab\u0437\u0430\u0433\u043e\u0440\u0435\u043b\u0441\u044f\u00bb \u0441\u043c\u043e\u0443\u043a \u0442\u0435\u0441\u0442 \u0434\u0430\u0442\u0430\u0446\u0435\u043d\u0442\u0440\u0430? | ProHoster","og:description":"\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a?","og:url":"https:\/\/prohoster.info\/pl\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-06-05T05:42:44+00:00","article:modified_time":"2020-06-05T05:42:44+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"84108","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 15:04:43","updated":"2022-10-02 12:24:32","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts\/84108","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/comments?post=84108"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/posts\/84108\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/media\/84109"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/media?parent=84108"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/categories?post=84108"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/pl\/wp-json\/wp\/v2\/tags?post=84108"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}