{"id":84108,"date":"2020-06-05T07:42:44","date_gmt":"2020-06-05T05:42:44","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra"},"modified":"2020-06-05T07:42:44","modified_gmt":"2020-06-05T05:42:44","slug":"tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","status":"publish","type":"post","link":"https:\/\/prohoster.info\/fr\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","title":{"rendered":"Faut-il \u00e9teindre les serveurs si le test de fum\u00e9e du data center a \u00e9chou\u00e9 ?","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>Que ressentiriez-vous si, un bel apr\u00e8s-midi d'\u00e9t\u00e9, le centre de donn\u00e9es avec votre \u00e9quipement ressemblait \u00e0 \u00e7a ?<\/p>\n<p><img decoding=\"async\" alt=\"Faut-il \u00e9teindre les serveurs si le test de fum\u00e9e du data center a \u00e9chou\u00e9 ?\" src=\"\/wp-content\/uploads\/2020\/06\/1e73d15d474bc8326a7d5f15239bc20d.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nBonjour \u00e0 tous ! Je m'appelle Dmitry Samsonov, je suis administrateur syst\u00e8me principal chez \u00ab<noindex><a rel=\"nofollow\" href=\"https:\/\/ok.ru\/\">Odnoklassniki<\/a><\/noindex>\u00bb. Sur la photo se trouve l'un des quatre centres de donn\u00e9es o\u00f9 notre \u00e9quipement, servant notre projet, est install\u00e9. Derri\u00e8re ces murs se trouvent environ 4 000 unit\u00e9s de mat\u00e9riel : serveurs, syst\u00e8mes de stockage de donn\u00e9es, \u00e9quipements r\u00e9seau, etc. \u2014 presque \u2153 de tout notre \u00e9quipement.<br \/>\nLa majorit\u00e9 des serveurs fonctionnent sous Linux. Il y a aussi quelques dizaines de serveurs sous Windows (MS SQL) \u2014 un h\u00e9ritage dont nous nous s\u00e9parons progressivement depuis de nombreuses ann\u00e9es.<br \/>\nAinsi, le 5 juin 2019 \u00e0 14h35, les ing\u00e9nieurs de l'un de nos centres de donn\u00e9es ont signal\u00e9 une alarme incendie.<br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><\/p>\n<h4>N\u00e9gation<\/h4>\n<p>\n14h45. De petits incidents de fum\u00e9e dans les centres de donn\u00e9es se produisent plus souvent qu'il n'y para\u00eet. Les indicateurs \u00e0 l'int\u00e9rieur des salles \u00e9taient normaux, donc notre premi\u00e8re r\u00e9action a \u00e9t\u00e9 relativement calme : nous avons impos\u00e9 une interdiction de travaux sur la production, c\u2019est-\u00e0-dire sur tout changement de configuration, le d\u00e9ploiement de nouvelles versions, etc., sauf pour les travaux li\u00e9s \u00e0 la r\u00e9paration de quoi que ce soit.<\/p>\n<h4>Col\u00e8re<\/h4>\n<p>\nAvez-vous d\u00e9j\u00e0 essay\u00e9 de demander aux pompiers o\u00f9 exactement sur le toit s'est produit l'incendie, ou d'aller vous-m\u00eame sur le toit en feu pour \u00e9valuer la situation ? Quel sera le niveau de confiance dans l'information re\u00e7ue \u00e0 travers cinq personnes ?<\/p>\n<p>14:50. <b>Des informations ont \u00e9t\u00e9 re\u00e7ues indiquant que le feu se rapproche du syst\u00e8me de refroidissement<\/b>. Mais atteindra-t-il ? L'administrateur syst\u00e8me de garde dirige le trafic externe depuis les fronts de ce centre de donn\u00e9es.<\/p>\n<blockquote><p>Actuellement, tous nos services sont r\u00e9pliqu\u00e9s dans trois centres de donn\u00e9es, et un \u00e9quilibrage au niveau DNS permet de retirer les adresses d'un centre de donn\u00e9es du DNS, prot\u00e9geant ainsi les utilisateurs de probl\u00e8mes d'acc\u00e8s potentiels aux services. En cas de probl\u00e8me sur un centre de donn\u00e9es, il est automatiquement retir\u00e9 de la rotation. Vous pouvez en lire plus ici : <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/321448\/\">\u00c9quilibrage de charge et r\u00e9silience chez \u00ab Odnoklassniki \u00bb.<\/a><\/noindex><\/p><\/blockquote>\n<p>\nPour l'instant, l'incendie ne nous a pas affect\u00e9s \u2014 ni les utilisateurs ni l'\u00e9quipement n'ont \u00e9t\u00e9 touch\u00e9s. Est-ce une urgence ? La premi\u00e8re partie du document \u00ab Plan d'action en cas d'urgence \u00bb d\u00e9finit le terme \u00ab urgence \u00bb et se termine par :<br \/>\n<b>\u00ab<u>S'il y a des doutes, s'il s'agit d'une urgence ou non, alors c'est une urgence !<\/u>\u00bb<\/b><\/p>\n<p>14:53. Un coordinateur d'urgence est d\u00e9sign\u00e9.<\/p>\n<blockquote><p>Le coordinateur est la personne qui supervise la communication entre tous les participants, \u00e9value l'ampleur de l'accident, utilise le \u00ab Plan d'action d'urgence \u00bb, fait appel au personnel n\u00e9cessaire, supervise l'ach\u00e8vement des r\u00e9parations, et, surtout, d\u00e9l\u00e8gue toutes les t\u00e2ches. En d'autres termes, c'est la personne qui g\u00e8re tout le processus de liquidation de l'accident.<\/p><\/blockquote>\n<p><\/p>\n<h4>N\u00e9gociation<\/h4>\n<p>\n15:01. Nous commen\u00e7ons \u00e0 \u00e9teindre les serveurs qui ne sont pas li\u00e9s \u00e0 la production.<br \/>\n15:03. Nous \u00e9teignons correctement tous les services r\u00e9serv\u00e9s.<br \/>\nCela inclut non seulement les avant-postes (auxquels les utilisateurs n'acc\u00e8dent d\u00e9j\u00e0 plus \u00e0 ce stade) et leurs services auxiliaires (logique m\u00e9tier, caches, etc.), mais aussi diverses bases de donn\u00e9es avec un facteur de r\u00e9plication de 2 ou plus (<noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/465475\/\">Cassandra<\/a><\/noindex>, <noindex><a rel=\"nofollow\" href=\"http:\/\/profyclub.ru\/docs\/174\">stockage de donn\u00e9es binaires<\/a><\/noindex>, <noindex><a rel=\"nofollow\" href=\"http:\/\/www.highload.ru\/2017\/abstracts\/2844.html\">stockage \u00e0 froid<\/a><\/noindex>, <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/417593\/\">NewSQL<\/a><\/noindex> etc.).<br \/>\n15:06. <b>Nous avons re\u00e7u l'information qu'un incendie menace l'une des salles du centre de donn\u00e9es.<\/b> Dans cette salle, nous n'avons pas d'\u00e9quipement, mais le fait que le feu puisse se propager du toit aux salles change consid\u00e9rablement la situation.<br \/>\n(Il s'est av\u00e9r\u00e9 plus tard qu'il n'y avait pas de menace physique pour la salle, car elle \u00e9tait herm\u00e9tiquement isol\u00e9e du toit. La menace ne concernait que le syst\u00e8me de refroidissement de cette salle.)<br \/>\n15:07. Nous autorisons l'ex\u00e9cution des commandes sur les serveurs en mode acc\u00e9l\u00e9r\u00e9 sans v\u00e9rifications suppl\u00e9mentaires (<noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/342300\/\">sans notre calculatrice pr\u00e9f\u00e9r\u00e9e<\/a><\/noindex>).<br \/>\n15:08. La temp\u00e9rature dans les salles est normale.<br \/>\n15:12. <b>Une augmentation de la temp\u00e9rature a \u00e9t\u00e9 enregistr\u00e9e dans les salles.<\/b><br \/>\n15:13. Plus de la moiti\u00e9 des serveurs dans le centre de donn\u00e9es sont \u00e9teints. Nous continuons.<br \/>\n15:16. Une d\u00e9cision a \u00e9t\u00e9 prise d'\u00e9teindre tout l'\u00e9quipement.<br \/>\n15:21. Nous commen\u00e7ons \u00e0 couper l'alimentation des serveurs sans \u00e9tat sans \u00e9teindre correctement l'application et le syst\u00e8me d'exploitation.<br \/>\n15:23. Un groupe est d\u00e9sign\u00e9 pour g\u00e9rer MS SQL (ils sont peu nombreux, la d\u00e9pendance des services \u00e0 leur \u00e9gard n'est pas grande, mais la proc\u00e9dure de restauration de la fonctionnalit\u00e9 prend plus de temps et est plus complexe que, par exemple, celle de Cassandra).<\/p>\n<h4>D\u00e9pression<\/h4>\n<p>\n15:25. <b>Nous avons re\u00e7u des informations sur la coupure de l'alimentation dans quatre salles sur 16 (n\u00b06, 7, 8, 9).<\/b> Nos \u00e9quipements se trouvent dans les salles 7 et 8. Nous n'avons pas encore d'informations sur deux de nos salles (n\u00b01 et 3).<br \/>\nEn g\u00e9n\u00e9ral, lors des incendies, l'alimentation \u00e9lectrique est imm\u00e9diatement coup\u00e9e, mais dans ce cas, gr\u00e2ce au travail coordonn\u00e9 des pompiers et du personnel technique du centre de donn\u00e9es, elle n'a pas \u00e9t\u00e9 coup\u00e9e partout et imm\u00e9diatement, mais selon les besoins.<br \/>\n(Il a \u00e9t\u00e9 d\u00e9couvert plus tard que l'alimentation dans les salles 8 et 9 n'avait pas \u00e9t\u00e9 coup\u00e9e.)<br \/>\n15:28. Nous commen\u00e7ons \u00e0 d\u00e9ployer des bases MS SQL \u00e0 partir des sauvegardes dans d'autres centres de donn\u00e9es.<br \/>\nCombien de temps cela va-t-il prendre ? La bande passante du r\u00e9seau suffira-t-elle sur tout le trajet ?<br \/>\n15:37. <b>Une coupure de certaines sections du r\u00e9seau a \u00e9t\u00e9 signal\u00e9e.<\/b><br \/>\nLa gestion et le r\u00e9seau de production sont physiquement isol\u00e9s l'un de l'autre. Si le r\u00e9seau de production est accessible, vous pouvez vous connecter au serveur, arr\u00eater l'application et \u00e9teindre l'OS. Si ce n'est pas le cas, vous pouvez acc\u00e9der via IPMI, arr\u00eater l'application et \u00e9teindre l'OS. Si aucun des r\u00e9seaux n'est disponible, vous ne pourrez rien faire. \"Merci, capitaine !\", pensez-vous.<br \/>\n\u00ab Et d'ailleurs, \u00e7a fait pas mal de bruit, \u00bb pensez-vous peut-\u00eatre aussi.<br \/>\nLe probl\u00e8me, c'est que les serveurs g\u00e9n\u00e8rent une \u00e9norme quantit\u00e9 de chaleur m\u00eame sans incendie. Plus pr\u00e9cis\u00e9ment, lorsqu'il y a du refroidissement, ils g\u00e9n\u00e8rent de la chaleur, et quand il n'y en a pas, ils cr\u00e9ent un enfer atroce qui, dans le meilleur des cas, fera fondre une partie de l'\u00e9quipement et \u00e9teindra l'autre, et dans le pire des cas... causera un incendie dans la salle, ce qui d\u00e9truira tout presque in\u00e9vitablement.<\/p>\n<p><img decoding=\"async\" alt=\"Faut-il \u00e9teindre les serveurs si le test de fum\u00e9e du data center a \u00e9chou\u00e9 ?\" src=\"\/wp-content\/uploads\/2020\/06\/83313a55926ffe0e78cdab97aa4f43d6.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n15:39. Nous enregistrons des probl\u00e8mes avec la base conf.<\/p>\n<blockquote><p>La base conf est le backend du service \u00e9ponyme, utilis\u00e9 par toutes les applications de production pour modifier dynamiquement les param\u00e8tres. Sans cette base, nous ne pouvons pas g\u00e9rer le fonctionnement du portail, mais le portail peut n\u00e9anmoins fonctionner.<\/p><\/blockquote>\n<p>\n15:41. Les capteurs de temp\u00e9rature sur l'\u00e9quipement r\u00e9seau Core enregistrent des valeurs proches du seuil critique. C'est une bo\u00eete qui occupe tout un rack et qui assure le fonctionnement de tous les r\u00e9seaux \u00e0 l'int\u00e9rieur du centre de donn\u00e9es.<\/p>\n<p><img decoding=\"async\" alt=\"Faut-il \u00e9teindre les serveurs si le test de fum\u00e9e du data center a \u00e9chou\u00e9 ?\" src=\"\/wp-content\/uploads\/2020\/06\/e716b26f2a66f6d5f4c794a8dfbe0f7f.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n15:42. Le tracker de probl\u00e8mes et le wiki ne sont pas accessibles, nous passons au mode de secours.<br \/>\nCe n'est pas la production, mais en cas d'accident, l'accessibilit\u00e9 de toute base de connaissances peut \u00eatre critique.<br \/>\n15:50. Un des syst\u00e8mes de monitorage s'est d\u00e9connect\u00e9.<br \/>\nIl y en a plusieurs, et elles r\u00e9pondent \u00e0 diff\u00e9rents aspects du fonctionnement des services. Certaines d'entre elles sont configur\u00e9es pour fonctionner de mani\u00e8re autonome \u00e0 l'int\u00e9rieur de chaque centre de donn\u00e9es (c'est-\u00e0-dire qu'elles ne surveillent que leur propre centre de donn\u00e9es), d'autres se composent de composants distribu\u00e9s qui passent sans probl\u00e8me la perte de n'importe quel centre de donn\u00e9es.<br \/>\nDans ce cas, le <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/321402\/\">syst\u00e8me de d\u00e9tection d'anomalies des indicateurs de la logique m\u00e9tier<\/a><\/noindex>, qui fonctionne en mode master-standby. Nous avons bascul\u00e9 sur le standby.<\/p>\n<h4>Acceptation<\/h4>\n<p>\n15:51. Nous avons \u00e9teint tous les serveurs via IPMI sans arr\u00eat correct, sauf pour MS SQL.<br \/>\n\u00cates-vous pr\u00eats pour la gestion de masse des serveurs via IPMI en cas de besoin ?<\/p>\n<p><i>C'est le moment o\u00f9 la sauvegarde de l'\u00e9quipement dans le data center est termin\u00e9e. Tout ce qui pouvait \u00eatre fait a \u00e9t\u00e9 fait. Certains coll\u00e8gues peuvent se reposer.<\/i><br \/>\n16:13. <b>Des informations sont parvenues indiquant que des tubes de frigidaire des climatiseurs sur le toit ont \u00e9clat\u00e9 - cela retardera le lancement du data center apr\u00e8s l'extinction de l'incendie.<\/b><br \/>\n16:19. Selon les donn\u00e9es re\u00e7ues du personnel technique du data center, l'augmentation de la temp\u00e9rature dans les salles a cess\u00e9.<br \/>\n17:10. Le fonctionnement de la base conf a \u00e9t\u00e9 r\u00e9tabli. Nous pouvons maintenant modifier les param\u00e8tres des applications.<br \/>\nPourquoi est-ce si important, si tout est tol\u00e9rant aux pannes et fonctionne m\u00eame sans un data center ?<br \/>\nTout d'abord, tout n'est pas tol\u00e9rant aux pannes. Il existe divers services secondaires qui ne survivent pas encore assez bien \u00e0 la panne du data center, ainsi que des bases en mode master-standby. La possibilit\u00e9 de g\u00e9rer les param\u00e8tres permet de faire tout le n\u00e9cessaire pour minimiser les cons\u00e9quences d'une panne pour les utilisateurs, m\u00eame dans des conditions difficiles.<br \/>\nDeuxi\u00e8mement, il est devenu clair que le travail du data center ne sera pas enti\u00e8rement r\u00e9tabli dans les heures \u00e0 venir, il \u00e9tait donc n\u00e9cessaire de prendre des mesures pour que l'indisponibilit\u00e9 prolong\u00e9e des r\u00e9pliques ne conduise pas \u00e0 des probl\u00e8mes suppl\u00e9mentaires tels que le d\u00e9bordement des disques dans les autres data centers.<br \/>\n17:29. L'heure de la pizza ! Nous avons des gens qui travaillent, pas des robots.<\/p>\n<p><img decoding=\"async\" alt=\"Faut-il \u00e9teindre les serveurs si le test de fum\u00e9e du data center a \u00e9chou\u00e9 ?\" src=\"\/wp-content\/uploads\/2020\/06\/b3cf24ff0774ba9c1b11e0f20728b3c9.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<\/p>\n<h4>R\u00e9habilitation<\/h4>\n<p>\n18:02. La temp\u00e9rature dans les salles n\u00b08 (la n\u00f4tre), 9, 10 et 11 s'est stabilis\u00e9e. Dans l'une de celles qui restent \u00e9teintes (n\u00b07), se trouve notre \u00e9quipement, et la temp\u00e9rature continue d'augmenter.<br \/>\n18:31. Le feu vert a \u00e9t\u00e9 donn\u00e9 pour le d\u00e9marrage de l'\u00e9quipement dans les salles n\u00b01 et 3 - ces salles n'ont pas \u00e9t\u00e9 touch\u00e9es par le feu.<\/p>\n<p><i>\u00c0 l'heure actuelle, le d\u00e9marrage des serveurs dans les salles n\u00b01, 3, et 8 est en cours, en commen\u00e7ant par les plus critiques. La conformit\u00e9 de tous les services en cours d'ex\u00e9cution est v\u00e9rifi\u00e9e. Des probl\u00e8mes persistent avec la salle n\u00b07.<\/i><\/p>\n<p>18:44. Le personnel technique du data center a d\u00e9couvert que dans la salle n\u00b07 (o\u00f9 se trouve uniquement notre \u00e9quipement), de nombreux serveurs ne sont pas \u00e9teints. Selon nos donn\u00e9es, 26 serveurs restent allum\u00e9s. Apr\u00e8s une v\u00e9rification suppl\u00e9mentaire, nous d\u00e9couvrons 58 serveurs.<br \/>\n20:18. Le personnel technique du data center souffle de l'air dans la salle sans climatiseurs \u00e0 travers des conduits d'air mobiles, install\u00e9s \u00e0 travers les couloirs.<br \/>\n23:08. Nous avons laiss\u00e9 partir le premier administrateur chez lui. Quelqu'un doit dormir cette nuit pour pouvoir continuer demain. Nous laissons ensuite partir d'autres administrateurs et d\u00e9veloppeurs.<br \/>\n02:56. Nous avons lanc\u00e9 tout ce qui pouvait \u00eatre lanc\u00e9. Nous effectuons un grand contr\u00f4le de tous les services avec des tests automatis\u00e9s.<\/p>\n<p><img decoding=\"async\" alt=\"Faut-il \u00e9teindre les serveurs si le test de fum\u00e9e du data center a \u00e9chou\u00e9 ?\" src=\"\/wp-content\/uploads\/2020\/06\/b86a9001068ef06a91d6544262299d85.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n03:02. La climatisation de la derni\u00e8re salle, la 7e, a \u00e9t\u00e9 r\u00e9tablie.<br \/>\n03:36. Nous avons ouvert les fronts dans le centre de donn\u00e9es pour la rotation DNS. \u00c0 partir de ce moment, le trafic utilisateur commence \u00e0 arriver.<br \/>\nNous renvoyons la plupart de l'\u00e9quipe des administrateurs chez eux. Mais nous en gardons quelques-uns.<\/p>\n<blockquote><p>Petit FAQ :<br \/>\nQ : Que s'est-il pass\u00e9 entre 18:31 et 02:56 ?<br \/>\nR : Conform\u00e9ment au \u00ab Plan d'action en cas d'urgence \u00bb, nous lan\u00e7ons tous les services, en commen\u00e7ant par les plus importants. Pendant ce temps, le coordinateur dans le chat attribue le service \u00e0 l'administrateur disponible, qui v\u00e9rifie si les OS et les applications ont d\u00e9marr\u00e9, s'il n'y a pas d'erreurs, si les indicateurs sont normaux. Une fois le lancement termin\u00e9, il informe le chat qu'il est libre et re\u00e7oit un nouveau service du coordinateur.<br \/>\nLe processus est \u00e9galement ralenti par du mat\u00e9riel d\u00e9fectueux. M\u00eame si l'arr\u00eat de l'OS et l'extinction des serveurs se sont bien d\u00e9roul\u00e9s, certaines machines ne red\u00e9marrent pas \u00e0 cause de disques, de m\u00e9moire ou de ch\u00e2ssis soudainement d\u00e9faillants. En cas de perte d'alimentation, le pourcentage de pannes augmente.<br \/>\nQ : Pourquoi ne peut-on pas simplement tout lancer en m\u00eame temps, puis r\u00e9parer ce qui appara\u00eet dans la surveillance ?<br \/>\nR : Tout doit \u00eatre fait progressivement, car il existe des d\u00e9pendances entre les services. Et il faut tout v\u00e9rifier imm\u00e9diatement, sans attendre la surveillance \u2014 car il vaut mieux r\u00e9soudre les probl\u00e8mes tout de suite, plut\u00f4t que d'attendre qu'ils s'aggravent.<\/p><\/blockquote>\n<p>\n7:40. Le dernier administrateur (coordinateur) est parti se coucher. Les travaux du premier jour sont termin\u00e9s.<br \/>\n8:09. Les premiers d\u00e9veloppeurs, ing\u00e9nieurs dans les centres de donn\u00e9es et administrateurs (y compris le nouveau coordinateur) ont commenc\u00e9 les travaux de r\u00e9tablissement.<br \/>\n09:37. Nous avons commenc\u00e9 \u00e0 lever la salle n\u00b07 (la derni\u00e8re).<br \/>\nEn parall\u00e8le, nous continuons \u00e0 r\u00e9tablir ce qui n'a pas \u00e9t\u00e9 termin\u00e9 dans les autres salles : remplacement de disques\/m\u00e9moire\/serveurs, r\u00e9paration de tout ce qui \u00ab br\u00fble \u00bb dans la surveillance, basculement inverse des r\u00f4les dans les sch\u00e9mas master-standby et autres d\u00e9tails, qui sont n\u00e9anmoins assez nombreux.<br \/>\n17:08. Nous autorisons toutes les op\u00e9rations normales avec le production.<br \/>\n21:45. Les travaux du deuxi\u00e8me jour sont termin\u00e9s.<br \/>\n09:45. Aujourd'hui, c'est vendredi. Il y a encore pas mal de petits probl\u00e8mes en cours de surveillance. Le week-end approche, tout le monde veut se reposer. Nous continuons \u00e0 r\u00e9parer massivement tout ce qui peut l'\u00eatre. Les t\u00e2ches administratives qui pouvaient \u00eatre report\u00e9es ont \u00e9t\u00e9 mises de c\u00f4t\u00e9. Un nouveau coordinateur.<br \/>\n15:40. Soudain, la moiti\u00e9 de la pile Core de l'\u00e9quipement r\u00e9seau dans UN AUTRE centre de donn\u00e9es a red\u00e9marr\u00e9. Nous avons retir\u00e9 les faces de la rotation pour minimiser les risques. Aucun impact pour les utilisateurs. Plus tard, il s'est av\u00e9r\u00e9 que c'\u00e9tait un ch\u00e2ssis d\u00e9fectueux. Le coordinateur travaille sur la r\u00e9paration de deux pannes simultan\u00e9ment.<br \/>\n17:17. Le fonctionnement du r\u00e9seau dans un autre centre de donn\u00e9es a \u00e9t\u00e9 r\u00e9tabli, tout a \u00e9t\u00e9 v\u00e9rifi\u00e9. Le centre de donn\u00e9es a \u00e9t\u00e9 int\u00e9gr\u00e9 \u00e0 la rotation.<br \/>\n18:29. Les travaux du troisi\u00e8me jour et la reprise globale apr\u00e8s l'accident sont d\u00e9sormais achev\u00e9s.<\/p>\n<h4>Postface<\/h4>\n<p>\n04.04.2013, <noindex><a rel=\"nofollow\" href=\"https:\/\/www.checkiday.com\/01bb4461b7595228127b36bbd62b9c61\/404-day\">le jour de l'erreur 404,<\/a><\/noindex>\u00ab Odnoklassniki \u00bb <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/268413\/\">a subi la plus grande panne<\/a><\/noindex> \u2014 pendant trois jours, le portail \u00e9tait compl\u00e8tement ou partiellement inaccessible. Pendant toute cette p\u00e9riode, plus de 100 personnes de diff\u00e9rentes villes et de diff\u00e9rentes entreprises (merci encore une fois !), ont r\u00e9par\u00e9 \u00e0 distance et directement dans les centres de donn\u00e9es, manuellement et automatiquement, des milliers de serveurs.<br \/>\nNous en avons tir\u00e9 des le\u00e7ons. Pour \u00e9viter que cela ne se reproduise, nous avons men\u00e9 et continuons \u00e0 mener des travaux \u00e9tendus.<\/p>\n<p>Quelles sont les principales diff\u00e9rences entre cet accident et le 404 ?<\/p>\n<ul>\n<li>Nous avons mis en place un \u00ab Plan d'action en cas d'accident \u00bb. Une fois par trimestre, nous organisons des exercices \u2014 simuler une situation d'accident que le groupe d'administrateurs (tous \u00e0 tour de r\u00f4le) doit r\u00e9soudre en utilisant le \u00ab Plan d'action en cas d'accident \u00bb. Les administrateurs syst\u00e8mes principaux prennent tour \u00e0 tour le r\u00f4le de coordinateur.<\/li>\n<li>Chaque trimestre, nous isolons temporairement les centres de donn\u00e9es (tous \u00e0 tour de r\u00f4le) sur le r\u00e9seau LAN et WAN, ce qui permet d'identifier rapidement les goulets d'\u00e9tranglement.<\/li>\n<li>Moins de disques d\u00e9fectueux, car nous avons durci les normes : moins d'heures de fonctionnement, des seuils stricts pour S.M.A.R.T.<\/li>\n<li>Nous avons compl\u00e8tement abandonn\u00e9 BerkeleyDB \u2014 une ancienne base de donn\u00e9es instable qui prenait beaucoup de temps \u00e0 r\u00e9cup\u00e9rer apr\u00e8s le red\u00e9marrage du serveur.<\/li>\n<li>Nous avons r\u00e9duit le nombre de serveurs MS SQL et diminu\u00e9 notre d\u00e9pendance aux serveurs restants.<\/li>\n<li>Nous avons notre propre <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/346868\/\">cloud \u2014 one-cloud,<\/a><\/noindex>vers lequel nous migrons activement tous les services depuis deux ans. Le cloud simplifie consid\u00e9rablement tout le cycle de travail avec l'application, et en cas d'accident, il offre des outils uniques tels que :\n<ul>\n<li>Arr\u00eat correct de toutes les applications en un clic ;<\/li>\n<li>Migration simple des applications \u00e0 partir de serveurs d\u00e9faillants ;<\/li>\n<li>D\u00e9marrage automatique class\u00e9 (par ordre de priorit\u00e9 des services) de l'ensemble du centre de donn\u00e9es.<\/li>\n<\/ul>\n<\/li>\n<\/ul>\n<p>\nL'incident d\u00e9crit dans cet article a \u00e9t\u00e9 le plus important depuis le jour de l'incident 404. Bien s\u00fbr, tout ne s'est pas d\u00e9roul\u00e9 sans accroc. Par exemple, pendant l'indisponibilit\u00e9 du centre de donn\u00e9es sinistr\u00e9, un disque d'un des serveurs d'un autre centre de donn\u00e9es a \u00e9chou\u00e9, laissant seulement une des trois r\u00e9pliques accessibles dans le cluster Cassandra, ce qui a emp\u00each\u00e9 4,2 % des utilisateurs des applications mobiles de se connecter. Cependant, les utilisateurs d\u00e9j\u00e0 connect\u00e9s continuaient \u00e0 travailler. Au total, plus de 30 probl\u00e8mes ont \u00e9t\u00e9 identifi\u00e9s suite \u00e0 cet incident - allant de simples bugs \u00e0 des lacunes dans l'architecture des services.<\/p>\n<p>Mais la principale diff\u00e9rence entre l'incident actuel et celui de 404 est que tandis que nous g\u00e9rions les cons\u00e9quences de l'incendie, les utilisateurs continuaient \u00e0 \u00e9changer des messages et \u00e0 passer des appels vid\u00e9o sur <noindex><a rel=\"nofollow\" href=\"https:\/\/about.tamtam.chat\/ru\/\">Tamtam<\/a><\/noindex>, jouaient \u00e0 des jeux, \u00e9coutaient de la musique, s'offraient des cadeaux, regardaient des vid\u00e9os, des s\u00e9ries et des cha\u00eenes de t\u00e9l\u00e9vision sur <noindex><a rel=\"nofollow\" href=\"https:\/\/ok.ru\/\">OK<\/a><\/noindex>, ainsi que diffusaient sur <noindex><a rel=\"nofollow\" href=\"https:\/\/live.ok.ru\/\">OK Live<\/a><\/noindex>.<\/p>\n<p>Comment se d\u00e9roulent vos incidents ?<br \/>\n<br \/>Source : <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/472812\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a? \u0412\u0441\u0435\u043c \u043f\u0440\u0438\u0432\u0435\u0442! \u041c\u0435\u043d\u044f \u0437\u043e\u0432\u0443\u0442 \u0414\u043c\u0438\u0442\u0440\u0438\u0439 \u0421\u0430\u043c\u0441\u043e\u043d\u043e\u0432, \u044f \u0440\u0430\u0431\u043e\u0442\u0430\u044e \u0432\u0435\u0434\u0443\u0449\u0438\u043c \u0441\u0438\u0441\u0442\u0435\u043c\u043d\u044b\u043c \u0430\u0434\u043c\u0438\u043d\u0438\u0441\u0442\u0440\u0430\u0442\u043e\u0440\u043e\u043c \u0432 \u00ab\u041e\u0434\u043d\u043e\u043a\u043b\u0430\u0441\u0441\u043d\u0438\u043a\u0430\u0445\u00bb. \u041d\u0430 \u0444\u043e\u0442\u043e\u0433\u0440\u0430\u0444\u0438\u0438 \u043e\u0434\u0438\u043d \u0438\u0437 \u0447\u0435\u0442\u044b\u0440\u0451\u0445 \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440\u043e\u0432, \u0433\u0434\u0435 \u0443\u0441\u0442\u0430\u043d\u043e\u0432\u043b\u0435\u043d\u043e \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435, \u043e\u0431\u0441\u043b\u0443\u0436\u0438\u0432\u0430\u044e\u0449\u0435\u0435 \u043d\u0430\u0448 \u043f\u0440\u043e\u0435\u043a\u0442. \u0417\u0430 \u044d\u0442\u0438\u043c\u0438 \u0441\u0442\u0435\u043d\u0430\u043c\u0438 \u043d\u0430\u0445\u043e\u0434\u0438\u0442\u0441\u044f \u043e\u043a\u043e\u043b\u043e 4 \u0442\u044b\u0441. \u0435\u0434\u0438\u043d\u0438\u0446 \u0442\u0435\u0445\u043d\u0438\u043a\u0438: \u0441\u0435\u0440\u0432\u0435\u0440\u044b, \u0441\u0438\u0441\u0442\u0435\u043c\u0430 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":84109,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-84108","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.2 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a?\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/fr\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.2\" \/>\n\t\t<meta property=\"og:locale\" content=\"fr_FR\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u00ab\u0422\u0443\u0448\u0438\u0442\u044c\u00bb \u043b\u0438 \u0441\u0435\u0440\u0432\u0435\u0440\u0430, \u0435\u0441\u043b\u0438 \u00ab\u0437\u0430\u0433\u043e\u0440\u0435\u043b\u0441\u044f\u00bb \u0441\u043c\u043e\u0443\u043a \u0442\u0435\u0441\u0442 \u0434\u0430\u0442\u0430\u0446\u0435\u043d\u0442\u0440\u0430? | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a?\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/fr\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-06-05T05:42:44+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-06-05T05:42:44+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47 Faut-il \u00ab \u00e9teindre \u00bb les serveurs si le test de fum\u00e9e du centre de donn\u00e9es \u00ab a pris feu \u00bb ? | ProHoster","description":"Que ressentiriez-vous si, un bel apr\u00e8s-midi d'\u00e9t\u00e9, le centre de donn\u00e9es avec votre \u00e9quipement ressemblait \u00e0 \u00e7a ?","canonical_url":"https:\/\/prohoster.info\/fr\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"fr_FR","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u00ab\u0422\u0443\u0448\u0438\u0442\u044c\u00bb \u043b\u0438 \u0441\u0435\u0440\u0432\u0435\u0440\u0430, \u0435\u0441\u043b\u0438 \u00ab\u0437\u0430\u0433\u043e\u0440\u0435\u043b\u0441\u044f\u00bb \u0441\u043c\u043e\u0443\u043a \u0442\u0435\u0441\u0442 \u0434\u0430\u0442\u0430\u0446\u0435\u043d\u0442\u0440\u0430? | ProHoster","og:description":"\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a?","og:url":"https:\/\/prohoster.info\/fr\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-06-05T05:42:44+00:00","article:modified_time":"2020-06-05T05:42:44+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"84108","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 15:04:43","updated":"2022-10-02 12:24:32","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/posts\/84108","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/comments?post=84108"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/posts\/84108\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/media\/84109"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/media?parent=84108"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/categories?post=84108"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/fr\/wp-json\/wp\/v2\/tags?post=84108"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}