{"id":84108,"date":"2020-06-05T07:42:44","date_gmt":"2020-06-05T05:42:44","guid":{"rendered":"https:\/\/prohoster.info\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra"},"modified":"2020-06-05T07:42:44","modified_gmt":"2020-06-05T05:42:44","slug":"tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","status":"publish","type":"post","link":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","title":{"rendered":"Sollten Server abgeschaltet werden, wenn der Smoke-Test des Rechenzentrums \u201ealarmiert\u201c?","gt_translate_keys":[{"key":"rendered","format":"text"}]},"content":{"rendered":"<p>Was w\u00fcrden Sie f\u00fchlen, wenn an einem sch\u00f6nen Sommertag das Rechenzentrum mit Ihrer Ausr\u00fcstung so aussehen w\u00fcrde?<\/p>\n<p><img decoding=\"async\" alt=\"Sollten Server abgeschaltet werden, wenn der Smoke-Test des Rechenzentrums \u201ealarmiert\u201c?\" src=\"\/wp-content\/uploads\/2020\/06\/1e73d15d474bc8326a7d5f15239bc20d.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\nHallo zusammen! Mein Name ist Dmitri Samsonov, ich arbeite als leitender Systemadministrator bei \u201e<noindex><a rel=\"nofollow\" href=\"https:\/\/ok.ru\/\">Odnoklassniki<\/a><\/noindex>\u201c. Auf dem Foto sehen Sie eines der vier Rechenzentren, in denen die Ausr\u00fcstung f\u00fcr unser Projekt installiert ist. Hinter diesen W\u00e4nden befinden sich etwa 4.000 Ger\u00e4te: Server, Speichersysteme, Netzwerkausr\u00fcstung usw. \u2013 fast ein Drittel unserer gesamten Ausr\u00fcstung.<br \/>\nDie meisten Server laufen mit Linux. Es gibt auch mehrere Dutzend Server mit Windows (MS SQL) \u2013 unser Erbe, von dem wir uns seit vielen Jahren schrittweise trennen.<br \/>\nAm 5. Juni 2019 um 14:35 Uhr berichteten die Ingenieure eines unserer Rechenzentren von einem Feueralarm.<br \/>\n<noindex><a rel=\"nofollow\" name=\"habracut\"><\/a><\/noindex><\/p>\n<h4>Leugnung<\/h4>\n<p>\n14:45 Uhr. Kleinere Vorf\u00e4lle mit Rauchentwicklung in Rechenzentren passieren h\u00e4ufiger, als man denkt. Die Werte in den S\u00e4len waren normal, deshalb war unsere erste Reaktion relativ ruhig: wir haben die Arbeiten im Produktivbetrieb, also alle \u00c4nderungen an der Konfiguration und die Bereitstellung neuer Versionen usw. untersagt, au\u00dfer f\u00fcr Arbeiten zur Behebung von Problemen.<\/p>\n<h4>Wut<\/h4>\n<p>\nHaben Sie jemals versucht, die Feuerwehr zu fragen, wo genau auf dem Dach das Feuer ausgebrochen ist, oder selbst auf das brennende Dach zu gelangen, um die Situation einzusch\u00e4tzen? Wie hoch w\u00e4re das Vertrauen in Informationen, die \u00fcber f\u00fcnf Personen weitergeleitet wurden?<\/p>\n<p>14:50. <b>Es gab Informationen, dass das Feuer sich dem K\u00fchlsystem n\u00e4hert<\/b>. Aber wird es das erreichen? Der diensthabende Systemadministrator leitet den externen Datenverkehr von den Fronten dieses Rechenzentrums ab.<\/p>\n<blockquote><p>Derzeit sind die Fronten aller unserer Dienste in drei Rechenzentren redundant, es wird ein DNS-Level-Balancing verwendet, was es erm\u00f6glicht, die Adressen eines Rechenzentrums aus dem DNS zu entfernen und somit die Benutzer vor potenziellen Problemen mit dem Zugriff auf die Dienste zu sch\u00fctzen. Falls im Rechenzentrum bereits Probleme aufgetreten sind, wird es automatisch aus der Rotation entfernt. Mehr dazu k\u00f6nnen Sie hier lesen: <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/post\/321448\/\">Lastverteilung und Ausfallsicherheit bei \u201eOdnoklassniki\u201c.<\/a><\/noindex><\/p><\/blockquote>\n<p>\nBisher hat das Feuer uns nicht beeinflusst \u2013 weder Benutzer noch Ausr\u00fcstung wurden besch\u00e4digt. Handelt es sich um einen Notfall? Der erste Abschnitt des Dokuments \u201eNotfallaktionsplan\u201c definiert den Begriff \u201eNotfall\u201c und endet mit den Worten:<br \/>\n<b>\u00ab<u>Wenn Zweifel bestehen, ob es sich um einen Notfall handelt oder nicht, dann ist es ein Notfall!<\/u>\u00bb<\/b><\/p>\n<p>14:53. Ein Koordinator f\u00fcr den Notfall wird ernannt.<\/p>\n<blockquote><p>Der Koordinator ist die Person, die die Kommunikation zwischen allen Beteiligten koordiniert, das Ausma\u00df des Notfalls bewertet, den \u201eNotfallaktionsplan\u201c anwendet, das erforderliche Personal einbezieht, die Beendigung der Reparatur \u00fcberwacht und vor allem Aufgaben delegiert. Mit anderen Worten, es ist die Person, die den gesamten Prozess der Notfallbew\u00e4ltigung managt.<\/p><\/blockquote>\n<p><\/p>\n<h4>Auktion<\/h4>\n<p>\n15:01. Wir beginnen mit dem Ausschalten der Server, die nicht mit der Produktion verbunden sind.<br \/>\n15:03. Wir schalten alle reservierten Dienste ordnungsgem\u00e4\u00df aus.<br \/>\nHierzu geh\u00f6ren nicht nur die Frontends (auf die zu diesem Zeitpunkt keine Benutzer mehr zugreifen), sowie ihre unterst\u00fctzenden Dienste (Gesch\u00e4ftslogik, Caches usw.), sondern auch verschiedene Datenbanken mit einem Replikationsfaktor von 2 und mehr (<noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/465475\/\">Cassandra<\/a><\/noindex>, <noindex><a rel=\"nofollow\" href=\"http:\/\/profyclub.ru\/docs\/174\">Speicher f\u00fcr Bin\u00e4rdaten<\/a><\/noindex>, <noindex><a rel=\"nofollow\" href=\"http:\/\/www.highload.ru\/2017\/abstracts\/2844.html\">kalter Speicher<\/a><\/noindex>, <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/417593\/\">NewSQL<\/a><\/noindex> und andere).<br \/>\n15:06. <b>Es gab Informationen, dass ein Feuer einen der S\u00e4le des Rechenzentrums bedroht.<\/b> In diesem Saal haben wir keine Ausr\u00fcstung, aber die M\u00f6glichkeit, dass das Feuer vom Dach auf die S\u00e4le \u00fcbergreift, \u00e4ndert die gesamte Situation erheblich.<br \/>\n(Sp\u00e4ter stellte sich heraus, dass es keine physische Bedrohung f\u00fcr den Saal gab, da er hermetisch vom Dach isoliert ist. Die Bedrohung bestand nur f\u00fcr das K\u00fchlsystem dieses Saals.)<br \/>\n15:07. Wir erlauben die Ausf\u00fchrung von Befehlen auf den Servern in beschleunigtem Modus ohne zus\u00e4tzliche Pr\u00fcfungen (<noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/342300\/\">ohne unseren Lieblingsrechner<\/a><\/noindex>).<br \/>\n15:08. Die Temperatur in den S\u00e4len liegt im normalen Bereich.<br \/>\n15:12. <b>Es wurde ein Anstieg der Temperatur in den S\u00e4len festgestellt.<\/b><br \/>\n15:13. Mehr als die H\u00e4lfte der Server im Rechenzentrum ist abgeschaltet. Wir machen weiter.<br \/>\n15:16. Es wurde beschlossen, die gesamte Ausr\u00fcstung abzuschalten.<br \/>\n15:21. Wir beginnen, die Stromversorgung der zustandslosen Server ohne korrekte Abschaltung der Anwendung und des Betriebssystems auszuschalten.<br \/>\n15:23. Eine Gruppe von Verantwortlichen f\u00fcr MS SQL wird gebildet (es gibt nur wenige von ihnen, die Abh\u00e4ngigkeit der Dienste von ihnen ist nicht gro\u00df, aber das Verfahren zur Wiederherstellung der Betriebsf\u00e4higkeit dauert l\u00e4nger und ist komplizierter als beispielsweise bei Cassandra).<\/p>\n<h4>Depression<\/h4>\n<p>\n15:25. <b>Es gab Informationen \u00fcber die Abschaltung der Stromversorgung in vier S\u00e4len von 16 (Nr. 6, 7, 8, 9).<\/b> In den S\u00e4len 7 und 8 befindet sich unsere Ausr\u00fcstung. \u00dcber zwei weitere S\u00e4le von uns (Nr. 1 und 3) liegen keine Informationen vor.<br \/>\nNormalerweise wird bei Br\u00e4nden die Stromversorgung sofort abgeschaltet, aber in diesem Fall wurde sie dank der koordinierten Arbeit der Feuerwehr und des technischen Personals des Rechenzentrums nicht \u00fcberall und nicht sofort, sondern nach Bedarf abgeschaltet.<br \/>\n(Sp\u00e4ter stellte sich heraus, dass die Stromversorgung in den Hallen 8 und 9 nicht unterbrochen wurde.)<br \/>\n15:28. Wir beginnen mit der Wiederherstellung der MS SQL-Datenbanken aus Backups in anderen Rechenzentren.<br \/>\nWie viel Zeit wird daf\u00fcr ben\u00f6tigt? Reicht die Bandbreite des Netzwerks auf der gesamten Strecke aus?<br \/>\n15:37. <b>Es wurde eine Unterbrechung einiger Netzwerksegmente festgestellt.<\/b><br \/>\nDas Management-Netzwerk und das Produktionsnetzwerk sind physisch voneinander isoliert. Wenn das Produktionsnetzwerk verf\u00fcgbar ist, k\u00f6nnen Sie auf den Server zugreifen, die Anwendung stoppen und das OS ausschalten. Wenn es nicht verf\u00fcgbar ist, k\u00f6nnen Sie \u00fcber IPMI auf den Server zugreifen, die Anwendung stoppen und das OS ausschalten. Wenn keines der Netzwerke funktioniert, k\u00f6nnen Sie nichts tun. \u201eDanke, Kapit\u00e4n!\u201c, werden Sie sich denken.<br \/>\n\u201eUnd \u00fcberhaupt, das ist ja ganz sch\u00f6n viel Aufregung\u201c, denken Sie vielleicht auch.<br \/>\nDie Sache ist die, dass Server, selbst ohne Feuer, eine enorme Menge an W\u00e4rme erzeugen. Genauer gesagt, wenn K\u00fchlung vorhanden ist, erzeugen sie W\u00e4rme, und wenn keine K\u00fchlung vorhanden ist, schaffen sie die H\u00f6lle, die im besten Fall einen Teil der Hardware schmelzen und einen anderen Teil abschalten kann, und im schlimmsten Fall\u2026 einen Brand im Raum ausl\u00f6st, der praktisch garantiert alles zerst\u00f6rt.<\/p>\n<p><img decoding=\"async\" alt=\"Sollten Server abgeschaltet werden, wenn der Smoke-Test des Rechenzentrums \u201ealarmiert\u201c?\" src=\"\/wp-content\/uploads\/2020\/06\/83313a55926ffe0e78cdab97aa4f43d6.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n15:39. Wir stellen Probleme mit der Konfigurationsdatenbank fest.<\/p>\n<blockquote><p>Die Konfigurationsdatenbank ist das Backend f\u00fcr den gleichnamigen Dienst, der von allen Produktionsanwendungen zur sofortigen \u00c4nderung von Einstellungen verwendet wird. Ohne diese Datenbank k\u00f6nnen wir die Portalnutzung nicht steuern, aber das Portal selbst kann weiterhin funktionieren.<\/p><\/blockquote>\n<p>\n15:41. Die Temperatursensoren am Core-Netzwerkger\u00e4t zeigen Werte, die nahe an den maximal zul\u00e4ssigen Werten liegen. Das ist ein Kasten, der eine ganze Rack-Einheit einnimmt und den Betrieb aller Netzwerke im Rechenzentrum sicherstellt.<\/p>\n<p><img decoding=\"async\" alt=\"Sollten Server abgeschaltet werden, wenn der Smoke-Test des Rechenzentrums \u201ealarmiert\u201c?\" src=\"\/wp-content\/uploads\/2020\/06\/e716b26f2a66f6d5f4c794a8dfbe0f7f.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n15:42. Issue Tracker und Wiki sind nicht verf\u00fcgbar, wir schalten auf Standby um.<br \/>\nDas ist kein Produktionsnetzwerk, aber bei einem Ausfall kann die Verf\u00fcgbarkeit jeder Wissensdatenbank kritisch sein.<br \/>\n15:50. Eines der \u00dcberwachungssysteme ist ausgefallen.<br \/>\nEs gibt mehrere, und sie sind f\u00fcr verschiedene Aspekte des Betriebs der Dienste verantwortlich. Einige davon sind auf einen autarken Betrieb innerhalb jedes Rechenzentrums eingestellt (d. h. sie \u00fcberwachen nur ihr Rechenzentrum), andere bestehen aus verteilten Komponenten, die transparent den Verlust eines beliebigen Rechenzentrums \u00fcberstehen.<br \/>\nIn diesem Fall hat das <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/mailru\/blog\/321402\/\">System zur Erkennung von Anomalien in den Gesch\u00e4ftsdaten<\/a><\/noindex>, das im Master-Standby-Modus arbeitet, aufgeh\u00f6rt zu funktionieren. Wir sind auf Standby umgeschaltet.<\/p>\n<h4>Abschluss<\/h4>\n<p>\n15:51. \u00dcber IPMI haben wir alle Server ohne ordnungsgem\u00e4\u00dfe Beendigung der Arbeiten ausgeschaltet, mit Ausnahme von MS SQL.<br \/>\nSind Sie bereit, die Server im Falle eines Bedarfs \u00fcber IPMI massenhaft zu verwalten?<\/p>\n<p><i>Der Moment, in dem die Rettung der Ausr\u00fcstung im Rechenzentrum an dieser Stelle abgeschlossen ist. Alles, was getan werden konnte, wurde getan. Einige Kollegen k\u00f6nnen sich ausruhen.<\/i><br \/>\n16:13. <b>Es wurde informiert, dass auf dem Dach die K\u00fchlmittelrohre der Klimaanlagen geplatzt sind \u2013 dies wird den Start des Rechenzentrums nach der Brandbek\u00e4mpfung verz\u00f6gern.<\/b><br \/>\n16:19. Laut Informationen des technischen Personals des Rechenzentrums hat die Temperatur in den R\u00e4umen zu steigen aufgeh\u00f6rt.<br \/>\n17:10. Die Arbeit der Datenbank conf wurde wiederhergestellt. Jetzt k\u00f6nnen wir die Einstellungen der Anwendungen \u00e4ndern.<br \/>\nWarum ist das so wichtig, wenn alles ausfallsicher ist und auch ohne ein Rechenzentrum funktioniert?<br \/>\nErstens, nicht alles ist ausfallsicher. Es gibt verschiedene sekund\u00e4re Dienste, die bisher nicht gut genug mit dem Ausfall eines Rechenzentrums umgehen k\u00f6nnen, und es gibt Datenbanken im Master-Standby-Modus. Die M\u00f6glichkeit, die Einstellungen zu verwalten, erm\u00f6glicht es, alles Notwendige zu tun, um selbst unter schwierigen Bedingungen die Auswirkungen einer St\u00f6rung auf die Benutzer zu minimieren.<br \/>\nZweitens wurde klar, dass die Arbeit des Rechenzentrums in den n\u00e4chsten Stunden nicht vollst\u00e4ndig wiederhergestellt wird, daher mussten Ma\u00dfnahmen ergriffen werden, damit die langfristige Unzug\u00e4nglichkeit der Replikate nicht zu weiteren unangenehmen \u00dcberraschungen wie Festplattenspeicher\u00fcberl\u00e4ufen in den verbleibenden Rechenzentren f\u00fchrt.<br \/>\n17:29. Zeit f\u00fcr Pizza! Bei uns arbeiten Menschen, keine Roboter.<\/p>\n<p><img decoding=\"async\" alt=\"Sollten Server abgeschaltet werden, wenn der Smoke-Test des Rechenzentrums \u201ealarmiert\u201c?\" src=\"\/wp-content\/uploads\/2020\/06\/b3cf24ff0774ba9c1b11e0f20728b3c9.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<\/p>\n<h4>Rehabilitation<\/h4>\n<p>\n18:02. In den R\u00e4umen Nr. 8 (unser), 9, 10 und 11 hat sich die Temperatur stabilisiert. In einem der ausgeschalteten R\u00e4ume (Nr. 7) befindet sich unsere Ausr\u00fcstung, und die Temperatur dort steigt weiter.<br \/>\n18:31. Wir haben gr\u00fcnes Licht f\u00fcr den Start der Ausr\u00fcstung in den R\u00e4umen Nr. 1 und 3 gegeben \u2013 diese R\u00e4ume wurden nicht vom Feuer betroffen.<\/p>\n<p><i>Derzeit wird der Start der Server in den R\u00e4umen Nr. 1, 3, 8 durchgef\u00fchrt, beginnend mit den kritischsten. Die Funktionsf\u00e4higkeit aller gestarteten Dienste wird \u00fcberpr\u00fcft. Es gibt weiterhin Probleme mit dem Raum Nr. 7.<\/i><\/p>\n<p>18:44. Das technische Personal des Rechenzentrums hat festgestellt, dass in Raum Nr. 7 (wo nur unsere Ausr\u00fcstung steht) viele Server nicht abgeschaltet sind. Nach unseren Informationen sind dort 26 Server eingeschaltet. Nach einer erneuten \u00dcberpr\u00fcfung stellen wir 58 Server fest.<br \/>\n20:18. Das technische Personal des Rechenzentrums bl\u00e4st die Luft in den Raum ohne Klimaanlagen \u00fcber mobile Luftkan\u00e4le, die durch die Flure verlegt wurden.<br \/>\n23:08. Der erste Administrator wurde nach Hause geschickt. Jemand muss nachts schlafen, um morgen mit den Arbeiten fortzufahren. Dann lassen wir noch einige Administratoren und Entwickler nach Hause gehen.<br \/>\n02:56. Wir haben alles gestartet, was gestartet werden konnte. Wir f\u00fchren eine umfassende \u00dcberpr\u00fcfung aller Dienste mit automatisierten Tests durch.<\/p>\n<p><img decoding=\"async\" alt=\"Sollten Server abgeschaltet werden, wenn der Smoke-Test des Rechenzentrums \u201ealarmiert\u201c?\" src=\"\/wp-content\/uploads\/2020\/06\/b86a9001068ef06a91d6544262299d85.jpg\" style=\"display:block;margin: 0 auto;\" \/><br \/>\n<br \/>\n03:02. Die Klimaanlage im letzten, 7. Raum wurde wiederhergestellt.<br \/>\n03:36. Wir haben die Fronten im Rechenzentrum in DNS rotieren lassen. Ab diesem Moment beginnt der Benutzerverkehr zu flie\u00dfen.<br \/>\nWir entlassen den Gro\u00dfteil des Administratorenteams nach Hause. Aber einige Personen bleiben.<\/p>\n<blockquote><p>Kleines FAQ:<br \/>\nQ: Was geschah von 18:31 bis 02:56?<br \/>\nA: Gem\u00e4\u00df dem 'Notfallplan' starten wir alle Dienste, beginnend mit den wichtigsten. Dabei teilt der Koordinator im Chat einen Dienst einem freien Administrator zu, der \u00fcberpr\u00fcft, ob das OS und die Anwendung gestartet wurden, ob es Fehler gibt und ob die Werte in Ordnung sind. Nach Abschluss des Starts informiert er den Chat, dass er frei ist, und erh\u00e4lt vom Koordinator einen neuen Dienst.<br \/>\nDer Prozess wird zus\u00e4tzlich durch ausgefallene Hardware verlangsamt. Selbst wenn das Stoppen des OS und das Ausschalten der Server korrekt durchgef\u00fchrt wurden, kehren einige Server aufgrund pl\u00f6tzlich ausgefallener Festplatten, Speicher oder Geh\u00e4use nicht zur\u00fcck. Bei Stromausfall erh\u00f6ht sich die Ausfallquote.<br \/>\nQ: Warum kann man nicht einfach alles auf einmal starten und dann das reparieren, was im Monitoring auftaucht?<br \/>\nA: Alles muss schrittweise erfolgen, da zwischen den Diensten Abh\u00e4ngigkeiten bestehen. Und man sollte alles sofort \u00fcberpr\u00fcfen, ohne auf das Monitoring zu warten \u2014 denn Probleme sollte man sofort l\u00f6sen, um deren Versch\u00e4rfung zu vermeiden.<\/p><\/blockquote>\n<p>\n7:40. Der letzte Administrator (Koordinator) ist schlafen gegangen. Die Arbeiten des ersten Tages sind abgeschlossen.<br \/>\n8:09. Die ersten Entwickler, Ingenieure in den Rechenzentren und Administratoren (einschlie\u00dflich des neuen Koordinators) haben mit den Wiederherstellungsarbeiten begonnen.<br \/>\n09:37. Wir haben mit der Wiederherstellung des Raumes Nr. 7 (des letzten) begonnen.<br \/>\nParallel dazu setzen wir die Wiederherstellung dessen fort, was in anderen R\u00e4umen nicht fertiggestellt wurde: Austausch von Festplatten\/Speicher\/Servern, Reparatur von allem, was im Monitoring 'brennt', R\u00fcckschaltung der Rollen in den Master-Standby-Schemata und andere Kleinigkeiten, von denen es dennoch genug gibt.<br \/>\n17:08. Wir genehmigen alle regul\u00e4ren Arbeiten mit der Produktion.<br \/>\n21:45. Die Arbeiten des zweiten Tages sind abgeschlossen.<br \/>\n09:45. Heute ist Freitag. Im Monitoring gibt es nach wie vor zahlreiche kleine Probleme. Das Wochenende steht vor der T\u00fcr, jeder m\u00f6chte sich ausruhen. Wir setzen die umfangreichen Reparaturen aller m\u00f6glicher Komponenten fort. Die administrativen Aufgaben, die aufgeschoben werden konnten, sind aufgeschoben. Ein neuer Koordinator ist im Einsatz.<br \/>\n15:40. Pl\u00f6tzlich hat sich die H\u00e4lfte des Stacks der Core-Netzwerkausr\u00fcstung in einem ANDEREN Rechenzentrum neu gestartet. Wir haben die Frontends aus dem Betrieb genommen, um Risiken zu minimieren. Die Nutzer haben keine Auswirkungen versp\u00fcrt. Sp\u00e4ter stellte sich heraus, dass es sich um ein fehlerhaftes Chassis handelte. Der Koordinator arbeitet daran, gleich zwei St\u00f6rungen zu beheben.<br \/>\n17:17. Der Netzbetrieb im anderen Rechenzentrum wurde wiederhergestellt, alles wurde \u00fcberpr\u00fcft. Das Rechenzentrum wurde wieder in den Betrieb genommen.<br \/>\n18:29. Die Arbeiten des dritten Tages und die allgemeine Wiederherstellung nach dem Vorfall sind abgeschlossen.<\/p>\n<h4>Nachwort<\/h4>\n<p>\n04.04.2013, <noindex><a rel=\"nofollow\" href=\"https:\/\/www.checkiday.com\/01bb4461b7595228127b36bbd62b9c61\/404-day\">am Tag des 404-Fehlers<\/a><\/noindex>, \"Od\u043d\u043e\u043a\u043b\u0430\u0441\u0441\u043d\u0438\u043a\u0438\" <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/268413\/\">erlebte den gr\u00f6\u00dften Ausfall<\/a><\/noindex> \u2014 w\u00e4hrend drei Tagen war das Portal vollst\u00e4ndig oder teilweise nicht verf\u00fcgbar. In dieser Zeit haben \u00fcber 100 Personen aus verschiedenen St\u00e4dten, aus verschiedenen Unternehmen (nochmals vielen Dank!), remote und direkt in den Rechenzentren, manuell und automatisch tausende Server repariert.<br \/>\nWir haben Lehren daraus gezogen. Damit sich so etwas nicht wiederholt, haben wir umfassende Ma\u00dfnahmen ergriffen und setzen diese bis heute fort.<\/p>\n<p>Was sind die Hauptunterschiede des aktuellen Vorfalls im Vergleich zum 404?<\/p>\n<ul>\n<li>Wir haben einen \"Notfallaktionsplan\" eingef\u00fchrt. Einmal im Quartal f\u00fchren wir \u00dcbungen durch \u2014 wir simulieren einen Notfall, den die Gruppe der Administratoren (alle abwechselnd) mithilfe des \"Notfallaktionsplans\" beheben muss. Die leitenden Systemadministratoren \u00fcben abwechselnd die Rolle des Koordinators.<\/li>\n<li>Jedes Quartal isolieren wir im Testbetrieb die Rechenzentren (alle abwechselnd) im LAN- und WAN-Netzwerk, was es uns erm\u00f6glicht, Engp\u00e4sse rechtzeitig zu erkennen.<\/li>\n<li>Weniger defekte Festplatten, da wir die Standards versch\u00e4rft haben: weniger Betriebsstunden, strengere Schwellenwerte f\u00fcr S.M.A.R.T.<\/li>\n<li>Wir haben ganz auf BerkeleyDB verzichtet \u2014 die alte und instabile Datenbank, die viel Zeit f\u00fcr die Wiederherstellung nach dem Serverneustart ben\u00f6tigte.<\/li>\n<li>Die Anzahl der MS SQL-Server wurde reduziert und die Abh\u00e4ngigkeit von den verbleibenden Servern verringert.<\/li>\n<li>Wir haben unsere eigene <noindex><a rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/346868\/\">Cloud \u2014 one-cloud<\/a><\/noindex>, in die wir bereits seit zwei Jahren aktiv alle Dienste migrieren. Die Cloud vereinfacht den gesamten Arbeitszyklus mit der Anwendung erheblich und bietet im Falle eines Ausfalls einzigartige Werkzeuge wie:\n<ul>\n<li>korrektes Stoppen aller Anwendungen mit einem Klick;<\/li>\n<li>einfache Migration von Anwendungen von fehlerhaften Servern;<\/li>\n<li>automatischer rangierter (nach Priorit\u00e4t der Dienste) Start eines gesamten Rechenzentrums.<\/li>\n<\/ul>\n<\/li>\n<\/ul>\n<p>\nDer in diesem Artikel beschriebene Vorfall war der gr\u00f6\u00dfte seit dem 404. Nat\u00fcrlich lief nicht alles glatt. Zum Beispiel fiel w\u00e4hrend der Unzug\u00e4nglichkeit des ausgebrannten Rechenzentrums in einem anderen Rechenzentrum eine Festplatte auf einem der Server aus, sodass nur eine von drei Repliken im Cassandra-Cluster verf\u00fcgbar war, was dazu f\u00fchrte, dass 4,2 % der Benutzer mobiler Anwendungen sich nicht einloggen konnten. Gleichzeitig konnten bereits angemeldete Benutzer weiterhin arbeiten. Insgesamt wurden aufgrund des Vorfalls \u00fcber 30 Probleme festgestellt \u2013 von banalen Bugs bis hin zu architektonischen M\u00e4ngeln der Dienste.<\/p>\n<p>Aber der wichtigste Unterschied zwischen dem aktuellen Vorfall und dem 404. ist, dass w\u00e4hrend wir die Folgen des Brandes beseitigten, die Benutzer weiterhin Nachrichten schrieben und Videoanrufe in <noindex><a rel=\"nofollow\" href=\"https:\/\/about.tamtam.chat\/ru\/\">Tamtam<\/a><\/noindex>, Spiele spielten, Musik h\u00f6rten, sich gegenseitig Geschenke schenkten, Videos, Serien und Fernsehsender in <noindex><a rel=\"nofollow\" href=\"https:\/\/ok.ru\/\">OK<\/a><\/noindex>, und auch in <noindex><a rel=\"nofollow\" href=\"https:\/\/live.ok.ru\/\">OK Live<\/a><\/noindex>.<\/p>\n<p>Wie verlaufen Ihre Vorf\u00e4lle?<br \/>\n<br \/>Quelle: <a content=\"nofollow\" rel=\"nofollow\" href=\"https:\/\/habr.com\/ru\/company\/odnoklassniki\/blog\/472812\/\">habr.com<\/a> <\/p>","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"excerpt":{"rendered":"<p>\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a? \u0412\u0441\u0435\u043c \u043f\u0440\u0438\u0432\u0435\u0442! \u041c\u0435\u043d\u044f \u0437\u043e\u0432\u0443\u0442 \u0414\u043c\u0438\u0442\u0440\u0438\u0439 \u0421\u0430\u043c\u0441\u043e\u043d\u043e\u0432, \u044f \u0440\u0430\u0431\u043e\u0442\u0430\u044e \u0432\u0435\u0434\u0443\u0449\u0438\u043c \u0441\u0438\u0441\u0442\u0435\u043c\u043d\u044b\u043c \u0430\u0434\u043c\u0438\u043d\u0438\u0441\u0442\u0440\u0430\u0442\u043e\u0440\u043e\u043c \u0432 \u00ab\u041e\u0434\u043d\u043e\u043a\u043b\u0430\u0441\u0441\u043d\u0438\u043a\u0430\u0445\u00bb. \u041d\u0430 \u0444\u043e\u0442\u043e\u0433\u0440\u0430\u0444\u0438\u0438 \u043e\u0434\u0438\u043d \u0438\u0437 \u0447\u0435\u0442\u044b\u0440\u0451\u0445 \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440\u043e\u0432, \u0433\u0434\u0435 \u0443\u0441\u0442\u0430\u043d\u043e\u0432\u043b\u0435\u043d\u043e \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435, \u043e\u0431\u0441\u043b\u0443\u0436\u0438\u0432\u0430\u044e\u0449\u0435\u0435 \u043d\u0430\u0448 \u043f\u0440\u043e\u0435\u043a\u0442. \u0417\u0430 \u044d\u0442\u0438\u043c\u0438 \u0441\u0442\u0435\u043d\u0430\u043c\u0438 \u043d\u0430\u0445\u043e\u0434\u0438\u0442\u0441\u044f \u043e\u043a\u043e\u043b\u043e 4 \u0442\u044b\u0441. \u0435\u0434\u0438\u043d\u0438\u0446 \u0442\u0435\u0445\u043d\u0438\u043a\u0438: \u0441\u0435\u0440\u0432\u0435\u0440\u044b, \u0441\u0438\u0441\u0442\u0435\u043c\u0430 [&hellip;]<\/p>\n","protected":false,"gt_translate_keys":[{"key":"rendered","format":"html"}]},"author":1,"featured_media":84109,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[688],"tags":[],"class_list":["post-84108","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-administrirovanie"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO 5.0.1.1 - aioseo.com -->\n\t<meta name=\"description\" content=\"\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a?\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Yuri Gagarin\"\/>\n\t<link rel=\"canonical\" href=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO (AIOSEO) 5.0.1.1\" \/>\n\t\t<meta property=\"og:locale\" content=\"de_DE\" \/>\n\t\t<meta property=\"og:site_name\" content=\"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"\ud83e\udd47\u00ab\u0422\u0443\u0448\u0438\u0442\u044c\u00bb \u043b\u0438 \u0441\u0435\u0440\u0432\u0435\u0440\u0430, \u0435\u0441\u043b\u0438 \u00ab\u0437\u0430\u0433\u043e\u0440\u0435\u043b\u0441\u044f\u00bb \u0441\u043c\u043e\u0443\u043a \u0442\u0435\u0441\u0442 \u0434\u0430\u0442\u0430\u0446\u0435\u043d\u0442\u0440\u0430? | ProHoster\" \/>\n\t\t<meta property=\"og:description\" content=\"\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a?\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"350\" \/>\n\t\t<meta property=\"og:image:height\" content=\"350\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2020-06-05T05:42:44+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2020-06-05T05:42:44+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<meta property=\"article:author\" content=\"https:\/\/www.facebook.com\/prohoster\" \/>\n\t\t<!-- All in One SEO -->\n\n","aioseo_head_json":{"title":"\ud83e\udd47Sollte man Server \u201el\u00f6schen\u201c, wenn der Smook-Test des Rechenzentrums \u201eangez\u00fcndet\u201c wurde? | ProHoster","description":"Was w\u00fcrden Sie f\u00fchlen, wenn an einem sch\u00f6nen Sommertag das Rechenzentrum mit Ihrer Ausr\u00fcstung so aussehen w\u00fcrde?","canonical_url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","robots":"max-image-preview:large","keywords":"","webmasterTools":{"miscellaneous":""},"schema":null,"og:locale":"de_DE","og:site_name":"ProHoster | \u041a\u0443\u043f\u0438\u0442\u044c \u043d\u0430\u0434\u0435\u0436\u043d\u044b\u0439 \u0445\u043e\u0441\u0442\u0438\u043d\u0433 \u0434\u043b\u044f \u0441\u0430\u0439\u0442\u043e\u0432 \u0441 \u0437\u0430\u0449\u0438\u0442\u043e\u0439 \u043e\u0442 DDoS, VPS VDS \u0441\u0435\u0440\u0432\u0435\u0440\u044b","og:type":"article","og:title":"\ud83e\udd47\u00ab\u0422\u0443\u0448\u0438\u0442\u044c\u00bb \u043b\u0438 \u0441\u0435\u0440\u0432\u0435\u0440\u0430, \u0435\u0441\u043b\u0438 \u00ab\u0437\u0430\u0433\u043e\u0440\u0435\u043b\u0441\u044f\u00bb \u0441\u043c\u043e\u0443\u043a \u0442\u0435\u0441\u0442 \u0434\u0430\u0442\u0430\u0446\u0435\u043d\u0442\u0440\u0430? | ProHoster","og:description":"\u0427\u0442\u043e \u0431\u044b \u0432\u044b \u043f\u043e\u0447\u0443\u0432\u0441\u0442\u0432\u043e\u0432\u0430\u043b\u0438, \u0435\u0441\u043b\u0438 \u0432 \u043e\u0434\u0438\u043d \u043f\u0440\u0435\u043a\u0440\u0430\u0441\u043d\u044b\u0439 \u043b\u0435\u0442\u043d\u0438\u0439 \u0434\u0435\u043d\u044c \u0434\u0430\u0442\u0430-\u0446\u0435\u043d\u0442\u0440 \u0441 \u0432\u0430\u0448\u0438\u043c \u043e\u0431\u043e\u0440\u0443\u0434\u043e\u0432\u0430\u043d\u0438\u0435\u043c \u0441\u0442\u0430\u043b \u0431\u044b \u0432\u044b\u0433\u043b\u044f\u0434\u0435\u0442\u044c \u0432\u043e\u0442 \u0442\u0430\u043a?","og:url":"https:\/\/prohoster.info\/de\/blog\/administrirovanie\/tushit-li-servera-esli-zagorelsya-smouk-test-dataczentra","og:image":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:secure_url":"https:\/\/prohoster.info\/wp-content\/uploads\/2021\/11\/logo-350.jpg","og:image:width":350,"og:image:height":350,"article:published_time":"2020-06-05T05:42:44+00:00","article:modified_time":"2020-06-05T05:42:44+00:00","article:publisher":"https:\/\/www.facebook.com\/prohoster","article:author":"https:\/\/www.facebook.com\/prohoster"},"aioseo_meta_data":{"post_id":"84108","title":null,"description":null,"keywords":null,"keyphrases":null,"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":null,"og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"","isEnabled":true},"graphs":[]},"schema_type":null,"schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":null,"robots_max_videopreview":null,"robots_max_imagepreview":"large","priority":null,"frequency":null,"local_seo":null,"seo_analyzer_scan_date":null,"breadcrumb_settings":null,"limit_modified_date":false,"reviewed_by":null,"ai":null,"created":"2021-02-28 15:04:43","updated":"2022-10-02 12:24:32","focus_keyword":null,"additional_keywords":null,"truseo_locale":null},"gt_translate_keys":[{"key":"link","format":"url"}],"_links":{"self":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/84108","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/comments?post=84108"}],"version-history":[{"count":0,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/posts\/84108\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/media\/84109"}],"wp:attachment":[{"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/media?parent=84108"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/categories?post=84108"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/prohoster.info\/de\/wp-json\/wp\/v2\/tags?post=84108"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}