Käivitame uusi teenuseid, liiklus kasvas, asendasime servereid, liitsime uusi plaatvorme ja rekonstrueerisime andmekeskuseid – nüüd jagame seda lugu, millega tutvustasime teid viis aastat tagasi..
Viis aastat on kujunev aeg vahekokkuvõtete tegemiseks. Seepärast otsustasime rääkida meie infrastruktuuri arengust, mis on viie aasta jooksul läbinud uskumatult huvitava arengu, mille üle oleme uhked. Meie ellu viidud kvantitatiivsed muutused on muutunud kvalitatiivseteks, nüüd suudab infrastruktuur töötada režiimides, mis möödunud sajandi keskpaiku tundusid ulmelised.
Me tagame keerukate projektide töötlust, mille usaldusväärsuse ja koormusnõuded on äärmiselt ranged, sealhulgas PREMIER ja Match ТВ. Spordülekannete ja populaarsete sarjade esilinastuste korral on vajalik terabittide/s toetamine, mida suudame kergesti teha, ning see on saanud meie jaoks igapäevaseks rutiiniks. Viis aastat tagasi oli meie süsteemide kõige raskem projekt Rutube, mis on sellest ajast alates arenenud, lõhkunud mahtu ja liiklust, mida tuli arvesse võtta koormuste planeerimisel.
Oleme rääkinud sellest, kuidas oleme arendanud meie infrastruktuuri „rauda“ () ja arendanud süsteemi, mis vastutab video edastamise eest (), kuid sellest ajast, kui need tekstid kirjutati, on möödunud palju aega, loodud ja rakendatud on palju teisi lahendusi, mille tulemused võimaldavad meil vastata kaasaegsetele nõudmistele ja olla piisavalt paindlikud, et ümber korraldada uusi ülesandeid.

Võrgu tuum oleme pidevalt arengus. Liikusime 2015. aastal Cisco seadmete juurde, millest mainisime juba eelnevas artiklis. Siis olid need ikka veel 10/40G, kuid arusaadavatel põhjustel moderniseeriti olemasolevaid šassiid mõne aasta pärast, ja nüüd kasutame aktiivselt ka 25/100G.

100G lingid ei ole juba ammu luksus (pigem on see meie segmendis hädavajalik nõue) ega haruldus (üha rohkem operaatoritest pakuvad selliste kiirusel ühendust). Siiski, 10/40G jääb endiselt relevantseks: nende linkide kaudu ühendame operaatorid, kellel on väike liiklusmaht, kus praegu ei ole mõistlik kasutada mahukamat porti.
Meie loodud võrgusüda väärib eraldi käsitlemist ja sellest saab varsti järgmise artikli teema. Seal süveneme tehnilistesse detailidesse ja arutame meie tegutsemise loogikat selle loomisel. Kuid nüüd jätkame infrastruktuuri joonistamist pigem skeemiliselt, kuna teie tähelepanu, austatud lugejad, ei ole piiramatud.
videote edastamise serverid arenevad kiiresti, selleks pakume palju pingutusi. Kui varem kasutasime peamiselt 2U servereid, millel oli 4-5 võrkaart ja igal kaardil kaks 10G-porti, siis nüüd antakse suurem osa liiklusest edasi 1U serveritest, millel on 2-3 kaarti, igal kaardil kaks 25G-porti. 10G ja 25G kaardid on hindade osas praktiliselt võrdsed ning kiirem lahendus võimaldab edastada nii 10G kui ka 25G. Tulemuseks on ilmne kokkuhoid: vähem serveri komponente ja kaableid – madalam hind (ja kõrgem töökindlus), koostisosad võtavad vähem ruumi rack'is – on võimalik mahutada rohkem servereid ruutmeetri kohta ja seega on madalam rendihind.
Kuid oluline on kiirus! Nüüd saame 1U-st edastada üle 100G! Ja see on olukorras, kus mõned suured Venemaa projektid nimetavad "saavutatuks" 40G edastamist 2U-st. Meil oleks nende probleemidest!

Märkame, et me kasutame endiselt sarnaseid võrgukaarte, mis töötavad ainult 10G. See varustus töötab stabiilselt ja on meile hästi tuntud, mistõttu ei visanud me seda minema, vaid leidis uue kasutuse. Need komponendid oleme paigaldanud videote salvestamise serveritesse, kus on tõepoolest vaja rohkem kui üht või kahte 1G liideseid, mistõttu 10G kaardid osutusid asjakohaseks.
Andmesalvestussüsteemid ka kasvavad. Viimase viie aasta jooksul on need kaheteistkümnest kettast (12x HDD 2U) muutunud kolmekümne kuue kettasüsteemiks (36x HDD 4U). Sedalaadi mahukate „kastide” kasutamise osas pelgavad mõned, kuna ühe sellise šassi riknemisel võib tekkida oht süsteemi tootlikkusele – ja isegi töövõimele! – Kuid me ei lase sel juhtuda: oleme taganud andmete geograafilise kopeerimise tasemel varukoopiad. Oleme jaotanud šassid erinevatesse andmekeskustesse – kokku kasutame kolme – ja see välistab probleemide tekkimise nii šassi rikete kui ka kottide kukkumise korral.

Muidugi on selline lähenemine muutnud riistvaralise RAIDi üleliigseks, millest me loobusime. Üksikasjadest vabanedes tõstsime samal ajal süsteemi usaldusväärsust, lihtsustades lahendust ja eemaldades ühe potentsiaalse rikke punkti. Meie andmesalvestussüsteemid on 'isetehtud'. Me läksime sellesse täiesti teadlikult ja tulemus rahuldas meid täielikult.
Andmekeskused viie aasta jooksul oleme neid korduvalt vahetanud. Alates eelmise artikli kirjutamisest pole me vahetanud ainult ühte andmekeskust – DataLine – kõik teised vajavad vahetust meie infrastruktuuri arenguga. Kõik üleminekud asukohtade vahel olid planeeritud.
Kaks aastat tagasi migrasime MMTs-9 sees, liikudes kvaliteetselt renoveeritud asukohta, kus on hea jahutussüsteem, stabiilne elektritoide ja ilma tolmuta, mis varem kattis kõik pinnad paksuse kihtidena ning ummistas meie seadmete sisemusi. Teenuste kvaliteedi – ja tolmu puudumise – valik oli meie kolimise põhjus.

Peaaegu alati on «üks kolimine võrdne kahe tulekahjuga», kuid migratsiooni probleemid on iga kord erinevad. Seekord oli peamine raskus ühes andmekeskuses kolimisel optilised ristumised – nende üleküllus korruste vahel ilma ühendamiseta ühte ristumisse sideoperaatorite poolt. Ristumiste ajakohastamine ja ümberpaiknemine (milles aitasid meid MMTs-9 insenerid) oli kahtlemata migratsiooni kõige keerulisem etapp.
Teine kolimine toimus aasta tagasi, 2019. aastal kolisime me kehvast andmekeskusest O2xygenisse. Kolimise põhjused olid sarnased eelnevalt käsitletud, kuid lisaks tuli ette probleem algse andmekeskuse atraktiivsusega sideoperaatorite jaoks – paljusid teenusepakkujaid tuli selle punkti jõudmiseks ise «järele aidata».

13 rack migration to a high-quality site at MMTS-9 has made it possible to develop this location not only as an operator (a couple of racks and operator 'pass-throughs') but also as one of the main ones. This somewhat simplified the migration from a not-so-good data center – we moved most of the equipment from it to another site, while O2xygen took on the role of developing, sending 5 racks of equipment there as well.
Today, O2xygen is already a fully-fledged site where the necessary operators have 'come' and continue to connect new ones. For operators, O2xygen has also proven attractive in terms of strategic development.
Peamine migreerimise etapp toimub meie kindlasti ühe öö jooksul ning järgime seda reeglit ka MMTS-9 ja O2xygeni vahelisi üleminekuid. Tähistame, et reegel „üleminek ühes öös“ kehtib rangelt sõltumata rackide arvust! Oli isegi juhtum, kus kolisime 20 racki ja tegime selle samuti ühe ööga. Migratsioon on piisavalt lihtne protsess, mis nõuab täpsust ja järjepidevust, kuid ka siin on mõned nipid nii ettevalmistamisel, ülemisel kui ka uues asukohas seadistamisel. Oleme valmis rääkima migratsioonist põhjalikult, kui see teid huvitab.
Tulemused Meile meeldib viieaastane areng. Oleme lõpetanud uue tõrke taluvuse infrastruktuuri ehitamise, mis on jagatud kolme andmekeskuse vahel. Oleme järsult suurendanud liiklusvõimet – kui varem nautisime 40-80G 2U kohta, siis nüüd on meie jaoks norm 100G 1U kohta. Nüüd tajume terabitti liiklust kui igapäevast. Oleme valmis edasi arendama meie infrastruktuuri, mis on osutunud paindlikuks ja skaleeritavaks.
Küsimus: Millest rääkida järgmistes tekstides, austatud lugejad? Miks me hakkasime looma isetegemise andmesalvestussüsteeme? Või võrgu tuumast ja selle omadustest? Kavalustest ja nüanssidest migratsioonis andmepunktide vahel? Lahenduste optimeerimist komponentide valikuga ja seadete täpsustamisega? Kuidas luua vastupidavaid lahendusi tänu korduvatele varukoopiatele ja horisontaalsetele skaleerimisvõimalustele andmepunktis, mis on ellu viidud kolme andmepunkti struktuuris?
Autor: Peeter Vinogradov — Tehnoloogia direktor Uma.Tech
Allikas: habr.com
