Përvoja e krijimit të një depo Ceph me bandwidth të tebibit në sekondë

Inxhinieri nga kompania Clyso përmbledh përvojën e krijimit të një grupi ruajtjeje mbi një sistem të shpërndarë të besueshëm Ceph me kapacitet që kalon tebibyte në sekondë. Vëren se kjo është klusteri i parë mbi Ceph që arriti një tregues të tillë, por për të arritur rezultatin e paraqitur, inxhinierët duhej të kalonin një seri pengesash të natyrshme.

PĂ«r shembull, pĂ«r tĂ« rritur performancĂ«n me 10-20%, mjaftonte tĂ« aktivizohej nĂ« serverĂ«t me cilĂ«simet e energjisĂ« nĂ« BIOS mĂ«nyra e maksimumit tĂ« performancĂ«s dhe tĂ« çaktivizohej c-state (c-state ndryshon parametrat e kursimit tĂ« energjisĂ« nĂ« varĂ«si tĂ« ngarkesĂ«s, e cila ndikon nĂ« Ceph). Po ashtu, doli se gjatĂ« pĂ«rdorimit tĂ« disqeve NVMe, bĂ«rthama e Linux-it kalonte njĂ« kohĂ« tĂ« konsiderueshme nĂ« pĂ«rpunimin e spin-locks gjatĂ« rinovimit tĂ« mapimit IOMMU. Çaktivizimi i IOMMU nĂ« bĂ«rthamĂ« çoi nĂ« njĂ« rritje tĂ« dukshme tĂ« performancĂ«s nĂ« testet e shkruarjes dhe leximeve tĂ« blloqeve me pĂ«rmasĂ« 4MB.

Megjithatë, çaktivizimi i IOMMU nuk zgjidhi problemin me rënien e performancës gjatë shkruarjes rastësore të blloqeve me përmasë 4KB. Me qëllim të zbardhjes së çështjes, inxhinierët u ndeshën me rregullime në skenarët e ndërtimit të Ceph nga projektet Gentoo dhe Ubuntu, të cilat përfshinin ndërtim me opsionin RelWithDebInfo, pasi me këtë në GCC aplikohej një mod Qëllimi optimizimi "-O2", në të cilën performanca e Ceph rritej ndjeshëm. Një tjetër faktor që çoi në rënien e performancës ishte kompilimi me bibliotekën TCMalloc. Ndryshimi i flagjeve të kompilimit dhe ndalimi i përdorimit të TCMalloc çoi në një ulje të kohës së paketimit (compaction) në tre herë dhe në dyfishimin e performancës së operacioneve rastësore të shkruarjes me blloqe 4K. Në fund, u kryen optimizime të mëtejshme të cilësimeve të Reef RocksDB dhe grupeve të vendosjes (PG).

Grupi Ă«shtĂ« formuar nga 68 nyje mbi servera Dell PowerEdge R6615 me CPU AMD EPYC 9454P 48C/96T. Çdo nyje pĂ«rmban 10 disqe NVMe Dell 15.36TB, dy adaptues Ethernet 100GbE Mellanox ConnectX-6 dhe 192 GB RAM. Programi bazĂ« Ă«shtĂ« i ndĂ«rtuar mbi Ubuntu 20.04.6 dhe Ceph 17.2.7. NĂ« grupin me 63 nyje janĂ« ngritur 630 OSD (Oobje Kumbimi, procesi i prapamshtĂ«sisĂ« qĂ« menaxhon ruajtjen e tĂ« dhĂ«nave nĂ« ruajtjen lokale, njĂ« OSD pĂ«r çdo NVMe), tre procese MON (monitorojnĂ« statusin e grupit) dhe njĂ« proces MGR (Menaxher, shĂ«rbimi menaxhues). MadhĂ«sia e ruajtjes Ă«shtĂ« 8.2 PB.

Kapaciteti gjatĂ« operacioneve sekuenciale tĂ« leximit tĂ« blloqeve 4M ishte 1025 GiB/s, shkruajti — 270 GiB/s. GjatĂ« leximit rastĂ«sor tĂ« blloqeve 4KB, performanca ishte 25.5 milion operacione leximi nĂ« sekondĂ« dhe 4.9 milion gjatĂ« shkruarjes. Aktivizimi i enkriptimit ul kapacitetin gjatĂ« leximit nĂ« rreth 750 GiB/s. Me aktivizimin e kodit tĂ« korrigjimit tĂ« gabimeve EC62, kapaciteti ishte 547 GiB/s gjatĂ« leximit dhe 387 GiB/s gjatĂ« shkruarjes (shkalla e shkruarjes rezultoi mĂ« e lartĂ« se pa kodet e korrigjimit), ndĂ«rsa me qasje rastĂ«sore 3.4M IOPS gjatĂ« leximit dhe 936K IOPS gjatĂ« shkruarjes.

Përvoja e krijimit të një depo Ceph me bandwidth të tebibit në sekondë
Përvoja e krijimit të një depo Ceph me bandwidth të tebibit në sekondë

Mund të vërehet gjithashtu se në shtator, një arritje e ngjashme e kapacitetit në tebibyte në sekondë u arrit në grupin e ruajtjes së CERN të exabytes, i realizuar mbi hapësirën e shpërndarë të hapur EOS, të ndërtuar mbi protokollin XRootD.

Burimi: opennet.ru

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster