Cephi andmehoidla loomise kogemus tebibaitides sekundis

Clyso insener viis kokkuvõtte Cephi baasil püsimälu klastrite loomise kogemusest, mille läbilaskevõime ületab tebibaiti sekundis. Tõdetakse, et see on esimene Cephile tuginev klaster, mis suutis selliseid näitajaid saavutada, kuid enne esitatud tulemuse saavutamist pidi inseneridel ületama mitmeid keerulisi takistusi.

Näiteks jõudluse suurendamiseks 10-20% piisab, kui aktiveerida serverite BIOS-i energiasäästurežiimis ainult maksimaalse jõudluse režiim ja välja lülitada c-state (c-state muudab energiasäästu parameetreid vastavalt koormusele, mis mõjutab Cephi). Samuti selgus, et NVMe mäluseadmete kasutamisel kulutab Linuxi südamik olulise aja spin-lockide töötlemiseks IOMMU kaardistuse uuendamise protsessis. IOMMU väljalülitamine südamikus tõi kaasa märgatava jõudluse kasvu blokktestides, mille suurus oli 4MB.

Siiski ei lahendanud IOMMU väljalülitamine probleemiga, kus jõudlus langes juhuslikel 4KB blokikirjutistel. Uurides probleemi, sattusid insenerid Gentoo ja Ubuntu Cephi kogumistsenaariumide parandustele, mis sisaldasid ehitamist valikuga RelWithDebInfo, kuna sellega rakendati GCC-s optimeerimisrežiimi "-O2", mille käigus Cephi jõudlus tõusis. Jõudluse langemist põhjustas ka TCMalloci teegiga kokkupanek. Kompileerimislipu muutmine ja TCMalloci kasutamise lõpetamine vähendas pakendamise (compaction) aega kolm korda ja suurendas 4K blokeerivate juhuslike kirjutusoperatsioonide jõudlust kaks korda. Lõpuks tehti täiendav optimeerimine Reef RocksDB seadetel ja rühmade jagamisprotsessidel (PG).

Klaster on moodustatud 68 sõlmest, mis põhinevad serverid Dell PowerEdge R6615 koos CPU AMD EPYC 9454P 48C/96T. Igal sõlmel on 10 NVMe-andmeühikut Dell 15.36TB, kaks Ethernet-adapterit 100GbE Mellanox ConnectX-6 ja 192 GB RAM-i. Tarkvara põhineb Ubuntu 20.04.6-l ja Ceph 17.2.7-l. 63-sõlmelises klastris on seadistatud 630 OSD (Object Storage Daemon, taustprotsess, mis haldab andmete salvestamist kohalikus salvestuses, üks OSD iga NVMe-andmeühiku kohta), kolm MON-protsessi (monitor, jälgib klastri olekut) ja üks MGR-protsess (Manager, haldussüsteem). Salvestusmaht on 8.2 PB.

Jõudlus järjestikustes 4M plokkide lugemisoperatsioonides oli 1025 GiB/s, kirjutamise puhul 270 GiB/s. Juhusliku 4KB plokkide lugemise korral oli jõudlus 25.5 miljonit lugemist sekundis ja 4.9 miljonit kirjutamises. Krüpteerimise aktiveerimine vähendas lugemise jõudlust umbes 750 GiB/s. Vigade paranduskoodide EC62 kasutamisel oli jõudlus 547 GiB/s lugemisel ja 387 GiB/s kirjutamisel (kirjutamise kiirus oli kõrgem kui ilma vigade parandamiseta), juhusliku juurdepääsu puhul 3.4M IOPS lugemisel ja 936K IOPS kirjutamisel.

Cephi andmehoidla loomise kogemus tebibaitides sekundis
Cephi andmehoidla loomise kogemus tebibaitides sekundis

Lisaks võib märkida, et septembris saavutati sarnane ribalaius tebibaiti sekundis CERN-i eksabaidi salvestusklastri puhul, mis on rakendatud avatud jaotatud salvestussüsteemi EOS põhjal, mis on üles ehitatud XRootD protokolli põhjal.

Allikas: opennet.ru

Osta usaldusväärne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid | ProHoster