Բիզնեսի տարբեր չափսերի առումով ամեն օր ծագում են գաղափարներ և հանդիպումներ, որոնք վերաբերում են այն գործընթացների ավտոմատացմանը, որոնք հնարավոր է կազմելու. Բայց բացի նրանից, որ հայեցակարգի ստեղծմանը շատ ժամանակ կարող է ծախսվել, անհրաժեշտ է ժամանակ անցկացնել դրա գնահատման և ստացվող արդյունքների պատահական չլինելու ստուգման համար: Միայն ներդրման գործընթացից հետո անհրաժեշտ է ցանկացած մոդել տեղադրել մոնիթորինգի և ժամանակ առ ժամանակ ստուգել որն է արդյունքը:
Եվ այս բոլորը փուլեր են, որոնք պետք է անցնել ցանկացած ընկերությունում, անկախ դրա չափից: Եթե խոսենք Սբերբանկի չափի և ժառանգության մասին, ապա նուրբ հարմարեցումների քանակը թերևս բազմապատկվում է: 2019-ի վերջի դրությամբ Սբերբանկում արդեն գոյություն ունեին ավելի քան 2000 մոդելներ: Պարզապես մոդել մշակելը բավարար չէ, անհրաժեշտ է ինտեգրվել արդյունաբերական համակարգերին, մշակել տվյալների ցուցադրություններ մոդելների կազմման համար, ապահովել նրա աշխատանքի վերահսկողությունը կլաստերում:
Մեր թիմը մշակել է Sber.DS հարթակը: Դա հնարավորություն է տալիս լուծել մեքենայական ուսուցման խնդիրներ, արագացնում է վարկածների ստուգման գործընթացը, կանոնավորում է մոդելների մշակման և վավերացման գործընթացը, ինչպես նաև վերահսկում է մոդելի աշխատանքը ПРОМ-ում:
Ձեր ակնկալիքները չխարդախելու համար, ուզում եմ առաջ заранее ասել, որ այս գրառումը ճանաչողական է, և երկրային հարթակի Sber.DS-ի ներսում ինչ-որ բան ներկայացնելու համար: Մոդելի կյանքի ցիկլի պատմությունը մշակման և ներդրման ժամանակ, մենք կպատմենք առանձին:
Sber.DS-ն բաղկացած է մի քանի բաղադրիչներից, որոնցից հիմնականներից են գրադարան, մշակման համակարգ և մոդելների իրականացման համակարգը:

Գրադարանն վերահսկում է մոդելի կյանքի ցիկլը, սկսած նրա մշակման գաղափարի ընդունումից մինչև ներդրում, մոնիտորինգի դրման և շահագործումից հանումը: Գրադարանի շատ հնարավորություններ գծված են կարգավորիչի կանոններով, օրինակ, հաշվետվություն և ուսուցողական և վավերացման ընտրանքների պահոցում: Ի վերջո, սա մեր բոլոր մոդելների ռեգիստրն է:
Մշակման համակարգը նախատեսված է մոդելների և վավերության մեթոդների տեսողական մշակման համար: Մշակված մոդելները անցնում են սկզբնական վավերացման և բերվում են իրականացման համակարգ, որպեսզի կատարեն իրենց բիզնես ֆունկציות: Նույնիսկ իրականացման համակարգում մոդելն կարող է մոնիտորին վրա կանգնել ժամանակ առ ժամանակ վավերական մեթոդների գործարկման նպատակով նրա աշխատանքի վերահսկողության համար:
Հատկացված համակարգում մի քանի տեսակի узлы կան: Որոշներն նախատեսված են տարբեր տվյալների աղբյուրների հետ միության համար, մյուսները` սկզբնական տվյալների վերամշակման և їх վերականգնման (անիշներ): Ավելին, մոդելների տարբերակները ստեղծելու համար շատ узлы կան և վավերացման узлы: Աջակցողը կարող է շուրջից բեռնել տվյալներ, վերամշակել, ֆիլտրել, միջանկյալ տվյալներն տեսանելի դարձնել, բաժանել դրանք մասերի:
Այնուամենայնիվ, պլատֆորմը պարունակում է արդեն պատրաստի մոդուլներ, որոնք կարելի է տեղափոխել նախագծային տարածքում: Բոլոր գործողությունները իրականացվում են վիզուալացված ինտերֆեյսի միջոցով: Ապրի մեջ կարելի է լուծել խնդիրը առանց մեկ հարված ծածկագրի բացարձակ:
Եթե встроенных возможностей не хватает, то система предоставляет возможность для быстрого создания своих собственных модулей. Мы сделали режим интегрированной разработки на основе для тех, кто создает новые модули «с нуля».

Sber.DS-ի ճարտարապետությունը հիմնված է միկրոսերվիսների վրա: Միկրոսերվիսների մասին շատ կարծիքներ կան: Ոմանք կարծում են, որ բավական է բաժանել մոնոլիտային ծածկագիրը մասերի, բայց նրանք դեռ մեկ և նույն տվյալների բազան են այցելում: Մեր միկրոսերվիսը պետք է հաղորդակցվի ուրիշ միկրոսերվիսի հետ միայն REST API-ով: Ոչ մի կարճ ճանապարհներ դեպի տվյալների բազա ուղիղ մուտք։
Մենք փորձում ենք, որ ծառայությունները շատ մեծ և ծանր չդառնա, մեկ օրինակ չի պետք է սպառի 4-8 գիգաբայթ օպերատիվ հիշողություն և պետք է ապահովի հորիզոնական մասշտաբավորման հնարավորություն հարցումների մեկնարկը նոր օրինակների գործարկմամբ: Մինչև յուրաքանչյուր ծառայություն հաղորդակցվում է միայն REST API-ի միջոցով (). Ծառայության համար պատասխանատու թիմը պարտավոր է պահպանել API-ի հետադարձ համատեղելիությունը մեկ վերջին հաճախորդի համար, որը դա օգտագործում է։
Կիրառման հիմնական մասը գրված է Java-ով ՝ օգտագործելով Spring Framework: Պարզապես նախապես նախագծված է արագ desplegման համար cloud-infrastructures-ում, այնպես որ ծրագիրը կառուցվում է containerization համակարգի միջոցով (). Պլատֆորմը մշտապես զարգանում է, թե՛ բիզնես ֆունկցիոնալության ավելացման մասով (նոր կոնեեկտորներ, AutoML) և թե՛ տեխնոլոգիական արդյունավետության մասով։
Մեր պլատֆորմի «ֆունկցիաներից» մեկը կայանում է նրանում, որ մենք կարող ենք գործարկել կոդը, որը մշակվել է վիզուալ ինտերֆեյսում, ցանկացած Սբերբանկ մոդելների կատարման համակարգում: Այժմ դրանք արդեն երկուսն են. մեկը Hadoop-ում, մյուսը - OpenShift-ում (Docker): Մենք դրան չենք կանգնում և ստեղծում ենք ինտեգրացիոն մոդուլներ՝ գործարկելու կոդը ցանկացած ենթակառուցվածքում, ներառյալ on-premise և cloud-ում: Ինչպես էլ որ շատ հնարաւորություն կա արդյունավետ ինտեգրումի Սբերբանկի էկոհամակարգին, մենք նաև ծրագրում ենք սատարել գործող հարուստ միջավայրերի աշխատանքին։ Մանրամաս Նմանակում՝ այս լուծումը կարող է ճկունորեն ինտեգրվել «բառերը» ցանկացած կազմակերպության լանդշաֆտում.
Անբարենպաստ մշակումներ իրականացնողները, ովքեր երբևէ փորձել են պիտանի Python-ով աշխատող լուծումը Հադուդում, գիտեն, որ անհրաժեշտ չէ միայն Python-ն օգտագործելու միջավայրի պատրաստելը և մատուցելը ՝ յուրաքանչյուր տվյալային հանգույցի համար։ Շատ մեծ թվով C/C++ գրադարանական մոդուլներ, որոնք օգտագործում են Python մոդուլներ, չեն թույլատրում հանգիստ լինել։ Ամեն անգամ նոր գրադարաններ կամ սերվերներ ավելացնելիս պետք չէ մոռանալ թարմացնել փաթեթները, պահպանելով համա-համատեղելիությունը արդեն ներդրված մոդելների կոդի հետ։
Postվերցնելով՝ ինչպես դա անել՝ մի քանի մեթոդներ կան։ Օրինակ, նախապես պատրաստել մի քանի հաճախ օգտագործվող գրադարաններ և ներառել դրանք Հադուդում։ Cloudera-ի Հադուդ բաշխման մեջ սովորաբար օգտագործվում է ։ Ներկայումս Հադուդը հնարավորություն է տալիս նաև սկսել -տարողություններ։ Որոշ պարզ դեպքերում կարելի է կոդը փոխանցել փաթեթի հետ .
Բանկը շատ զգուշորեն մոտեցում է արտաքին կոդի գործարկման անվտանգության հարցերին, ուստի մենք առավելագույնս օգտագործում ենք Լինուքս Kernal-ի նոր հնարավորությունները, որտեղ մեկուսացված միջավայրում գործարկվող գործընթացը կարող է սահմանափակվել՝ օրինակ, ցանցի և տեղական դիսկի հասանելիության իմաստով, ինչը զգալիորեն նվազեցնում է չարամիտ կոդի հնարավորությունները։ Յուրաքանչյուր դեպարտամենտի տվյալների ոլորտները պաշտպանված են և հասանելի են միայն տվյալների տիրոջը։ Հարթակը երաշխավորում է, որ մեկ ոլորտից տվյալները կարող են մտնել մեկ այլ ոլորտ միայն տվյալների հրապարակման գործընթացի միջոցով, որը վերահսկվում է բոլոր հանգույցներում նշված դիրքում `մանից դեպի աղբյուրներ ` զգուշանալով մինչվիրված առիթին։ ։ Այս տարին մենք նախատեսում ենք ավարտելու MVP-ները, որոնք անկախ Python/R/Java-ով իսկ Հադուդում մշակած մոդելների գործարկման համար ենք նախատեսել։ Մենք ourselvesեռ թեղուբելության այդ հնարավորություններ են դնում մեր օգտագործողների ազատ գայթակղիչները։

Բացի դրանից, ինչպես գտնվել է, շատ DS-մասնագետներ շատ լավ գիտեն մաթեմատիկան և վիճակագրությունն, ստեղծում են հրաշալի մոդելներ, սակայն լավ չեն գիտակցում մեծ տվյալների տրանսֆորմացիաներին՝ մեր տվյալների ճարտարագետների աջակցություն են պահանջում։ Մենք որոշեցինք աջակցել գործընկերներին և ստեղծել հարմար մոդուլներ մոդելների նորմալ տրանսֆորմացիայի և պատրաստակամությունների համար, ինչը հնարավորություն կտա ավելի շատ ժամանակ տրամադրել մոդելների զարգացմանը, և սպասել չի լինի, քանի դեռ տվյալների ճարտարագետները պատրաստեն նոր տվյալների հավաքածու։
Մեր մոտ աշխատում են մարդիկ՝ տարբեր ոլորտներում գիտելիքներով՝ Լինուքս և DevOps, Հադուդ և Spark, Java և Spring, Scala և Akka, OpenShift և Kubernetes։ Հաջորդ անգամ մենք կպատմենք մոդելների գրադարանական մասին, ինչպես մոդելը անցնում է ընկերության կյանքի ցիկլի ընթացքում, ինչպես տեղի է ունենում վավերացումը և ներդրումը։
Մայքրոշոֆթը հայտարարել է Linux-ի համար Defender ATP հանրային տարբերակը
Ընտանիք: habr.com
