Ndonjëherë, për të zgjidhur një problem, është e nevojshme ta shikosh atë nga një këndvështrim tjetër. Edhe nëse në 10 vitet e fundit këto probleme janë zgjidhur me të njëjtën metodë me efekte të ndryshme, nuk ka garanci që ky është mënyra e vetme.
Ekziston një temë siç është ikja e klientëve. Ky është një fenomen i pashmangshëm, sepse klientët e çdo kompanie mund të ndalen nga përdorimi i produkteve ose shërbimeve të saj për shumë arsye. Natyrisht, për kompaninë, ikja është një veprim që, edhe pse natyror, nuk është aspak i dëshiruar, prandaj të gjithë përpiqen ta minimizojnë atë. Edhe më mirë është të parashikosh mundësinë e ikjes së një kategorie përdoruesish, ose të një përdoruesi të veçantë, dhe të ofrosh disa masa për mbajtjen e tyre.
Të analizosh dhe të përpiqesh të mbash klientin, nëse është e mundur, duhet të bëhet, të paktën, për këto arsye:
- tërheqja e klientëve të rinj është më e shtrenjtë se procedurat e mbajtjes. Tërheqja e klientëve të rinj zakonisht kërkon shpenzime të caktuara (reklamim), ndërsa klientët ekzistues mund të aktivizohen me një ofertë speciale me kushte të veçanta;
- kuptimi i arsyeve të ikjes së klientëve është çelësi për përmirësimin e produkteve dhe shërbimeve.
Ekzistojnë qasje standarde për të parashikuar ikjen. Por në një nga kampionatet e AI, ne vendosëm të provojmë shpërndarjen e Weibullit për këtë qëllim. Ai përdoret më shpesh për analizën e mbijetesës, parashikimin e motit, analizën e katastrofave natyrore, inxhinierinë industriale dhe të ngjashme. Shpërndarja e Weibullit është një funksion veçorë i shpërndarjes, i parametrizuar nga dy parameterë.
dhe
.
Wikipedia
Në përgjithësi, është një gjë interesante, por për parashikimin e ikjes dhe në përgjithësi në fintech, përdoret jo aq shpesh. Pas mëposht, do të tregojmë se si ne (Laboratori i Analizës Inteligjente të Dhënave) e realizuam këtë, duke fituar për më tepër medaljen e artë në Kampionatin e Inteligjencës Artificiale në kategorinë "AI në banka."
Rreth ikjes në përgjithësi
Le të kuptojmë pak më shumë lidhjen midis largimit të klientëve dhe rëndësisë së tij. Një bazë e qëndrueshme klientësh është thelbësore për biznesin. Në këtë bazë, mund të hyjnë klientë të rinj, për shembull, duke iu njohur produkteve ose shërbimeve përmes reklamave, dhe pas një periudhe të caktuar, ata mund të ndalojnë së përdoruri. Ky periudhë quhet "Cikli i jetës së klientit" - një term që përshkruan fazat që kalon një klient, fillimisht kur njihet me një produkt, merr vendim për blerje, paguan, përdor dhe bëhet një konsumator besnik, dhe në fund ndalon së përdoruri për arsye të ndryshme. Prandaj, largimi nënkupton fazën përfundimtare të ciklit të jetës së klientit, kur klienti ndalon së përdoruri shërbimet, dhe kjo për biznesin do të thotë se klienti ka ndaluar së sjelluri të ardhura dhe ndonjë dobi tjetër.
Çdo klient i bankës është një person specifik që zgjidh një kartë bankare të caktuar sipas nevojave të tij. Ndonjëherë udhëton shpesh - do të ishte e dobishme një kartë me milje. Bën shumë blerje - përshëndetje, karta me keshback. Blerjet kryhen kryesisht në disa dyqane - dhe për këtë ka plastikë partnerësh të posaçme. Sigurisht, ndonjëherë karta zgjidhet edhe sipas kriterit "Shërbimi më i lirë". Në përgjithësi, këtu ka mjaft variabla.
Një tjetër faktor është se klienti zgjidh gjithashtu bankën - çfarë kuptimi ka të zgjedhësh kartën e një banke që ka degë vetëm në Moskë, kur ti je nga Khabarovsku? Edhe nëse karta e atij banke është dyfish më e favorshme, pranueshmëria e degëve të bankës afër është ende një kriter i rëndësishëm. Po, vitin 2019 e kemi këtu dhe digitali është gjithçka për ne, por disa çështje me disa banka mund të zgjidhen vetëm në degë. Plus, një pjesë e popullsisë i beson shumë më tepër bankës fizike se sa aplikacionit në telefonin e smart, dhe kjo gjithashtu duhet të merret parasysh.
Si pasojë, arsyet për t'u larguar nga produktet e bankës (ose nga banka vetë) mund të jenë të shumta. Ka ndryshuar punën dhe tarifa e kartës është kaluar nga "paga" në "Për njerëzit e zakonshëm", që është më pak e favorshme. Ka kaluar në një qytet tjetër ku nuk ka degë të bankës. Nuk i pëlqeu bashkëpunimi me një operator të paekspozuar në degë. Pra, arsyet për të mbyllur një llogari mund të jenë, në fakt, shumë më të shumta sesa për të përdorur produktin.
Po ashtu, klienti mund të shprehë jo thjesht qartë qëllimin e tij — të shkojë në bankë dhe të shkruajë një deklaratë, por thjesht të ndalojë së përdoruri produktet, pa e ndërprerë kontratën. Pikërisht për të kuptuar detyra të tilla, u vendos që të përdoret mësimi makina dhe AI.
Më shumë se kaq, shkalla e largimit të klientëve mund të ndodhë në çdo industri (telekom, ofruesit e internetit, kompanitë e sigurimeve, në tërësi, kudo që ka një bazë klientësh dhe transaksione periodike).
Çfarë kemi bërë
Së pari, duhet të përshkruanim një kufi të qartë — që nga çfarë kohe fillojmë të llogarisim klientin e larguar. Nga pikëpamja e bankës, që na ofroi të dhënat për punë, gjendja e aktivitetit të klientit ishte binar — ai është ose aktiv, ose jo. Kishim një flamur ACTIVE_FLAG në tabelën "Aktiviteti", vlera e të cilit mund të ishte ose "0", ose "1" (përkatësisht, "Jo aktiv" dhe "Aktiv"). Dhe çdo gjë do ishte në rregull, por njeriu është si një person, që mund të përdorë aktivisht për një kohë, e pastaj për një muaj të dalë nga grupi i aktivëve — mund të sëmuret, të shkojë në një vend tjetër për pushim, ose madje të fillojë të testojë kartën e një banke tjetër. Po ashtu, pas një periudhe të gjatë mosaktiviteti, mund të fillojë sërish të përdorë shërbimet e bankës.
Prandaj, ne vendosëm të quajmë periudhën e mosaktivitetit një segment të vazhdueshëm kohor, gjatë së cilës flamuri për të vendosej si "0".

Klientët kalojnë nga mosaktiv në aktiv pas periudhash mosaktiviteti të ndryshme në gjatësi. Ne kemi mundësinë të llogarisim gradën e shkallës empirike "besueshmëria e periudhave të mosaktivitetit" — domethënë, probabilitetin se një person do të rifillojë të përdorë produktet e bankës pas një periudhe të kohës së mosaktivitetit.
Për shembull, në këtë grafik është e ilustruar rinovimi i aktivitetit (ACTIVE_FLAG=1) të klientëve pas disa muajsh mosaktiviteti (ACTIVE_FLAG=0).

Këtu ne saktësojmë pak më mirë atë grup të dhënash me të cilat filluam të punojmë. Pra, banka na ofroi informacion të agreguar për 19 muaj në tabelat e mëposhtme:
- "Aktiviteti" — transaksionet mujore të klientëve (për karta, në internet-banking dhe banking celular), duke përfshirë akumulimet e pagave dhe informacionin mbi qarkullimet.
- "Kartat" — të dhënat mbi të gjitha kartat që ka klienti, me një strukturë tarifore të detajuar.
- «Kontratat» – informacion për kontratat e klientit (si ato të hapura, ashtu edhe të mbyllura): kredite, depozita dhe të tjera, me shënimin e parametrave të çdo njësi.
- «Klientët» – një grup të dhënash demografike (gjinia dhe mosha) dhe disponueshmëria e të dhënave për kontakt.
Për punën tonë, na nevojiteshin të gjitha tabelat, përveç «Hartave».
Vështirësia këtu ishte se banka nuk specifikonte se çfarë aktiviteti kishte ndodhur përmes kartave. Kështu që mundëm të kuptonim nëse ishin realizuar transaksione, por të përcaktonim llojin e tyre – jo. Prandaj, nuk ishte e qartë nëse klienti kishte tërhequr para, kishte marrë pagën, ose kishte shpenzuar para për blerje. Gjithashtu, nuk kishim të dhëna për balancat në llogari, çka do të ishte e dobishme.
Kjo mostrë ishte e pandryshuar – në këtë prerje, gjatë 19 muajve banka nuk ndërmori asnjë përpjekje për të mbajtur klientët dhe për të minimizuar largimin e tyre.
Pra, rreth periudhave të pasivitetit.
Për formulimin e përcaktimit të largimit, duhet të zgjidhni një periudhë pasiviteti. Për të krijuar një parashikim të largimit në një moment të caktuar
, duhet të keni historinë e klientëve për një minimum prej 3 muajsh në intervalin
. Historia jonë ishte e kufizuar në 19 muaj, kështu që vendosëm të merrnim një periudhë pasiviteti prej 6 muajsh, nëse ka ndonjë. Ndërsa për periudhën minimale për një parashikim cilësor, morëm 3 muaj. Numrat 3 dhe 6 muaj i morëm empirike mbi bazën e analizës së sjelljes së këtyre klientëve.
Përcaktimi i largimit e formuluam si vijon: muaji i largimit të klientit
është muaji i parë me ACTIVE_FLAG=0, ku nga ky muaj ndodhin të paktën gjashtë zero radhazi në fushën ACTIVE_FLAG, me fjalë të tjera, muaji nga i cili klienti ka qenë i pasiv 6 muaj.

Numri i klientëve që e kanë lënë

Numri i klientëve që kanë mbetur
Siç pranohet të mendohet largimi
Në gara të tilla, po ashtu dhe në praktikë, largimin shpesh e parashikojnë në këtë mënyrë. Klienti përdor produkte dhe shërbime në intervale të ndryshme kohor, të dhënat për ndërveprimin me të paraqiten si një vektor karakteristikash me gjatësi fikse n. Shpesh, në këtë informacion përfshihen:
- Të dhënat që karakterizojnë përdoruesin (të dhëna demografike, segmenti i marketingut).
- Historia e përdorimit të produkteve dhe shërbimeve bankare (kjo janë veprimet e klientëve, të cilat gjithmonë janë të lidhura me një moment të caktuar ose periudhën e intervalit tonë të nevojshëm).
- Të dhëna të jashtme, nëse janë marrë — për shembull, dëshmitë nga rrjetet sociale.
Dhe vetëm pas kësaj përcaktojnë përcaktimin e ikjes, të vetin për çdo detyrë. Pastaj përdorin një algoritëm të mësimit të makinerive, i cili parashikon mundësinë e largimit të klientit
me bazë në vektorin e faktoreve
. Për të trajnuar algoritmin përdorin një nga kornizat e njohura për ndërtimin e grupeve të pemëve vendimtare, , , ose modifikimet e tyre.
Algoritmi vetë nuk është i keq, por pikërisht në pjesën e parashikimit të ikjes ka disa disavantazhe të rëndësishme.
- Ai nuk ka atë që quhet "memorie". Në hyrje të modelit hyjnë një numër i caktuar karakteristikash, të cilat i përkasin momentit aktual. Për të regjistruar informacionin mbi historinë e ndryshimit të parametrave, nevojitet llogaritja e karakteristikave të veçanta, të cilat karakterizojnë ndryshimet e parametrave në kohë, për shembull, numri ose shuma e transaksioneve bankare për 1, 2, 3 muajt e fundit. Ky qasje mund të pasqyrojë vetëm pjesërisht karakterin e ndryshimeve temporale.
- Horozont i fiksuar i parashikimit. Modeli është në gjendje të parashikojë ikjen e klientëve vetëm për një periudhë të caktuar të parashikuar, për shembull, parashikimi për një muaj përpara. Nëse kërkohet një parashikim për një periudhë tjetër, për shembull, për tre muaj, atëherë është e nevojshme të rindërtohet grupi i të dhënave të trajnuara dhe të ritrënohet një model i ri.
Qasja jonë
Ne vendosëm që nga fillimi nuk do të përdorim qasje standarde. Në kampionat ishim regjistruar edhe 497 persona të tjerë, secili prej të cilëve kishte një përvojë të konsiderueshme. Prandaj, të përpiqesh të bësh diçka sipas një skeme standarde në këto kushte — nuk është ideja më e mirë.
Dhe ne filluam të zgjidhim problemet që qëndrojnë përpara modelit të klasifikimit binar, me anë të parashikimit të shpërndarjes probabilistike të kohës së ikjes së klientëve. Ky qasje mund të shikohet , ajo lejon parashikimin më elastik të ikjes dhe kontrollimin e hipotezave më komplekse sesa në qasjen klasike. Si një familje shpërndarjesh që modelojnë kohën e ikjes, ne zgjodhëm shpërndarjen për aplikimin e tij të gjerë në analizën e mbijetesës. Sjellja e klientit mund të konsiderohet si një lloj mbijetese.
Këtu janë disa shembuj të shpërndarjeve të densiteteve të mundësive Weibull në varësi të parametrave.
dhe
:

Kjo është densiteti i shpërndarjes së mundësisë së shkarkimit të klientit të tre klientëve të ndryshëm me kalimin e kohës. Koha është e paraqitur në muaj. Me fjalë të tjera, ky grafik tregon kur është më e mundur që ndodh shkarkimi i klientit në dy muajt e ardhshëm. Siç mund të shihet, klienti me shpërndarjen ka një potencial më të madh për t'u larguar më herët se klientët me shpërndarjet Weibull(2, 0.5) dhe Weibull(3, 1).
Si rezultat, krijohet një model që për çdo klient për çdo
muaj parashikon parametrat e shpërndarjes Weibull, që zakonisht pasqyron ardhjen e mundësisë së shkarkimit me kalimin e kohës. Nëse shkojmë më thellë:
- Karakteristikat e synuara në grupin e trajnimit janë koha e mbetur deri në shkarkim për një muaj të caktuar për një klient të caktuar.
- Nëse nuk kemi tregues për shkarkimin e klientit, supozojmë se koha e shkarkimit është më e madhe sesa numri i muajve që fillon nga aktuali dhe deri në fund të historisë që kemi.
- Modeli i përdorur: një rrjet nervor rekursiv me një sloj LSTM.
- Si funksion humbjeje përdorim funksionin e logaritmit të negativizuar të vërtetësisë për shpërndarjen Weibull.
Këtu janë avantazhet e këtij metode:
- Shpërndarja probabilistike, përveç mundësisë së qartë për klasifikim binar, lejon parashikimin e ngjarjeve të ndryshme, për shembull, nëse një klient do të ndalojë së përdoruari shërbimet e bankës brenda 3 muajve. Gjithashtu, nëse është e nevojshme, nga kjo shpërndarje mund të mesatohen metrika të ndryshme.
- Rrjeti nervor rekursiv LSTM ka memorie dhe përdor efektivisht të gjithë historinë e disponueshme. Me zgjerimin ose saktësimin e historisë, saktësia rritet.
- Qasja mund të shkallëzohet në mënyrë të lehtë me ndarjen e intervaleve të kohës në më të vogla (për shembull, me ndarjen e muajve në javë).
Por është e pamjaftueshme të krijosh një model të mirë, duhet gjithashtu ta vlerësosh cilësinë e tij.
Si e vlerësuam cilësinë
Si metrikë ne zgjodhëm Kurvën e Liftit. Kjo përdoret në biznes për raste të tillë për shkak të interpretimit të qartë, është përshkruar mirë dhe . Nëse e përshkruajmë kuptimin e kësaj metrike me një fjali, do të ishte «Sa më mirë e bën algoritmi parashikimin në fillim
% se rastësisht».
Trajnojmë modelet
Rregullat e garës nuk përcaktuan një metrikë të saktë cilësie, me të cilën mund të krahasohen modele dhe qasje të ndryshme. Më tepër, përcaktimi i konceptit të largimit mund të jetë i ndryshëm dhe mund të varet nga përcaktimi i detyrës, e cila, nga ana e saj, përcaktohet nga objektivat e biznesit. Prandaj, për të kuptuar se cila metodë është më e mira, ne trajnuam dy modele:
- Qasja e përdorur shpesh e klasifikimit binar me përdorimin e algoritmit të mësimit të makinerive, grupimi i pemëve vendimtare ();
- Modeli Weibull-LSTM
Grupi testues përbëhej nga 500 klientë të përzgjedhur paraprakisht, të cilët nuk ishin në grupin e trajnimit. Për modelin u realizua një optimizim i hiperparameterëve duke përdorur validimin e kryqëzuar të ndarë sipas klientëve. Për trajnimin e çdo modeli u përdorën të njëjtat grupe veçorish.
Duke marrë parasysh se modeli nuk ka kujtesë, për të u morën veçori të veçanta që tregojnë lidhjen e ndryshimeve të parametrave një muaj me mesataren e parametrave për tre muajt e fundit. Kjo karakterizonte shpejtësinë e ndryshimit të vlerave për periudhën e fundit prej tre muajsh. Pa këtë, modeli i bazuar në Random Forest do të ishte në një pozitë më të dobët në krahasim me Weibull-LSTM.
Si e kalon LSTM me shpërndarje Weibull qasjen që bazohet në grupimin e pemëve vendimtare
Aty është gjithçka e qartë, duke përdorur vetëm disa figura.

Krahasimi i Lift Curve për algoritmin klasik dhe Weibull-LSTM

Krahasimi i metrikes Lift Curve sipas muajve për algoritmin klasik dhe Weibull-LSTM
Në përgjithësi, LSTM e dëbon algoritmin klasik në pothuajse të gjitha rastet.
Parashikimi i largimit
Modeli i bazuar në rrjetin nervor rekurent me qeliza LSTM me shpërndarje Weibull mund të parashikojë largimin para se të ndodhë, për shembull, të parashikojë largimin e klientëve brenda n muajve të ardhshëm. Le të shqyrtojmë rastin për n = 3. Në këtë rast, për secilin muaj, rrjeti nervor duhet të përcaktojë saktësisht: nëse klienti do të largohet, duke filluar nga muaji i ardhshëm deri në muajin e n-të. Në fjalë të tjera, ai duhet të përcaktojë saktësisht nëse klienti do të mbetet pas kalimit të n muajve. Kjo mund të konsiderohet si një parashikim të përparshëm: parashikimi i momentit kur klienti sapo ka filluar të mendojë për largimin.
Le të krahasojmë Lift Curve për Weibull-LSTM një, dy dhe tre muaj para largimit:

Kemi shkruar më lart se janë të rëndësishme edhe ato parashikime që janë bërë për klientët që dalin nga aktiviteti për një kohë. Prandaj, ne do të shtojmë në mostrën tonë raste të tilla kur një klient që është larguar ka qenë i pasiv një ose dy muaj, dhe do të verifikojmë që Weibull-LSTM klasifikon saktë këto raste si humbje. Duke qenë se këto raste ishin të pranishme në mostër, ne presim që rrjeti të përballojë mirë me to:

Rrjedhja e klientëve
Kjo është thelbësore, pasi keni informacion mbi klientët që po përgatiten të ndalojnë përdorimin e produktit. Kur flasim për ndërtimin e një modeli që mund të ofrojë diçka të dobishme për klientët për t'i mbajtur ata — nuk do të arrijmë ta bëjmë këtë nëse nuk keni histori të përpjekjeve të ngjashme që përfunduan me sukses.
Ne nuk e kemi pasur një histori të tillë, prandaj vendosëm ta bëjmë kështu.
- Po ndërtojmë një model që përcakton produkte tërheqëse për çdo klient.
- Çdo muaj kemi në funksion klasifikuesin dhe përcaktojmë klientët që potencialisht mund të largohen.
- Disa klientëve u ofrojmë një produkt, sipas modelit nga pika 1, dhe mbajmë mend veprimet tona.
- Pas disa muajsh, shohim se kush nga këta klientë potencialisht në ikje është larguar dhe kush ka mbetur. Në këtë mënyrë formojmë një mostër për trajnim.
- E trajnojmë modelin me historinë e marrë nga pika 4.
- Opcionalisht, e përsërisim procedurën, duke zëvendësuar modelin nga pika 1 me modelin e marrë në pikën 5.
Kontrolli i cilësisë së këtij mbajtur mund të përfaqësohet nga testimi A/B standard — e ndajmë klientët potencialisht në ikje në dy grupe. Njërit grup i ofrojmë produkte bazuar në modelin tonë të mbajtjes, grupit tjetër nuk u ofrojmë asgjë. Vendosëm të trajnojmë modelin që mund të ofrojë përfitim që në pikën 1 të shembullit tonë.
Donim të bënim segmentimin sa më të interpretuar. Për këtë, zgjodhëm disa karakteristika që mund të ishin lehtësisht interpretuese: numri i përgjithshëm i transaksioneve, rroga, qarkullimi total për llogari, mosha, gjinia. Karakteristat nga tabela "Kartat" nuk u morën parasysh si të pakorkueshme, ndërsa karakteristat nga tabela 3 "Kontratë" — për shkak të kompleksitetit të përpunimit për të shmangur rrjedhjen e të dhënave midis grupit validues dhe grupit të trajnuar.
Klasifikimi u krye duke përdorur modelet e përzierjeve Gaussian. Kritéri për informacionin Akaike ndihmoi në përcaktimin e 2 optimumeve. Optimumi i parë i përket 1 klastri. Optimumi i dytë, më pak i shprehur, përkon me 80 klastera. Nga ky rezultat mund të bëhet ky përfundim: të dhënat janë jashtëzakonisht të vështira për t'u ndarë në klastera pa informacion të dhënë paraprakisht. Për një klasifikim më cilësor, nevojiten të dhëna që e përshkruajnë detajisht çdo klient.
Prandaj, u shqyrtua një detyrë e mësimit me mbikëqyrje, për të propozuar një produkt të veçantë për secilin klient. Produktet e shqyrtuara ishin: "Depozitë e menjëhershme", "Kartë krediti", "Ovdraft", "Kredi konsumatori", "Kredi auto", "Hipotekë".
Në të dhëna kishte edhe një lloj tjetër produkti: "Llogaria e zakonshme". Por ne nuk e shqyrtuam atë për shkak të informacioneve të pakta. Për përdoruesit, të cilët janë klientë të bankës, dmth. që nuk kanë ndaluar së përdoruri produktet e saj, u ndërtua një model që parashikon se cili produkt mund të jetë i interesuar për ta. Modeli i zgjedhur ishte regresioni logjistik, dhe si metrikë për vlerësimin e cilësisë u përdor vlera Lift për percenilët e parë 10.
Cilësia e modelit mund të vlerësohet në figurë.

Rezultatet e modelit të rekomandimeve të produkteve për klientët
Përfundimi
Ky qasje na solli vendin e parë në kategorinë "AI në banka" në Kampionatin e AI RAIF-Challenge 2017.

Duket se e rëndësishmja ishte të afrohemi me problemin nga një këndvështrim jo më të zakonshëm, duke përdorur një metodë që zakonisht përdoret për situata të tjera.
Megjithatë, një ikje masive e përdoruesve mund të jetë një katastrofë për shërbimet.
Kjo metodë mund të merret parasysh edhe për çdo fushë tjetër, ku është e rëndësishme të merren parasysh ikjet, jo vetëm nga bankat. Për shembull, ne e përdorëm atë për të llogaritur ikjen tonë - në filialet e Siberisë dhe Shën Petersburgut të Rostelecom.
"Laboratoria e analizës inteligjente të të dhënave" nga kompania "Portali kërkues "Sputnik"
Burimi: habr.com
