MĂ”nikord, et lahendada mĂ”ni probleem, tuleb sellele lihtsalt teise nurga alt vaadata. Isegi kui viimased kĂŒmme aastat on sarnaseid probleeme lahendatud sama meetodiga erineva tulemusega, ei pruugi see meetod olla ainus.
On teema, nagu klientide lahkumine. See on vĂ€ltimatu nĂ€htus, sest igal ettevĂ”tte kliendil on pĂ”hjuseid, miks nad vĂ”ivad lĂ”petada selle toodete vĂ”i teenuste kasutamise. Loomulikult ei ole lahkumine ettevĂ”tte jaoks soovitav sĂŒndmus, seega pĂŒĂŒavad kĂ”ik seda minimaalset hoida. Veel parem on prognoosida lahkumise tĂ”enĂ€osust teatud kasutajate kategooriates vĂ”i konkreetse kasutaja puhul ning pakkuda lahendusi nende sĂ€ilitamiseks.
Klienti analĂŒĂŒsida ja pĂŒĂŒda teda sĂ€ilitada, kui see on vĂ”imalik, on vajalik vĂ€hemalt jĂ€rgmistel pĂ”hjustel:
- uute klientide kaasamine on kallim kui sÀilitamine. Uute klientide kaasamiseks kulub tavaliselt teatud summad (reklaam), samas kui olemasolevaid kliente saab aktiveerida eripakkumisega, millel on erilised tingimused;
- klientide lahkumise pÔhjuste mÔistmine on vÔtmetÀhtsusega toodete ja teenuste parendamiseks.
Lahkumise prognoosimiseks on olemas standardmeetodid. Kuid ĂŒhes tehisintellekti meistrivĂ”istlustel otsustasime proovida selleks Weibulli jaotust. Seda kasutatakse kĂ”ige sagedamini ellujÀÀmise analĂŒĂŒsimiseks, ilmaennustamiseks, looduskatastroofide analĂŒĂŒsimiseks, tööstusinsenerias ja mujal. Weibulli jaotus on spetsiaalne jaotuse funktsioon, millel on kaks parameetrit.
ja
.
Vikipeedia
Ăldiselt on see huvitav asi, kuid lahkumise prognoosimiseks, ja isegi finantstehnoloogias, ei kasutata seda nii sageli. Allpool rÀÀgime, kuidas me (AndmeanalĂŒĂŒsi Labor) seda tegime, kattes kuldmedali tehisintellekti meistrivĂ”istlustel kategoorias âAI pankadesâ.
Lahkumisest ĂŒldiselt
Vaatame veidi lĂ€hemalt, mis on kliendihĂ€ving ja miks see on nii oluline. Ări jaoks on kliendibaas tĂ€htis. Sellesse baasi tulevad uued kliendid, nĂ€iteks tutvuvad nad tootega vĂ”i teenusega reklaami kaudu, elavad seal mĂ”nda aega (kasutavad aktiivselt tooteid) ja mingil hetkel lĂ”petavad selle kasutamise. Seda perioodi nimetatakse "Kliendi elutsĂŒkliks" (ingl. k. Customer Lifecycle) â see on termin, mis kirjeldab etappe, mida klient lĂ€bib, kui ta tutvub tootega, teeb ostuotsuse, maksab, kasutab ja muutub lojaalseks tarbijaks, ning lĂ”puks lĂ”petab toote kasutamise erinevatel pĂ”hjustel. Seega on hĂ€ving lĂ”ppstaadium kliendi elutsĂŒklist, mil klient lĂ”petab teenuste kasutamise, mis tĂ€hendab ettevĂ”ttele, et klient ei too enam kasumit ja ei too ĂŒldse mingit kasu.
Iga panga klient on konkreetne inimene, kes valib ĂŒhe vĂ”i teise pangakaardi spetsiaalselt oma vajaduste jaoks. Reisib sageli â sobib kaart miilidega. Ostab palju â tere, kaardikass tagasi. Ostab palju konkreetsetes kauplustes â ja selle jaoks on juba olemas spetsiaalne partnerkaart. Loomulikult valitakse kaart vahel ka kriteeriumi jĂ€rgi "odavaim teenindus". ĂhesĂ”naga, muutujaid on siin kĂŒllalt.
Inimene valib ka pangandi â miks valida panga kaart, mille filiaalid asuvad ainult Moskvas ja piirkonnas, kui sa oled Habarovskist? Olgu see pangakaart isegi kaks korda kasulikum, kuid panga filiaalide olemasolu lĂ€heduses on endiselt oluline kriteerium. Jah, 2019 on juba kĂ€es ja digitaalne on meie kĂ”ik, kuid teatud kĂŒsimusi saab mĂ”nes pangas lahendada ainult filiaalis. Pluss, jĂ€lle, osa elanikkonnast usaldab palju rohkem fĂŒĂŒsilist panka kui nutitelefoni rakendust, seda tuleb samuti arvesse vĂ”tta.
SeetÔttu vÔib inimesel olla palju erinevaid pÔhjuseid panga toodetest (vÔi pangast endast) loobumiseks. Vahetas tööd ja kaardi tarifikatsioon muutus palgakaardilt "Lihtsate surelike jaoks", mis on vÀhem kasulik. Kolis teise linna, kus ei ole pangafiliale. Ei meeldinud suhtlemine kvalifitseerimata pangatöötajaga filiaalis. Seega vÔivad pangakonto sulgemise pÔhjused olla isegi palju arvukamad kui toote kasutamise pÔhjused.
Kliendil on vĂ”imalus mitte ainult selgelt vĂ€ljendada oma kavatsust â minna panka ja kirjutada avaldus, vaid ka lihtsalt lĂ”petada toodete kasutamine, katkestamata lepingut. Just selliste probleemide lahendamiseks otsustati kasutada masinĂ”pet ja tehisintellekti.
TĂ”epoolest, klientide lahkumine vĂ”ib toimuda igas valdkonnas (telekom, internetiteenuse pakkujad, kindlustusfirmad â igal pool, kus on kliendibaas ja perioodilised tehingud).
Mida me tegime
Esmalt tuli mÀÀratleda selge piir, millal me hakkame arvestama, et klient on lahkunud. Panga jaoks, kes andis meile töötamiseks andmed, oli kliendi aktiivsuse seisund binaarne â ta oli kas aktiivne vĂ”i mitte. Andmebaasi tabelis "Aktiivsus" oli flag ACTIVE_FLAG, mille vÀÀrtuseks vĂ”is olla kas "0" vĂ”i "1" (vastavalt "Mitteaktiivne" ja "Aktiivne"). KĂ”ik oleks hĂ€sti, kuid inimene on selline, et vĂ”ib mĂ”nda aega aktiivselt kasutada, seejĂ€rel aga jÀÀda kuuks ajaks mitteaktiivseks â ta on haigena, reisib teise riiki puhkama vĂ”i katsetab hoopis teise panga kaarti. VĂ”ib-olla hakkab ta pĂ€rast pikka mitteaktiivsuse perioodi uuesti panga teenuseid kasutama.
SeetÔttu otsustasime nimetada mitteaktiivsuse perioodiks teatud katkematu ajavahemiku, mille jooksul tema flag oli seatud "0".

Kliendid muudavad mitteaktiivsed aktiivseteks pĂ€rast erineva pikkusega mitteaktiivsuse perioode. Meil on vĂ”imalus arvutada empiirilise suuruse "mitteaktiivsuse perioodide usaldusvÀÀrsus" â ehk tĂ”enĂ€osus, et inimene hakkab uuesti panga tooteid kasutama pĂ€rast ajutist mitteaktiivsust.
NÀiteks, siin diagrammil on kujutatud klientide aktiivsuse taastumist (ACTIVE_FLAG=1) pÀrast mitut kuud mitteaktiivsust (ACTIVE_FLAG=0).

Siin tÀpsustame andmestikku, millega hakkasime töötama. Pangaklient andis 19 kuu kokkuvÔtete andmed jÀrgmistes tabelites:
- "Aktiivsus" â kliendi kuised tehingud (kaardiga, internetipangas ja mobiilipangas), sealhulgas palkade laekumised ja teave kĂ€ivete kohta.
- "Kaardid" â andmed kĂ”ikide kaartide kohta, mis kliendil on, koos ĂŒksikasjaliku hinnakirjaga.
- âLepingudâ â teave kliendi lepingute kohta (nii avatud kui suletud): laenud, hoiused ja muu, igaĂŒhe parameetritega.
- âKliendidâ â demograafiliste andmete kogum (sugu ja vanus) ning kontaktandmete olemasolu.
Meie töös vajati kĂ”iki tabeleid, vĂ€lja arvatud âKaardidâ.
Siin oli keerukus veel selles, et need andmed ei nĂ€idanud, milline tegevus kaardiga toimus. Me saime aru, kas tehingud toimusid vĂ”i mitte, kuid nende tĂŒĂŒpi mÀÀramine oli juba keeruline. SeetĂ”ttu ei olnud selge, kas klient vĂ”ttis sularaha, sai palka vĂ”i kasutas raha ostude jaoks. Ja meil ei olnud ka konto saldode andmeid, mis oleks olnud kasulikud.
Valimine oli mittekatkestamata â selle lĂ”ike jaoks ei olnud pank 19 kuu jooksul teinud mingeid katseid klientide hoidmiseks ja lahkumise vĂ€hendamiseks.
Nii et nĂŒĂŒd rÀÀgime mitteaktiivsuse perioodidest.
Lahkumise mÀÀratlemiseks tuleb valida mitteaktiivsuse periood. Selleks, et luua lahkumise prognoos kindlal hetkel,
, peab olema kliendi ajalugu vÀhemalt 3 kuud antud ajavahemikus.
Meie ajalugu oli piiratud 19 kuuga, seetĂ”ttu otsustasime vĂ”tta mitteaktiivsuse perioodiks 6 kuud, kui see on olemas. Kvaliteetse prognoosi jaoks vĂ”tsime minimaalperioodiks 3 kuud. Numbrid 3 ja 6 kuud pĂ”hinevad empiiriliselt antud klientide kĂ€itumise analĂŒĂŒsil.
Lahkumise mÀÀratlesime jÀrgmiselt: kliendi lahkumise kuu
on esimene kuu, mil ACTIVE_FLAG=0, kus alates sellest kuust on ACTIVE_FLAG vÀljal jÀrjest vÀhemalt kuus nulli. TeisisÔnu, kuu, mil klient oli 6 kuud mitteaktiivne.

Lahkunud klientide arv

JÀÀnud klientide arv
Kuidas tavaliselt pĂŒstitada lahkumisprognoosi
Sarnastes vÔistlustes ja praktikas prognoositakse lahkumist sageli sellisel viisil. Klient kasutab tooteid ja teenuseid erinevates ajavahemikes, tema suhtluse andmed esitatakse fikseeritud pikkusega tunnuste vektorina n. Enamasti sisaldavad need andmed:
- Kliendi iseloomustavad andmed (demograafilised andmed, turunduse segment).
- Panga toodete ja teenuste kasutamise ajalugu (need on tegevused, mis on alati seotud konkreetse aja vÔi soovitud ajavahemiku perioodiga).
- VĂ€listeavet, kui seda on Ă”nnestunud hankida â nĂ€iteks sotsiaalmeedia arvustused.
Ja alles pĂ€rast seda antakse igale ĂŒlesandele vĂ€lja lahendus klientide lahkumise mÀÀratlemiseks. SeejĂ€rel kasutatakse masinĂ”ppe algoritmi, mis ennustab kliendi lahkumise tĂ”enĂ€osust
tuginedes tegurite vektorile
. Algoritmi treenimiseks kasutatakse ĂŒhte tuntud otsustuspuude ansamblite raamistikku, , , vĂ”i nende modifikatsioone.
Isegi algoritm on hea, kuid just klienditeeninduse prognoosimise osas on tal mitmeid tÔsiseid puudusi.
- Talle ei meeldi nn âmĂ€luâ. Mudelile edastatakse etteantud arv tunnuseid, mis vastavad praegusele ajahetkele. Ajaloo teabe sisestamiseks muudatuste kohta on vajalik arvutada erilisi tunnuseid, mis iseloomustavad parameetrite muutusi ajas, nĂ€iteks pangatehingute arvu vĂ”i summa viimase 1, 2, 3 kuu jooksul. Selline lĂ€henemine vĂ”ib vaid osaliselt peegeldada ajaliselt muutuvate andmete olemust.
- MÀÀratud prognoosihorisont. Mudel suudab prognoosida klienditeeninduse lahkumist ainult eelnevalt mÀÀratud ajavahemikuks, nĂ€iteks kuu aja prognoosiks. Kui on vajalik prognoos teise ajavahemiku kohta, nĂ€iteks kolme kuu kohta, siis tuleb ĂŒmber ehitada treenimisnĂ€idist ja uut mudelit uuesti treenida.
Meie lÀhenemine
Otsustasime kohe, et ei kasuta standardseid lĂ€henemisi. Meie kĂ”rval registreerus meistrivĂ”istlustel veel 497 osalejat, kellest igaĂŒhel oli muljetavaldav kogemus. Seega sellistes tingimustes standardse skeemi jĂ€rgimine â ei ole parim idee.
Ja hakkasime lahendama mudeli binaarse klassifitseerimisega seotud probleeme, kasutades kliendi lahkumise tĂ”enĂ€osuse jaotuse prognoosimist. Sarnast lĂ€henemist saab vaadata , see vĂ”imaldab paindlikumalt prognoosida lahkumist ja testida keerukamaid hĂŒpoteese kui klassikaline lĂ€henemine. Lahkumise aja modelleerimise jaotuste haru valisime selle laialdase rakendamise pĂ€rast ellujÀÀmise analĂŒĂŒsis. Kliendi kĂ€itumist vĂ”ib vaadelda kui mingisugust ellujÀÀmist.
Siin on nÀited Weibulli tÔenÀosusjaotuste jaotumisest sÔltuvalt parameetritest.
ja
:

See on kolmest erinevast kliendist kliendi lahkumise tÔenÀosuse jaotuse tihedus ajas. Aeg on esitatud kuudes. TeisisÔnu, see graafik nÀitab, millal on kÔige tÔenÀolisem, et klient lahkub jÀrgmise kahe kuu jooksul. Nagu nÀha, on kliendil, kellel on jaotus, suurem potentsiaal lahkuda varem kui klientidel, kellel on Weibulli jaotused (2, 0,5) ja Weibulli jaotused (3,1).
Tulemusena saadakse mudel, mis iga kliendi jaoks igaks
kuuks prognoosib Weibulli jaotuse parameetreid, mis kÔige paremini peegeldavad lahkumise tÔenÀosuse tekkimist aja jooksul. TÀiendavalt:
- SihtmĂ€rkide tunnused koolituskogumis â aeg, mis on jÀÀnud lahkumiseni konkreetse kuu jooksul konkreetse kliendi jaoks.
- Kui kliendi lahkumise nÀitajat pole, eeldame, et lahkumise aeg on suurem kui kuude arv alates praegusest hetkest kuni olemasoleva ajalooga.
- Kasutatav mudel: rekurssne nÀrvivÔrk LSTM-kihiga.
- Kahjufunktsioonina kasutame Weibulli jaotuse negatiivset logaritmilist tÔenÀosusfunktsiooni.
Siin on meetodi plussid:
- TĂ”enĂ€osusjaotus, lisaks ilmselgele vĂ”imalusele binaarseks klassifitseerimiseks, vĂ”imaldab paindlikult prognoosida erinevaid sĂŒndmusi, nĂ€iteks kas klient lĂ”petab panga teenuste kasutamise kolme kuu jooksul. Samuti saab seda jaotust kasutada erinevate nĂ€itajate keskmistamiseks, kui see on vajalik.
- Rekurssne nÀrvivÔrk LSTM-l on mÀlu ja see kasutab tÔhusalt kogu olemasolevat ajalugu. Ajaloo laiendamise vÔi tÀpsustamise korral tÀpsus suureneb.
- Seda lÀhenemist saab probleemideta skaleerida ajavahemike jaotamisel vÀiksemateks (nÀiteks kuude jaotamine nÀdalateks).
Kuid hea mudeli loomine ei piisa, tuleb ka Ôige kvaliteet hindamine.
Kuidas kvaliteeti hinnati
Kvaliteedi mÔÔdikuks valisime Lift Curve. Seda kasutatakse Ă€ritegevuses sarnastes olukordades selle arusaadava tĂ”lgendamise tĂ”ttu, see on hĂ€sti kirjeldatud ja . Kui selle mÔÔdiku tĂ€hendust ĂŒhes lauses describeerida, siis see kĂ”laks "Mitu korda algoritm teeb paremat prognoosi esimestel
% vÔrreldes juhusliku valikuga."
Treeni mudeleid.
Konkurentsi tingimustes ei olnud kindlat kvaliteedimeetrit, mille alusel oleks vĂ”imalik vĂ”rrelda erinevaid mudeleid ja lĂ€henemisviise. Veelgi enam, lahkumise mĂ”isted vĂ”ivad olla erinevad ja sĂ”ltuda ĂŒlesande mÀÀratlemisest, mille omakorda mÀÀravad Ă€rieesmĂ€rgid. Seega, et mĂ”ista, milline meetod on parem, koolitasime kahte mudelit:
- Sageli kasutatav lÀhenemine binaarse klassifitseerimisega, kasutades otsustuspuude ensemblese masinÔppe algoritmi ();
- Weibull-LSTM mudel
Testigrupp koosnes 500 eelnevalt valitud kliendist, keda ei olnud koolitusgrupis. Mudeli jaoks tehti hĂŒperparameetrite valimine klientide lĂ”ikes lĂ€bi ristvalideerimise. Iga mudeli koolitamiseks kasutati samu tunnuste komplekte.
Arvestades, et mudel ei oma mĂ€lu, kasutati selle jaoks spetsiaalseid tunnuseid, mis nĂ€itasid ĂŒhe kuu parameetrite muutumise suhet viimase kolme kuu keskmise vÀÀrtusega. See iseloomustas viimase kolme kuu jooksul vÀÀrtuste muutumise kiirust. Ilma selleta oleks Random Forest baasil mudel eelnevalt ebasoodsas positsioonis vĂ”rreldes Weibull-LSTM-iga.
Miks on LSTM Weibulli jaotuse pÔhjal parem kui otsustuspuude ensemble'l pÔhinev lÀhenemine
Siin on kÔik selgelt nÀidatud paar pildi kaudu.

Lift Curve'i vÔrdlus klassikalise algoritmi ja Weibull-LSTM vahel

Lift Curve'i metoodika vÔrdlus kuude lÔikes klassikalise algoritmi ja Weibull-LSTM vahel
Ăldiselt on LSTM peaaegu igas olukorras klassikalisest algoritmist parem.
Lahkumise ennustamine
Weibulli jaotuse pÔhjal LSTM rakendatud korduva nÀrvivÔrgu mudel suudab lahkumist ette ennustada, nÀiteks ennustada kliendi lahkumist jÀrgmise n kuu jooksul. Vaatame juhtumit, kus n = 3. Sellisel juhul peab iga kuu nÀrvivÔrk Ôigesti mÀÀrama: kas klient lahkub alates jÀrgmisest kuust kuni n-kuu jooksul. TeisisÔnu, ta peab Ôigesti mÀÀrama, kas klient jÀÀb pÀrast n kuud. Seda vÔib pidada eelnevaks prognoosiks: hetk, mil klient hakkab mÔtlema lahkumisele.
VÔrreldame Weibull-LSTM Lift Curve'i 1, 2 ja 3 kuud enne lahkumist:

Oleme juba varem maininud, et olulised on ka prognoosid, mis on tehtud klientide kohta, kes on aktiivsest kasutusest mĂ”neks ajaks vĂ€lja langenud. SeetĂ”ttu lisame siia valimisse olukorrad, kui lahkunud klient oli juba ĂŒks vĂ”i kaks kuud mitteaktiivne, ja kontrollime, et Weibull-LSTM i suudaks sellised juhtumid Ă”igesti lahus hoidmiseks klassifitseerida. Kuna sarnased juhtumid olid valimis olemas, siis ootame, et mudel suudab nendega hĂ€sti hakkama saada:

Klientide hoidmine
See on tegelikult peamine, mida saate teha, kui teil on kĂ€es teave, et teatud kliendid kavatsevad lĂ”petada toote kasutamise. RÀÀkides mudeli loomisest, mis vĂ”iks klientidele soovitada midagi, et neid hoida â seda ei saa teha, kui teil pole ajalooandmeid sarnaste hĂ€sti lĂ”ppenud katsete kohta.
Meil sellist ajalugu ei olnud, seega otsustasime selle viisi.
- Loome mudeli, mis mÀÀratleb iga kliendi huvitavad tooted.
- Igas kuus kÀivitame klassifitseerija ja mÀÀrame potentsiaalselt lahkuvad kliendid.
- MÔnele kliendile pakume toodet vastavalt punktis 1 kirjeldatud mudelile ja salvestame oma tegevuse.
- MÔne kuu pÀrast vaatame, kes neist potentsiaalselt lahkuvad klientidest on lahkunud ja kes on jÀÀnud. Nii moodustame Ôppimisvalimi.
- Koolitame mudelit ajaloo pealt, mille saime punktis 4.
- Valikuline: kordame protseduuri, asendades punktis 1 toodud mudeli punktis 5 saadud mudeliga.
A/Đ-testimise kaudu saab kontrollida sellise hoidmise kvaliteeti â jagame potentsiaalselt lahkuvad kliendid kaheks rĂŒhmaks. Ăhele pakume tooteid meie hoidmisemudeli pĂ”hjal, teisele ei paku me midagi. Otsustasime koolitada mudelit, mis vĂ”iks kasu tuua juba meie nĂ€ite punktis 1.
Soovisime, et segmenteerimine oleks maksimaalselt tĂ”lgendatav. SeetĂ”ttu valisime mĂ”ned omadused, mida oleks lihtne tĂ”lgendada: tehingute koguarv, palk, konto koguvool, vanus, sugu. âKaardidâ tabelist ei vĂ”etud omadusi arvesse, kuna need on vĂ€he informatiivsed, ja âLepingudâ tabelist omadused â komplitseeritud töötlemise tĂ”ttu, et vĂ€ltida andmete lekkeid valideerimisja kohaliku vĂ€ltimise vahel.
Klastri loomine toimus Gaussiani segamudelite abil. Akaike teavet kriteerium aitas mÀÀrata 2 optimaalset lahendust. Esimene optimaalse lahendus vastab 1 klastrile. Teine, vĂ€hem vĂ€ljendunud, vastab 80 klastrile. Selle tulemuse pĂ”hjal vĂ”ib teha jĂ€rgmise jĂ€relduse: andmeid on ÀÀrmiselt keeruline jagada klastriteks ilma eeloleva teabeta. Kvaliteetseks klasterdamiseks on vajalikud andmed, mis kirjeldavad iga kliendi ĂŒksikasjalikult.
SeetĂ”ttu vaadati ĂŒle juhendatud Ă”ppe ĂŒlesanne, et pakkuda igale kliendile tema toodet. Arvesse vĂ”eti jĂ€rgmised tooted: âTĂ€htajaline hoiustusâ, âKrediitkaartâ, âĂlekatte vĂ”imalusâ, âTarbijalaenâ, âAutolaenâ, âHĂŒpokatekaâ.
Andmetes oli veel ĂŒks toote tĂŒĂŒp: âJooksev kontoâ. Kuid me ei vaadanud seda vĂ€ikese informatiivsuse tĂ”ttu. Panga klientide seas, kes pole lĂ”petanud tema toodete kasutamist, ehitati mudel, mis ennustab, milline toode vĂ”iks neid huvitada. Mudeliks valiti logistiline regressioon ning kvaliteedi hindamiseks kasutati Lift vÀÀrtust esimese 10 protsentiili jaoks.
Mudeli kvaliteeti saab hinnata jooniselt.

Toodete soovituste mudeli tulemused klientidele
KokkuvÔte
See lĂ€henemine tĂ”i meile esikoha âAI pangandusesâ nominatsioonis 2017. aasta RAIF-Challenge tehisintellekti vĂ”istlusel.

Tundub, et peamine oli siiski probleemile lÀheneda mitte kÔige tavalisemalt ja kasutada meetodit, mida tavaliselt kasutatakse teistes olukordades.
Kuigi massiline kasutajate vÀljavool vÔib olla teenustele tÔeline looduskatastroof.
Seda meetodit saab rakendada ka igas muus valdkonnas, kus on oluline arvestada kasutajate vÀljavoolu, mitte ainult pankade puhul. NÀiteks kasutasime seda ka meie enda vÀljavoolu arvutamiseks - Siberi ja Peterburi Rossotelecomi filiaalides.
âIntelligentse andmeanalĂŒĂŒsi laborâ ettevĂ”te âOtsinguportaal âSputnikâ
Allikas: habr.com
