Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.

Parfois, pour rĂ©soudre un problĂšme, il suffit de le regarder sous un autre angle. MĂȘme si, au cours des dix derniĂšres annĂ©es, des problĂšmes similaires ont Ă©tĂ© rĂ©solus de la mĂȘme maniĂšre avec des effets diffĂ©rents, il n'est pas certain que cette mĂ©thode soit la seule.

Il existe un phĂ©nomĂšne appelĂ© dĂ©part des clients. C'est quelque chose d'inĂ©vitable, car les clients de chaque entreprise peuvent cesser d'utiliser ses produits ou services pour de nombreuses raisons. Il va sans dire que pour une entreprise, le dĂ©part, mĂȘme s'il est naturel, n'est pas l'action la plus souhaitable, donc tout le monde essaie de minimiser ce dĂ©part. Mieux encore, anticiper la probabilitĂ© de dĂ©part d'une certaine catĂ©gorie d'utilisateurs ou d'un utilisateur spĂ©cifique et proposer des mesures pour les retenir.

Il est nécessaire d'analyser et d'essayer de retenir le client, si possible, pour au moins les raisons suivantes :

  • l'acquisition de nouveaux clients coĂ»te plus cher que les procĂ©dures de rĂ©tention.. L'acquisition de nouveaux clients nĂ©cessite gĂ©nĂ©ralement un certain investissement d'argent (publicitĂ©), tandis que les clients existants peuvent ĂȘtre rĂ©activĂ©s par une offre spĂ©ciale avec des conditions particuliĂšres ;
  • la comprĂ©hension des raisons du dĂ©part des clients est la clĂ© de l'amĂ©lioration des produits et services..

Il existe des approches standard pour prĂ©dire le dĂ©part. Mais lors d'un des championnats d'IA, nous avons dĂ©cidĂ© d'essayer pour cela la distribution de Weibull. Elle est le plus souvent utilisĂ©e pour l'analyse de survie, la prĂ©vision mĂ©tĂ©o, l'analyse des catastrophes naturelles, l'ingĂ©nierie industrielle, et des domaines similaires. La distribution de Weibull est une fonction de distribution spĂ©ciale, paramĂ©trĂ©e par deux paramĂštres. Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle. et Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle..

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.
Wikipedia

En général, c'est un sujet intéressant, mais pour la prédiction du départ, et en général dans le secteur fintech, elle n'est pas utilisée trÚs fréquemment. Dans l'article, nous expliquerons comment nous (le Laboratoire d'analyse intellectuelle des données) avons fait cela, remportant au passage l'or au Championnat d'intelligence artificielle dans la catégorie « IA dans les banques ».

Concernant le départ en général.

Examinons un peu ce qu'est le taux de dĂ©sabonnement des clients et pourquoi il est si important. Pour une entreprise, la base de clients est essentielle. De nouveaux clients arrivent dans cette base, par exemple, en dĂ©couvrant un produit ou un service par la publicitĂ©, ils restent un certain temps (utilisent activement les produits) et, au bout d'un moment, cessent de les utiliser. Cette pĂ©riode est appelĂ©e « Cycle de vie du client » (en anglais, Customer Lifecycle) — c'est un terme qui dĂ©crit les Ă©tapes qu'un client traverse lorsqu'il dĂ©couvre un produit, prend une dĂ©cision d'achat, paie, utilise et devient un consommateur fidĂšle, puis finit par cesser d'utiliser pour diverses raisons les produits. Ainsi, le dĂ©sabonnement est la derniĂšre Ă©tape du cycle de vie du client, oĂč le client cesse d'utiliser les services, et pour l'entreprise, cela signifie que le client a cessĂ© de gĂ©nĂ©rer des bĂ©nĂ©fices et de fournir quoi que ce soit d'utile.

Chaque client d'une banque est une personne spĂ©cifique qui choisit une carte bancaire en fonction de ses besoins. Voyage souvent — une carte avec des miles sera utile. Fait beaucoup d'achats — bienvenue, carte avec cashback. AchĂšte beaucoup dans certaines boutiques — pour cela, il existe dĂ©jĂ  une carte partenaire spĂ©ciale. Bien sĂ»r, parfois, la carte est choisie selon le critĂšre « Le service le moins cher ». En somme, il y a beaucoup de variables.

De plus, une personne choisit elle-mĂȘme sa banque — quel est le sens de choisir une carte d'une banque dont les agences ne se trouvent qu'Ă  Moscou et dans ses environs, alors que vous ĂȘtes de Khabarovsk ? MĂȘme si la carte de cette banque est deux fois plus avantageuse, la proximitĂ© des agences de la banque reste un critĂšre important. Oui, 2019 est dĂ©jĂ  lĂ  et le numĂ©rique est tout, mais certaines questions avec certaines banques peuvent ĂȘtre rĂ©solues uniquement en agence. De plus, encore une fois, une partie de la population accorde beaucoup plus de confiance Ă  une banque physique qu'Ă  une application sur smartphone, c'est aussi Ă  prendre en compte.

En consĂ©quence, les raisons d'abandonner les produits d'une banque (ou mĂȘme la banque elle-mĂȘme) peuvent ĂȘtre multiples. Changement de travail et le tarif de la carte est passĂ© de « salaire » Ă  « Pour les simples mortels », qui est moins avantageux. DĂ©mĂ©nagement dans une autre ville oĂč il n'y a pas d'agences de la banque. Mauvaise expĂ©rience avec un opĂ©rateur peu qualifiĂ© dans une agence. Ainsi, les raisons de fermer un compte peuvent ĂȘtre beaucoup plus nombreuses que celles pour utiliser un produit.

De plus, un client peut non seulement exprimer clairement son intention — se rendre Ă  la banque et Ă©crire une demande, mais simplement arrĂȘter d'utiliser les produits, sans rompre le contrat. Pour comprendre de telles problĂ©matiques, il a Ă©tĂ© dĂ©cidĂ© d'utiliser l'apprentissage automatique et l'IA.

En outre, le dĂ©part des clients peut se produire dans n'importe quel secteur (tĂ©lĂ©communications, fournisseurs d'accĂšs Internet, compagnies d'assurance, en gros, partout oĂč il y a une base de clients et des transactions pĂ©riodiques).

Ce que nous avons fait

Tout d'abord, il fallait dĂ©crire une limite claire — Ă  partir de quel moment nous commençons Ă  considĂ©rer qu'un client est parti. Du point de vue de la banque qui nous a fourni les donnĂ©es pour travailler, l'Ă©tat d'activitĂ© du client Ă©tait binaire — il est soit actif, soit inactif. Il y avait un drapeau ACTIVE_FLAG dans la table «Activité», dont la valeur pouvait ĂȘtre soit «0», soit «1» (respectivement, «Inactif» et «Actif»). Et tout aurait Ă©tĂ© bien, mais une personne peut utiliser activement les services pendant un certain temps, puis devenir inactive pendant un mois — tomber malade, partir en vacances dans un autre pays ou mĂȘme commencer Ă  tester la carte d'une autre banque. Ou peut-ĂȘtre, aprĂšs une longue pĂ©riode d'inactivitĂ©, recommencer Ă  utiliser les services de la banque.

C'est pourquoi nous avons décidé de désigner une période d'inactivité comme une certaine période continue durant laquelle le drapeau pour elle était défini comme «0».

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.

Les clients passent d'inactifs Ă  actifs aprĂšs des pĂ©riodes d'inactivitĂ© de diffĂ©rentes longueurs. Nous avons la possibilitĂ© de calculer le degrĂ© de la grandeur empirique «fiabilitĂ© des pĂ©riodes d'inactivité» — c'est-Ă -dire la probabilitĂ© qu'une personne recommence Ă  utiliser les produits de la banque aprĂšs une pĂ©riode d'inactivitĂ©.

Par exemple, ce graphique montre la reprise de l'activité (ACTIVE_FLAG=1) des clients aprÚs plusieurs mois d'inactivité (ACTIVE_FLAG=0).

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.

Ici, nous allons préciser un peu le jeu de données avec lequel nous avons commencé à travailler. Ainsi, la banque a fourni des informations agrégées sur 19 mois dans les tableaux suivants :

  • «Activité» — les transactions mensuelles des clients (par cartes, dans la banque en ligne et la banque mobile), y compris les versements de salaires et les informations sur les transactions.
  • «Cartes» — donnĂ©es sur toutes les cartes que possĂšde le client, avec un tableau tarifaire dĂ©taillĂ©.
  • «Contrats» — informations sur les contrats du client (ouverts et fermĂ©s) : crĂ©dits, dĂ©pĂŽts et autres, avec les paramĂštres de chacun.
  • «Clients» — ensemble de donnĂ©es dĂ©mographiques (sexe et Ăąge) et existence de donnĂ©es de contact.

Pour notre travail, nous avions besoin de toutes les tables, sauf celle des «Cartes».

La difficultĂ© ici Ă©tait autre — dans ces donnĂ©es, la banque ne spĂ©cifiait pas quelle activitĂ© avait eu lieu avec les cartes. Autrement dit, nous pouvions savoir s'il y avait eu des transactions ou non, mais nous ne pouvions pas dĂ©terminer leur type. Donc, il Ă©tait flou de savoir si le client avait retirĂ© des espĂšces, si son salaire avait Ă©tĂ© versĂ©, ou s'il avait dĂ©pensĂ© de l'argent pour des achats. De plus, nous n'avions pas de donnĂ©es sur les soldes des comptes, ce qui aurait Ă©tĂ© utile.

L'Ă©chantillon lui-mĂȘme Ă©tait non biaisĂ© — sur cette tranche, pendant 19 mois, la banque n'avait entrepris aucune tentative de fidĂ©lisation des clients ou de minimisation du flux sortant.

Parlons des périodes d'inactivité.

Pour formuler une dĂ©finition du dĂ©sabonnement, il faut choisir une pĂ©riode d'inactivitĂ©. Pour crĂ©er une projection de dĂ©sabonnement Ă  un moment donnĂ©, Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.il est nĂ©cessaire d'avoir l'historique des clients sur au moins 3 mois dans l'intervalle Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.. Notre historique Ă©tait limitĂ© Ă  19 mois, donc nous avons dĂ©cidĂ© de prendre une pĂ©riode d'inactivitĂ© de 6 mois, si elle existait. Et nous avons pris 3 mois comme pĂ©riode minimale pour une prĂ©vision de qualitĂ©. Les chiffres de 3 et 6 mois ont Ă©tĂ© pris empiriquement sur la base de l'analyse du comportement de ces clients.

Nous avons formulĂ© la dĂ©finition du dĂ©sabonnement comme suit : le mois de dĂ©sabonnement d'un client Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle. est le premier mois avec ACTIVE_FLAG=0, oĂč Ă  partir de ce mois, il y a au moins six zĂ©ros consĂ©cutifs dans le champ ACTIVE_FLAG, en d'autres termes, le mois Ă  partir duquel le client a Ă©tĂ© inactif pendant 6 mois.

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.
Nombre de clients partis

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.
Nombre de clients restants

Comment le désabonnement est-il généralement considéré

Dans de telles compétitions, et en pratique en général, le désabonnement est souvent prédit de cette maniÚre. Le client utilise des produits et services à différents intervalles de temps, les données sur son interaction sont représentées sous la forme d'un vecteur de caractéristiques de longueur fixe n. Le plus souvent, cette information comprend :

  • DonnĂ©es caractĂ©risant l'utilisateur (donnĂ©es dĂ©mographiques, segment marketing).
  • Historique d'utilisation des produits et services bancaires (ce sont des actions des clients qui sont toujours liĂ©es Ă  un moment donnĂ© ou Ă  une pĂ©riode de l'intervalle souhaitĂ©).
  • DonnĂ©es externes, si elles ont pu ĂȘtre obtenues — par exemple, des avis provenant des rĂ©seaux sociaux.

Et c'est seulement aprĂšs cela qu'ils Ă©tablissent une dĂ©finition de l'attrition, propre Ă  chaque tĂąche. Ensuite, ils utilisent un algorithme d'apprentissage machine qui prĂ©dit la probabilitĂ© de dĂ©part du client. Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle. sur la base d'un vecteur de facteurs. Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.. Pour entraĂźner l'algorithme, ils utilisent l'un des frameworks bien connus de construction d'ensembles d'arbres dĂ©cisionnels, cuML, LightGBM, CatBoost ou leurs modifications.

L'algorithme en soi est bon, mais en ce qui concerne la prévision de l'attrition, il présente plusieurs inconvénients sérieux.

  • Il n'a pas ce qu'on appelle 'la mĂ©moire'.À l'entrĂ©e du modĂšle, un certain nombre de caractĂ©ristiques correspondant au moment actuel sont fournies. Pour intĂ©grer des informations sur l'historique des changements de paramĂštres, il est nĂ©cessaire de calculer des caractĂ©ristiques spĂ©ciales, qui dĂ©crivent les changements de paramĂštres dans le temps, par exemple le nombre ou le total des transactions bancaires des 1, 2, 3 derniers mois. Cette approche ne peut que partiellement reflĂ©ter la nature des changements temporels.
  • Horizon de prĂ©vision fixe. Le modĂšle est capable de prĂ©dire l'attrition des clients uniquement sur un intervalle de temps prĂ©alablement dĂ©fini, par exemple, une prĂ©vision pour un mois Ă  venir. Si une prĂ©vision pour un autre intervalle de temps est requise, par exemple, pour trois mois, il faut reconstruire l'Ă©chantillon d'entraĂźnement et rĂ©entraĂźner un nouveau modĂšle.

Notre approche

Nous avons immédiatement décidé de ne pas utiliser les approches standards. Dans le championnat, 497 autres personnes se sont également inscrites, chacune ayant une solide expérience. Donc, essayer de faire quelque chose selon un schéma standard dans de telles conditions n'est pas la meilleure idée.

Et nous avons commencĂ© Ă  rĂ©soudre les problĂšmes posĂ©s par le modĂšle de classification binaire en prĂ©disant la distribution probabiliste du temps d'attrition des clients. Une telle approche peut ĂȘtre consultĂ©e ici, elle permet de prĂ©dire l'attrition de maniĂšre plus flexible et de vĂ©rifier des hypothĂšses plus complexes que dans l'approche classique. Comme famille de distributions modĂ©lisant le temps d'attrition, nous avons choisi la distribution Weibull pour son utilisation Ă©tendue dans l'analyse de la survie. Le comportement du client peut ĂȘtre considĂ©rĂ© comme une sorte de survie.

Voici des exemples de distributions de densitĂ©s de probabilitĂ© de Weibull en fonction des paramĂštres Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle. et Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.:

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.

C'est la densité de distribution de la probabilité de désabonnement de trois clients différents au fil du temps. Le temps est représenté en mois. En d'autres termes, ce graphique montre quand il est le plus probable qu'un client se désabonne dans les deux mois suivants. Comme on peut le constater, le client avec cette distribution a un potentiel de désabonnement plus tÎt que les clients avec les distributions Weibull(2, 0.5) et Weibull(3,1).

En fin de compte, nous obtenons un modÚle qui prédit pour chaque client, pour n'importe quel
mois, les paramĂštres de la distribution de Weibull, reflĂ©tant au mieux l'arrivĂ©e de la probabilitĂ© de dĂ©sabonnement au fil du temps. Pour ĂȘtre plus prĂ©cis :

  • Les caractĂ©ristiques cibles dans l'Ă©chantillon d'apprentissage sont le temps restant avant le dĂ©sabonnement pour un mois spĂ©cifique pour un client spĂ©cifique.
  • S'il n'y a pas d'indicateur de dĂ©sabonnement pour un client, nous supposons que le temps de dĂ©sabonnement est supĂ©rieur au nombre de mois Ă©coulĂ©s depuis le dĂ©but de l'histoire que nous avons.
  • ModĂšle utilisĂ© : rĂ©seau de neurones rĂ©current avec couche LSTM.
  • Nous utilisons comme fonction de perte la fonction de vraisemblance logarithmique nĂ©gative pour la distribution de Weibull.

Voici les avantages de cette méthode :

  • La distribution de probabilitĂ©, en plus de la possibilitĂ© Ă©vidente de classification binaire, permet de prĂ©dire de maniĂšre flexible diffĂ©rents Ă©vĂ©nements, par exemple, si un client continuera Ă  utiliser les services de la banque dans les 3 mois. De plus, si nĂ©cessaire, diffĂ©rentes mĂ©triques peuvent ĂȘtre moyennĂ©es selon cette distribution.
  • Le rĂ©seau de neurones rĂ©current LSTM a de la mĂ©moire et utilise efficacement toute l'histoire disponible. Avec l'expansion ou le raffinement de l'histoire, la prĂ©cision augmente.
  • L'approche peut facilement ĂȘtre Ă©voluĂ©e en divisant les intervalles de temps en plus petites unitĂ©s (par exemple, en divisant les mois en semaines).

Mais il ne suffit pas de créer un bon modÚle, il faut aussi évaluer correctement sa qualité.

Comment la qualité a été évaluée

Nous avons choisi comme mĂ©trique la Lift Curve. Elle est couramment utilisĂ©e dans le monde des affaires pour des cas similaires grĂące Ă  son interprĂ©tation claire, elle est bien dĂ©crite ici et ici. Pour rĂ©sumer le sens de cette mĂ©trique en une phrase, cela donnerait « Combien de fois l'algorithme fait meilleure prĂ©diction dans les premiers Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.% par rapport Ă  un tirage alĂ©atoire ».

Nous entraĂźnons les modĂšles

Les conditions de la compétition n'ont pas établi de métrique de qualité précise pour comparer différents modÚles et approches. De plus, la définition du concept de désabonnement peut varier et dépendre des objectifs d'affaires. Ainsi, pour déterminer quel méthode est la meilleure, nous avons formé deux modÚles :

  1. Une approche couramment utilisée de classification binaire avec un algorithme d'ensemble d'arbres décisionnels (LightGBM);
  2. ModĂšle Weibull-LSTM

L'Ă©chantillon de test Ă©tait composĂ© de 500 clients prĂ©alablement sĂ©lectionnĂ©s qui n'Ă©taient pas dans l'Ă©chantillon d'entraĂźnement. Les hyperparamĂštres du modĂšle ont Ă©tĂ© ajustĂ©s en utilisant une validation croisĂ©e basĂ©e sur les clients. Les mĂȘmes ensembles de caractĂ©ristiques ont Ă©tĂ© utilisĂ©s pour former chaque modĂšle.

Étant donnĂ© que le modĂšle n'a pas de mĂ©moire, des caractĂ©ristiques spĂ©cifiques ont Ă©tĂ© sĂ©lectionnĂ©es pour montrer la relation entre le changement des paramĂštres d'un mois par rapport Ă  la moyenne des paramĂštres des trois derniers mois. Cela caractĂ©risait la vitesse de changement des valeurs au cours de la pĂ©riode de trois mois prĂ©cĂ©dente. Sans cela, le modĂšle basĂ© sur Random Forest serait dĂ©savantagĂ© par rapport au Weibull-LSTM.

Pourquoi le LSTM avec une distribution de Weibull est-il meilleur qu'une approche basée sur un ensemble d'arbres décisionnels ?

Tout est clairement illustré par quelques images.

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.
Comparaison de la courbe de lift pour l'algorithme classique et le Weibull-LSTM

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.
Comparaison de la métrique de courbe de lift par mois pour l'algorithme classique et le Weibull-LSTM

Dans l'ensemble, le LSTM surpasse l'algorithme classique presque dans tous les cas.

Prédiction du désabonnement

Le modĂšle basĂ© sur un rĂ©seau de neurones rĂ©currents avec des cellules LSTM et une distribution de Weibull peut prĂ©dire le dĂ©sabonnement Ă  l'avance, par exemple, prĂ©dire le dĂ©part d'un client au cours des n prochains mois. ConsidĂ©rons le cas pour n = 3. Dans ce cas, pour chaque mois, le rĂ©seau de neurones doit dĂ©terminer correctement : le client partira-t-il, Ă  partir du mois suivant jusqu'au n-iĂšme mois ? En d'autres termes, il doit dĂ©terminer correctement si le client restera aprĂšs n mois. Cela peut ĂȘtre considĂ©rĂ© comme une prĂ©vision anticipĂ©e : prĂ©dire le moment oĂč le client commence Ă  penser Ă  partir.

Comparons la courbe de lift pour le Weibull-LSTM 1, 2 et 3 mois avant le désabonnement :

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.

Nous avons dĂ©jĂ  mentionnĂ© ci-dessus que les prĂ©visions pour les clients inactifs pendant un certain temps sont Ă©galement importantes. Pour cela, nous ajouterons Ă  l'Ă©chantillon les cas oĂč un client parti a dĂ©jĂ  Ă©tĂ© inactif pendant un ou deux mois, et nous vĂ©rifierons que le Weibull-LSTM classifie correctement ces cas comme des dĂ©parts. Étant donnĂ© que ces cas Ă©taient prĂ©sents dans l'Ă©chantillon, nous nous attendons Ă  ce que le rĂ©seau les gĂšre bien :

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.

Fidélisation des clients

C'est en fait la principale chose à faire lorsque l'on dispose d'informations indiquant que certains clients sont sur le point de cesser d'utiliser le produit. Pour construire un modÚle capable de proposer quelque chose d'utile aux clients afin de les fidéliser, cela ne sera pas possible si vous n'avez pas d'historique d'essais similaires qui se sont bien terminés.

Nous n'avons pas eu un tel historique, c'est pourquoi nous avons décidé de le faire ainsi.

  1. Nous construisons un modÚle qui détermine les produits intéressants pour chaque client.
  2. Chaque mois, nous exécutons le classificateur et identifions les clients potentiellement sur le départ.
  3. Nous proposons le produit à une partie des clients, conformément au modÚle du point 1, et nous mémorisons nos actions.
  4. AprÚs quelques mois, nous examinons qui parmi ces clients potentiellement sur le départ est parti et qui est resté. Nous formons ainsi un échantillon d'apprentissage.
  5. Nous entraĂźnons le modĂšle sur l'historique obtenu au point 4.
  6. En option, nous répétons la procédure en remplaçant le modÚle du point 1 par le modÚle obtenu au point 5.

La vĂ©rification de la qualitĂ© de cette fidĂ©lisation peut se faire par un simple A/B testing : nous divisons les clients potentiellement sur le dĂ©part en deux groupes. À l'un, nous proposons des produits basĂ©s sur notre modĂšle de fidĂ©lisation, Ă  l'autre, nous ne proposons rien. Nous avons dĂ©cidĂ© d'entraĂźner un modĂšle qui pourrait ĂȘtre utile dĂšs le point 1 de notre exemple.

Nous souhaitions rendre la segmentation aussi interprĂ©table que possible. Pour cela, nous avons sĂ©lectionnĂ© plusieurs caractĂ©ristiques qui pouvaient ĂȘtre facilement interprĂ©tĂ©es : le nombre total de transactions, le salaire, le chiffre d'affaires total sur le compte, l'Ăąge, le sexe. Les caractĂ©ristiques de la table "Cartes" n'ont pas Ă©tĂ© prises en compte pour leur manque d'information, et les caractĂ©ristiques de la table 3 "Contrats" pour des raisons de complexitĂ© de traitement afin d'Ă©viter une fuite de donnĂ©es entre l'ensemble de validation et l'ensemble d'apprentissage.

La classification a Ă©tĂ© effectuĂ©e Ă  l'aide de modĂšles de mĂ©lange gaussien. Le critĂšre d'information d'Akaike a permis de dĂ©terminer 2 maxima. Le premier maximum correspond Ă  1 cluster. Le deuxiĂšme maximum, moins prononcĂ©, correspond Ă  80 clusters. À partir de ce rĂ©sultat, on peut conclure que les donnĂ©es sont trĂšs difficiles Ă  diviser en clusters sans information a priori. Pour une classification de meilleure qualitĂ©, des donnĂ©es dĂ©crivant en dĂ©tail chaque client sont nĂ©cessaires.

Ainsi, nous avons considĂ©rĂ© la tĂąche d'apprentissage supervisĂ© afin de proposer Ă  chaque client un produit distinct. Les produits suivants ont Ă©tĂ© envisagĂ©s : « DĂ©pĂŽt Ă  terme », « Carte de crĂ©dit », « DĂ©couvert », « PrĂȘt Ă  la consommation », « PrĂȘt automobile », « PrĂȘt hypothĂ©caire ».

Il y avait également un autre type de produit dans les données : « Compte courant ». Mais nous ne l'avons pas considéré en raison de son faible niveau d'information. Pour les utilisateurs qui sont des clients de la banque, c'est-à-dire ceux qui n'ont pas cessé d'utiliser ses produits, un modÚle a été construit pour prédire quel produit pourrait les intéresser. Une régression logistique a été choisie comme modÚle et la valeur Lift pour les 10 premiers percentiles a été utilisée comme métrique d'évaluation de la qualité.

La qualitĂ© du modĂšle peut ĂȘtre Ă©valuĂ©e sur le graphique.

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.
Résultats du modÚle de recommandation de produits pour les clients

Conclusion

Cette approche nous a valu la premiÚre place dans la nomination « IA dans les banques » au Championnat IA RAIF-Challenge 2017.

Comme nous l'avons prĂ©dit, le dĂ©part doit ĂȘtre abordĂ© comme une catastrophe naturelle.

Apparemment, l'élément clé était de s'attaquer au problÚme sous un angle peu habituel et d'utiliser une méthode généralement appliquée à d'autres situations.

Bien qu'un retrait massif d'utilisateurs puisse ĂȘtre une catastrophe naturelle pour les services.

Cette mĂ©thode peut Ă©galement ĂȘtre notĂ©e pour d'autres domaines oĂč il est important de considĂ©rer les retraits, pas seulement pour les banques. Par exemple, nous l'avons utilisĂ©e pour calculer notre propre taux de dĂ©part — dans les agences de SibĂ©rie et de Saint-PĂ©tersbourg de Rostelecom.

« Laboratoire d'analyse intelligente des données » de la société « Portail de recherche « Sputnik »

Source : habr.com

Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS đŸ”„ Acheter un hĂ©bergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster