En 2008, le Big Data était un nouveau terme et une tendance à la mode. En 2019, le Big Data est devenu un objet de vente, une source de profit et un prétexte pour de nouveaux projets de loi.
Ă l'automne dernier, le gouvernement russe a initiĂ© un projet de loi sur la rĂ©gulation des grandes donnĂ©es. Il est interdit d'identifier les personnes par leurs informations, mais cela est permis Ă la demande des autoritĂ©s fĂ©dĂ©rales. Le traitement des Big Data pour des tiers n'est autorisĂ© qu'aprĂšs notification Ă Roskomnadzor. Les entreprises possĂ©dant plus de 100 000 adresses rĂ©seau sont soumises Ă cette loi. Et, bien sĂ»r, il ne peut y avoir de registre â la crĂ©ation d'un tel registre avec la liste des opĂ©rateurs de bases de donnĂ©es est prĂ©vue. Et si auparavant le Big Data n'Ă©tait pas pris au sĂ©rieux par tout le monde, il faudra dĂ©sormais en tenir compte.
Je ne peux pas ignorer le Big Data non plus, en tant que directeur d'une sociĂ©tĂ© de dĂ©veloppement de facturation qui traite cette mĂȘme Big Data. Je vais rĂ©flĂ©chir aux grandes donnĂ©es Ă travers le prisme des opĂ©rateurs de tĂ©lĂ©communication, Ă travers les systĂšmes de facturation desquels passent chaque jour les flux d'informations sur des milliers d'abonnĂ©s.
ThéorÚme
Commençons comme dans un problĂšme de mathĂ©matiques : prouvons d'abord que les donnĂ©es des opĂ©rateurs de tĂ©lĂ©communication peuvent ĂȘtre qualifiĂ©es de Big Data. En gĂ©nĂ©ral, les grandes donnĂ©es se caractĂ©risent par trois caractĂ©ristiques VVV, bien que dans des interprĂ©tations libres, le nombre de « V » ait atteint jusqu'Ă sept.
Volume. Un seul MVNO de Rostelecom sert plus d'un million d'abonnés. Les principaux opérateurs hÎtes traitent des données pour 44 à 78 millions de personnes. Le trafic augmente chaque seconde : au premier trimestre 2019, les abonnés avaient déjà surfé sur leurs téléphones mobiles pour 3,3 milliards de Go.
Vélocité. Personne ne raconte mieux la dynamique que les statistiques, donc je vais passer en revue les prévisions de Cisco. D'ici 2021, 20 % du trafic IP sera attribué au trafic mobile - il augmentera presque de trois fois en cinq ans. Un tiers des connexions mobiles sera dédié à M2M - le développement de l'IoT entraßnera une multiplication par six des connexions. L'Internet des objets ne deviendra pas seulement un domaine rentable, mais aussi énergivore, c'est pourquoi certains opérateurs se concentreront uniquement sur cela. Et ceux qui développeront l'IoT en tant que service séparé obtiendront le double du trafic.
VariĂ©tĂ©. La diversitĂ© est un concept subjectif, mais les opĂ©rateurs de tĂ©lĂ©communications en savent vraiment presque tout sur leurs abonnĂ©s. Du nom et des donnĂ©es d'identification jusqu'au modĂšle de tĂ©lĂ©phone, aux achats, aux lieux visitĂ©s et aux centres d'intĂ©rĂȘt. Les fichiers multimĂ©dias doivent ĂȘtre conservĂ©s pendant au moins six mois selon la loi Yarovaya. Donc, acceptons comme un axiome que les donnĂ©es collectĂ©es sont variĂ©es.
Logiciels et méthodologie
Les fournisseurs sont l'un des principaux consommateurs de Big Data, c'est pourquoi la plupart des mĂ©thodes d'analyse des grandes donnĂ©es sont applicables au secteur des tĂ©lĂ©communications. La vraie question est de savoir qui est prĂȘt Ă investir dans le dĂ©veloppement de l'apprentissage automatique (ML), de l'intelligence artificielle (IA), de l'apprentissage en profondeur, d'investir dans des centres de donnĂ©es et dans le data mining. Un travail efficace avec des bases de donnĂ©es nĂ©cessite une infrastructure et une Ă©quipe, dont les coĂ»ts ne sont pas Ă la portĂ©e de tous. Les entreprises qui disposent dĂ©jĂ d'un entrepĂŽt de donnĂ©es d'entreprise ou qui dĂ©veloppent une mĂ©thode de gouvernance des donnĂ©es devraient miser sur le Big Data. Pour celles qui ne sont pas encore prĂȘtes Ă des investissements Ă long terme, je recommanderais de dĂ©velopper progressivement l'architecture des logiciels et d'installer les composants un par un. Les modules lourds et Hadoop peuvent ĂȘtre laissĂ©s pour la fin. Peu de gens achĂštent une solution clĂ© en main pour des tĂąches telles que Data Quality et Data Mining, la plupart des entreprises adaptent le systĂšme Ă leur spĂ©cificitĂ© et Ă leurs besoins - elles le font elles-mĂȘmes ou avec l'aide de dĂ©veloppeurs.
Cependant, tous les systĂšmes de facturation ne peuvent pas ĂȘtre modifiĂ©s pour travailler avec Big Data. En fait, ce ne sont pas tous qui peuvent ĂȘtre modifiĂ©s. Peu de gens savent faire ça.
Trois signes qu'un systÚme de facturation a une chance de devenir un outil de traitement de base de données :
- ScalabilitĂ© horizontale. Le logiciel doit ĂȘtre flexible - nous parlons de grandes donnĂ©es. L'augmentation de la quantitĂ© d'information doit ĂȘtre compensĂ©e par une augmentation proportionnelle du matĂ©riel dans le cluster.
- Résilience aux pannes. Les systÚmes prépayés sérieux sont généralement résilients par défaut : la facturation est déployée dans un cluster dans plusieurs géolocalisations, afin que celles-ci puissent se sécuriser automatiquement les unes les autres. Il doit également y avoir suffisamment d'ordinateurs dans le cluster Hadoop en cas de défaillance d'un ou plusieurs d'entre eux.
- LocalitĂ©. Les donnĂ©es doivent ĂȘtre stockĂ©es et traitĂ©es sur un le serveur, sinon on risque de faire faillite Ă cause du transfert de donnĂ©es. Un des schĂ©mas populaires d'approche Map-Reduce : HDFS stocke, Spark traite. IdĂ©alement, le logiciel devrait s'intĂ©grer sans douleur dans l'infrastructure des centres de donnĂ©es et savoir faire trois en un : collecter, organiser et analyser l'information.
Commande
C'est l'équipe qui détermine ce que le programme va faire avec de grandes données, et à quelles fins. Souvent, cette équipe est composée d'une seule personne : le data scientist. Cependant, à mon avis, le minimum d'employés pour le Big Data devrait également inclure un chef de produit, un Data Engineer et un responsable. Le premier comprend les services, traduit le jargon technique en langage compréhensible et vice versa. Le Data Engineer concrétise les modÚles à l'aide de Java/Scala et expérimente avec le Machine Learning. Le responsable coordonne, fixe des objectifs et contrÎle les étapes.
ProblĂšmes
C'est gĂ©nĂ©ralement du cĂŽtĂ© de l'Ă©quipe Big Data que surgissent des problĂšmes lors de la collecte et du traitement des donnĂ©es. Le programme doit comprendre quoi collecter et comment traiter ces informations ; pour cela, il faut d'abord bien comprendre soi-mĂȘme. Et pour les fournisseurs, ce n'est pas toujours aussi simple. Je vais illustrer les problĂšmes Ă travers l'exemple d'une tĂąche de rĂ©duction du taux de dĂ©sabonnement â c'est prĂ©cisĂ©ment ce que les opĂ©rateurs de tĂ©lĂ©communications tentent de rĂ©soudre en prioritĂ© grĂące au Big Data.
DĂ©finition des tĂąches. Un cahier des charges bien rĂ©digĂ© et la comprĂ©hension variĂ©e des termes â c'est une douleur millĂ©naire non seulement pour les freelances. MĂȘme les abonnĂ©s 'partis' peuvent ĂȘtre interprĂ©tĂ©s de diffĂ©rentes maniĂšres : comme n'utilisant pas les services de l'opĂ©rateur depuis un mois, six mois ou un an. Et pour crĂ©er un MVP Ă partir de donnĂ©es historiques, il est essentiel de comprendre la frĂ©quence de retour des abonnĂ©s sortis â ceux qui ont essayĂ© les services d'autres opĂ©rateurs ou qui ont quittĂ© la ville en utilisant un autre numĂ©ro. Une autre question importante est : combien de temps avant le dĂ©part prĂ©vu de l'abonnĂ© l'opĂ©rateur doit-il identifier ce dĂ©part et prendre des mesures ? Six mois Ă l'avance â c'est trop tĂŽt, une semaine Ă l'avance â dĂ©jĂ trop tard.
Confusion des termes. D'habitude, les opĂ©rateurs identifient le client par son numĂ©ro de tĂ©lĂ©phone, il est donc logique d'extraire les indicateurs par celui-ci. Qu'en est-il du compte client ou du numĂ©ro de l'application de service ? Il faut dĂ©terminer quelle unitĂ© doit ĂȘtre considĂ©rĂ©e comme le client, afin que les donnĂ©es dans le systĂšme de l'opĂ©rateur ne varient pas. L'Ă©valuation de la valeur du client est Ă©galement remise en question â quel abonnĂ© est le plus prĂ©cieux pour l'entreprise, pour lequel il faut investir le plus d'efforts pour le retenir, et lesquels 'partiront' de toute façon et ne justifient pas l'investissement de ressources.
Manque d'informations. Loin d'ĂȘtre tous, les employĂ©s du fournisseur sont capables d'expliquer Ă l'Ă©quipe BigData ce qui influence prĂ©cisĂ©ment le dĂ©part des abonnĂ©s et comment les facteurs possibles sont calculĂ©s dans la facturation. MĂȘme si l'un d'eux Ă©tait mentionnĂ© â l'ARPU â il s'avĂšre qu'on peut aussi le calculer de diffĂ©rentes maniĂšres : soit par les paiements pĂ©riodiques du client, soit par les charges automatiques de la facturation. En cours de travail, un million d'autres questions surgissent. Tout le monde est-il inclus dans le modĂšle, quel est le coĂ»t pour la fidĂ©lisation des clients, a-t-il du sens de rĂ©flĂ©chir Ă des modĂšles alternatifs et que faire avec les clients que l'on a commencĂ© Ă retenir par erreur ?
Objectifs. Je connais trois types d'erreurs liées aux résultats qui frustrent les opérateurs concernant les bases de données.
- Le fournisseur investit dans BigData, traite des gigaoctets d'informations, mais obtient un rĂ©sultat qu'il aurait pu avoir Ă moindre coĂ»t. Des schĂ©mas et modĂšles simples sont utilisĂ©s, une analyse primitive. Le coĂ»t est des fois plus Ă©levĂ©, mais le rĂ©sultat reste le mĂȘme.
- L'opĂ©rateur reçoit des donnĂ©es multifactorielles Ă la sortie, mais ne sait pas comment les utiliser. L'analyse est lĂ â la voici, claire et volumineuse, mais elle est sans aucun intĂ©rĂȘt. Le rĂ©sultat final n'a pas Ă©tĂ© pensĂ©, il ne peut pas se rĂ©sumer Ă l'objectif "traiter les donnĂ©es". Traiter est insuffisant â l'analyse doit devenir la base pour la mise Ă jour des processus mĂ©tier.
- Des processus d'affaires obsolĂštes et un logiciel inadaptĂ© aux nouveaux objectifs peuvent constituer un obstacle Ă l'utilisation d'analytique BigData. Cela signifie qu'il y a eu un Ă©chec Ă l'Ă©tape de prĂ©paration â l'algorithme d'actions et les Ă©tapes d'implĂ©mentation de BigData dans le travail n'ont pas Ă©tĂ© rĂ©flĂ©chis.
Pourquoi
à propos des résultats. Je vais passer en revue les méthodes d'utilisation et de monétisation de BigData déjà exploitées par les opérateurs de télécommunications.
Les fournisseurs prévoient non seulement le départ des abonnés, mais aussi les charges sur les stations de base.
- Les informations sur les déplacements des abonnés, leur activité et les services fréquents sont analysées. Résultat : réduction du nombre de surcharges grùce à l'optimisation et à la modernisation des zones problématiques de l'infrastructure.
- Les informations sur la géolocalisation des abonnés et la densité du flux sont utilisées par les opérateurs de télécommunications lors de l'ouverture de points de vente. Ainsi, l'analytique BigData est déjà utilisée par MTS et Vimpelcom pour planifier l'emplacement de nouveaux bureaux.
- Les fournisseurs monétisent leurs propres grandes données en les offrant à des entreprises tierces. Les principaux clients des opérateurs Big Data sont les banques commerciales. Grùce aux données, elles surveillent les activités suspectes des cartes SIM liées aux cartes, utilisent des services de scoring des risques, de vérification et de surveillance. En 2017, le gouvernement de Moscou a demandé à Tele2 des données sur la dynamique des déplacements pour planifier l'infrastructure technique et de transport.
- L'analyse Big Data est une mine d'or pour les marketeurs, qui peuvent crĂ©er des campagnes publicitaires personnalisĂ©es pour des milliers de groupes d'abonnĂ©s, s'ils le souhaitent. Les entreprises de tĂ©lĂ©communications agrĂšgent des profils sociaux, des intĂ©rĂȘts consommateurs et des modĂšles comportementaux des abonnĂ©s, puis utilisent les Big Data collectĂ©es pour attirer de nouveaux clients. Mais pour une planification Ă grande Ă©chelle des promotions et des relations publiques, la facturation n'a pas toujours les fonctionnalitĂ©s nĂ©cessaires : le programme doit simultanĂ©ment prendre en compte de nombreux facteurs tout en fournissant des informations dĂ©taillĂ©es sur les clients.
Tandis que certains considÚrent encore Big Data comme un concept vide, les "grands quatre" en tirent déjà des profits. MTS génÚre 14 milliards de roubles en six mois grùce au traitement des grandes données, tandis que Tele2 a multiplié par trois et demi ses revenus provenant de projets. Big Data évolue d'une tendance à un must have, autour duquel toute la structure des opérateurs de télécommunication va se réorganiser.
Source : habr.com
