Klasifikimi i të dhënave të shkallëzuar për sigurinë dhe privatësinë

Klasifikimi i të dhënave të shkallëzuar për sigurinë dhe privatësinë

Klasifikimi i të dhënave në bazë të përmbajtjes është një detyrë e hapur. Sistemet tradicionale të parandalimit të humbjes së të dhënave (DLP) e zgjidhin këtë problem duke marrë shtypje nga të dhënat përkatëse dhe duke monitoruar piketat për të marrë shtypjet. Duke marrë parasysh numrin e madh të burimeve të dhënash që ndryshojnë vazhdimisht në Facebook, ky qasje jo vetëm që nuk është e shkallëzueshme, por është edhe e paefektshme për të përcaktuar se ku ndodhen të dhënat. Ky artikull është i dedikuar një sistemi tërësor, i ndërtuar për të zbuluar lloje të ndjeshme semantike në Facebook në shkallë dhe për të siguruar automatikisht ruajtjen e të dhënave dhe kontrollin e qasjes.

Qasja e përshkruar këtu është sistemi ynë i parë i përfunduar i privatësisë, i cili përpiqet të zgjidhë këtë problem duke përfshirë sinjale të dhënash, mësim në makinë dhe metoda tradicionale të identifikimit për të shfaqur dhe klasifikuar të dhënat në Facebook. Sistemi i përshkruar eksploatohet në një ambient të prodhimit, duke arritur një rezultat mesatar F2 mbi 0.9 në kategoritë e ndryshme të privatësisë duke trajtuar një sasi të madhe të burimeve të dhënash në dhjetëra depo. Paraqesim përkthimin e publikimit të Facebook në ArXiv mbi klasifikimin e shkallëzueshëm të të dhënave për sigurimin dhe privatësinë e bazuar në mësimin në makinë.

Hyrje

Sotëria po mbledh dhe ruan sasi të mëdha të të dhënave në formate dhe vende të ndryshme [1], pastaj të dhënat konsumohen në shumë vende, ndonjëherë kopjohen ose ruajnë disa herë, duke bërë që informacioni i çmuar dhe konfidencial i biznesit të shpërndahet në shumë depo të dhënash korporative. Kur kërkohet që një organizatë të përmbushë kushte të caktuara ligjore ose rregullatore, si për të përmbushur rregullat gjatë procedurave civile, lind nevoja për të mbledhur të dhëna mbi vendndodhjen e të dhënave të nevojshme. Kur një urdhër për privatësi thotë se organizata duhet të maskojë të gjitha numrat e sigurimeve shoqërore (SSN) kur transmeton informacion personal tek subjekte të paautorizuara, hapi i parë natyror është të kërkojë të gjitha SSN në depozitë e të dhënave të tërë organizatës. Në këto rrethana, klasifikimi i të dhënave bëhet kritik [1]. Një sistem klasifikimi do të lejojë organizatat të sigurojnë automatikisht përputhshmërinë me privatësinë dhe politikat e sigurisë, siç është përfshirja e politikave të menaxhimit të aksesit dhe ruajtja e të dhënave. Facebook ofron një sistem të ndërtuar nga ne në Facebook, i cili përdor shumë sinjale të dhënash, një arkitekturë të sistemit të shkallëzueshëm dhe mësimautomatik për të zbuluar lloje të ndjeshme semantike të të dhënave.

Identifikimi dhe klasifikimi i të dhënave është procesi i gjetjes dhe etiketimit të tyre në një mënyrë që informacioni i duhur të mund të nxirret shpejt dhe efikasitet kur është e nevojshme. Procesi aktual është kryesisht manual dhe përfshin studimin e ligjeve ose rregulloreve përkatëse, përcaktimin e cilat tipe informacioni duhet të konsiderohen të ndjeshëm dhe cila është shkalla e ndryshme e ndjeshmërisë, dhe më pas ndërtimin përkatës të klasave dhe politikave të klasifikimit [1]. Pasi që sistemet e mbrojtjes nga humbja e të dhënave (DLP) marrin gjurmët e të dhënave dhe ndjekin pikëfundet poshtë rrjedhës për të marrë gjurmët. Duke punuar me një depo të madhe me aktive dhe petabajtë të të dhënave, ky qasje thjesht nuk është e qëndrueshme në shkallë.

Qëllimi ynë është të ndërtojmë një sistem klasifikimi të të dhënave që është në shkallë si për të dhënat e qëndrueshme ashtu edhe për ato të paqëndrueshme, pa ndonjë kufizim të shtuar mbi tipin apo formatin e të dhënave. Kjo është një qëllim ambicioz dhe natyrisht sjell sfida. Një regjistrim ndonjëherë mund të jetë mijëra karaktere i gjatë.

Klasifikimi i të dhënave të shkallëzuar për sigurinë dhe privatësinë
Figura 1. Flukset e parashikimeve online dhe offline

Prandaj, ne duhet ta paraqesim atë në mënyrë efektive duke përdorur një grup të përbashkët veçorish, të cilat më vonë mund të kombinohen dhe të zhvendosen lehtësisht. Këto veçori duhet të sigurojnë jo vetëm klasifikim të saktë, por gjithashtu të sigurojnë fleksibilitet dhe zgjerueshmëri për të lejuar shtimin dhe zbulimin e llojeve të reja të të dhënave në të ardhmen. Përveç kësaj, është e nevojshme të merret me tabela të mëdha autonome. Të dhënat e qëndrueshme mund të ruhen në tabela me madhësi shumë petabayti. Kjo mund të çojë në ulje të shpejtësisë së skanimit. Për më tepër, ne duhet të respektojmë një klasifikim të rreptë SLA për të dhënat e paqëndrueshme. Kjo e bën sistemin shumë efikas, të shpejtë dhe të saktë. Së fundmi, ne duhet të sigurojmë klasifikimin e të dhënave me vonesë të ulët për të dhënat e paqëndrueshme, për të realizuar klasifikimin në kohë reale, si dhe për rastet e përdorimit në internet.

Ky artikull përshkruan se si e trajtuam problemin e mësipërm dhe paraqet një sistem klasifikimi të shpejtë dhe të shkallëzuar, i cili klasifikon elementët e të dhënave të të gjitha llojeve, formateve dhe burimeve mbi një grup të përbashkët veçorish. Ne zgjeruam arkitekturën e sistemit dhe krijuam një model të veçantë të mësimit të makinerisë për klasifikimin e shpejtë të të dhënave offline dhe online. Ky artikull është organizuar si më poshtë: në Seksionin 2 paraqitet dizajni i përgjithshëm i sistemit. Në Seksionin 3 diskutojmë pjesët e sistemit të mësimit të makinerisë. Në Seksionet 4 dhe 5 flitet për punën e lidhur dhe për të ardhmen e punës.

Arkitektura

Për të përballuar problemet e të dhënave të qëndrueshme dhe të dhënave online në shkallën e Facebook-ut, sistemi i klasifikimit ka dy rrjedha të ndara, të cilat do t'i diskutojmë në detaje.

Të dhëna të qëndrueshme

Së pari, sistemi duhet të njohë një shumëllojshmëri aktivash informativë në Facebook. Për çdo depo, mblidhet ndonjë informacion bazë, siç është qendra e të dhënave që përmban këto të dhëna, sistemi që ka këto të dhëna dhe aktivet e ndodhura në depo specifike të dhënash. Kjo formon një katalog të të dhënave metadatatike, duke lejuar sistemin të nxjerrë informacionin në mënyrë efikase pa e ngarkuar klientin dhe burimet e përdorura nga inxhinierët e tjerë.

Ky katalog i të dhënave metadatatike siguron një burim të besueshëm për të gjithë aktivet e skanuara dhe lejon monitorimin e gjendjes së aktivave të ndryshme. Me këtë informacion, vendoset përparësia e planifikimit në bazë të të dhënave të mbledhura dhe informacionit të brendshëm nga sistemin, siç është koha e fundit e skanimit të suksesshëm të aktivës dhe koha e krijimit të saj, si dhe kërkesat e kaluara për kujtesë dhe procesor për këtë aktiv, nëse është skanuar më parë. Pastaj, për çdo burim të dhënash (ndërsa burimet bëhen të disponueshme), thirret detyra e skanimit aktual të burimit.

Çdo detyrĂ« Ă«shtĂ« njĂ« skedar i kompiluar binar qĂ« kryen njĂ« mostĂ«r Beras tĂ« fundit tĂ« dhĂ«nash qĂ« janĂ« tĂ« disponueshme pĂ«r çdo aktiv. Aktiviteti ndahet nĂ« kolona tĂ« veçanta, ku rezultati i klasifikimit pĂ«r çdo kolonĂ« pĂ«rpunohen nĂ« mĂ«nyrĂ« tĂ« pavarur. PĂ«r mĂ« tepĂ«r, sistemi skanon çdo tĂ« dhĂ«nĂ« tĂ« pĂ«rmbledhur brenda kolonave. JSON, arrays, struktura tĂ« koduara, URL-tĂ«, tĂ« dhĂ«nat e serialize tĂ« base 64 dhe shumĂ« tĂ« tjera – tĂ« gjitha kĂ«to skanohen. Kjo mund tĂ« rrisĂ« ndjeshĂ«m kohĂ«n e ekzekutimit tĂ« skanimit, pasi njĂ« tabelĂ« mund tĂ« pĂ«rmbajĂ« mijĂ«ra kolona tĂ« ngulitura nĂ« njĂ« objekt tĂ« madh binaire. json.

Për çdo rresht që përzgjidhet në aktivin e dhënave, sistemi i klasifikimit nxjerr objektet e lundrueshme dhe tekstet nga përmbajtja dhe lidh secilin objekt mbrapsht me kolonën nga e cila është marrë. Rezultati i fazës së nxjerrjes së objekteve është një hartë e të gjithë objekteve për çdo kolonë të gjetur në aktivin e dhënave.

Për çfarë nevojiten karakteristikat?

Koncepti i karakteristikave është një çështje kyçe. Në vend të karakteristikave float dhe text, ne mund të dërgojmë mostra të papërpunuara të rreshtave, të cilat janë nxjerrë direkt nga çdo burim të dhënash. Për më tepër, modelet e mësimit të makinerisë mund të trajnohen direkt me çdo mostër, në vend të qindra llogaritjeve të karakteristikave që vetëm përpiqen të afrojë mostrën. Këtij fenomeni i japin disa arsye:

  1. Privatësia para së gjithash: e rëndësishme, koncepti i karakteristikave na lejon të mbajmë në kujtesë vetëm ato mostra që nxjerrim. Kjo garanton që ne ruajmë mostrat për një qëllim të vetëm dhe asnjëherë nuk i regjistrojmë ato me përpjekjet tona. Kjo është veçanërisht e rëndësishme për të dhënat e paqëndrueshme, pasi shërbimi duhet të mbajë një gjendje klasifikimi para se të ofrojë parashikimin.
  2. Kujtesa: disa mostra mund të kenë gjatësi në mijëra karaktere. Ruajtja e të dhënave të tilla dhe transmetimi i tyre në disa pjesë të sistemit pa nevojë konsumon shumë bajte shtesë. Dy faktorë mund të kombinohen me kalimin e kohës, duke marrë parasysh se ka shumë burime të dhënash me mijëra kolona.
  3. Agregimi i karakteristikave: me anë të karakteristikave, rezultatet e çdo skanimi paraqiten qartë përmes grupit të tyre, duke lejuar sistemin të bashkojë rezultatet e skanimeve të mëparshme të të njëjtit burim të dhënash në një mënyrë të përshtatshme. Kjo mund të jetë e dobishme për të agreguar rezultatet e skanimit të një burimi të dhënash në disa execucione.

Më pas, karakteristikat dërgohen në shërbimin e parashikimit, ku ne përdorim klasifikimin e bazuar në rregulla dhe mësimin e automatik për të parashikuar etiketat e të dhënave për çdo kolonë. Shërbimi mbështetet si në klasifikuesit e rregullave ashtu edhe në mësimin e automatik dhe zgjedh parashikimin më të mirë të dhënë nga çdo objekt parashikimi.

Klasifikuesit e rregullave janë një heuristik manual, ata përdorin llogaritje dhe koeficientë për të normalizuar objektin në një gamë nga 0 deri në 100. Pasi që një pikë fillestare krijohet për çdo lloj të dhënash dhe emri i kolonës përkatës, që nuk përfshihet në asnjë 'listë të ndaluar', klasifikuesi i rregullave zgjedh pikën më të lartë të normalizuar mes të gjitha llojeve të të dhënave.

Për shkak të kompleksitetit të klasifikimit, përdorimi ekskluzivisht i heuristikës manuale çon në saktësi të ulët në klasifikim, veçanërisht për të dhënat e pa strukturuara. Për këtë arsye, ne kemi zhvilluar një sistem të mësimit të makinerive për të punuar me klasifikimin e të dhënave të pa strukturuara, siç janë përmbajtjet e përdoruesve dhe adresat. Mësimi i makinave na ka lejuar të fillojmë të largohemi nga heuristika manuale dhe të aplikojmë sinjale të tjera të dhënash (p.sh., emrat e kolonave, origjina e të dhënave), duke rritur ndjeshëm saktësinë e identifikimit. Ne do të thellohemi më tej në arkitekturën tonë të mësimit të makinave më vonë.

ShĂ«rbimi i parashikimit ruan rezultatet pĂ«r çdo kolonĂ« sĂ« bashku me metadata qĂ« lidhen me kohĂ«n dhe gjendjen e skanimit. Çdo konsumator dhe proceset e poshtme qĂ« varen nga kĂ«to tĂ« dhĂ«na, mund t'i lexojnĂ« ato nga sĂ«rĂ« tĂ« dhĂ«nash qĂ« publikohen çdo ditĂ«. Ky set agregon rezultatet e tĂ« gjitha kĂ«tyre detyrave tĂ« skanimit, ose API-nĂ« e kohĂ«s reale tĂ« katalogut tĂ« tĂ« dhĂ«nave. Parashikimet e publikuara janĂ« themeli i automatikisht aplikimit tĂ« politikĂ«s sĂ« privatĂ«sisĂ« dhe sigurisĂ«.

NĂ« fund, pasi shĂ«rbimi i parashikimit tĂ« regjistrojĂ« tĂ« gjithĂ« tĂ« dhĂ«nat dhe tĂ« gjitha parashikimet tĂ« ruajten, API i katelogut tonĂ« tĂ« tĂ« dhĂ«nave mund tĂ« kthejĂ« tĂ« gjitha parashikimet e tipave tĂ« tĂ« dhĂ«nave pĂ«r burimin nĂ« kohĂ« reale. Çdo ditĂ«, sistemi publikoon njĂ« grup tĂ« dhĂ«nash qĂ« pĂ«rmban tĂ« gjitha parashikimet mĂ« tĂ« fundit pĂ«r çdo aktiv.

Të dhënat e pasigurta

Megjithëse procesi i përshkruar më sipër është krijuar për aktivet që ruhen, trafiku që nuk ruhet gjithashtu merret parasysh si një pjesë e të dhënave të organizatës dhe mund të jetë i rëndësishëm. Për këtë arsye, sistemi ofron një API online për gjenerimin e parashikimeve të klasifikimit në kohë reale për çdo trafik të pasigurt. Sistemi i parashikimit në kohë reale përdoret gjerësisht në klasifikimin e trafikut të daljës, trafikut të hyrjes në modelet e mësimit të makinerive dhe të dhënat e reklamuesve.

Këtu API pranon dy argumente kryesore: çelësi i grumbullimit dhe të dhënat e papërpunuara që duhet të parashikohen. Shërbimi kryen të njëjtin nxjerrje objektesh siç është përshkruar më sipër dhe grupin objektesh së bashku për të njëjtin çelës. Këto karakteristika gjithashtu mbështeten në cache-in e ruajtur për rikuperim pas dështimit. Për çdo çelës grumbullimi, shërbimi garanton se para thirrjes së shërbimit të parashikimit, ai ka parë mjaft muestra në përputhje me procesin e përshkruar më lart.

Optimizimi

Për skanimin e disa depozitave, ne përdorim biblioteka dhe metoda optimizimi në leximin nga depozita e nxehtë [2] dhe garantojmë se nuk ka asnjë dështim nga përdorues të tjerë që kanë akses në të njëjtën depozitë.

Për tabela jashtëzakonisht të mëdha (50+ petabajt), pavarësisht optimizimeve të shumta dhe efikasitetit të memories, sistemi punon për skanimin dhe llogaritjen e gjithçkaje para se të përfundojë memoria. Në fund, skanimi llogaritet plotësisht në memorie dhe nuk ruhet gjatë skanimit. Nëse tabelat e mëdha përmbajnë mijëra kolona me grumbuj të dhënash të pa strukturuar, detyra mund të dështojë për shkak të mungesës së burimeve të memories gjatë kryerjes së parashikimeve për të gjithë tabelën. Kjo do të çojë në reduktimin e mbulimit. Për të luftuar këtë, ne e kemi optimizuar sistemin për të përdorur shpejtësinë e skanimit si një ndërmjetës përsa i përket sasisë sa mirë sistemi përballon ngarkesën aktuale. Ne e përdorim shpejtësinë si një mekanizëm parashikimi, për të parë problemet me memorien dhe në llogaritjen parashikuese të harta objekteve. Në këtë mënyrë, ne përdorim më pak të dhëna se zakonisht.

Sinjalet e të dhënave

Sistemi i klasifikimit është i mirë aq sa janë sinjalet nga të dhënat. Këtu do të shqyrtojmë të gjitha sinjalet që përdoren nga sistemi i klasifikimit.

  • Bazuar nĂ« pĂ«rmbajtje: sigurisht, sinjali i parĂ« dhe mĂ« i rĂ«ndĂ«sishĂ«m Ă«shtĂ« pĂ«rmbajtja. Kryhet njĂ« pĂ«rzgjedhje Bernulli pĂ«r çdo aset tĂ« dhĂ«nash qĂ« skanojmĂ« dhe nxjerrim karakteristika nga pĂ«rmbajtja e tĂ« dhĂ«nave. ShumĂ« karakteristika rrjedhin nga pĂ«rmbajtja. Mund tĂ« ketĂ« çdo numĂ«r objektesh tĂ« lĂ«vizshĂ«m qĂ« pĂ«rfaqĂ«sojnĂ« llogaritjet e numrit tĂ« herĂ«ve qĂ« Ă«shtĂ« vĂ«rejtur njĂ« tip specifik pattern. PĂ«r shembull, mund tĂ« kemi karakteristika tĂ« numrit tĂ« email-Ă«ve qĂ« janĂ« parĂ« nĂ« pĂ«rzgjedhje, ose karakteristika tĂ« numrit tĂ« smiley-ve qĂ« janĂ« vĂ«rejtur nĂ« pĂ«rzgjedhje. KĂ«to llogaritje karakteristikash mund tĂ« normalizohen dhe agregohen pĂ«r skanime tĂ« ndryshme.
  • Origjinat e tĂ« dhĂ«nave: njĂ« sinjal i rĂ«ndĂ«sishĂ«m qĂ« mund tĂ« ndihmojĂ« kur pĂ«rmbajtja ka ndryshuar nga tabela prind. NjĂ« shembull i zakonshĂ«m Ă«shtĂ« tĂ« dhĂ«nat e hash-it. Kur tĂ« dhĂ«nat nĂ« tabelĂ«n fĂ«mijĂ« hash-ohen, ato shpesh vijnĂ« nga tabela prind, ku qĂ«ndrojnĂ« nĂ« formĂ« tĂ« hapur. TĂ« dhĂ«nat mbi origjinĂ«n ndihmojnĂ« nĂ« klasifikimin e tipeve tĂ« caktuara tĂ« tĂ« dhĂ«nave kur ato nuk lexohen qartĂ« ose janĂ« transformuar nga tabela lart nĂ« rrjedhĂ«.
  • Annotimet: njĂ« tjetĂ«r sinjal me cilĂ«si tĂ« lartĂ« qĂ« ndihmon nĂ« identifikimin e tĂ« dhĂ«nave tĂ« pa strukturuara. NĂ« fakt, annotimet dhe tĂ« dhĂ«nat e origjinĂ«s mund tĂ« punojnĂ« sĂ« bashku pĂ«r tĂ« shpĂ«rndarĂ« atribute midis aktiveve tĂ« ndryshme tĂ« tĂ« dhĂ«nave. Annotimet ndihmojnĂ« nĂ« identifikimin e burimit tĂ« tĂ« dhĂ«nave tĂ« pa strukturuara, ndĂ«rsa tĂ« dhĂ«nat e origjinĂ«s mund tĂ« ndihmojnĂ« nĂ« gjurmimin e flukseve tĂ« kĂ«tyre tĂ« dhĂ«nave nĂ« tĂ« gjithĂ« ruajtjen.
  • Injeksioni i tĂ« dhĂ«nave Ă«shtĂ« njĂ« metodĂ« nĂ« tĂ« cilĂ«n simbole speciale, tĂ« lexueshme, gĂ«njehen nĂ« burime tĂ« njohura me lloje tĂ« njohura tĂ« tĂ« dhĂ«nave. Pastaj, sa herĂ« qĂ« ne skanojmĂ« pĂ«rmbajtjen me njĂ« sekuencĂ« tĂ« njĂ«jtĂ« tĂ« simboleve tĂ« padukshme, mund tĂ« konkludohet se pĂ«rmbajtja buron nga ky lloj i njohur i tĂ« dhĂ«nave. Ky Ă«shtĂ« njĂ« tjetĂ«r sinjal cilĂ«sor i tĂ« dhĂ«nave, i ngjashĂ«m me annotimet. PĂ«rveç asaj, zbulimi mbi pĂ«rmbajtjen ndihmon nĂ« zbuluar tĂ« dhĂ«nat e futur.

Metrika e matjes

Një komponent i rëndësishëm është metodologjia rigoroze e matjes së metriku. Metrikat kryesore të iteracionit për përmirësimin e klasifikimit janë saktësia dhe rikthimi i çdo etikete, me vlerësimin F2 që është më i rëndësishmi.

Për të llogaritur këto tregues, është e nevojshme një metodologji e pavarur e etiketimit të të dhënave që nuk varet nga sistemi vetë, por mund të përdoret për krahasim të drejtpërdrejtë me të. Më poshtë do të përshkruajmë se si e mbledhim të vërtetën kryesore nga Facebook dhe e përdorim atë për të trajnuar sistemin tonë të klasifikimit.

Grumbullimi i të dhënave të sakta

Ne grumbullojmĂ« tĂ« dhĂ«na tĂ« sakta nga çdo burim tĂ« listuar mĂ« poshtĂ«, nĂ« tabelĂ«n e tij tĂ« vetme. Çdo tabelĂ« Ă«shtĂ« pĂ«rgjegjĂ«se pĂ«r agregimin e vlerave mĂ« tĂ« fundit tĂ« vĂ«zhguara nga ky burim specifik. Çdo burim ka njĂ« kontroll tĂ« cilĂ«sisĂ« sĂ« tĂ« dhĂ«nave pĂ«r tĂ« garantuar qĂ« vlerat e vĂ«zhguara pĂ«r çdo burim janĂ« tĂ« larta dhe pĂ«rmbajnĂ« etiketat mĂ« tĂ« fundit tĂ« llojeve tĂ« tĂ« dhĂ«nave.

  • Konfigurimet e platformĂ«s sĂ« regjistrimit: disa fusha nĂ« tabelat e ultrave mbushen me tĂ« dhĂ«na qĂ« i pĂ«rkasin njĂ« tipi tĂ« caktuar. PĂ«rdorimi dhe shpĂ«rndarja e kĂ«tyre tĂ« dhĂ«nave shĂ«rbejnĂ« si njĂ« burim i besueshĂ«m i tĂ« dhĂ«nave tĂ« sakta.
  • ShĂ«njimi manual: zhvilluesit qĂ« mbĂ«shtesin sistemin, si dhe shĂ«njuesit e jashtĂ«m, janĂ« tĂ« trajnuar pĂ«r tĂ« shĂ«njuar kolonat. Kjo zakonisht funksionon mirĂ« pĂ«r tĂ« gjitha llojet e tĂ« dhĂ«nave nĂ« depo, dhe mund tĂ« jetĂ« burimi kryesor i besueshmĂ«risĂ« pĂ«r disa tĂ« dhĂ«na tĂ« pa-strukturuara, si tĂ« dhĂ«nat e mesazheve ose pĂ«rmbajtjen e pĂ«rdoruesve.
  • Kolonat nga tabelat prind mund tĂ« shĂ«nohen ose tĂ« anotohen si qĂ« pĂ«rmbajnĂ« tĂ« dhĂ«na tĂ« caktuara, dhe ne mund tĂ« ndjekim kĂ«to tĂ« dhĂ«na nĂ« tabelat e poshtme.
  • Selekcioni i rrjedhave tĂ« ekzekutimit: rrjedhat e ekzekutimit nĂ« Facebook mbajnĂ« tĂ« dhĂ«na tĂ« njĂ« tipi tĂ« caktuar. Duke pĂ«rdorur skanerin tonĂ« si njĂ« arkitekturĂ« shĂ«rbimi, ne mund tĂ« selektojmĂ« rrjedhat qĂ« kanĂ« lloje tĂ« njohura tĂ« tĂ« dhĂ«nave dhe t'i dĂ«rgojmĂ« ato nĂ«pĂ«rmjet sistemit. Sistemi premton tĂ« mos ruajĂ« kĂ«to tĂ« dhĂ«na.
  • Tabela e seleksionimit: tabela tĂ« mĂ«dha, tĂ« njohura pĂ«r pĂ«rmbajtjen e tĂ« dhĂ«nave tĂ« plota, mund tĂ« pĂ«rdoren gjithashtu si tĂ« dhĂ«na stĂ«rvitore dhe tĂ« transmetohen pĂ«rmes njĂ« skaner si shĂ«rbim. Kjo Ă«shtĂ« ideale pĂ«r tabelat me njĂ« gamĂ« tĂ« plotĂ« tipesh tĂ« dhĂ«nash, duke bĂ«rĂ« qĂ« seleksioni i kolonave nĂ« mĂ«nyrĂ« rastĂ«sore tĂ« jetĂ« ekuivalent me seleksionimin e tĂ«rĂ« grupit tĂ« kĂ«tij lloj tĂ« dhĂ«nash.
  • TĂ« dhĂ«na sintetike: ne mund tĂ« pĂ«rdorim madje biblioteka qĂ« gjenerojnĂ« tĂ« dhĂ«na nĂ« kohĂ« reale. Kjo funksionon mirĂ« pĂ«r tregues tĂ« thjeshtĂ« dhe publikĂ«, si adresa ose GPS.
  • MenaxherĂ«t e tĂ« dhĂ«nave: programet e privatĂ«sisĂ« zakonisht pĂ«rdorin menaxherĂ« tĂ« tĂ« dhĂ«nave pĂ«r tĂ« lidhur manuelisht politikat me pjesĂ«t e tĂ« dhĂ«nave. Kjo ofron njĂ« burim shumĂ« tĂ« saktĂ« tĂ« besueshmĂ«risĂ«.

Ne nevojitet pranishmëri e çdo burimi kryesor të dhënash të besueshme në një njësi me të gjitha këto të dhëna. Problemi më i madh me besueshmërinë është të sigurohemi që ajo është përfaqësuese për magazinën e të dhënave. Përndryshe, motorët e klasifikimit mund të stërviten keq. Për të luftuar këtë, të gjithë burimet e mësipërme përdoren për të siguruar një balancë gjatë trajnimit të modeleve ose llogaritjes së metrikeve. Për më tepër, njerëzit e etiketimit zgjedhin në mënyrë të barabartë kolona të ndryshme në magazinën e të dhënave dhe i etiketohet të dhënat në përputhje, që grumbullimi i vlerave të besueshme të mbetet i paanshëm.

Integrimi i vazhdueshëm

Për të siguruar iterim të shpejtë dhe përmirësim, është thelbësore të masim gjithmonë performancën e sistemit në kohë reale. Ne mund të masim çdo përmirësim të klasifikimit në krahasim me sistemin sot, në mënyrë që taktikisht të mund të orientojmë të dhënat në përmirësimet në vazhdim. Këtu do të shqyrtojmë se si sistemi e përfundon ciklin e rikthimit, i cili sigurohet nga të dhënat e besueshme.

Kur sistemi i planifikimit pĂ«rballet me njĂ« aset qĂ« ka njĂ« etiketĂ« nga njĂ« burim tĂ« besueshĂ«m, ne planifikojmĂ« dy detyra. E para pĂ«rdor skanerĂ«t tanĂ« tĂ« prodhimit dhe, kĂ«shtu, kapacitetet tona tĂ« prodhimit. Detyra e dytĂ« pĂ«rdor skanerin e mbledhjes mĂ« tĂ« fundit me veçoritĂ« mĂ« tĂ« reja. Çdo detyrĂ« shkruan daljen e saj nĂ« tabelĂ«n e saj tĂ« veçantĂ«, duke shĂ«nuar versionet sĂ« bashku me rezultatet e klasifikimit.

Kështu ne krahasojmë rezultatet e klasifikimit të versionit kandidatë për lëshim dhe modelit të prodhimit në kohë reale.

Ndërsa grupe të dhënash krahasojnë veçoritë RC dhe PROD, logohen shumë variacione të motorit të klasifikimit të shërbimit të parashikimit. Modeli më i fundit i ndërtuar i mësimit të makinerisë, modeli aktual në prodhim dhe çdo model eksperimental. Të njëjtin qasje na lejon "të presim" versionet e ndryshme të modelit (agnostik të klasifikuesve tanë të rregullave) dhe të krahasojmë metrikat në kohë reale. Kështu është e lehtë të përcaktohet kur eksperimenti me ML është gati për t'u implementuar në prodhim.

Çdo natĂ«, shenjat RC tĂ« llogaritura pĂ«r kĂ«tĂ« ditĂ« dĂ«rgohen nĂ« konvejerin e trajnimit ML, ku modeli trajnohet mbi shenjat mĂ« tĂ« fundit tĂ« RC dhe vlerĂ«son performancĂ«n e tij nĂ« krahasim me njĂ« set tĂ« dhĂ«nash tĂ« besueshĂ«m.

Çdo mĂ«ngjes modeli pĂ«rfundon trajnimin dhe automatikisht publikohet si eksperimentale. Ai automatikisht pĂ«rfshihet nĂ« listĂ«n e eksperimentaleve.

Disa rezultate

Më shumë se 100 lloje të ndryshme të të dhënave etiketohen me saktësi të lartë. Llojet e strukturuara mirë, si email-et dhe numrat e telefonit, klasifikohen me një vlerësim f2 më shumë se 0,95. Llojet e lirë të të dhënave, si përmbajtja e përdoruesve dhe emrat, gjithashtu funksionojnë shumë mirë, me gola F2 më shumë se 0,85.

Një numër i madh kolonash të qëndrueshme dhe të paqëndrueshme të dhënash klasifikohen çdo ditë në të gjitha depozitë. Më shumë se 500 terabajt skanojnë çdo ditë në më shumë se 10 depo të të dhënash. Mb coveri i shumicës së këtyre depozita është më shumë se 98%.

Me gjatë kohës, klasifikimi është bërë shumë efektiv, pasi detyrat e klasifikimit në rrjedhën autonome të ruajtur zgjatin mesatarisht 35 sekonda nga skanimi i aktivizimit deri në llogaritjen e parashikimeve për çdo kolonë.

Klasifikimi i të dhënave të shkallëzuar për sigurinë dhe privatësinë
Fig. 2. Diagrami që përshkruan rrjedhën e vazhdueshme të integrimit për të kuptuar se si gjërat RC generohet dhe dërgohet në model.

Klasifikimi i të dhënave të shkallëzuar për sigurinë dhe privatësinë
Figura 3. Diagrami në nivel të lartë i komponentës së mësimit të makinerive.

Komponenti i sistemit të mësimit të makinerive

Në seksionin e kaluar ne thellë hulumtuam arkitekturën e tërë sistemit, duke theksuar shkallën, optimizimin dhe rrjedhat e të dhënave në modin autonom dhe online. Në këtë seksion do të shqyrtojmë shërbimin e parashikimit dhe do të përshkruajmë sistemin e mësimit të makinerive që siguron funksionimin e shërbimit të parashikimit.

Me më shumë se 100 lloje të të dhënave dhe disa përmbajtje të pa-strukturuar, si të dhënat e mesazheve dhe përmbajtja e përdoruesve, përdorimi ekskluziv i heuristikës manuale rezulton në saktësi klasifikimi subparare, veçanërisht për të dhënat e pa-strukturuar. Për këtë arsye, ne gjithashtu zhvilluam një sistem mësimi makina për të adresuar kompleksitetet e të dhënave të pa-strukturuar. Përdorimi i mësimit të makinave lejon fillimin e një shkëputjeje nga heuristika manuale dhe punën me tiparet dhe sinjalet shtesë të të dhënave (p.sh. emrat e kolonave, origjina e të dhënave) për të përmirësuar saktësinë.

Modeli i realizuar studioja përfaqësimet vektoriale [3] për objekte të dendura dhe të shpërndara veçmas. Më pas, ato bashkohen për të formuar një vektor që kalon përmes një serie fazash të normalizimit të paketave [4] dhe nonlineariteteve për të arritur rezultatin përfundimtar. Rezultati përfundimtar është një numër me presje lëvizëse ndërmjet [0-1] për çdo etiketë, që tregon probabilitetin se shembulli i përket këtij lloji ndjeshmërie. Përdorimi i PyTorch për modelin na lehtësoi të lëvizim më shpejt, duke mundësuar zhvilluesve jashtë ekipit të bëjnë shpejt dhe të testojnë ndryshimet.

NĂ« projektimin e arkitekturĂ«s, ishte e rĂ«ndĂ«sishme tĂ« modeloheshin veçmas objekte tĂ« shpĂ«rndara (p.sh., tekst) dhe tĂ« dendura (p.sh., numra) pĂ«r shkak tĂ« dallimeve tĂ« tyre tĂ« brendshme. Po ashtu, pĂ«r arkitekturĂ«n pĂ«rfundimtare ishte e rĂ«ndĂ«sishme tĂ« realizohej shpĂ«rndarja e parametrave, pĂ«r tĂ« gjetur vlerĂ«n optimale tĂ« shpejtĂ«sisĂ« sĂ« tĂ« mĂ«suarit, madhĂ«sisĂ« sĂ« paketĂ«s dhe hiperparametrave tĂ« tjerĂ«. Zgjedhja e optimizuesit ishte gjithashtu njĂ« hiperparametĂ«r i rĂ«ndĂ«sishĂ«m. Zbuluam se optimizuesi popullor Adamshpesh çon nĂ« mbingarkesĂ«, ndĂ«rsa modeli me SGD mĂ« tĂ« qĂ«ndrueshme. Ishin disa nuanca shtesĂ« qĂ« duhej t’i pĂ«rfshinin nĂ« modelin vetĂ«. PĂ«r shembull, rregullat statike qĂ« garantonin qĂ« modeli bĂ«nte njĂ« parashikim deterministik kur njĂ« karakteristikĂ« kishte njĂ« vlerĂ« tĂ« caktuar. KĂ«to rregulla statike janĂ« tĂ« pĂ«rcaktuara nga klientĂ«t tanĂ«. Ne zbuluam se pĂ«rfshirja e tyre nĂ« model çoi nĂ« krijimin e njĂ« arkitekture mĂ« tĂ« pavarur dhe tĂ« besueshme, pĂ«r dallim nga implementimi i njĂ« faze post-procesimi pĂ«r tĂ« trajtuar kĂ«to raste speciale tĂ« kufizimeve. Gjithashtu, vini re se gjatĂ« trajnimit kĂ«to rregulla janĂ« tĂ« çkyçura pĂ«r tĂ« mos penguar procesin e trajnimit tĂ« gradientit.

Problemet

Një nga problemet ishte mbledhja e të dhënave të besueshme dhe cilësore. Modeli ka nevojë për besueshmëri për çdo kategori, që të mund të studiojë asocimet midis objekteve dhe etiketave. Në seksionin e mëparshëm diskutuam për metodat e mbledhjes së të dhënave si për matjen e sistemit ashtu edhe për trajnimin e modeleve. Analiza tregoi se kategori të dhënash si numrat e kartave të kreditit dhe llogaritë bankare nuk janë shumë të përhapura në depozitat tona. Kjo e bën të vështirë mbledhjen e një sasi të madhe të dhënash të besueshme për trajnimin e modeleve. Për të zgjidhur këtë problem, kemi zhvilluar procese për fitimin e të dhënave sintetike të besueshme për këto kategori. Ne gjenerojmë të dhëna të tilla për lloje të ndjeshme, duke përfshirë SSN, numrat e kartave të kreditit dhe IBAN-numrat për të cilat modeli nuk ka mundur të parashikojë më parë. Ky qasje lejon trajtimin e llojeve të dhënash konfidenciale pa rrezikun e privacisë që lidhet me fshehjen e të dhënave reale konfidenciale.

Përveç problemeve të besueshmërisë së të dhënave, ekzistojnë probleme të hapura të arkitekturës mbi të cilat po punojmë, siç janë izolimi i ndryshimeve dhe ndalimi i hershëm. Izolimi i ndryshimeve është i rëndësishëm për të siguruar që kur bëhen ndryshime të ndryshme në pjesë të ndryshme të rrjetit, ndikimi të izolohet nga klasat specifike dhe të mos ketë një ndikim të gjerë në performancën e përgjithshme të parashikimit. Përmirësimi i kritereve të ndaljes së hershme gjithashtu ka rëndësi thelbësore, në mënyrë që të mund të ndalojmë procesin e trajnim në një pikë të qëndrueshme për të gjitha klasat, dhe jo në atë pikë ku disa klasa përshtaten shumë, ndërsa të tjera jo.

Rëndësia e veçorisë

Kur një veçori e re prezantohet në model, ne duam të dimë ndikimin e saj të përgjithshëm në model. Ne gjithashtu duam të sigurohemi që parashikimet janë interpretuese nga njeriu, për të kuptuar saktësisht se cilat veçori përdoren për çdo tip të të dhënave. Për këtë, ne kemi zhvilluar dhe introduktuar për klasat rëndësia e veçorive për modelin PyTorch. Vini re se kjo është ndryshe nga rëndësia e përgjithshme e veçorisë, e cila zakonisht mbështetet, sepse ajo nuk na tregon se cilat janë veçoritë e rëndësishme për një klasë të caktuar. Ne e masim rëndësinë e objektit duke llogaritur rritjen e gabimit të parashikimit pas riorganizimit të objektit. Një veçori është "e rëndësishme" kur riorganizimi i vlerave rrit gabimin e modelit, pasi në këtë rast modeli mbështetet në veçorinë për parashikimin. Një veçori është "e parëndësishme" kur riorganizimi i vlerave të saj e lë gabimin e modelit të pandryshuar, pasi në këtë rast modeli e injoron atë [5].

Rëndësia e veçorisë për çdo klasë lejon që modeli të jetë i interpretuar, në mënyrë që ne të mund të shohim se në çfarë i kushton vëmendje modeli gjatë parashikimit të etiketës. Për shembull, kur analizojmë ADDR, sigurojmë që veçoria e lidhur me adresën, si AddressLinesCount, të jetë në vend të lartë në tabelën e rëndësisë së veçorive për çdo klasë, për t'u siguruar që intuicioni ynë njerëzor të përputhet mirë me atë që është mësuar nga modeli.

Vlerësimi

ËshtĂ« e rĂ«ndĂ«sishme tĂ« pĂ«rcaktohet njĂ« metrikĂ« e vetme suksesi. Ne zgjodhĂ«m F2 — balancĂ« midis reagimit dhe saktĂ«sisĂ« (devijimi i reagimit Ă«shtĂ« pak mĂ« i madh). Reagimi Ă«shtĂ« mĂ« i rĂ«ndĂ«sishĂ«m pĂ«r rastin e pĂ«rdorimit tĂ« privatĂ«sisĂ« sesa saktĂ«sia, pasi Ă«shtĂ« thelbĂ«sore pĂ«r ekipin tĂ« mos humbasĂ« asnjĂ« tĂ« dhĂ«nĂ« konfidenciale (duke siguruar njĂ« saktĂ«si tĂ« arsyeshme). TĂ« dhĂ«nat faktike tĂ« vlerĂ«simit tĂ« performancĂ«s F2 tĂ« modelit tonĂ« kalojnĂ« pĂ«rtej kĂ«tij artikulli. MegjithatĂ«, me konfigurim tĂ« kujdesshĂ«m mund tĂ« arrijmĂ« njĂ« rezultat tĂ« lartĂ« (0.9+) F2 pĂ«r klasat mĂ« tĂ« ndjeshme.

Puna e lidhur

Ekzistojnë shumë algoritme të klasifikimit automatik të dokumenteve të pa strukturuara duke përdorur metoda të ndryshme, të tilla si përputhja e shablloneve, kërkimi i ngjashmërisë së dokumenteve dhe metoda të ndryshme të mësimit mesin (bayesian, pemë vendimesh, k-afërsia e afërt dhe shumë të tjera) [6]. Cdo prej tyre mund të përdoret si pjesë e klasifikimit. Megjithatë, problemi qëndron te shkallëzueshmëria. Qasja e klasifikimit në këtë artikull është e orientuar drejt fleksibilitetit dhe performancës. Kjo na lejon të mbështesim klasat e reja në të ardhmen dhe të ruajmë vonesë të ulët.

Ekziston gjithashtu një numër i madh punësh për heqjen e gjurmëve nga të dhënat. Për shembull, autorët në [7] përshkruajnë një zgjidhje që përqendrohet në problemin e kapjes së rrjedhjeve të të dhënave të ndjeshme. Supozimi kryesor është mundësia e gjurmës për të krahasuar atë me një grup të njohur të të dhënave të ndjeshme. Autorët në [8] përshkruajnë një problem të ngjashëm të rrjedhjes së privatësisë, por zgjidhja e tyre bazohet në një arkitekturë specifike Android dhe klasifikohet vetëm në rast se veprimet e përdoruesit çuan në dërgimin e informacionit personal ose nëse një aplikacion bazë rrjedh të dhënat e përdoruesit. Situata këtu është ndonjëherë ndryshe, pasi të dhënat e përdoruesit gjithashtu mund të jenë shumë të strukturuara. Prandaj, na nevojitet një teknikë më e sofistikuar sesa heqja e gjurmëve.

Më në fund, për të përballuar mungesën e të dhënave për disa lloje të dhënash të ndjeshme, ne prezantuam të dhëna sintetike. Ekziston një volum i madh literaturë mbi augmentimin e të dhënave, për shembull, autorët në [9] studiuan rolin e injeksionit të zhurmës gjatë trajnimit dhe vunë re rezultate pozitive në mësimin e kontrolluar. Qasja jonë ndaj privatësisë është ndryshe, sepse introduktimi i të dhënave të zhurmshme mund të jetë kunderproduktiv, dhe në vend të kësaj përqendrohemi në të dhëna sintetike të cilësisë së lartë.

Përfundimi

Në këtë artikull, ne prezantuam një sistem që mund të klasifikojë një fragment të dhënash. Kjo na lejon të krijojmë sisteme për të siguruar përputhshmërinë me politikat e privatësisë dhe sigurisë. Ne treguam se infrastruktura e shkallëzuar, integrimi i vazhdueshëm, mësimi me makinë dhe të dhënat cilësore mbi besueshmërinë e të dhënave luajnë një rol kyç në suksesin e shumë iniciativave tona në fushën e privatësisë.

Ekzistojnë shumë drejtime për punën e ardhshme. Ajo mund të përfshijë ofrimin e mbështetjes për të dhënat jo të strukturuara (skedarët), klasifikimin jo vetëm të tipeve të të dhënave, por edhe të nivelit të ndjeshmërisë, si dhe përdorimin e mësimit të vetëkryer në mënyrë të drejtpërdrejtë gjatë mësimit përmes gjenerimit të shembujve të saktë sintetikë. Këta shembuj do të ndihmojnë modelin të zvogëlojë humbjet në masën më të madhe. Puna e ardhshme mund të përqendrohet gjithashtu në procesin e hetimit, ku ne dalim përtej zbulesës dhe ofrojmë një analizë të shkakut rrënor të shkeljeve të ndryshme të privatësisë. Kjo do të ndihmojë në raste të tilla si analiza e ndjeshmërisë (p.sh., a është ndjeshmëria e privatësisë së tipi të dhënave e lartë (p.sh., IP e përdoruesit) apo e ulët (p.sh., IP e brendshme e Facebook-ut)).

Bibliografia

  1. David Ben-David, Tamar Domany, dhe Abigail Tarem. Klasifikimi i tĂ« dhĂ«nave nĂ« ndĂ«rmarrje duke pĂ«rdorur teknologjitĂ« e web-it semantik. NĂ« Peter F.Ï Patel-Schneider, Yue Pan, Pascal Hitzler, Peter Mika, Lei Zhang, Jeff Z. Pan, Ian Horrocks, dhe Birte Glimm, redaktorĂ«, Webi Semantik – ISWC 2010, fq. 66–81, Berlin, Heidelberg, 2010. Springer Berlin Heidelberg.
  2. Subramanian Muralidhar, Wyatt Lloyd, Sabyasachi Roy, Cory Hill, Ernest Lin, Weiwen Liu, Satadru Pan, Shiva Shankar, Viswanath Sivakumar, Linpeng Tang, dhe Sanjeev Kumar. f4: Sistemi i ngrohtĂ« i ruajtjes BLOB tĂ« Facebook. Simpoziumi i 11-tĂ« USENIX mbi Dizajnin dhe Zbatimin e Sistemeve Operative (OSDI 14), fq. 383–398, Broomfield, CO, Tetor 2014. Shoqata USENIX.
  3. Tomas Mikolov, Ilya Sutskever, Kai Chen, Greg S Corrado, dhe Jeff Dean. PĂ«rfaqĂ«simet e shpĂ«rndara tĂ« fjalĂ«ve dhe frazave dhe pĂ«rbĂ«rshmĂ«ria e tyre. NĂ« C. J. C. Burges, L. Bottou, M. Welling, Z. Ghahramani, dhe K. Q. Weinberger, redaktues, PĂ«rparimet nĂ« Sistemet e Informacionit Neural 26, fq. 3111–3119. Curran Associates, Inc., 2013.
  4. Sergey Ioffe dhe Christian Szegedy. Normalizimi i grupeve: Accelerating trajnimi i rrjetit tĂ« thellĂ« duke reduktuar ndryshimin e brendshĂ«m tĂ« variablave. NĂ« Francis Bach dhe David Blei, redaktues, Aktet e KonferencĂ«s NdĂ«rkombĂ«tare tĂ« 32-tĂ« mbi MĂ«simin e Makinerive, vĂ«llimi 37 i Aktet e KĂ«rkimeve mbi MĂ«simin e Makinerive, fq. 448–456, Lille, FrancĂ«, 07–09 Korrik 2015. PMLR.
  5. Leo Breiman. Pyjet e rastĂ«sishme. Mach. Learn., 45(1):5–32, Tetor 2001.
  6. Thair Nu Phyu. Anketë mbi teknikat e klasifikimit në minierat e të dhënave.
  7. X. Shu, D. Yao, dhe E. Bertino. Zbulimi qĂ« ruan privatĂ«sinĂ« tĂ« ekspozimit tĂ« tĂ« dhĂ«nave tĂ« ndjeshme. Transaksionet IEEE mbi ForensikĂ«n dhe SigurinĂ« e Informacionit, 10(5):1092–1103, 2015.
  8. Zhemin Yang, Min Yang, Yuan Zhang, Guofei Gu, Peng Ning, dhe Xiaoyang Wang. Appintent: Duke analizuar transmetimin e tĂ« dhĂ«nave tĂ« ndjeshme nĂ« android pĂ«r zbulimin e rrjedhjes sĂ« privatĂ«sisĂ«. fq. 1043–1054, 11 2013.
  9. Qizhe Xie, Zihang Dai, Eduard H. Hovy, Minh-Thang Luong, dhe Quoc V. Le. Rritja e të dhënave pa mbikëqyrje.

Klasifikimi i të dhënave të shkallëzuar për sigurinë dhe privatësinë
Merrni detaje se si të fitoni një profesion të kërkuar nga e para ose të përmirësoni aftësitë dhe pagat përmes kurseve online SkillFactory:

E tjera kurse

Burimi: habr.com

Bli njĂ« hosting tĂ« besueshĂ«m pĂ«r faqet me mbrojtje DDoS, VPS VDS serverĂ« đŸ”„ Bli njĂ« hosting tĂ« besueshĂ«m pĂ«r faqet me mbrojtje DDoS, VPS VDS serverĂ« | ProHoster