Klasifikimi i shkallëzuar i të dhënave për sigurinë dhe privatësinë

Klasifikimi i shkallëzuar i të dhënave për sigurinë dhe privatësinë

Klasifikimi i të dhënave në bazë të përmbajtjes është një detyrë e hapur. Sistemet tradicionale për parandalimin e humbjes së të dhënave (DLP) e zgjidhin këtë problem duke krijuar gjurmë të të dhënave përkatëse dhe duke monitoruar pikëfundet për të marrë gjurmët. Duke marrë parasysh numrin e madh të burimeve të dhënash që ndryshojnë vazhdimisht në Facebook, ky qasje është jo vetëm jo e shkallëzuar, por gjithashtu joefektive për të përcaktuar se ku ndodhen të dhënat. Ky artikull është i përkushtuar për një sistem të plotë, i ndërtuar për të zbuluar lloje të ndjeshme semantike në Facebook në shkallë dhe për të siguruar automatikisht ruajtjen e të dhënave dhe kontrollin e qasjes.

Qasja e përshkruar këtu është sistemi ynë i parë i plotë për privatësi, i cili përpiqet të zgjidhë këtë problem duke përfshirë sinjalet e të dhënave, mësimin e makinerive dhe metodat tradicionale të gjurmimit për të paraqitur dhe klasifikuar të gjitha të dhënat në Facebook. Sistemi i përshkruar operon në një mjedis prodhimi, duke arritur një rezultat mesatar F2 mbi 0,9 për klasat e ndryshme të privatësisë ndërsa përpunon një numër të madh burimesh të dhënash në dhjetëra depo. Po paraqesim përkthimin e publikimit të Facebook në ArXiv mbi klasifikimin e shkallëzueshëm të të dhënave për të siguruar sigurinë dhe privatësinë në bazë të mësimit të makinerisë.

Hyrje

SotditĂ« organizatat mbledhin dhe ruajnĂ« sasi tĂ« mĂ«dha tĂ« dhĂ«nash nĂ« formate dhe vende tĂ« ndryshme [1], pastaj tĂ« dhĂ«nat konsumohet nĂ« shumĂ« vende, ndonjĂ«herĂ« kopjohen ose ruajnĂ« disa herĂ«, duke rezultuar qĂ« informacioni i vlefshĂ«m dhe i fshehtĂ« i biznesit shpĂ«rndahen nĂ« shumĂ« depo tĂ« dhĂ«nash korporative. Kur njĂ« organizatĂ« kĂ«rkohet tĂ« pĂ«rmbushĂ« disa kĂ«rkesa ligjore ose rregullative, siç Ă«shtĂ« pĂ«rmbushja e rregullave gjatĂ« procedurave civile, shfaqet nevoja pĂ«r tĂ« mbledhur informacion mbi vendndodhjen e tĂ« dhĂ«nave tĂ« nevojshme. Kur njĂ« urdhĂ«r pĂ«r mbrojtjen e tĂ« dhĂ«nave thotĂ« se organizata duhet tĂ« mashtrojĂ« tĂ« gjithĂ« numrat e sigurimeve shoqĂ«rore (SSN) gjatĂ« transferimit tĂ« informacionit personal te subjekte tĂ« paautorizuara, hapi natyror i parĂ« Ă«shtĂ« tĂ« kĂ«rkojmĂ« tĂ« gjithĂ« SSN nĂ« depo tĂ« dhĂ«nash tĂ« gjithĂ« organizatĂ«s. NĂ« ato rrethana, klasifikimi i tĂ« dhĂ«nave bĂ«het jetik [1]. NjĂ« sistem klasifikimi do t’i lejojĂ« organizatat tĂ« sigurojnĂ« automatikisht pĂ«rputhshmĂ«rinĂ« me politikĂ«n e mbi periodit dhe privatĂ«sisĂ«, siç Ă«shtĂ« pĂ«rfshirja e politikave tĂ« menaxhimit tĂ« aksesit, ruajtjes sĂ« tĂ« dhĂ«nave. Facebook paraqet njĂ« sistem tĂ« ndĂ«rtuar nga ne nĂ« Facebook qĂ« pĂ«rdor njĂ« shumĂ«llojshmĂ«ri sinjalesh tĂ« dhĂ«nash, njĂ« arkitekturĂ« tĂ« sistemit tĂ« shkallĂ«zuar dhe mĂ«sim makine pĂ«r zbulimin e llojeve tĂ« dhĂ«nave sensitive semantike.

Zbulimi dhe klasifikimi i të dhënave janë kërkimi dhe etiketimi i tyre në një mënyrë që, kur është e nevojshme, informacioni përkatës mund të nxirret shpejt dhe efikasht. Procesi aktual është kryesisht manual dhe përfshin shqyrtimin e ligjeve ose rregullativave përkatëse, përcaktimin e llojeve të informacionit që duhet të përllogariten të ndjeshme dhe çfarë janë nivelet e ndryshme të ndjeshmërisë, dhe pastaj ndërtimin përkatës të klasave dhe politikave të klasifikimit [1]. Pas sistemeve të mbrojtjes nga humbja e të dhënave (DLP), merren gjurmët e të dhënave dhe ndiqen pikëfundet poshtë për të marrë gjurmë. Kur punoni me një depo me shumë aktive dhe petabajt të dhënash një qasje e tillë thjesht nuk shkallëzohet.

QĂ«llimi ynĂ« Ă«shtĂ« tĂ« ndĂ«rtojmĂ« njĂ« sistem klasifikimi tĂ« tĂ« dhĂ«nave qĂ« shkallĂ«zohet si pĂ«r tĂ« dhĂ«nat e qĂ«ndrueshme ashtu edhe pĂ«r tĂ« dhĂ«nat e paqĂ«ndrueshme tĂ« pĂ«rdoruesve, pa ndonjĂ« kufizim tĂ« mĂ«tejshĂ«m mbi llojin ose formatin e tĂ« dhĂ«nave. Kjo Ă«shtĂ« njĂ« qĂ«llim guximtar dhe, natyrisht, vjen me sfida. Çdo regjistrim tĂ« dhĂ«nash mund tĂ« ketĂ« njĂ« gjatĂ«si prej mijĂ«ra karakteresh.

Klasifikimi i shkallëzuar i të dhënave për sigurinë dhe privatësinë
Fig. 1. Flukset e parashikimit online dhe offline

Prandaj, ne duhet ta paraqesim atë në mënyrë efikase, duke përdorur një grup të përbashkët veçorish, të cilat më pas mund të kombinohen dhe lehtësisht të lëvizin. Këto veçori duhet të sigurojnë jo vetëm klasifikim të saktë, por gjithashtu fleksibilitet dhe zgjerueshmëri për shtimin dhe zbulimin e lehtë të llojeve të reja të të dhënave në të ardhmen. Në radhë të dytë, duhet të merremi me tabela të mëdha autonome. Të dhënat e qëndrueshme mund të ruhen në tabela me përmasa prej disa petabaytësh. Kjo mund të shkaktojë një rënie të shpejtësisë së skanimit. Në radhë të tretë, ne duhet të zbatojmë klasifikim të rreptë SLA për të dhënat e paqëndrueshme. Kjo e bën sistemin të jetë shumë efikas, të shpejtë dhe të sakta. Së fundi, ne duhet të sigurojmë klasifikimin e të dhënave me vonesë të ulët për të dhënat e paqëndrueshme për të kryer klasifikimin në kohë reale, si dhe për raste të përdorimit në internet.

Në këtë artikull përshkruhet si e trajtuam problemet e mësipërme dhe paraqitet një sistem klasifikimi i shpejtë dhe i shkallëzuar, i cili klasifikon elementët e të dhënave të të gjitha tipave, formateve dhe burimeve në bazë të një grupi të përbashkët veçorish. Ne rritëm arkitekturën sistemike dhe krijuam një model të veçantë të mësimit të makinerisë për klasifikim të shpejtë të të dhënave offline dhe online. Ky artikull është organizuar si më poshtë: në seksionin 2 paraqitet dizajni i përgjithshëm i sistemit. Në seksionin 3 diskutohen pjesët e sistemit të mësimit të makinerisë. Në seksionet 4 dhe 5 flitet për punën e lidhur, dhe rindërtohet një drejtim të ardhshëm.

Arkitektura

Për të përballuar problemet e të dhënave të qëndrueshme dhe të dhënave online në shkallën e Facebook-ut, sistemi i klasifikimit ka dy flukse të ndara, të cilat do t'i diskutojmë në detaje.

Të dhënat e qëndrueshme

Sistemi fillimisht duhet të njohë shumë informacion për asetet e Facebook-ut. Për çdo depo, mblidhet disa informacion themelor, si qendra e të dhënave që përmban këto të dhëna, sistemi me këto të dhëna dhe asetet e vendosura në një depo të caktuar të dhënash. Kjo formon një katalog të metadave, duke lejuar sistemin të nxjerrë të dhëna në mënyrë efikase pa e ngarkuar klientin dhe burimet që përdoren nga inxhinierë të tjerë.

Ky katalog i metadave siguron një burim të besueshëm për të gjitha asetet e skanuara dhe lejon ndjekjen e gjendjes së aseteve të ndryshme. Me këtë informacion përcaktohet prioriteti i planifikimit në bazë të të dhënave të mbledhura dhe informacionit të brendshëm nga sistemi, si koha e fundit e skanimit të suksesshëm të aktivës dhe koha e krijimit të saj, si dhe kërkesat e mëparshme për memorie dhe procesor për këtë akt, nëse ishte skanuar më parë. Pastaj, për çdo burim të dhënash (ndërsa burimet bëhen të disponueshme) thirret një detyrë për skanimin real të burimit.

Çdo detyrĂ« Ă«shtĂ« njĂ« skedar binar i kompiluar qĂ« kryen njĂ« zgjedhje Bernoulli mbi tĂ« dhĂ«nat mĂ« tĂ« fundit tĂ« disponueshme pĂ«r çdo aktiv. Aktiviteti ndahen nĂ« kolona tĂ« veçanta, ku rezultati i klasifikimit tĂ« çdo kolone pĂ«rpunon nĂ« mĂ«nyrĂ« tĂ« pavarur. Gjithashtu, sistemi skanon çdo tĂ« dhĂ«nĂ« tĂ« ngopur brenda kolonave. JSON, array, struktura tĂ« koduara, URL-tĂ«, tĂ« dhĂ«nat e serializuara base 64 dhe shumĂ« mĂ« tepĂ«r skanohet. Kjo mund tĂ« rrisĂ« ndjeshĂ«m kohĂ«n e ekzekutimit tĂ« skanimit, pasi njĂ« tabelĂ« mund tĂ« pĂ«rmbajĂ« mijĂ«ra kolona tĂ« ngulitura nĂ« njĂ« objekt binar tĂ« madh. json..

Për çdo rresht që përzgjidhet në aktivin e të dhënave, sistemi i klasifikimit nxjerr objekte flotante dhe tekstuale nga përmbajtja dhe lidh çdo objekt përsëri me kolonen nga e cila u mor. Rezultati i fazës së nxjerrjes së objekteve është një hartë e të gjitha objekteve për çdo kolonë të gjetur në aktivin e dhënave.

Për çfarë shërbejnë karakteristikat?

Koncepci i karakteristikave është një çështje kyçe. Në vend të karakteristikave float dhe text, ne mund të dërgojmë prova të papërpunuara të shenjave, të cilat janë nxjerrë drejtpërdrejt nga çdo burim të dhënash. Për më tepër, modelet e mësimit të makinerisë mund të mësojnë direkt nga çdo mostrë, e jo nga qindra llogaritje të karakteristikave, të cilat përpiqen vetëm të afrojnë mostrën. Kjo ka disa arsye:

  1. Privatësia është përparësi: më e rëndësishmja, koncepti i karakteristikave na lejon të ruajmë në memorie vetëm ato mostra që nxjerrim. Kjo garanton që ne ruajmë mostrën për një qëllim të vetëm dhe kurrë nuk i regjistrojmë ato me përpjekjet tona. Kjo është veçanërisht e rëndësishme për të dhënat e paqëndrueshme, pasi shërbimi duhet të mbajë një gjendje klasifikimi para se të ofrojë parashikimin.
  2. Memoria: disa mostra mund të kenë gjatësi nga mijëra karaktere. Ruajtja e të dhënave të tilla dhe dërgimi i tyre pjesëve të sistemit pa nevojë konsumon shumë bajta të tjerë. Dy faktorë mund të bashkohen me kalimin e kohës, duke marrë parasysh se ka shumë burime të dhënash me mijëra kolona.
  3. Agregimi i karakteristikave: me anë të karakteristikave, përmes setit të tyre paraqiten qartë rezultatet e çdo skanimi, duke i lejuar sistemit të bashkojë rezultatet e skanimet e mëparshme të të njëjtit burim të dhënash në një mënyrë të përshtatshme. Kjo mund të jetë e dobishme për të aggreguar rezultatet e skanimit të një burimi të dhënash në disa ekzekutime.

Pastaj, karakteristikat dërgohen në shërbimin e parashikimit, ku ne përdorim klasifikimin e bazuar në rregulla dhe mësimin e makinerisë për të parashikuar etiketat e të dhënave të çdo kolone. Shërbimi mbështetet si në klasifikuesit e rregullave, ashtu edhe në mësimin e makinerisë dhe zgjidh parashikimin më të mirë, të dhënë nga çdo objekt parashikimi.

Klasifikuesit e rregullave janë heuristika manuale, ata përdorin llogaritje dhe koeficiento për të normalizuar objektin në një gamë nga 0 në 100. Sa herë që një pikë fillestare krijohet për çdo lloj të dhënash dhe emri i kolonës që lidhet me këto të dhëna, nëse nuk bie në asnjë 'listë ndalimi', klasifikuesi i rregullave zgjedh pikën më të lartë të normalizuar midis të gjithë llojeve të të dhënave.

Për shkak të kompleksitetit të klasifikimit, përdorimi ekskluziv i heuristikës manuale çon në saktësi të ulët të klasifikimit, veçanërisht për të dhëna të pa strukturuara. Për këtë arsye, ne zhvilluam një sistem mësimi automatik për të punuar me klasifikimin e të dhënave të pa strukturuara, siç janë përmbajtja e përdoruesve dhe adresa. Mësimi automatik na lejoi të fillojmë të largohemi nga heuristika manuale dhe të aplikojmë sinjale shtesë të dhënash (për shembull, emrat e kolonave, origjina e të dhënave), duke rritur ndjeshëm saktësinë e zbulimit. Ne do të thellohemi në arkitekturën tonë të mësimit automatik më vonë.

ShĂ«rbimi i parashikimit ruan rezultatet pĂ«r çdo kolonĂ« sĂ« bashku me metadaten lidhur me kohĂ«n dhe gjendjen e skanimit. Çdo konsumator dhe procese tĂ« tjera qĂ« varen nga kĂ«to tĂ« dhĂ«na, mund t'i lexojnĂ« ato nga seti i tĂ« dhĂ«nave qĂ« publikohet çdo ditĂ«. Ky set agregon rezultatet e tĂ« gjitha kĂ«tyre detyrave tĂ« skanimit, ose API-nĂ« e kohĂ«s reale tĂ« katalogut tĂ« tĂ« dhĂ«nave. Parashikimet e publikuara janĂ« themeli i aplikimit automatik tĂ« politikĂ«s sĂ« privatĂ«sisĂ« dhe sigurisĂ«.

NĂ« fund, pasi shĂ«rbimi i parashikimit regjistron tĂ« gjitha tĂ« dhĂ«nat dhe tĂ« gjitha parashikimet ruhen, API-ja jonĂ« e katalogut tĂ« tĂ« dhĂ«nave mund tĂ« kthejĂ« tĂ« gjitha parashikimet e llojeve tĂ« tĂ« dhĂ«nave pĂ«r burimin nĂ« kohĂ« reale. Çdo ditĂ«, sistemi publikon njĂ« set tĂ« dhĂ«nash qĂ« pĂ«rmban tĂ« gjitha parashikimet e fundit pĂ«r çdo aktiv.

Të dhëna të pasigurt

Pavarësisht se procesi i përshkruar më sipër është krijuar për asetet e ruajtura, trafiku i papërshkruar gjithashtu konsiderohet një pjesë e të dhënave të organizatës dhe mund të jetë i rëndësishëm. Për këtë arsye, sistemi ofron një API në kohë reale për gjenerimin e parashikimeve të klasifikimit për çdo trafik të pasigurt. Sistemi i parashikimit në kohë reale përdoret gjerësisht për klasifikimin e trafikut të dalshëm, trafikut të hyrshëm në modelet e mësimit automatik dhe të dhënat e reklamuesve.

Kyçi i API pranon dy argumente kryesore: çelësi i grupit dhe të dhënat e papërpunuara që duhet të parashikohen. Shërbimi kryen të njëjtin nxjerrje objektesh siç është përshkruar më sipër dhe grupon objektet së bashku për të njëjtin çelës. Këto karakteristika gjithashtu mbështeten në memorjen e ruajtur për rikthim pas dështimit. Shërbimi garanton për çdo çelës grupimi se para thirrjes së shërbimit të parashikimit ka parë mjaft mostra përkatëse me procesin e përshkruar më lart.

Optimizimi

Për skanimin e disa depozita ne përdorim biblioteka dhe metoda optimizimi për leximin nga depozita e nxehtë [2] dhe garantojmë se nuk ka ndodhur ndonjë dështim nga përdoruesit e tjerë që po aksesojnë të njëjtën depozitë.

Për tabela jashtëzakonisht të mëdha (50+ petabajt), pavarësisht nga të gjitha optimizimet dhe efikasiteti i memories, sistemi punon për skanimin dhe llogaritjen e gjithçkaje para se të mbarojë memoria. Në fund, skanimi llogaritet plotësisht në memory dhe nuk ruhet për gjatë skanimit. Nëse tabelat e mëdha përmbajnë mijëra kolona me grumbuj të dhënash të pa strukturuara, detyra mund të dështojë për shkak të mungesës së resurseve të memories gjatë realizimit të parashikimeve për tërë tabelën. Kjo do të sjellë një zvogëlim të mbulimit. Për të luftuar këtë, ne e kemi optimizuar sistemin që të përdorë shpejtësinë e skanimit si një ndërmjetës për sa mirë e përballon sistemi ngarkesën aktuale. Ne përdorim shpejtësinë si një mekanizëm parashikues për të parë problemet me memorien dhe gjatë llogaritjes parashikuese të hartës së objekteve. Kështu, ne përdorim më pak të dhëna se zakonisht.

Sinjalet e të dhënave

Sistemi i klasifikimit është sa më i mirë sa sinjalet nga të dhënat. Këtu do të shqyrtojmë të gjitha sinjalet që përdoren nga sistemi i klasifikimit.

  • Bazuar nĂ« pĂ«rmbajtje: natyrisht, sinjali i parĂ« dhe mĂ« i rĂ«ndĂ«sishĂ«m Ă«shtĂ« pĂ«rmbajtja. Kryhet njĂ« mostĂ«r Bernoulli pĂ«r çdo aset tĂ« dhĂ«nash, qĂ« ne e skanojmĂ« dhe nxjerrim karakteristika lidhur me pĂ«rmbajtjen e tĂ« dhĂ«nave. Shumica e karakteristikave vijnĂ« nga pĂ«rmbajtja. Mund tĂ« ketĂ« çdo numĂ«r objektesh tĂ« lĂ«vizshme qĂ« pĂ«rfaqĂ«sojnĂ« llogaritjet e numrit tĂ« herĂ«ve qĂ« Ă«shtĂ« vĂ«rejtur njĂ« tip i caktuar i mostĂ«r. PĂ«r shembull, mund tĂ« kemi shenja tĂ« numrit tĂ« email-eve qĂ« janĂ« parĂ« nĂ« mostĂ«r, apo karakteristika tĂ« numrit tĂ« emotikonĂ«ve tĂ« vĂ«rejtur nĂ« mostĂ«r. KĂ«to llogaritje tĂ« karakteristikave mund tĂ« normalizohen dhe aggregohen pĂ«r skanime tĂ« ndryshme.
  • Origjina e tĂ« dhĂ«nave: njĂ« sinjal i rĂ«ndĂ«sishĂ«m qĂ« mund tĂ« ndihmojĂ« kur pĂ«rmbajtja ka ndryshuar nga tabela prind. NjĂ« shembull i zakonshĂ«m janĂ« tĂ« dhĂ«nat e heshura. Kur tĂ« dhĂ«nat nĂ« tabelĂ«n fĂ«mijĂ« heshur, ato shpesh vijnĂ« nga tabela prind, ku mbeten tĂ« hapura. TĂ« dhĂ«nat mbi origjinĂ«n ndihmojnĂ« nĂ« klasifikimin e tipeve tĂ« caktuara tĂ« tĂ« dhĂ«nave, kur ato nuk lexohen qartĂ« ose janĂ« transformuar nga tabela lart nĂ« gjenezĂ«.
  • Annotationet: njĂ« tjetĂ«r sinjal me cilĂ«si tĂ« lartĂ«, qĂ« ndihmon nĂ« identifikimin e tĂ« dhĂ«nave jo-strukturuara. NĂ« fakt, annotationet dhe tĂ« dhĂ«nat e origjinĂ«s mund tĂ« punojnĂ« sĂ« bashku pĂ«r tĂ« shpĂ«rndarĂ« atribute midis aktiveve tĂ« ndryshme tĂ« tĂ« dhĂ«nave. Annotationet ndihmojnĂ« nĂ« identifikimin e burimit tĂ« tĂ« dhĂ«nave jo-strukturuara, ndĂ«rkohĂ« qĂ« tĂ« dhĂ«nat mbi origjinĂ«n mund tĂ« ndihmojnĂ« nĂ« ndjekjen e rrjedhĂ«s sĂ« kĂ«tyre tĂ« dhĂ«nave nĂ« tĂ« gjithĂ« depo.
  • Injektimi i tĂ« dhĂ«nave Ă«shtĂ« njĂ« metodĂ«, ku qĂ«llimisht futen simbole speciale, tĂ« padukshme nĂ« burime tĂ« njohura me lloje tĂ« njohura tĂ« tĂ« dhĂ«nave. Pastaj, çdo herĂ« qĂ« ne skanojmĂ« pĂ«rmbajtjen me tĂ« njĂ«jtin rend tĂ« padukshĂ«m tĂ« simboleve, mund tĂ« konkludohet se pĂ«rmbajtja e buron nga ky tip i njohur tĂ« dhĂ«nash. Ky Ă«shtĂ« njĂ« sinjal tjetĂ«r cilĂ«sor i tĂ« dhĂ«nave, tĂ« ngjashĂ«m me annotationet. PĂ«rveç kĂ«saj, zbulimi mbi bazĂ«n e pĂ«rmbajtjes ndihmon nĂ« zbulimin e tĂ« dhĂ«nave tĂ« dhĂ«na.

Matja e metrikeve

Një komponent i rëndësishëm është metodologjia rigoroze e matjes së metrikeve. Metriket kryesore të iterimit për përmirësimin e klasifikimit janë saktësia dhe kujdesi i çdo etiketë, ndërsa vlerësimi F2 është më i rëndësishëm.

Për të llogaritur këto tregues, është e nevojshme një metodologji e pavarur për etiketimin e aktiveve të të dhënave, e cila nuk varet nga vetë sistemi, por mund të përdoret për krahasime të drejtpërdrejta me të. Më poshtë ne do të përshkruajmë se si e mbledhim të vërtetën bazë nga Facebook dhe e përdorim për të trajnuar sistemin tonë të klasifikimit.

Mbledhja e të dhënave të besueshme

Ne akumulojmĂ« tĂ« dhĂ«na tĂ« besueshme nga çdo burim tĂ« listuar mĂ« poshtĂ«, nĂ« tabelĂ«n e tij pĂ«rkatĂ«se. Çdo tabelĂ« pĂ«rgjigjet pĂ«r agregimin e vlerave tĂ« fundit tĂ« vĂ«zhguara nga ky burim tĂ« veçantĂ«. Çdo burim ka njĂ« kontroll tĂ« cilĂ«sisĂ« sĂ« tĂ« dhĂ«nave pĂ«r t'u siguruar qĂ« vlerat e vĂ«zhguara pĂ«r çdo burim janĂ« tĂ« larta nĂ« cilĂ«si dhe pĂ«rfshijnĂ« etiketat mĂ« tĂ« fundit tĂ« llojeve tĂ« tĂ« dhĂ«nave.

  • Konfigurimet e platformĂ«s sĂ« logimit: fushat e caktuara nĂ« tabelat e koshit plotĂ«sohen me tĂ« dhĂ«na qĂ« i pĂ«rkasin njĂ« lloji tĂ« caktuar. PĂ«rdorimi dhe shpĂ«rndarja e kĂ«tyre tĂ« dhĂ«nave shĂ«rben si njĂ« burim i besueshĂ«m i tĂ« dhĂ«nave tĂ« besueshme.
  • Etiketimi me dorĂ«: zhvilluesit qĂ« mbĂ«shtesin sistemin dhe gjithashtu etiketuesit e jashtĂ«m janĂ« tĂ« trajnuar pĂ«r tĂ« etiketuar kolonat. Kjo zakonisht funksionon mirĂ« pĂ«r tĂ« gjitha llojet e tĂ« dhĂ«nave nĂ« depo, dhe mund tĂ« jetĂ« burimi kryesor i besueshmĂ«risĂ« pĂ«r disa tĂ« dhĂ«na jo-strkturuara, siç janĂ« tĂ« dhĂ«nat e mesazheve ose pĂ«rmbajtja e pĂ«rdoruesve.
  • Kolonat nga tabelat prind mund tĂ« etiketohen ose annotohen si pĂ«rmbajnĂ« tĂ« dhĂ«na tĂ« caktuara, dhe ne mund t'i ndjekim kĂ«to tĂ« dhĂ«na nĂ« tabelat nĂ«nka.
  • Konsultimi i rrjedhave tĂ« ekzekutimit: rrjedhat e ekzekutimit nĂ« Facebook mbajnĂ« tĂ« dhĂ«na tĂ« njĂ« lloji tĂ« caktuar. Duke pĂ«rdorur skanerin tonĂ« si njĂ« arkitekturĂ« shĂ«rbimi, ne mund tĂ« konsultojmĂ« rrjedhat qĂ« kanĂ« lloje tĂ« njohura tĂ« tĂ« dhĂ«nave dhe t’i dĂ«rgojmĂ« ato pĂ«rmes sistemit. Sistemi premton tĂ« mos ruajĂ« kĂ«to tĂ« dhĂ«na.
  • Tabelat e konsultimit: tabelat e mĂ«dha tĂ« koshit, tĂ« cilat janĂ« tĂ« njohura pĂ«r tĂ« pĂ«rmbajtur tĂ« gjithĂ« korpusin e tĂ« dhĂ«nave, gjithashtu mund tĂ« pĂ«rdoren si tĂ« dhĂ«na trajnuese dhe tĂ« dĂ«rgohen pĂ«rmes skanerit si shĂ«rbim. Kjo Ă«shtĂ« e shkĂ«lqyer pĂ«r tabelat me njĂ« gamĂ« tĂ« plotĂ« llojesh tĂ« dhĂ«nash, kĂ«shtu qĂ« konsultimi i njĂ« colonne rastĂ«sisht Ă«shtĂ« ekuivalente me konsultimin e tĂ« gjithĂ« setit tĂ« kĂ«tij lloji tĂ« dhĂ«nash.
  • TĂ« dhĂ«nat sintetike: ne mund tĂ« pĂ«rdorim edhe biblioteka qĂ« gjenerojnĂ« tĂ« dhĂ«na nĂ« kohĂ« reale. Kjo funksionon mirĂ« pĂ«r lloje tĂ« thjeshta, publikohet tĂ« dhĂ«nash si adresa ose GPS.
  • MenaxherĂ«t e tĂ« dhĂ«nave: programet e privatĂ«sisĂ« shpesh pĂ«rdorin menaxherĂ« tĂ« tĂ« dhĂ«nave pĂ«r tĂ« bashkangjitur manualisht politika pĂ«r pjesĂ«t e tĂ« dhĂ«nave. Kjo shĂ«rben si njĂ« burim shumĂ« i saktĂ« besueshmĂ«rie.

Ne bashkojmë çdo burim kryesor të të dhënave të besueshme në një korp tjetër me të gjitha këto të dhëna. Problemi më i madh me besueshmërinë është të sigurohemi se ajo është përfaqësuese e depozitës së të dhënave. Përndryshe, motorët e klasifikimit mund të stërviten më shumë. Në luftën me këtë, të gjithë burimet e mësipërme përdoren për të siguruar një ekuilibër gjatë trajnimit të modeleve ose llogaritjes së matjeve. Për më tepër, njerëzit etiketues përzgjidhen në mënyrë të barabartë nga kolona të ndryshme në depozitë dhe etiketojnë përkatësisht të dhënat, në mënyrë që mbledhja e vlerave të besueshme të mbetet e paanshme.

Integrimi i vazhdueshëm

Për të siguruar iterim të shpejtë dhe përmirësim, është e rëndësishme të matet gjithmonë performanca e sistemit në kohë reale. Ne mund të masim çdo përmirësim të klasifikimit në krahasim me sistemin e sotëm, në mënyrë që taktikisht të orientojmë të dhënat në përmirësimet e ardhshme. Këtu do të shqyrtojmë se si sistemi përfundon ciklin e feedback-ut, i cili mundësohet nga të dhënat e besueshme.

Kur sistemi i planifikimit pĂ«rballet me njĂ« aktiv qĂ« ka njĂ« etiketĂ« nga njĂ« burim tĂ« besueshĂ«m, ne planifikojmĂ« dy detyra. E para pĂ«rdor skanerin tonĂ« prodhues dhe, kĂ«shtu, kapacitetet tona prodhuese. Detyra e dytĂ« pĂ«rdor skanerin e versionit mĂ« tĂ« fundit me tiparet mĂ« tĂ« fundit. Çdo detyrĂ« shkruan rezultatin e saj nĂ« tabelĂ«n pĂ«rkatĂ«se, duke treguar versionet me rezultatet e klasifikimit.

Kështu, ne krahasojmë rezultatet e klasifikimit të kandidatëve të lëshimit dhe modelit prodhues në kohë reale.

NdĂ«rsa grupet e tĂ« dhĂ«nave krahasojnĂ« cilĂ«sitĂ« RC dhe PROD, regjistrohen shumĂ« variante tĂ« motorit tĂ« klasifikimit tĂ« shĂ«rbimit tĂ« parashikimit ML. Modeli mĂ« i fundit i ndĂ«rtuar i mĂ«simit tĂ« makinerive, modeli aktual nĂ« prodhim dhe çdo model eksperimental. TĂ« njĂ«jtin qasje na lejon "ta ndajmĂ«" versionet e ndryshme tĂ« modelit (agnostikĂ« tĂ« klasifikuesve tanĂ« tĂ« rregullave) dhe tĂ« krahasojmĂ« metrikat nĂ« kohĂ« reale. ËshtĂ« shumĂ« e lehtĂ« tĂ« pĂ«rcaktohet kur eksperimenti me ML Ă«shtĂ« gati pĂ«r t'u integruar nĂ« prodhim.

Çdo natĂ«, karakteristikat RC, tĂ« llogaritura pĂ«r atĂ« ditĂ«, dĂ«rgohen nĂ« tubin mĂ«simor tĂ« ML, ku modeli trajnohet me karakteristikat mĂ« tĂ« fundit RC dhe vlerĂ«son performancĂ«n e tij nĂ« krahasim me njĂ« grup tĂ« dhĂ«nash tĂ« besueshĂ«m.

Çdo mĂ«ngjes, modeli pĂ«rfundon trajnimet dhe publikohet automatikisht si eksperimental. Ai automatikisht pĂ«rfshihet nĂ« listĂ«n e eksperimentaleve.

Disa rezultate

Diku më shumë se 100 lloje të ndryshme të të dhënave etiketohen me saktësi të lartë. Llojet e strukturuara mirë, si email-et dhe numrat e telefonit, klasifikohen me vlerësim f2 më shumë se 0.95. Llojet e lirshme të të dhënave, si përmbajtja e përdoruesit dhe emrat, gjithashtu funksionojnë shumë mirë, me pikë f2 më shumë se 0.85.

Çdo ditĂ«, njĂ« numĂ«r i madh kolonash tĂ« dhĂ«nash tĂ« qĂ«ndrueshme dhe tĂ« paqĂ«ndrueshme klasifikohen nĂ« tĂ« gjitha depozitĂ«. MĂ« shumĂ« se 500 terabajt skanohen çdo ditĂ« nĂ« mĂ« shumĂ« se 10 depozita tĂ« dhĂ«nash. Mbulimi i shumicĂ«s sĂ« kĂ«tyre depozitave Ă«shtĂ« mĂ« shumĂ« se 98%.

Me kalimin e kohës, klasifikimi është bërë shumë efikas, pasi detyrat e klasifikimit në rrjedhën autonome të ruajtur zgjasin mesatarisht 35 sekonda nga skanimi i aktivës deri në llogaritjen e parashikimeve për secilën kolonë.

Klasifikimi i shkallëzuar i të dhënave për sigurinë dhe privatësinë
Fig. 2. Një diagram që përshkruan rrjedhën e vazhdueshme të integrimit, për të kuptuar si objektet RC gjenerohen dhe dërgohen në model.

Klasifikimi i shkallëzuar i të dhënave për sigurinë dhe privatësinë
Figura 3. Një diagram i nivelit të lartë të komponentit të mësimit të makinerive.

Komponenti i sistemit të mësimit të makinerive

Në kapitullin e mëparshëm, ne thellësisht hulumtuam arkitekturën e gjithë sistemit, duke theksuar shkallën, optimizimin dhe rrjedhat e të dhënave në modalitetin autonom dhe online. Në këtë kapitull, ne do të shqyrtojmë shërbimin e parashikimit dhe do të përshkruajmë sistemin e mësimit të makinerive që siguron funksionimin e shërbimit të parashikimit.

Me më shumë se 100 lloje të dhënash dhe disa përmbajtje jo-strukturore, siç janë të dhënat e mesazheve dhe përmbajtja e përdoruesit, përdorimi ekskluziv i heurisë manuale rezulton në saktësi klasifikimi nënparimetrike, veçanërisht për të dhënat jo-strukturore. Për këtë arsye, ne gjithashtu kemi zhvilluar një sistem të mësimit automat për të trajtuar kompleksitetet e të dhënave jo-strukturore. Përdorimi i mësimit automat lejon të fillojmë të largohemi nga heuristika manuale dhe të punojmë me karakteristikat dhe sinjalet shtesë të dhënash (p.sh., emrat e kolonave, origjina e të dhënave) për të rritur saktësinë.

Modeli i realizuar mëson përfaqësimet vektoriale [3] mbi objekte të dendura dhe të holluara veçmas. Pas kësaj, ato bashkohen për të formuar një vektor që kalon nëpër një seri fazash normalizimi të grupit [4] dhe jo-lineariteti për të arritur rezultatin përfundimtar. Rezultati përfundimtar është një numër me pikë të lundrueshme midis [0-1] për çdo etiketë, që tregon probabilitetin që shembulli i përket një lloji të caktuar ndjeshmërie. Përdorimi i PyTorch për modelin na lejoi të lëviznim më shpejt, duke u ofruar zhvilluesve jashtë ekipit mundësinë për të bërë dhe testuar shpejt ndryshime.

GjatĂ« projektimit tĂ« arkitekturĂ«s, ishte e rĂ«ndĂ«sishme tĂ« modeloheshin objektet e holluara (p.sh., tekstuale) dhe ato tĂ« dendura (p.sh., numerike) veçmas pĂ«r shkak tĂ« dallimeve tĂ« brendshme. PĂ«r arkitekturĂ«n pĂ«rfundimtare, ishte gjithashtu e rĂ«ndĂ«sishme tĂ« realizohej zbĂ«rthimi i parametrave pĂ«r tĂ« gjetur vlerĂ«n optimale tĂ« normĂ«s sĂ« tĂ« mĂ«suarit, madhĂ«sisĂ« sĂ« grupit dhe parametrave tĂ« tjerĂ« hipermetricĂ«. Zgjedhja e optimizuesit gjithashtu ishte njĂ« parametr hipermetrik i rĂ«ndĂ«sishĂ«m. Ne zbuluam se optimizuesi i njohur Adamshpesh çon nĂ« mbifitim, ndryshe nga modeli me SGD mĂ« tĂ« qĂ«ndrueshme. Kishte aspekte tĂ« tjera qĂ« ne duhej t’i pĂ«rfshimĂ« direkt nĂ« model. PĂ«r shembull, rregulla statike qĂ« garantonin se modeli bĂ«nte njĂ« parashikim deterministik kur njĂ« karakteristikĂ« kishte njĂ« vlerĂ« tĂ« caktuar. KĂ«to rregulla statike janĂ« tĂ« definuara nga klientĂ«t tanĂ«. Ne zbuluam se pĂ«rfshirja e tyre direkt nĂ« model çoi nĂ« krijimin e njĂ« arkitekture mĂ« tĂ« vetĂ«-pavarur dhe tĂ« besueshme, nĂ« vend tĂ« implementimit tĂ« njĂ« faze postprocesimi pĂ«r tĂ« trajtuar kĂ«to raste speciale tĂ« kufizuara. Po ashtu, vĂ«reni se gjatĂ« stĂ«rvitjes kĂ«to rregulla janĂ« çaktivizuar pĂ«r tĂ« mos e penguar procesin e stĂ«rvitjes sĂ« rĂ«nies gradienti.

Problemet

Një nga problemet ishte mbledhja e të dhënave të besueshme me cilësi të lartë. Modeli ka nevojë për besueshmëri për çdo kategori, në mënyrë që të mund të studiojë asociacionet midis objekteve dhe etiketave. Në seksionin e mëparshëm kemi diskutuar metodat e mbledhjes së të dhënave si për matjen e sistemit ashtu edhe për stërvitjen e modeleve. Analiza tregoi se klasa të tilla të dhënash si numrat e kartave të kreditit dhe numrat e llogarive bankare nuk janë shumë të përhapura në ruajtjen tonë. Kjo e vështirëson mbledhjen e volumeve të mëdha të të dhënave të besueshme për stërvitjen e modeleve. Për të zgjidhur këtë problem, zhvilluam procese për të krijuar të dhëna sintetike të besueshme për këto klasa. Ne krijojmë të dhëna të tilla për tipe të ndjeshme, duke përfshirë SSN, numrat e kartave të kreditit dhe IBAN-numrat për të cilët modeli nuk mund të parashikonte më parë. Ky qasje lejon trajtimin e tipeve të dhënash konfidenciale pa rrezikun e privatesisë, i lidhur me fshehjen e të dhënave reale konfidenciale.

Përveç problemeve të të dhënave të besueshme, ka probleme të hapura arkitekturore mbi të cilat ne po punojmë, të tilla si izolimi i ndryshimeve dhe ndalimi i hershëm. Izolimi i ndryshimeve është i rëndësishëm për të siguruar që, kur bëhen ndryshime të ndryshme në pjesë të ndryshme të rrjetit, ndikimi të jetë i izoluara në kategori specifike dhe të mos ketë një ndikim të gjerë në performancën e përgjithshme të parashikimit. Përmirësimi i kritereve për ndalimin e hershëm gjithashtu ka rëndësi jetike për ne që të mund të ndalojmë procesin e stërvitjes në një pikë të qëndrueshme për të gjitha kategoritë, jo në atë pikë ku disa kategori janë mbiparashikuar dhe të tjera jo.

Rëndësia e veçorisë

Kur një veçori e re përfshihet në model, ne duam të dimë ndikimin e saj të përgjithshëm mbi modelin. Gjithashtu, ne duam të sigurohemi që parashikimet të jenë interpretuese nga njerëzit, në mënyrë që të kuptohet plotësisht se cilat veçori përdoren për çdo tip të dhënash. Për këtë, ne kemi zhvilluar dhe futur për klasat rëndësinë e veçorive për modelin PyTorch. Vlen të theksohet se kjo është ndryshe nga rëndësia e përgjithshme e veçorisë, e cila zakonisht mbështetet, sepse nuk na tregon se cilat veçori janë të rëndësishme për një klasë të caktuar. Ne e matim rëndësinë e objektit duke llogaritur rritjen e gabimit të parashikimit pas përzierjes së objektit. Një veçori është "e rëndësishme" kur përzierja e vlerave rrit gabimin e modelit, sepse në këtë rast modeli u mbështet në veçorinë në parashikimin. Një veçori është "e parëndësishme" kur përzierja e vlerave të saj lë gabimin e modelit të pandryshuar, sepse në këtë rast modeli e injoroi atë [5].

Rëndësia e veçorisë për secilën klasë e bën modelin interpretuese, në mënyrë që ne të mund të shohim në çfarë vëmendjeje i kushton modeli gjatë parashikimit të etiketës. Për shembull, kur analizojmë ADDR, ne sigurohemi që veçoria e lidhur me adresën, siç është CountLinesAddress, zë një vend të lartë në tabelën e rëndësisë së veçorive për secilën klasë, në mënyrë që intuicioni ynë njerëzor të përputhet mirë me atë që ka mësuar modeli.

Vlerësimi

ËshtĂ« e rĂ«ndĂ«sishme tĂ« pĂ«rcaktohet njĂ« metrikĂ« e vetme suksesi. Ne zgjodhĂ«m F2 - njĂ« balancĂ« midis rikthimit dhe saktĂ«sisĂ« (me njĂ« shpĂ«rbĂ«rje tĂ« vogĂ«l tĂ« rikthimit). Rikthimi Ă«shtĂ« mĂ« i rĂ«ndĂ«sishĂ«m pĂ«r rastin e pĂ«rdorimit tĂ« privatĂ«sisĂ« sesa saktĂ«sia, sepse pĂ«r ekipin Ă«shtĂ« jashtĂ«zakonisht e rĂ«ndĂ«sishme tĂ« mos humbasĂ« asnjĂ« tĂ« dhĂ«nĂ« tĂ« ndjeshme (duke siguruar gjithashtu njĂ« saktĂ«si tĂ« arsyeshme). TĂ« dhĂ«nat reale tĂ« vlerĂ«simit tĂ« performancĂ«s F2 tĂ« modelit tonĂ« kalojnĂ« pĂ«rtej kĂ«tij artikulli. MegjithatĂ«, me njĂ« optimizim tĂ« kujdesshĂ«m, ne mund tĂ« arrijmĂ« njĂ« pikĂ« tĂ« lartĂ« (0,9+) F2 pĂ«r klasat mĂ« tĂ« ndjeshme.

Puna e lidhur

Ka there shumĂ« algoritme pĂ«r klasifikimin automatik tĂ« dokumenteve tĂ« pa strukturuara duke pĂ«rdorur metoda tĂ« ndryshme, si pĂ«rputhja e modele, kĂ«rkimi i ngjashmĂ«rive tĂ« dokumenteve dhe metoda tĂ« ndryshme tĂ« mĂ«simit tĂ« makinerisĂ« (bayesiane, pemĂ«t e vendimeve, fqinjĂ«t mĂ« tĂ« afĂ«rt dhe shumĂ« tĂ« tjera) [6]. Çdo njĂ«ra prej tyre mund tĂ« pĂ«rdoret si pjesĂ« e klasifikimit. MegjithatĂ«, problemi Ă«shtĂ« nĂ« shkallĂ«zueshmĂ«ri. Qasja pĂ«r klasifikimin nĂ« kĂ«tĂ« artikull Ă«shtĂ« orientuar drejt fleksibilitetit dhe performancĂ«s. Kjo na lejon tĂ« mbĂ«shtesim klasat e reja nĂ« tĂ« ardhmen dhe tĂ« mbajmĂ« njĂ« vonesĂ« tĂ« ulĂ«t.

Ekziston gjithashtu një sasi e madhe punimesh për marrjen e gjurmëve nga të dhënat. Për shembull, autorët në [7] përshkruan një zgjidhje që përqendrohet në problemin e kapjes së rrjedhjeve të të dhënave të ndjeshme. Supozimi kryesor është mundësia e gjurmës nga të dhënat, për ta përputhur atë me një grup të njohur të dhënash të ndjeshme. Autorët në [8] përshkruajnë një problem të ngjashëm të rrjedhjes së privatësisë, por zgjidhja e tyre bazohet në një arkitekturë specifike Android dhe klasifikohet vetëm kur veprimet e përdoruesit rezultojnë në dërgimin e informacionit personal ose nëse ka një rrjedhje të të dhënave të përdoruesve në aplikacionin bazë. Situata këtu është disa herë e ndryshme, pasi të dhënat e përdoruesve gjithashtu mund të jenë shumë të pa strukturuara. Prandaj, na nevojitet një teknikë më komplekse sesa marrja e gjurmëve.

Në fund, për të përballuar mungesën e të dhënave për disa lloje të të dhënave të ndjeshme, ne e kemi futur përdorimin e të dhënave sintetike. Ekziston një volum i madh literaturë mbi augmentimin e të dhënave, për shembull, autorët në [9] kanë studiuar rolin e injeksionit të zhurmës gjatë mësimit dhe kanë vërejtur rezultate pozitive në mësimin e kontrolluar. Qasja jonë ndaj privatësisë është e ndryshme, sepse introduktimi i të dhënave të zhurmuara mund të jetë kontraproduktive, dhe në vend të kësaj përqendrohemi në të dhëna sintetike me cilësi të lartë.

Përfundim

Në këtë artikull paraqesim një sistem që mund të klasifikojë fragmentet e të dhënave. Kjo na lejon të krijojmë sisteme për të siguruar ndjekjen e politikave të privatësisë dhe sigurisë. Ne treguam se infrastruktura e shkallëzueshme, integrimi i vazhdueshëm, mësimi përmes makinerive dhe të dhënat e besueshmërisë së larte luajnë një rol kyç në suksesin e shumë iniciativave tona në fushën e privatësisë.

Ka shumë drejtime për punën e ardhshme. Ajo mund të përfshijë sigurimin e mbështetjes për të dhëna të papërcaktuara (skedarë), klasifikimin jo vetëm të llojit të të dhënave, por edhe të nivelit të ndjeshmërisë, si dhe përdorimin e mësimit të vetëk kontrolluar gjatë trajnimit përmes gjenerimit të shembujve sintetikë të saktë. Këta, nga ana e tyre, do të ndihmojnë modelin të ulë humbjet në maksimum. Puna e ardhshme mund të përqendrohet gjithashtu në procesin e hetimit, ku ne dalim përtej zbulimit dhe ofrojmë analizë të shkakut të ndryshimeve të ndryshme të privatësisë. Kjo do të ndihmojë në raste të tilla si analiza e ndjeshmërisë (dmth, a është ndjeshmëria e privatësisë e llojit të të dhënave e lartë (p.sh. IP e përdoruesit) apo e ulët (p.sh. IP e brendshme e Facebook).

Bibliografia

  1. David Ben-David, Tamar Domany, dhe Abigail Tarem. Klasifikimi i tĂ« dhĂ«nave tĂ« ndĂ«rmarrjeve duke pĂ«rdorur teknologjitĂ« e rrjetit semantik. NĂ« Peter F.İ Patel-Schneider, Yue Pan, Pascal Hitzler, Peter Mika, Lei Zhang, Jeff Z. Pan, Ian Horrocks, dhe Birte Glimm, redaktorĂ«, Rrjeti Semantik – ISWC 2010, fq. 66–81, Berlin, Heidelberg, 2010. Springer Berlin Heidelberg.
  2. Subramanian Muralidhar, Wyatt Lloyd, Sabyasachi Roy, Cory Hill, Ernest Lin, Weiwen Liu, Satadru Pan, Shiva Shankar, Viswanath Sivakumar, Linpeng Tang, dhe Sanjeev Kumar. f4: Sistemi i ngrohjes BLOB tĂ« Facebook. NĂ« Simpoziumi i 11-tĂ« USENIX mbi Dizajnin dhe Zbatimin e Sistemeve Operative (OSDI 14), fq. 383–398, Broomfield, CO, tetor 2014. Asociata USENIX.
  3. Tomas Mikolov, Ilya Sutskever, Kai Chen, Greg S Corrado, dhe Jeff Dean. PĂ«faqĂ«sime tĂ« shpĂ«rndara tĂ« fjalĂ«ve dhe frazave dhe kompozicionaliteti i tyre. NĂ« C. J. C. Burges, L. Bottou, M. Welling, Z. Ghahramani, dhe K. Q. Weinberger, redaktorĂ«, PĂ«rmirĂ«simet nĂ« Sistemet e Informacionit Neural 26, fq. 3111–3119. Curran Associates, Inc., 2013.
  4. Sergey Ioffe dhe Christian Szegedy. Normalizimi i grupeve: Shtyrja pĂ«rpara e trajnimit tĂ« rrjeteve tĂ« thella duke reduktuar zhvendosjen e brendshme tĂ« variablit. NĂ« Francis Bach dhe David Blei, redaktorĂ«, Aktet e KonferencĂ«s NdĂ«rkombĂ«tare tĂ« MĂ«simit tĂ« MakinerisĂ« tĂ« 32-tĂ«, vĂ«llimi 37 i Aktet e KĂ«rkimit tĂ« MĂ«simit tĂ« MakinerisĂ«, fq. 448–456, Lille, FrancĂ«, 07–09 Korrik 2015. PMLR.
  5. Leo Breiman. Pyjet RastĂ«sore. MĂ«s. MĂ«s., 45(1):5–32, tetor 2001.
  6. Thair Nu Phyu. Anketa e teknikave të klasifikimit në minierat e të dhënave.
  7. X. Shu, D. Yao, dhe E. Bertino. Zbulimi i mbrojtur i ekspozitĂ«s sĂ« tĂ« dhĂ«nave tĂ« ndjeshme. Transaksionet IEEE mbi ForensicĂ«n e Informacionit dhe SigurinĂ«, 10(5):1092–1103, 2015.
  8. Zhemin Yang, Min Yang, Yuan Zhang, Guofei Gu, Peng Ning, dhe Xiaoyang Wang. Appintent: Analizimi i transmetimit tĂ« tĂ« dhĂ«nave tĂ« ndjeshme nĂ« android pĂ«r zbulimin e rrjedhjes sĂ« privatĂ«sisĂ«. faqet 1043–1054, 11 2013.
  9. Qizhe Xie, Zihang Dai, Eduard H. Hovy, Minh-Thang Luong, dhe Quoc V. Le. Rritja e të dhënave të pa mbikëqyrura.

Klasifikimi i shkallëzuar i të dhënave për sigurinë dhe privatësinë
Merrni detaje se si të fitoni një profesion të kërkuar nga fillimi ose të përmirësoni aftësitë dhe pagën tuaj duke kaluar nëpër kurset online SkillFactory:

Kurse të tjera

Burimi: habr.com

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster