Een groep onderzoekers van Mozilla, de Universiteit van Iowa en de Universiteit van Californiƫ heeft de resultaten bestudeerd van het gebruik van code voor verborgen identificatie van gebruikers op websites. Verborgen identificatie houdt in dat identificatoren worden gegenereerd op basis van indirecte gegevens over de werking van de browser, zoals , ondersteunde MIME-typen, specifieke parameters in de headers ( en ) plugins en lettertypen renderingen met behulp van WebGL en , met CSS, , van netwerpoorten, analysis van de kenmerken van de interactie met en .
Een studie van 100.000 populairste websites volgens de Alexa-ranglijst toonde aan dat code voor verborgen identificatie op 9.040 van hen (10,18%) wordt gebruikt. Wanneer we kijken naar de duizend populairste websites, werd dergelijke code aangetroffen in 30,60% van de gevallen (266 websites), en onder websites die van duizendste tot tienduizendste plaats in het ranglijst vallen, in 24,45% van de gevallen (2010 websites). Verborgen identificatie wordt voornamelijk toegepast in scripts die door externe services worden aangeboden voor en het filteren van bots, evenals door advertentienetwerken en systemen voor het volgen van gebruikersbewegingen.
Om de code voor verborgen identificatie te identificeren, is een toolkit ontwikkeld , waarvan de code onder MIT-licentie valt. De toolkit maakt gebruik van methoden voor machine learning in combinatie met statische en dynamische analyse van JavaScript-code. Er wordt beweerd dat het gebruik van machine learning de nauwkeurigheid van het identificeren van code voor verborgen identificatie aanzienlijk heeft verbeterd en 26% meer problematische scripts heeft onthuld
vergeleken met handmatig ingestelde heuristieken.
Veel van de geĆÆdentificeerde identificatiescripts ontbraken in de gebruikelijke blokkadelijsten , , DuckDuckGo, en .
Na het indienen door de ontwikkelaars van de blokkadelijst EasyPrivacy, werd er een aparte sectie voor scripts voor verborgen identificatie. Bovendien heeft FP-Inspector nieuwe manieren ontdekt om Web-API's te gebruiken voor identificatie die eerder niet in de praktijk voorkwamen.
Bijvoorbeeld, werd het gebruik van informatie voor het identificeren van de indeling van het toetsenbord (getLayoutMap), resterende gegevens in de cache (via de Performance API worden de vertragingen bij het teruggeven van gegevens geanalyseerd, wat het mogelijk maakt te bepalen of de gebruiker toegang heeft gehad tot een bepaald domein of niet, en of er eerder een pagina is geopend), afgebakende machtigingen in de browser (informatie over toegang tot de Notification, Geolocation en Camera API), de aanwezigheid van gespecialiseerde randapparatuur en zeldzame sensoren (gamepads, virtual reality-headsets, nabijheidssensoren) vastgesteld. Daarnaast werd rekening gehouden met de identificatie van gespecialiseerde API's voor bepaalde browsers en gedragsverschillen in de API (AudioWorklet, setTimeout, mozRTCSessionDescription), evenals het gebruik van de AudioContext API om eigenschappen van het audiosysteem te bepalen.
Tijdens het onderzoek werd ook gekeken naar de schending van de normale functionaliteit van websites wanneer methoden voor bescherming tegen verborgen identificatie worden toegepast, wat leidt tot blokkering van netwerkverzoeken of beperking van toegang tot de API. Het bleek dat selectieve beperking van de API alleen voor scripts die door FP-Inspector zijn gedetecteerd, leidt tot minder verstoringen in de werking dan bij gebruik van strengere algemene beperkingen voor API-aanroepen in Brave en Tor Browser, die mogelijk tot gegevenslekken leiden.

Bron: opennet.ru
