Bild:
FĂŒr Aggregator-Websites im Bereich E-Commerce ist es von entscheidender Bedeutung, aktuelle Informationen bereitzustellen. Andernfalls entfĂ€llt ihr hauptsĂ€chlicher Vorteil â die Möglichkeit, die relevantesten Daten an einem Ort zu sehen.
Um diese Aufgabe zu lösen, ist es notwendig, die Technik des Web-Scrapings zu verwenden. Dabei wird spezielle Software â ein Crawler â erstellt, der die erforderlichen Websites aus einer Liste durchlĂ€uft, Informationen von ihnen extrahiert und auf der Aggregator-Website hochlĂ€dt.
Das Problem besteht darin, dass die EigentĂŒmer der Websites, von denen die Aggregatoren Daten beziehen, oft nicht so einfach Zugang gewĂ€hren wollen. Das ist verstĂ€ndlich â wenn die Preisinformationen eines Online-Shops auf der Aggregator-Website angezeigt werden und höher sind als die der dort ebenfalls dargestellten Wettbewerber, verliert das Unternehmen Kunden.
Methoden zur BekÀmpfung von Scraping
Daher wehren sich hĂ€ufig die EigentĂŒmer solcher Websites gegen das Scraping â das heiĂt, gegen das Herunterladen ihrer Daten. Sie können Anfragen erkennen, die von Bot-Crawlern gesendet werden, basierend auf der IP-Adresse. In der Regel verwenden solche Software sogenannte Server-IP-Adressen, die leicht zu identifizieren und zu blockieren sind.
ZusĂ€tzlich zur Blockierung von Anfragen wird hĂ€ufig eine andere Methode verwendet â identifizierte Bots erhalten irrelevante Informationen angezeigt. Zum Beispiel werden die Preise fĂŒr Produkte erhöht oder gesenkt, oder ihre Beschreibungen werden geĂ€ndert.
Ein hĂ€ufiges Beispiel in diesem Zusammenhang sind die Preise fĂŒr Flugtickets. TatsĂ€chlich können Fluggesellschaften und ReisebĂŒros oft unterschiedliche Ergebnisse fĂŒr die gleichen FlĂŒge je nach IP-Adresse anzeigen. Ein tatsĂ€chlicher Fall: Die Suche nach einem Flug von Miami nach London an demselben Datum mit einer IP-Adresse aus Osteuropa und Asien liefert unterschiedliche Ergebnisse.
Im Falle einer IP-Adresse in Osteuropa sieht der Preis wie folgt aus:

Und fĂŒr eine IP-Adresse aus Asien so:

Wie zu sehen ist, unterscheidet sich der Preis fĂŒr den gleichen Flug erheblich â die Differenz betrĂ€gt 76 USD, was wirklich viel ist. FĂŒr eine Aggregator-Website gibt es nichts Schlimmeres â wenn falsche Informationen angezeigt werden, werden die Nutzer sie nicht nutzen. Zudem wirkt sich negativ auf den Ruf des Projekts aus, wenn auf dem Aggregator fĂŒr ein bestimmtes Produkt ein Preis angezeigt wird und dieser sich beim Wechsel zur Website des VerkĂ€ufers Ă€ndert.
Lösung: Verwendung von Residential Proxies
Um Probleme beim Scraping von Daten fĂŒr deren Aggregation zu vermeiden, können residente Proxys verwendet werden. Server-IP-Adressen werden von Hosting-Anbietern bereitgestellt. Es ist recht einfach, die Zugehörigkeit einer Adresse zu einem bestimmten Anbieter zu erkennen â jede IP hat eine ASN-Nummer, die diese Informationen enthĂ€lt.
Es gibt viele Dienste zur Analyse von ASN-Nummern. Oft werden sie in Antibot-Systeme integriert, die den Zugang fĂŒr Crawler blockieren oder die bei Anfragen zurĂŒckgegebenen Daten manipulieren.
Residente IP-Adressen helfen, solche Systeme zu umgehen. Solche IPs werden von Internetanbietern an Wohnungsbesitzer vergeben, mit entsprechenden Notizen in allen zugehörigen Datenbanken. Es gibt spezielle Dienste fĂŒr residente Proxys, die es ermöglichen, residente Adressen zu nutzen. â genau so ein Dienst.
Anfragen, die Crawler von Aggregator-Websites ĂŒber residente IPs senden, erscheinen so, als kĂ€men sie von normalen Nutzern aus einer bestimmten Region. Normale Besucher werden jedoch nicht blockiert â im Fall von Online-Shops sind das potenzielle Kunden.
Insgesamt ermöglicht die Nutzung von rotierenden Proxys von Infatica Aggregator-Websites, garantierte genaue Daten zu erhalten und Blockierungen sowie Schwierigkeiten beim Parsen zu vermeiden.
Weitere Artikel zum Thema Nutzung residenter Proxys fĂŒr Unternehmen:
Quelle: habr.com
