Obraz:
Dla witryn agregujących w dziedzinie e-commerce niezwykle ważne jest, aby utrzymywać aktualne informacje. W przeciwnym razie znikają ich główne atuty – możliwość zobaczenia najbardziej relevantnych danych w jednym miejscu.
Aby rozwiązać ten problem, należy zastosować technikę web scrapingu. Polega ona na stworzeniu specjalnego oprogramowania – crawliera, który przeszukuje odpowiednie strony z listy, parsuje z nich informacje i ładuje je na stronę agregatora.
Problem polega na tym, że często właściciele stron, z których korzystają agregatory, wcale nie chcą w ten sposób łatwo udostępniać swoich danych. Można to zrozumieć – jeśli informacja o cenie w sklepie internetowym trafi na stronę agregatora i okaże się wyższa niż u konkurencji wyświetlanej tamże – firma traci klientów.
Metody przeciwdziałania scrapowaniu
Dlatego często właściciele takich stron przeciwdziałają scrapowaniu – tzn. pobieraniu swoich danych. Mogą wykrywać zapytania, które wysyłają boty-crawlery po adresie IP. Zwykle takie oprogramowanie korzysta z tzw. adresów IP serwerów, które łatwo obliczyć i zablokować.
Ponadto, zamiast blokowania zapytań, często stosuje się inną metodę – wykrytym botom pokazuje się nierelatywne informacje. Na przykład, zawyża się lub zaniża ceny na towary lub zmienia się ich opisy.
Przykład, który często się podaje w tym kontekście – ceny na bilety lotnicze. Rzeczywiście, dość często linie lotnicze i biura podróży mogą pokazywać różne wyniki dla tych samych lotów w zależności od adresu IP. Rzeczywisty przypadek: wyszukiwanie lotu z Miami do Londynu na tę samą datę z adresu IP w Europie Wschodniej i Azji zwraca różne wyniki.
W przypadku adresu IP w Europie Wschodniej cena wygląda następująco:

A dla adresu IP z Azji jest taka:

Jak widać, cena za ten sam lot znacznie się różni – różnica wynosi 76 $, co rzeczywiście jest sporo. Dla strony agregatora nie ma nic gorszego niż to – jeżeli będzie prezentował błędne informacje, użytkownicy przestaną go używać. Ponadto, jeśli na agregatorze dla konkretnego towaru jest jedna cena, a przy przejściu na stronę sprzedawcy zmienia się ona – również negatywnie wpływa to na reputację projektu.
Rozwiązanie: wykorzystanie proxy rezydenckich
Aby uniknąć problemów z skanowaniem danych na potrzeby ich agregacji, można skorzystać z użycia resident proxy. Serwerowe IP są dostarczane przez dostawców hostingu. Ustalenie przynależności adresu do puli konkretnego dostawcy jest dość proste – każde IP ma numer ASN, w którym zawarte są te informacje.
Istnieje wiele usług do analizy numerów ASN. Często integrują się z systemami antybotowymi, które blokują dostęp crawlerom lub fałszują dane, które zwracają w odpowiedzi na ich zapytania.
Obejść takie systemy pomagają resident IP. Takie IP są wydawane przez dostawców internetowych właścicielom nieruchomości, z odpowiednimi oznaczeniami we wszystkich związanych bazach danych. Istnieją specjalne usługi resident proxy, które umożliwiają korzystanie z adresów resident. – to właśnie taki serwis.
Zapytania, które crawlerzy stron agregatorów wysyłają z resident IP, wyglądają tak, jakby pochodziły od zwykłych użytkowników z określonego regionu. A zwykłych odwiedzających nikt nie blokuje – w przypadku sklepów internetowych to potencjalni klienci.
W efekcie użycie rotowanych proxy od Infatica pozwala stronom agregatorom otrzymywać gwarantowanie dokładne dane i unikać zablokowań oraz trudności z parsowaniem.
Inne artykuły na temat wykorzystania resident proxy w biznesie:
Źródło: habr.com
