Что такое веб-парсер?

Определение веб-парсера

Веб-парсер - это программный робот, который сканирует Интернет и загружает найденные данные. Большинство парсеров работают под управлением поисковых систем, таких как Google, Bing, Baidu и DuckDuckGo. Поисковые системы применяют свои алгоритмы поиска к собранным данным, формируя индекс поисковой системы. Индексы позволяют поисковым системам предоставлять пользователям релевантные ссылки на основе их поисковых запросов.

Существуют веб-парсеры, которые служат не только поисковым системам, но и другим интересам, например, The Way Back Machine из Internet Archive, который предоставляет снимки веб-сайтов в определенный момент времени в прошлом.

Как работают веб-парсеры?

Веб-парсеры, такие как Googlebot компании Google, начинают каждый день со списка сайтов, которые они хотят просмотреть. Это называется бюджетом на обход. Бюджет отражает потребность в индексировании страниц. На бюджет переползания влияют два основных фактора: популярность и устарелость. URL-адреса, которые более популярны в Интернете, обычно просматриваются чаще, чтобы сохранить их свежесть в индексе. Веб-парсеры также пытаются предотвратить устаревание URL-адресов в индексе.

Когда веб-парсер подключается к сайту, он начинает с загрузки и чтения файла robots.txt. Файл robots.txt является частью протокола исключения роботов (REP) - группы веб-стандартов, которые регулируют порядок работы роботов в Интернете, доступа к содержимому, его индексации и предоставления пользователям. Владельцы сайтов могут определить, какие агенты пользователей могут и не могут получить доступ к сайту. В файле Robots.txt также может быть определена директива crawl-delay, позволяющая снизить скорость выполнения запросов к сайту. В Robots.txt также перечисляются связанные с сайтом карты сайта, так что парсер может найти каждую страницу и время ее последнего обновления. Если страница не изменилась с момента последнего посещения сайта парсером, то в этот раз она будет пропущена.

Когда веб-парсер достигает страницы, которую необходимо просмотреть, он отображает ее в браузере, загружая весь HTML, код сторонних разработчиков, JavaScript и CSS. Эта информация сохраняется в базе данных поисковой системы и в дальнейшем используется для индексации и ранжирования страницы. Также загружаются все ссылки на странице. Ссылки, которых еще нет в индексе поисковой системы, добавляются в список для последующего просмотра.

Соблюдение директив, содержащихся в файле robots.txt, является добровольным. Большинство крупных поисковых систем следуют директивам robots.txt, но некоторые не выполняют их. Плохие игроки, такие как спамеры и ботнеты, игнорируют директивы robots.txt. Даже некоторые легитимные поисковые системы, например Internet Archive, игнорируют robots.txt.

Примеры веб-парсеров

Поисковые системы имеют несколько типов веб-парсеров. Например, Google имеет 17 типов ботов:

  • APIs-Google
  • AdSense
  • AdsBot Mobile Web Android
  • AdsBot Mobile Web
  • Googlebot Image
  • Googlebot News
  • Googlebot Video
  • Googlebot Desktop
  • Googlebot Smartphone
  • Mobile Apps Android
  • Mobile AdSense
  • Feedfetcher
  • Google Read Aloud
  • Duplex on the web
  • Google Favicon
  • Web Light
  • Google StoreBot

Почему веб-парсеры важны для SEO

Цель SEO заключается в том, чтобы ваш контент можно было легко найти при поиске пользователем соответствующего поискового запроса. Google не сможет определить, куда ранжировать ваш контент, если он не будет просмотрен и проиндексирован.

Веб-парсеры могут быть полезны и в других областях: сайты электронной коммерции часто просматривают сайты конкурентов, чтобы проанализировать выбор товаров и ценообразование. 

Проблемы, с которыми сталкиваются веб-парсеры

Существует ряд проблем, с которыми могут столкнуться веб-парсеры.

Проблема Описание
Ограничения в Robots.txt Если веб-парсер соблюдает ограничения robots.txt, он может не получить доступ к определенным веб-страницам или отправлять запросы, превышающие произвольный лимит.
Запреты на IP-адреса Поскольку некоторые веб-парсеры не соблюдают ограничения robots.txt, они могут применять ряд других инструментов для ограничения веб-парсинга. Веб-сайты могут запретить IP-адреса, которые известны как вредоносные, например бесплатные прокси-серверы, используемые мошенниками, или определенные IP-адреса центров обработки данных.
Ограничения геолокации Некоторые сайты требуют, чтобы посетитель находился в определенном географическом регионе для доступа к содержимому сайта. Примером может служить попытка получить доступ к содержимому Netflix USA из другой страны. Большинство географических ограничений может быть преодолено с помощью прокси-сетей для жилых районов.
CAPTCHAs Некоторые сайты при обнаружении большого количества активности из подозрительных источников выставляют CAPTCHA, чтобы проверить, действительно ли за запросом стоит человек. CAPTCHA могут нарушать работу веб-парсеров. Многие решения для веб-парсинга имеют инструменты и технологии для преодоления подобных блокировок. Эти инструменты часто используют решение для разблокировки CAPTCHA.

Заключение

Веб-парсеры являются важнейшей частью инфраструктуры Интернета. Они позволяют поисковым системам собирать данные, необходимые для построения поисковых индексов, что дает возможность выдавать результаты поиска по запросам пользователей. Многие компании считают, что веб-парсеры помогают им в исследованиях. На самом деле они часто ориентированы только на один или два сайта, например Amazon, Adidas или объявления Airbnb.