Парсинг сайтов и хаки для сбора данных
Парсинг все еще остается нишевой областью, и только технически богатые компании решаются заниматься им своими силами. Возможности сбора огромного объема содержательных данных из хранилища больших данных, называемого всемирной паутиной, очень широки.
Поскольку мы занимаемся получением данных из Интернета с помощью передовых технологий поиска, мы ежедневно обрабатываем терабайты данных.
С большими данными приходят большие идеи. С помощью парсинга веб-сайтов мы увидели хорошую, плохую и уродливую сторону Интернета. Мы будем рады поделиться некоторыми глубокими открытиями, которые мы смогли обнаружить благодаря всем тем данным, с которыми мы работали. Подкрепленные данными выводы могут стать открытием, даже если идеи всегда существовали в виде предположений. Вот некоторые глубокие выводы, которые мы сделали из зеттабайт данных, с которыми мы работали.
1. Большинство веб-сайтов претерпевают изменения каждый день
Вы можете даже не замечать этого, но практически каждый сайт ежедневно претерпевает те или иные изменения. Патчи к проблемам безопасности, управление кодом, новые предложения и дизайнерские импровизации - вот некоторые из наиболее распространенных причин изменений на сайте.
Для людей это не представляет особой проблемы, поскольку изменения в основном внутренние и не полностью меняют способ взаимодействия с сайтом. Но для парсеров даже изменение названия класса может привести к шлейфу ошибок. Это подчеркивает важность регулярного мониторинга веб-сайтов-источников в процессе сбора данных.
2. Каждый сайт собирает данные о вас
Возможно, это не станет для вас сюрпризом, но масштабы и глубина сбора данных, несомненно, поднимут брови, если вы об этом узнаете. Электронные коммерческие сайты, платформы социальных сетей, поисковые системы и буквально любой сайт, где вы можете создать профиль и стать участником, собирают и рассматривают ваши данные как ценный актив.
Например, Facebook, как сообщается, сохраняет все, что вы набираете в поле статуса, даже если вы не публикуете статус, а удаляете текст. Неудивительно, что данные становятся все более важными на этом конкурентном рынке, и все хотят получить их побольше.
Однако это не всегда плохо, вот почему это нормально - позволить технологиям узнать вас лучше.

3. Около 60 % сайтов имеют серьезные уязвимости в системе безопасности
Говорят, что люди, которые хорошо осведомлены о проблемах безопасности в Интернете, используют самые слабые меры безопасности. Не уверены, что это так, но мы обнаружили серьезные уязвимости в системе безопасности почти на 60 % веб-страниц.
Это может означать, что эти сайты уязвимы для различных видов атак, которые могут скомпрометировать пользовательские данные, такие как пароли и данные кредитных карт. Нелогично ожидать, что все эти сайты сразу исправят эти проблемы и обеспечат вам более безопасную работу в Интернете. Если вы все еще используете общий пароль для всех сайтов, которыми пользуетесь, сейчас самое время просветиться и сменить их все.
4. Блокировка ботов приводит к снижению посещаемости и трафика
Многие сайты блокируют боты-парсеры и автоматический парсинг с помощью robots.txt или страницы TOS. Некоторые даже доходят до того, что используют инструменты обнаружения ботов для агрессивной блокировки ботов, что, безусловно, является бесплодной и довольно унизительной мерой.
Будучи хорошим ботом, мы уважаем их выбор и оставляем их в покое. Но, по нашим наблюдениям, эти сайты в конечном итоге становятся менее популярными по сравнению с их конкурентами. Причина в том, что сбор данных действительно вносит свой вклад в значительную часть экспозиции, которую получает сайт в долгосрочной перспективе.
Многие агрегаторы контента просматривают сайты, чтобы получить фрагменты или резюме ваших веб-страниц и показать их с обратной ссылкой на источник. Со временем эти ссылки могут помочь вашему сайту получить трафик и присутствие в поисковых системах, которого он заслуживает. Вывод: использовать механизмы блокировки ботов следует только в том случае, если вы хотите прокатиться по склону. Блокируя ботов, вы идете против фундаментальной идеи всемирной паутины.
5. Большинство сайтов больше не имеют всего содержимого в исходном коде
Десятилетие назад на большинстве сайтов весь контент находился в исходном коде страницы. Обычно это означало загрузку всего содержимого страницы каждый раз, когда пользователь перезагружал ее, поскольку кэширование здесь невозможно. Это также было кошмаром для разработчиков, которым приходилось иметь дело с этим беспорядочным кодом.
С тех пор практика кодирования претерпела значительные изменения, и большинство веб-сайтов теперь следуют лучшим практикам, таким как асинхронная загрузка скриптов, отказ от встроенного CSS и т.д. Написание скриптов для извлечения данных было бы проще при использовании старых конвенций, но мы ценим и принимаем положительные изменения, происходящие в Интернете.
В заключение
Данные, конечно, не лгут. Итак, пришло время использовать эти идеи, с которыми мы столкнулись при извлечении большого количества данных для улучшения ваших сайтов.
екоторые из них могут помочь вам обнаружить незамеченные недостатки вашего сайта и исправить их, чтобы сделать интернет лучше для всех. Интернет как совокупность веб-сайтов, принадлежащих различным организациям, имеет свою долю недостатков, и нам, возможно, придется с этим смириться.


