web scraping.

Как робот из Китая превратился в тысячи «посетителей» сайта

Всё началось со странности в Google Analytics. Для регионального новостного сайта сервис неожиданно стал показывать очень большую долю посетителей с настольных компьютеров.Это выглядело неправдоподобно: реальная аудитория новостных сайтов сегодня в основном приходит со смартфонов. Но ещё интереснее оказалось другое — значительная часть новых «читателей» якобы находилась в китайском городе Ланьчжоу. Я решил разобраться, откуда взялись эти люди и люди ли это вообще.Тысячи одинаковых посетителейПри более подробном анализе выяснилось, что практически все посетители из Ланьчжоу выглядят одинаково:

продолжить чтение

Автоматизация рутины на hh.ru: Как мы учили Headless Chrome притворяться живым человеком (RPA против Anti-Fraud)

С инженерной точки зрения поиск работы — это процесс с низкой энтропией. Есть входящий поток данных (JSON с вакансиями) и есть необходимость отправить ответный сигнал (POST-запрос с откликом). Задача кажется тривиальной для автоматизации: написал парсер, настроил cron, пошел пить кофе.Однако, если вы попробуете автоматизировать отклики на крупных job-board платформах (особенно на hh.ru) в 2026 году, вы столкнетесь с серьезным противодействием. WAF (Web Application Firewall), анализ TLS-отпечатков, поведенческая биометрия и теневые баны — это реальность, которая убивает скрипты на requests за пару часов.

продолжить чтение

Как решить проблемы с капчей при веб-скрейпинге

продолжить чтение