Как проверить, чем на самом деле занимается сайт, если у него тысячи страниц, динамический контент, а часть информации спрятана глубоко в каталоге?
В новой статье рассказываем о ЮScan — сервисе автоматизированного аудита от ЮMoney, который помогает банкам и платёжным организациям выявлять сайты с запрещённой или рискованной деятельностью ещё до начала сотрудничества.
Сервис рекурсивно обходит сайты, работает с динамическим контентом через браузерное окружение, анализирует тексты, изображения, отзывы, внешние ссылки и регистрационные данные. Затем ML-модели, embeddings и LLM помогают оценить найденный контент и снизить количество ложных срабатываний. В статье разбираем:
-
как ЮScan обходит сайты с динамическим контентом;
-
зачем в краулере нужны Scrapy, Playwright и как устроена его архитектура;
-
как сервис находит рискованный контент и снижает ложные срабатывания;
-
какие внешние данные дополнительно анализирует ЮScan;
-
каких результатов удалось добиться после автоматизации.
За время работы через ЮScan проверили более 550 тысяч заявок, а пропускная способность краулера достигает 1000 сайтов в час. Если вы работаете с эквайрингом, маркетплейсами, KYC/AML-проверками или просто сталкиваетесь с необходимостью анализировать тысячи страниц в сутки — все подробности ждут вас в полной версии статьи.
Источник: habr.com