Как устроен автоматизированный аудит сайтов в ЮScan

Как проверить, чем на самом деле занимается сайт, если у него тысячи страниц, динамический контент, а часть информации спрятана глубоко в каталоге?

В новой статье рассказываем о ЮScan — сервисе автоматизированного аудита от ЮMoney, который помогает банкам и платёжным организациям выявлять сайты с запрещённой или рискованной деятельностью ещё до начала сотрудничества.

Сервис рекурсивно обходит сайты, работает с динамическим контентом через браузерное окружение, анализирует тексты, изображения, отзывы, внешние ссылки и регистрационные данные. Затем ML-модели, embeddings и LLM помогают оценить найденный контент и снизить количество ложных срабатываний. В статье разбираем:

  • как ЮScan обходит сайты с динамическим контентом;

  • зачем в краулере нужны Scrapy, Playwright и как устроена его архитектура;

  • как сервис находит рискованный контент и снижает ложные срабатывания;

  • какие внешние данные дополнительно анализирует ЮScan;

  • каких результатов удалось добиться после автоматизации.

За время работы через ЮScan проверили более 550 тысяч заявок, а пропускная способность краулера достигает 1000 сайтов в час. Если вы работаете с эквайрингом, маркетплейсами, KYC/AML-проверками или просто сталкиваетесь с необходимостью анализировать тысячи страниц в сутки — все подробности ждут вас в полной версии статьи.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев