Японский независимый исследователь и трейдер под псевдонимом rS_alonewolf представил необычный метод автоматизации подготовки обучающих материалов для генеративных нейросетей. Автор поставил перед собой задачу извлекать точные 10-секундные отрезки с кульминационными моментами из продолжительных видеороликов категории 18+, чтобы использовать их в качестве референсов в среде ComfyUI. Ручной отбор сотен фрагментов отнимал слишком много времени и сил, в то время как стандартные мультимодальные модели до сих пор не способны с высокой точностью определять пиковые эмоциональные сцены при прямом анализе видеоряда.
Для решения этой проблемы автор задействовал локальную языковую модель Qwen 3.8 27B NVFP4, с помощью которой написал специальный скрипт для комплексной обработки аудиодорожки и видеопотока. В ходе исследования разработчик выделил 3 ключевых параметра, совокупность которых указывает на момент оргазма. Первым фактором стал анализ звука с фиксацией характерных стонов в диапазоне от 100 до 1500 Гц и их последующего резкого затухания. Вторым параметром выступил резкий скачок объема визуальных изменений между соседними кадрами, а третьим стал факт появления специфических монтажных склеек, стоп-кадров или мягких переходов.
По словам разработчика rS_alonewolf, поиск таких специфических таймингов на графиках оказался практически идентичен принципам работы торговых роботов на фондовом и криптовалютном рынках. Ни один из 3 факторов сам по себе не гарантирует точного попадания, поэтому задача сводится к выявлению комплексного паттерна из множества сигналов. Автор сравнил этот процесс с фильтрацией индикаторов на покупку и продажу активов, где алгоритм отсеивает ложные срабатывания на основе математических весов.
Следующим этапом проекта станет полная автоматизация конвейера подготовки данных. Найденные видеофрагменты будут автоматически нарезаться, приводиться к стандарту 24 кадра в секунду с фиксированным числом кадров и передаваться напрямую в генератор ComfyUI. По мере накопления числовых метрик автор планирует обучить легковесный алгоритм машинного обучения CatBoost, что позволит полностью исключить участие человека из процесса сортировки контента.
Основной сложностью текущего подхода остаются индивидуальные особенности актеров и специфика видеомонтажа. Как отметил создатель системы, реакция тела и звуковые характеристики сильно различаются от человека к человеку, а фактор актерской игры может приводить к ложным срабатываниям. В будущем разработчик намерен создать систему калибровки под конкретных моделей или обучать персональные мини-модели, продолжая использовать возможности открытой модели Qwen 3.8 27B.
Публикация вызвала бурную реакцию среди исследователей локальных нейросетей и разработчиков генеративного контента. В ходе обсуждения энтузиасты предложили альтернативные подходы вроде интеграции распознавания речи для поиска ключевых фраз или анализа векторов движения формата H.264, отметив, что подобная комбинация биржевой математики и нейросетевой фильтрации наглядно демонстрирует новые сценарии применения открытых моделей в прикладных задачах.
Источник: www.playground.ru