Японский независимый исследователь и трейдер, известный под псевдонимом rS_alonewolf, представил необычный метод автоматизации подготовки обучающих материалов для генеративных нейросетей. Его задача заключалась в извлечении точных 10-секундных отрезков с кульминационными моментами из продолжительных видеороликов, чтобы использовать их в качестве референсов в среде ComfyUI. Ручной отбор сотен фрагментов отнимал слишком много времени, а стандартные мультимодальные модели не могли точно определять пиковые эмоциональные сцены при прямом анализе видеоряда.
Три ключевых параметра для определения кульминации
Для решения проблемы автор задействовал локальную языковую модель Qwen 3. 8 27B NVFP4, с помощью которой написал скрипт для комплексной обработки аудиодорожки и видеопотока. В ходе исследования он выделил три ключевых параметра, совокупность которых указывает на момент оргазма. Первый — анализ звука с фиксацией характерных стонов в диапазоне от 100 до 1500 Гц и их резкого затухания. Второй — резкий скачок объема визуальных изменений между соседними кадрами. Третий — появление специфических монтажных склеек, стоп-кадров или мягких переходов.
По словам разработчика, поиск таких таймингов на графиках практически идентичен принципам работы торговых роботов на фондовом и криптовалютном рынках. Ни один из трех факторов сам по себе не гарантирует точного попадания, поэтому задача сводится к выявлению комплексного паттерна из множества сигналов. Автор сравнил этот процесс с фильтрацией индикаторов на покупку и продажу активов, где алгоритм отсеивает ложные срабатывания на основе математических весов.
Следующим этапом проекта станет полная автоматизация конвейера подготовки данных. Найденные видеофрагменты будут автоматически нарезаться, приводиться к стандарту 24 кадра в секунду с фиксированным числом кадров и передаваться напрямую в генератор ComfyUI. По мере накопления числовых метрик автор планирует обучить легковесный алгоритм машинного обучения CatBoost, что позволит полностью исключить участие человека из процесса сортировки контента.
Основной сложностью текущего подхода остаются индивидуальные особенности актеров и специфика видеомонтажа. Как отметил создатель системы, реакция тела и звуковые характеристики сильно различаются от человека к человеку, а фактор актерской игры может приводить к ложным срабатываниям. В будущем разработчик намерен создать систему калибровки под конкретных моделей или обучать персональные мини-модели, продолжая использовать возможности открытой модели Qwen 3. 8 27B.
Публикация вызвала бурную реакцию среди исследователей локальных нейросетей и разработчиков генеративного контента. В ходе обсуждения энтузиасты предложили альтернативные подходы, такие как интеграция распознавания речи для поиска ключевых фраз или анализ векторов движения формата H. 264. Они отметили, что подобная комбинация биржевой математики и нейросетевой фильтрации наглядно демонстрирует новые сценарии применения открытых моделей в прикладных задачах.

Комментарии
Оставляйте комментарии, отвечайте другим пользователям, ставьте плюсы и минусы и добавляйте быстрые реакции.
Войдите в аккаунт, чтобы оставлять комментарии, отвечать другим пользователям и ставить реакции.