Архив, в котором можно найти любое выступление
У клуба почти наверняка уже есть накопленный архив прошлых концертов — часть на дисках, часть в облаке, часть в папках без названий. И каждый новый вечер добавляет к этому ещё: аудио с пульта, видео с чьей-то камеры или телефона, фотографии. Найти конкретное выступление можно, только если кто-то вспомнит, когда это было, и пересмотрит всё вручную.
Мы предлагаем разобрать то, что уже накопилось, и дальше держать архив в таком виде, чтобы для этого больше никогда не требовался человек с хорошей памятью.
Как это устроено
Сначала программа проходит по всему, что уже есть, — по дискам, папкам, облачным хранилищам — и разбирает это целиком: что где лежит, что дублирует друг друга, к какому вечеру что относится. Это разовый проход по всему накопленному архиву, и он закрывает главный вопрос: что вообще есть в этих завалах файлов.
Дальше программа сама возвращается к этой же папке каждую ночь и проверяет, что появилось нового со вчерашнего дня. Обрабатывается только разница — то, что уже разобрано, второй раз не трогается. Архив, который сегодня разобрали один раз, через месяц не превращается обратно в кучу файлов без подписей — он остаётся актуальным сам по себе.
Что происходит каждую ночь
- Скан хранилища — сверка с индексной таблицей, в обработку идут только новые файлы.
- Звук — с пульта или из видеозаписи — распознаётся в текст с таймкодами через Whisper-turbo, полностью локально, без видеокарты.
- Видео размечается по сменам плана, не покадрово, — чтобы через минуту понять, что происходило в кадре, не пересматривая всю запись.
- Файлы одного вечера — видео, аудио, фото — группируются в одно мероприятие по времени съёмки и записи.
- Индексная таблица пополняется: какое мероприятие, какие файлы, что на них звучало и когда.
Тексты песен: узнаём точнее с каждым разом
Мы уже собрали базу текстов исполняемых песен разных жанров: перед распознаванием программа подсказывает нейросети, какая песня, скорее всего, звучит, и куда точнее справляется с необычными словами и именами, чем при обычной расшифровке речи. Эта база растёт с каждым новым архивом — включая записи самого клуба: чем больше ваших вечеров мы обработаем, тем точнее становится распознавание именно вашего репертуара и ваших постоянных исполнителей.
Что вы получите
По любому мероприятию — концерту, творческому вечеру — сразу видно: какие видео, аудиозаписи и фото к нему относятся, что было исполнено и в какую минуту записи. Дальше с этим можно:
- вырезать конкретный номер по таймкоду и выложить на YouTube;
- отдать исполнителю его собственное выступление, не пересматривая весь вечер;
- передать материал в монтаж с уже готовой разметкой, что где искать;
- найти все записи и фото с участием конкретного исполнителя за всё время — не только за один вечер.
Исполнители: подтвердили один раз — дальше система узнаёт сама
Тот же принцип, что и с голосом, работает с лицом в кадре — на видео или на фотографии: один раз подтверждаете, кто это, дальше система узнаёт этого человека сама, в любой новой записи, без повторного вопроса. Хранится не один усреднённый портрет, а несколько эталонных снимков на человека, поэтому узнавание не теряется даже спустя годы, при другом освещении или причёске.
Для клуба это значит: если артист выступал у вас десять раз за два года, после первого подтверждения система сама находит все десять выступлений — не нужно пересматривать архив вручную каждый раз, когда нужно отдать исполнителю его собственные записи.
Решение всегда за человеком: система только предлагает совпадение с процентом схожести, подтверждает или отклоняет тот, кто разбирает архив. Механизм уже проверен на 20 терабайтах концертных видеозаписей; скорость именно на процессоре вашего компьютера, как и с распознаванием речи, мы пока не измеряли.
Что мы пока не проверяли — честно
Мы много раз запускали его на видеокартах и знаем, что версия для CPU существует и работает в принципе; но именно на процессоре клубного компьютера мы её ещё не тестировали. Первые несколько дней пилота — включая ту самую нагрузку — как раз и покажут реальную скорость: сколько минут обработки уходит на час записи на конкретном железе клуба.
Whisper-turbo — это черновой, быстрый режим распознавания; более медленный и точный проход, дообучаемый под конкретные голоса, обычно требует видеокарты и здесь не включён. Для поиска, таймкодов и разбивки по мероприятиям точности turbo-режима достаточно; если позже понадобится текст более высокого качества — например, дословные субтитры для публикации, — это отдельный, более тяжёлый шаг, который можно добавить.
В этой версии мы сознательно не ставим локальную языковую модель, которая обычно пишет краткое содержание документов и по-настоящему описывает фотографии. Но то, что мы всё равно отдаём — размеченный по времени текст и таблица «файл → мероприятие» — это готовый, компактный материал именно того вида, который любая современная онлайн-нейросеть (ChatGPT, Claude, Gemini — что уже используете) разбирает сама, без всякой донастройки под неё. Резюме вечера, поиск по смыслу, ответы на вопросы по архиву остаются доступны — просто эту работу на последнем шаге берёт на себя онлайн-инструмент, а не наш локальный.
Без Ollama система не пишет текстовое описание того, что происходит на фотографии, — не расскажет про атмосферу кадра или что на заднем плане. Она уже узнаёт исполнителей по лицу и группирует фото в мероприятие по времени съёмки — этого достаточно, чтобы найти нужный вечер и нужного человека, но не чтобы получить пересказ содержания снимка.
Отдельный интерфейс
Для клуба это будет отдельная, облегчённая (standalone) версия — узкий инструмент под одну задачу, без лишних настроек и режимов. Интерфейс тоже свой, под три экрана:
Клик по строке текста в третьем экране перематывает запись на нужную минуту.
Дальше
Предлагаю начать с пилота прямо на компьютере клуба: разобрать часть уже накопленного архива и подключить несколько ближайших вечеров вживую. Так сразу будет видно и реальный объём того, что уже накопилось, и скорость обработки на конкретном железе клуба.