Digercules — что это и кому нужно

1. Кто вероятный потребитель

Прежде всего — хранители звуковых архивов: люди и организации, у которых скопились сотни или тысячи аудиозаписей, и которым важно знать что именно на них записано.

Конкретнее:

2. Что делает продукт

Digercules берёт папку с аудиофайлами — концертами, лекциями, записями выступлений — и автоматически превращает их в текст с указанием времени каждой фразы.

При этом он не просто "расшифровывает речь". Он также:

3. К какой категории он относится

Это инструмент класса "автоматическая каталогизация аудиоархива" — нечто среднее между:

Но в отличие от каждого из этих классов по отдельности — Digercules заточен именно под живые выступления на русском языке, где обычные инструменты дают плохой результат.

4. Чем это лучше других близких вещей

Стандартные транскрибаторы (Google, Yandex, Whisper «из коробки») работают плохо на:

Что делает Digercules иначе:

  1. Обучает модель специально под конкретный голос и репертуар. Он берёт образцовые расшифровки нескольких записей и "дообучает" нейросеть — как ученик, который сначала читает ноты, а потом слушает конкретного исполнителя. Результат: в 2–3 раза меньше ошибок на похожих записях.
  2. Знает тексты песен заранее. Перед распознаванием программа подсказывает нейросети: "сейчас, скорее всего, будет эта песня" — и модель гораздо точнее справляется с нестандартными словами и именами.
  3. Умеет фильтровать "мусор". У стандартных распознавателей есть известная проблема: на аплодисментах и тишине они начинают выдумывать фразы. Digercules ведёт список таких "галлюцинаций" и вычищает их автоматически.
  4. Работает на русском, на живом звуке, на бардовской специфике — а не на студийных записях или деловых переговорах, под которые заточены коммерческие сервисы.

5. Какие задачи он может исполнить

Задача Что получает пользователь
Расшифровать 200 концертов Текстовый файл рядом с каждым MP3, с таймкодами по минутам
Узнать, что именно исполнялось Список песен с привязкой ко времени и ссылками на тексты
Найти конкретную песню в архиве Поиск по тексту через любой файловый менеджер
Подготовить материал для исследования Готовые транскрипты в текстовом формате
Создать "умную" нейросеть под свой архив Обученная модель, которая знает голос исполнителя и его репертуар
Передать результаты заказчику Лёгкий zip-архив с текстами (без аудио), распаковывается в одно нажатие

6. Как этот инструмент помогает

Представьте: у вас есть 218 концертных записей, каждая по 1–2 часа. Чтобы прослушать их все и записать, что исполнялось — нужно несколько месяцев работы одного человека.

Digercules делает это за несколько дней машинного времени — пока вы занимаетесь другими делами.

Конкретный результат на реальном архиве (218 записей бардовских концертов, которые и стали основой проекта):

Для клиента это означает: архив, который раньше существовал только в виде сотен безымянных файлов, превращается в каталог с поиском — можно найти любую песню, любую фразу, любой момент выступления.

Показательный кейс: поиск конкретной оцифрованной записи выступления Визбора 1979 года — материала, которого нет в открытом доступе и который не находится обычным поиском. Именно такие записи, а не студийные альбомы, составляют основную ценность подобных архивов: 90% содержимого крупных бардовских коллекций не индексируется поисковиками вообще.


Есть возможность работать как с архивом заказчика на мощном компьютере с видеокартой, так и передавать результаты в виде готовых текстовых файлов, которые клиент сам распаковывает рядом со своими аудиозаписями. Всё — без единого байта в облаке.