# Digercules — что это и кому нужно

## 1. Кто вероятный потребитель

Прежде всего — **хранители звуковых архивов**: люди и организации, у которых скопились сотни или тысячи аудиозаписей, и которым важно знать *что именно* на них записано.

Конкретнее:

- **Библиотеки, архивы, музеи** — фонды с магнитофонными записями, концертами, лекциями, устной историей
- **Частные коллекционеры** — у кого дома лежат MP3, оцифрованные кассеты, концерты любимых исполнителей
- **Исследователи** и фольклористы — кому нужно не просто хранить, а искать и цитировать по тексту
- **Звукозаписывающие студии и лейблы** — для каталогизации архивного материала
- **Организаторы песенных или стихотворных фестивалей** — в первую очередь, это и был исходный случай: 218 концертных записей бардовских песен
- **Музыкальные и литературные клубы** — у которых из вечера в вечер копятся записи прошедших концертов, творческих встреч и поэтических чтений, а разобрать их руками уже некому

## 2. Что делает продукт

Digercules берёт папку с аудиофайлами — концертами, лекциями, записями выступлений — и **автоматически превращает их в текст с указанием времени каждой фразы.**

При этом он не просто "расшифровывает речь". Он также:

- **Определяет, какие именно песни** прозвучали в записи, сверяясь с базой текстов
- **Помечает паузы и аплодисменты** — чтобы было понятно, где заканчивается одна песня и начинается другая
- **Конвертирует сопроводительные документы** (HTML-страницы, PDF) в удобный текст
- **Упаковывает результаты** в архив, который клиент может распаковать прямо в свою папку с аудио — и тексты окажутся рядом с каждым файлом

## 3. К какой категории он относится

Это инструмент класса **"автоматическая каталогизация аудиоархива"** — нечто среднее между:

- транскрибатором (расшифровщиком речи)
- поисковым индексатором для музыкальных коллекций
- системой управления цифровым архивом (Digital Asset Management)

Но в отличие от каждого из этих классов по отдельности — Digercules заточен именно под **живые выступления на русском языке**, где обычные инструменты дают плохой результат.

## 4. Чем это лучше других близких вещей

**Стандартные транскрибаторы** (Google, Yandex, Whisper «из коробки») работают плохо на:
- живых концертах с шумом зала и несовершенной акустикой
- бардовских текстах, которых нет в стандартных обучающих данных
- длинных записях, где модель начинает "галлюцинировать" — повторять одну фразу снова и снова

**Что делает Digercules иначе:**

1. **Обучает модель специально под конкретный голос и репертуар.** Он берёт образцовые расшифровки нескольких записей и "дообучает" нейросеть — как ученик, который сначала читает ноты, а потом слушает конкретного исполнителя. Результат: в 2–3 раза меньше ошибок на похожих записях.
2. **Знает тексты песен заранее.** Перед распознаванием программа подсказывает нейросети: "сейчас, скорее всего, будет эта песня" — и модель гораздо точнее справляется с нестандартными словами и именами.
3. **Умеет фильтровать "мусор".** У стандартных распознавателей есть известная проблема: на аплодисментах и тишине они начинают выдумывать фразы. Digercules ведёт список таких "галлюцинаций" и вычищает их автоматически.
4. **Работает на русском, на живом звуке, на бардовской специфике** — а не на студийных записях или деловых переговорах, под которые заточены коммерческие сервисы.

## 5. Какие задачи он может исполнить

| Задача | Что получает пользователь |
|---|---|
| Расшифровать 200 концертов | Текстовый файл рядом с каждым MP3, с таймкодами по минутам |
| Узнать, что именно исполнялось | Список песен с привязкой ко времени и ссылками на тексты |
| Найти конкретную песню в архиве | Поиск по тексту через любой файловый менеджер |
| Подготовить материал для исследования | Готовые транскрипты в текстовом формате |
| Создать "умную" нейросеть под свой архив | Обученная модель, которая знает голос исполнителя и его репертуар |
| Передать результаты заказчику | Лёгкий zip-архив с текстами (без аудио), распаковывается в одно нажатие |

## 6. Как этот инструмент помогает

Представьте: у вас есть 218 концертных записей, каждая по 1–2 часа. Чтобы прослушать их все и записать, *что* исполнялось — нужно несколько месяцев работы одного человека.

Digercules делает это за несколько дней машинного времени — пока вы занимаетесь другими делами.

**Конкретный результат на реальном архиве** (218 записей бардовских концертов, которые и стали основой проекта):
- Все 218 концертов автоматически расшифрованы; в целом по всем обработанным Digercules архивам (не только бардовским) — уже более 38 000 часов аудио- и видеозаписей
- Для каждого концерта составлен список песен с таймкодами
- Нейросеть обучена под голоса конкретных исполнителей (Окуджава, Городницкий, Визбор и др.)
- Результаты упакованы и переданы в папку к исходным файлам — никакой переструктуризации архива

**Для клиента** это означает: архив, который раньше существовал только в виде сотен безымянных файлов, превращается в **каталог с поиском** — можно найти любую песню, любую фразу, любой момент выступления.

Показательный кейс: поиск конкретной оцифрованной записи выступления Визбора 1979 года — материала, которого нет в открытом доступе и который не находится обычным поиском. Именно такие записи, а не студийные альбомы, составляют основную ценность подобных архивов: 90% содержимого крупных бардовских коллекций не индексируется поисковиками вообще.

---

Есть возможность работать как с архивом заказчика на мощном компьютере с видеокартой, так и передавать результаты в виде готовых текстовых файлов, которые клиент сам распаковывает рядом со своими аудиозаписями. Всё — без единого байта в облаке.
