# Пятый подвиг Геракла: цифровая конюшня

*Царь Авгий получил от богов огромные стада скота. Скот был божественный — не болел, плодился, накапливался. Конюшни не чистились годами. Геракл справился за один день — направил через них две реки.*

У всех нас есть цифровая конюшня. Называется она по-разному: "АРХИВ 2012", "Старый ноут", "Диск D — разобрать потом". Файлы тоже накапливаются сами — мессенджер автосохраняет, скриншоты делаются одной кнопкой, почта тянет вложения, торрент качает про запас. Не болеют, не пахнут, места почти не занимают — вот и лежат.

## 1. Кто вероятный потребитель

**Человек с дисками в шкафу.** Снаружи написано "ВАЖНОЕ". Внутри — несколько копий одного и того же, папка "фото разобрать" с тысячами файлов, архивы с неизвестным содержимым. Не выбросить, потому что вдруг там что-то ценное. Не разобрать, потому что когда?

**Маркетолог в десятках чатов одновременно.** Рабочие чаты с клиентами, тематические каналы, профессиональные сообщества. Где-то там — живые клиенты, незакрытые запросы, чужие боли. Но поток такой плотный, что читать некогда, а нанять аналитика дорого.

**Студент.** Годы конспектов, сканов методичек, записей лекций и семинаров — часто на нескольких языках сразу. Разложено по папкам с именами вроде "пары 3 курс" и "надо пересмотреть". Найти нужный фрагмент перед экзаменом — целое расследование.

**Преподаватель.** Учебные материалы накапливаются десятилетиями: конспекты курсов, записи лекций, переписка со студентами, черновики методичек на разных языках. Архив растёт быстрее, чем успеваешь его пересматривать и обновлять.

**Инженер.** Даташиты, схемы, расчёты, техническая документация — годами, десятки гигабайт. В облако нельзя: конфиденциально или просто не хочется кормить чужой датацентр своими знаниями. Половина файлов — без распознавания текста, то есть для поиска они просто не существуют.

**Музыкант или автор песен.** Концертные записи, черновики, дубли одной и той же вещи в разных исполнениях, магнитофонные плёнки, оцифровки. Знает, что где-то там есть уникальное исполнение или неизданная запись. Не знает, в каком из сотен файлов.

**Музыкальный или литературный клуб.** Из вечера в вечер копятся записи концертов, творческих встреч, поэтических чтений — но разобрать, кто выступал и что именно звучало, руками уже некому: состав меняется, а архив остаётся общим и ничьим конкретно.

**Архивист.** Хранитель фонда — личного, семейного или переданного на попечение чужого архива. Носители, документы и записи разных эпох вперемешку, без единой системы описания. Задача не «удалить», а понять, что вообще есть, прежде чем что-то решать.

## 2. Что делает продукт

Четыре инструмента под одной крышей — четыре потока воды через четыре разные конюшни.

**Поток первый: библиотека.** Берёт папку с файлами любого типа — книги, даташиты, схемы, документы — и просит локальную нейросеть написать аннотацию к каждому. Нераспознанные PDF готовит к OCR. На выходе: нормальный индекс, в котором можно искать по смыслу, а не гадать по имени файла `doc_final_FINAL_v3_USE_THIS.pdf`.

**Поток второй: аудио и видео.** Берёт записи — концерты, голосовые, переговоры, кружочки из мессенджеров — и превращает их в текст с таймкодами. Если это музыка — пытается определить, что именно исполнялось. Если это разговоры или интервью с несколькими участниками — разделяет реплики по говорящим и суммаризирует, кто и о чём говорил.

**Поток третий: переписка.** Берёт полную выгрузку канала или чата, собирает весь текст, скачивает голосовые и видео, распознаёт их, складывает в длинный документ и суммаризирует. На выходе: кто эти люди, что их волнует, есть ли среди них потенциальные клиенты — плюс готовое задание для любой нейросети: вот аудитория, вот её язык, вот что ей предложить.

**Поток четвёртый: фотографии.** Берёт кластеры однотипных снимков — например, все фото одного события или периода — и просит локальную нейросеть с распознаванием изображений описать, что на них: кто и сколько человек в кадре, место, сюжет. Не по каждому снимку из тысяч, а по представительной выборке внутри каждого кластера — чтобы описание архива было готово за разумное время, а не за недели видеокарты.

Всё работает локально. Файлы никуда не уходят.

## 3. К какой категории он относится

**Локальный ИИ-разведчик для личных коллекций** — новая категория без устоявшегося названия. Не облачный транскрибатор. Не корпоративный документооборот. Не поисковик по файлам. Не медиасервер. Что-то между — но с принципиальным отличием: работает на вашем железе, с вашими данными, и на выходе даёт не список файлов, а структурированную библиотеку. По каждому файлу — тема, язык, тип документа, ключевые сущности, краткое содержание. Это делается заранее, без спешки и дедлайна, пока никому это ещё не понадобилось срочно — а не в последний момент под конкретную задачу. Готовую библиотеку можно скормить любой нейросети, базе данных или поисковой системе — дальше они сами находят нужное и строят интерфейс; Digercules не заменяет этот следующий шаг, а делает его вообще возможным, беря на себя ту трудоёмкую подготовку, на которую обычно никогда не хватает ресурсов.

## 4. Чем это лучше других близких вещей

Все эти инструменты — организаторы файлов с ИИ, десктопный поиск, системы документооборота с OCR, обычная транскрипция — работают только тогда, когда архив уже приведён в машиночитаемый вид: текст распознан, файлы описаны, всё разложено. Именно эту подготовку они не делают и сделать не могут — они на неё рассчитывают как на данность.

Digercules делает ровно эту недостающую часть: смешанный архив (текст + аудио + видео + фото + сканы) превращается в единую структурированную библиотеку, обученную под специфику конкретной коллекции — полностью локально. Дальше с этой библиотекой может работать уже любой из перечисленных инструментов, любая нейросеть или поисковая система — Digercules не конкурирует с ними, а даёт им то, без чего они бесполезны.

## 5. Какие задачи он может исполнить

| Задача | Результат |
|---|---|
| Разобраться, что на диске | Карта архива с аннотациями к каждой группе файлов |
| Убрать дубли и очевидный мусор | Дедупликация без потери чего-то важного |
| Сделать библиотеку searchable | Аннотации + OCR → поиск по смыслу |
| Расшифровать часы записей | Текст с таймкодами, суммаризация, идентификация |
| Понять, кто в чате | Портрет аудитории + промпт для следующего шага |
| Оценить, что уникально, а что мусор | Редкое / типовое / устаревшее / требует внимания |
| Разобраться в архиве фотографий | Описание по представительной выборке в каждом кластере снимков |

## 6. Как это помогает

**Человек с дисками в шкафу** запускает инструмент, указывает папку, уходит пить чай. Через несколько часов: вот мусор — удалить? Вот семейные фото. Вот рабочие документы — осторожно, может быть конфиденциальное.

**Маркетолог** загружает выгрузки каналов. Получает: эти — шум, не тратить время. Этот — там живут потенциальные клиенты, вот их боли, вот готовый промпт для следующего разговора.

**Инженер** впервые видит свою библиотеку целиком: что есть, что устарело, что нигде больше не найти. Аннотации написаны на его языке — потому что инструмент обучился на его же коллекции.

**Студент и преподаватель** получают searchable-архив конспектов, сканов и записей лекций даже на нескольких языках сразу — то, что раньше искалось листанием файлов вручную, теперь ищется по смыслу.

**Музыкант или автор** получает расшифровку и каталог концертных записей с определением, что именно исполнялось в каждой — включая дубли и черновики, которые иначе никто не переслушал бы.

**Клуб** получает каталог своих вечеров: кто выступал, что читал или исполнял, в какой записи что искать — вместо архива, который держится в памяти пары старожилов.

**Архивист** получает не список файлов, а структурированное заключение по всему фонду: что ценно, что дублирует уже известное, что требует немедленного внимания.

---

Отдельная, эмоционально другая ситуация — когда архив не свой, а достался от кого-то. Об этом отдельно: [Унаследованный архив](/net/inherited-archive/).

*Ключевые технологии уже работают на реальных архивах разного масштаба: инженерная библиотека — стабильно, в продакшне, студенческие и преподавательские архивы на трёх языках; в сумме по обработанным проектам — более 38 000 часов аудио- и видеозаписей расшифровано и более 125 000 документов разобрано (около 11,7 ТБ суммарно), модель дообучается. Это не концепция — это инструмент, у которого есть доказательства.*

---

Та же самая технология работает не только для личного архива — если вы представляете организацию (компанию, студию, бюро, клинику, библиотеку), см. [Digercules для организаций](/org/).
