Digercules для организаций

Большинству инструментов для работы с корпоративными данными нужно, чтобы вы заранее знали, что у вас за архив. Юридический софт ждёт, что это дела. Медиа-каталог ждёт, что это отснятый материал. Инструменты для аудита корпоративных данных (обычно их называют data governance — сервисы вроде BigID или IBM Guardium) умеют находить в файлах персональные данные и оценивать риск утечки, но не умеют сказать, что внутри файла по смыслу.

Digercules начинает с другого вопроса: а что там вообще есть? Приносите неразобранный массив — компьютер уволившегося сотрудника, архив старых дел, десятилетия отснятого материала, записи прошедших вечеров музыкального или литературного клуба, историю переписки с клиентами — и получаете не список файлов, а структурированную библиотеку. По каждому файлу — тема, язык, тип документа, ключевые сущности, краткое содержание. Это делается заранее, без спешки и дедлайна, пока никому это ещё не понадобилось срочно — а не в последний момент под конкретную задачу. Готовую библиотеку можно скормить любой нейросети, базе данных или поисковой системе — дальше они сами находят нужное и строят интерфейс; Digercules не заменяет этот следующий шаг, а делает его вообще возможным, беря на себя ту трудоёмкую подготовку, на которую обычно никогда не хватает ресурсов.

Как это работает

Обработка идёт либо целиком на компьютере клиента, либо — если мощности недостаточно — делегируется конкретной внешней машине по закрытому пиринговому каналу (не публичное облако): вычислительные мощности физически расположены на Кавказе и в Восточной Европе, клиенту всегда явно указывается, на какой машине и в какой юрисдикции идёт обработка, и обратно возвращаются только текстовые/структурированные результаты, а не исходники.

Это не «отправить данные в облако». Это прямая передача на определённое, названное вам устройство, и обратно приходят только тексты и структурированные результаты — а не исходники, которые, естественно, не пропадают, не удаляются и не изменяются никак.

Зачем это вам

Экономия происходит сразу в двух местах: вашего времени (архив не нужно разбирать руками) и мощности следующей нейросети, которая будет с этим работать — она получает уже переработанный, компактный контекст вместо сырого неразобранного массива.

Сценарии по отраслям и задачам

Клиентские данные и история взаимодействия

Медиа, съёмка, звук

Профессиональные архивы документов

Институции и медиа-инфраструктура

Образование и практика

Уже проверено

Технология уже работает не как концепция: инженерная библиотека — стабильно, в продакшне; студенческие и преподавательские архивы на трёх языках уже разобраны; в сумме по обработанным проектам (включая аудиоархив бардовской песни) — более 38 000 часов аудио/видео расшифровано и более 125 000 документов разобрано (около 11,7 ТБ), модель дообучается на конкретной коллекции.

Общее описание продукта и структура компании — на digercules.com. По вопросам сотрудничества — ryazansky@gmail.com.