Архив новостей, который не работает на новые публикации
У информационного агентства архив прошлых публикаций растёт годами, но почти не используется при работе над новыми материалами: журналист пишет о развитии темы, но не знает, что агентство уже публиковало об этом три года назад — потому что найти это можно только по точному совпадению ключевых слов в заголовке.
Digercules разбирает архив публикаций и создаёт по нему индекс по содержанию — темам, персонам, событиям — так, чтобы новую публикацию можно было автоматически связать с релевантными материалами из прошлого, даже если формулировки не совпадают.
Как это работает
Обработка идёт либо целиком на компьютере клиента, либо — если мощности недостаточно — делегируется конкретной внешней машине по закрытому пиринговому каналу (не публичное облако): вычислительные мощности физически расположены на Кавказе и в Восточной Европе, клиенту всегда явно указывается, на какой машине и в какой юрисдикции идёт обработка, и обратно возвращаются только текстовые/структурированные результаты, а не исходники.
Возражения
«У нас есть внутренний поиск по CMS» — поиск по CMS обычно ищет по точным словам в тексте или заголовке; Digercules находит связь по смыслу — тема, персона, событие — даже когда формулировки за годы изменились.
«Штат и так знает архив агентства» — работает для небольшой редакции с давним составом; перестаёт работать при смене поколения журналистов или росте архива за десятилетия публикаций.
Первый контакт
Пилот на архиве публикаций по одной теме или региону за несколько лет — демонстрация автоматической кросс-линковки с новым материалом. Решение о доступе к архиву публикаций — уровень главного редактора, не рядового журналиста.