Работающее демо · подготовлено 7 сентября 2026

re-publisher

Очистка текста, извлечение HTML, классификация и подготовка черновика с видимыми этапами обработки. В публичном контуре отключены внешний сбор и публикация.

История кода: с 16 июня 2026. Подготовка демо: 7 сентября 2026.Версия b13048fb13 кадров интерфейса

01 / Задача

Из материала — в объяснимый редакционный черновик

Редакционный конвейер должен отделять исходник, промежуточные признаки и черновик, чтобы результат можно было проверить и повторить после ошибки.

Для кого: Редакторы тематических каналов и разработчики систем обработки контента.

Мой вклад

  • Модули нормализации, извлечения, классификации и шаблонного редактирования.
  • История обработки с результатами каждого этапа.
  • Изолированный публичный runtime и исправление опасного workflow деплоя.

Интерфейс в работе

Сценарии, детали и состояния

02 / Технологии

Стек и его роль

Python / FastAPI

Отдельный публичный runtime, лимиты и HTTP-контракты.

trafilatura / BeautifulSoup

Реальное извлечение текста из встроенного HTML.

scikit-learn

TF-IDF + LogisticRegression с фиксированным random_state.

PostgreSQL

Сессионные результаты pipeline в JSONB, TTL и атомарная квота.

03 / Решения

Как устроен проект

  • Публичная точка входа не монтирует collector и операционный admin.
  • Используются исходные processed_values, extract_html, predict и draft_from_template.
  • TF-IDF и LogisticRegression выполняются реально на фиксированном синтетическом наборе.
  • Повтор управляемого сбоя обновляет тот же run ID, сохраняя принадлежность сессии.
Компоненты опубликованного демо
Компоненты опубликованного демо

04 / Проверка

Что попробовать

  1. Выберите один из трёх материалов и запустите обработку.
  2. Просмотрите очищенный текст, извлечение, классификацию и черновик.
  3. Включите пример ошибки извлечения, затем повторите тот же материал.
  4. Сравните свою историю со второй сессией и сбросьте свой пример.

Подтверждённые результаты

  • Сохранено 13 содержательных кадров фактического интерфейса.
  • Дата, сценарий и версия указаны у каждого кадра.
  • Максимум RAM контейнеров в коротком тесте: 213.2 MiB. Общие службы учитываются отдельно; магазин включает свою БД.
  • Измерено 6 повторений сценария; медиана 1730.0 мс, максимум 2992 мс. Время включает браузер и HTTPS; методика и ограничения приложены.

Границы и ограничения

  • Telegram input заменён тремя собственными материалами; LLM заменена шаблонным редактором.
  • Шесть обучающих примеров не позволяют заявлять качество классификатора на независимых данных.
  • Внешняя публикация и произвольные URL/загрузки отключены. Два одновременных выполнения, 20 материалов на сессию, TTL один час.

Нужны детали реализации?

Архитектура, code-map, API, проверка, развёртывание и реальные измерения.

Открыть документацию →Скачать материалы ↓