Работающее демо · подготовлено 7 сентября 2026
re-publisher
Очистка текста, извлечение HTML, классификация и подготовка черновика с видимыми этапами обработки. В публичном контуре отключены внешний сбор и публикация.
01 / Задача
Из материала — в объяснимый редакционный черновик
Редакционный конвейер должен отделять исходник, промежуточные признаки и черновик, чтобы результат можно было проверить и повторить после ошибки.
Для кого: Редакторы тематических каналов и разработчики систем обработки контента.
Мой вклад
- Модули нормализации, извлечения, классификации и шаблонного редактирования.
- История обработки с результатами каждого этапа.
- Изолированный публичный runtime и исправление опасного workflow деплоя.
Интерфейс в работе
Сценарии, детали и состояния02 / Технологии
Стек и его роль
Python / FastAPI
Отдельный публичный runtime, лимиты и HTTP-контракты.
trafilatura / BeautifulSoup
Реальное извлечение текста из встроенного HTML.
scikit-learn
TF-IDF + LogisticRegression с фиксированным random_state.
PostgreSQL
Сессионные результаты pipeline в JSONB, TTL и атомарная квота.
03 / Решения
Как устроен проект
- Публичная точка входа не монтирует collector и операционный admin.
- Используются исходные processed_values, extract_html, predict и draft_from_template.
- TF-IDF и LogisticRegression выполняются реально на фиксированном синтетическом наборе.
- Повтор управляемого сбоя обновляет тот же run ID, сохраняя принадлежность сессии.
04 / Проверка
Что попробовать
- Выберите один из трёх материалов и запустите обработку.
- Просмотрите очищенный текст, извлечение, классификацию и черновик.
- Включите пример ошибки извлечения, затем повторите тот же материал.
- Сравните свою историю со второй сессией и сбросьте свой пример.
Подтверждённые результаты
- Сохранено 13 содержательных кадров фактического интерфейса.
- Дата, сценарий и версия указаны у каждого кадра.
- Максимум RAM контейнеров в коротком тесте: 213.2 MiB. Общие службы учитываются отдельно; магазин включает свою БД.
- Измерено 6 повторений сценария; медиана 1730.0 мс, максимум 2992 мс. Время включает браузер и HTTPS; методика и ограничения приложены.
Границы и ограничения
- Telegram input заменён тремя собственными материалами; LLM заменена шаблонным редактором.
- Шесть обучающих примеров не позволяют заявлять качество классификатора на независимых данных.
- Внешняя публикация и произвольные URL/загрузки отключены. Два одновременных выполнения, 20 материалов на сессию, TTL один час.
Нужны детали реализации?
Архитектура, code-map, API, проверка, развёртывание и реальные измерения.
Открыть документацию →Скачать материалы ↓