Архивный проект; сервис выведен из эксплуатации
WTG
Система собирала публикации, прогоняла их через OCR и классификацию, затем показывала оператору на проверку. Сервис удалён с VPS вместе с данными и бэкапами. Здесь остались обезличенные скрины, схемы и замеры.
01 / Задача
Сбор публикаций, OCR и классификация. Архив
У публикации несколько этапов обработки. Нужно было видеть, откуда она пришла, что сделал OCR, как сработала классификация и какое решение принял оператор. Ошибки и очереди — на отдельных экранах.
Сценарий: Сбор и ручная проверка обработанных публикаций.
Что делал
- Сбор, очереди, обработка и экран проверки оператором.
- Админка, модели данных и code-map.
- Перед удалением сохранил обезличенные скрины и агрегаты. Сам сервис, рабочие данные и бэкапы удалены.
Скриншоты
Экраны, формы, ошибкиСкриншоты, схемы и исходные материалы сохранены на языке оригинала; подписи и описание переведены.
02 / Технологии
Что использовано
Python / FastAPI / Jinja
Операционная админка, JSON API и orchestration.
PostgreSQL / SQLAlchemy / Alembic
Публикации, задания, версии решений, материалы и миграции.
PaddleOCR
Отдельный OCR sidecar и worker.
Docker / Nginx / systemd
Прежнее размещение семи служб и фоновые задания.
03 / Решения
Как устроен проект
- Сбор и долгая обработка вынесены в задания с lease/heartbeat.
- OCR отделён от web и имеет самостоятельные очередь, статусы и попытки.
- Исходная публикация, промежуточные решения и итоговые материалы имеют разные роли.
- Архив содержит только обезличенные изображения, документацию и агрегаты; рабочая БД, сессии и резервные копии не сохранены.
04 / Проверка
Что сохранено
- Просмотрите обезличенные расписания, группы, pipeline и материалы.
- Сопоставьте экран со строкой code-map и схемой данных.
- Откройте агрегаты очередей и истории, прочитайте дату и ограничения замера.
- Изучите акт удаления и сравнение диска/RAM до и после вывода из эксплуатации.
Результаты проверок
- Сохранено 30 содержательных кадров фактического интерфейса.
- Дата, сценарий и версия указаны у каждого кадра.
- Зафиксировано 527 718 публикаций и 29 092 OCR-задания; это разные сущности и не показатели качества.
- WTG удалён после проверки локального архива; до очистки его каталог занимал около 104 GiB.
Ограничения
- Архивный проект; сервис выведен из эксплуатации. Демо-ссылки и восстановления WTG нет.
- Статусы заданий и confidence не являются измерением точности OCR или моделей.
- Legacy noVNC и недоступные разделы не выдаются за работающие.
- Обнаруженный рост web до примерно 3,8 GiB описан как наблюдение; первопричина кода не установлена.
Технические заметки
Модули, API, схема данных, запуск и результаты проверок.
Документация →Материалы ↓