Что работает сейчас
TXT читается напрямую. PDF разбирается через pdftotext. DOCX читается через docx2txt. OCR печатного текста работает через tesseract с русским, английским и украинским языками; изображение предварительно очищается через ImageMagick. Архивы и исполняемые файлы не принимаются.
личные файлыDOCXукраинский OCRбез архивов