Доступно на английскомvust.ai
vust

PDF-скан

В сканированном PDF нет текста — и вот что с этим делать

Сканированная страница — фотография текста, а не текст, который читает программа. Поэтому разбор возвращается пустым, и «взять модель поумнее» тут не помогает: суммаризация работает с текстом, а текста в файле нет. Ниже — четыре признака скана и порядок действий, после которого файл разберётся как обычный.

Распознавания здесь нет · порядок действий нижеЧестная граница: текст, но не картинки
Честно: распознавания здесь нетЧетыре признака сканаЧто сделать до отправки

Честная граница

Честный отказ надёжнее правдоподобной выдумки

Разбор ищет в файле текстовый слой. Нашёл — работает обычный путь. Не нашёл — возвращается отказ, а не догадка по названию файла и не выжимка по первой странице. Инструмент, который на пустом входе выдаёт правдоподобный текст, опаснее того, который отказывается: выжимка по договору, которого никто не прочитал, выглядит убедительно и ровно поэтому попадает в переписку и в решение.

Отказ стоит минуты на распознавание. Выдуманная выжимка стоит доверия к документу.
Образцы

До и после

Что происходит со сканом, как за десять секунд проверить текстовый слой и что сделать, чтобы файл разобрался.

Отправили скан как есть

Чего ждали

Загрузили PDF — получили выжимку, как с любым другим документом.

Что происходит

Извлечение находит ноль символов: сканированная страница — это фотография текста, а не закодированный текст. Вместо догадки по названию файла возвращается честный отказ: в PDF нет извлекаемого текста, файл сканированный.

Проверка за десять секунд

Что сделать

Откройте файл и попробуйте выделить абзац мышью — так же, как выделили бы текст в документе.

Что это говорит

Выделяется предложение и копируется — текстовый слой есть, файл разберётся. Выделяется прямоугольник целиком, а поиск не находит слово, которое видно на экране, — это скан, и никакой инструмент его напрямую не прочитает.

Один шаг — и файл готов

Что сделать

Прогоните файл через распознавание тем, что у вас уже стоит: штатные средства системы, приложение сканера, офисный пакет.

Дальше как обычно

Проверьте результат — найдите поиском слово из середины документа — и отправляйте. Дальше работает обычный разбор: тезисы, абзацы, ключевые выводы или короткий TL;DR. Для двух-трёх страниц быстрее просто перепечатать текст в чат.
Практические сценарии

Кому эта страница

Тем, у кого PDF не читается
Файл открывается, текст виден, а инструмент говорит, что текста нет.
Это скан: внутри фотографии страниц, а не символы. Здесь разобрано, как это понять за десять секунд и что сделать.
Тем, кто работает с архивами и справками
Отсканированные договоры, выписки и старые документы приходят именно в таком виде.
Штатное распознавание в системе или приложении сканера решает задачу — отдельный сервис обычно не нужен.
Тем, кто уже прогнал распознавание
Текст выделяется, поиск что-то находит, а в выжимке мусор.
Самый коварный случай — плохое распознавание: ошибка проходит молча. Проверять нужно до отправки.
Как это работает01–03

Что сделать со сканом

  1. 01

    Проверьте, скан ли это

    Текст не выделяется, поиск не находит слово, которое видно на экране, страница перекошена, файл неожиданно тяжёлый — четыре признака.

  2. 02

    Распознайте тем, что уже стоит

    Штатные средства операционной системы, приложение сканера или офисный пакет: режим «распознать текст» либо «PDF с возможностью поиска».

  3. 03

    Проверьте результат до отправки

    Найдите поиском слово из середины документа и выделите абзац. Копируется читаемый текст — файл готов. Для двух-трёх страниц быстрее просто перепечатать текст в чат.

Тот же инструмент · в Telegram@vustSummaryBot

Когда текстовый слой появился

Отправьте распознанный PDF файлом в @vustSummaryBot — дальше работает обычный разбор, а у загруженного файла появляется режим вопросов.

Открыть в Telegram
Качество и доверие

Почему отказ, а не догадка

Распознавания в этом пути нет

И это не недоделка. Распознавание многостраничного скана заметно тяжелее извлечения текста; встраивать его в каждую загрузку значило бы замедлить подавляющее большинство файлов.

Выдуманная выжимка опаснее отказа

Правдоподобный текст по документу, которого никто не прочитал, выглядит убедительно и ровно поэтому попадает в переписку и в решение.

Ограничения на PDF

До 15 МБ, до 50 страниц, до 5000 слов извлечённого текста. Файл под паролем не откроется, фотография страницы и скриншот не читаются.

FAQ

Частые вопросы

Почему сканированный PDF не читается?

Потому что внутри не текст, а фотографии страниц. Формат файла тот же самый, содержимое — пиксели, а не символы. Извлечение ищет в файле текстовый слой; если его нет, извлекать нечего, и суммаризировать тоже нечего. Это не недоработка, которую закроет модель поумнее: суммаризация работает с текстом, а текста в файле нет. Чинить нужно на шаг раньше — распознаванием.

Есть ли встроенное распознавание?

Нет, и это осознанное решение, а не забытая функция. Распознавание многостраничного скана — заметно более тяжёлая операция, чем извлечение текста; встраивать её в каждую загрузку означало бы замедлить подавляющее большинство файлов, у которых текстовый слой есть. Честнее отказать быстро и понятно и показать, что сделать дальше.

Чем распознать файл, если ничего специального не установлено?

Почти всегда достаточно того, что уже есть: штатные средства операционной системы, приложение сканера, офисный пакет — в них есть режим «распознать текст» либо «сохранить как PDF с возможностью поиска». Отдельный сервис обычно не нужен. Если страниц две-три, быстрее всего просто перепечатать или скопировать текст и отправить его в чат напрямую.

Я распознал файл, но в выжимке мусор — почему?

Это самый коварный случай: скан, поверх которого распознавание прогнали плохо. Текст выделяется, поиск что-то находит, а вместо «отчёт» стоит «отчёг» — и такой файл обработается без ошибки, а мусор попадёт в выжимку молча. Поэтому после любого распознавания выделите пару абзацев и посмотрите, что реально скопировалось. Кривая съёмка при плохом свете распознаётся плохо в любом инструменте: переснять страницу ровно дешевле, чем чинить последствия.

Что ещё не получится и какие ограничения у PDF?

Фотография страницы, скриншот и присланное изображение не читаются: нужен текст либо PDF с текстовым слоем. Файл под паролем не откроется. Ограничения на PDF: до 15 МБ, до 50 страниц, до 5000 слов извлечённого текста — длинный документ разумно делить по главам. Списание происходит после того, как выжимка готова, поэтому за отказ по сканированному файлу денег не берут.

Можно начинать

Скан — это фотографии страниц, а не текст.

Отсюда и честный отказ вместо правдоподобной выдумки. Распознайте файл тем, что у вас уже есть, — и присылайте снова.

Два разных PDF, которые выглядят одинаково

Файл PDF может хранить две принципиально разные вещи, и на экране они неотличимы.

«Цифровой» PDF — выгруженный из Word, «Google Документов», вёрстки или отчётной системы — хранит настоящие символы. Каждая буква и пробел записаны как данные: их можно выделить, найти поиском, скопировать.

«Сканированный» PDF — это контейнер с фотографиями страниц. Глазу человека — та же страница текста. Программе — набор пикселей, читаемый ровно настолько же, насколько текстовый файл читается из фотографии дорожного знака.

Разница невидима в обычном использовании и становится очевидной в ту секунду, когда что-то пытается извлечь из файла текст. И именно поэтому «возьми модель поумнее» тут не помогает: суммаризация работает с текстом, а текста в файле нет. Чинить нужно на шаг раньше — на превращении изображения в символы, то есть распознаванием.

Как бот ведёт себя со сканом

Разбор PDF ищет в файле текстовый слой. Нашёл — дальше обычный путь: выжимка тезисами, абзацами, ключевыми выводами или коротким TL;DR.

Не нашёл — возвращается честная ошибка: в PDF нет извлекаемого текста, файл сканированный или состоит из изображений. Не выдуманная выжимка по названию файла, не догадка по первой странице — отказ.

Распознавания в этом пути нет, и это не недоделка, которую вот-вот закроют. Распознавание многостраничного скана — заметно более тяжёлая операция, чем извлечение текста, и встраивать её в каждую загрузку ради меньшинства файлов означало бы замедлить подавляющее большинство. Честнее отказать быстро и понятно и показать, что сделать дальше.

Четыре признака, что PDF сканированный

Проверяется за десять секунд, до всякой отправки:

  1. Текст не выделяется. Пробуете выделить абзац мышью — выделяется прямоугольник целиком, как картинка.
  2. Поиск по документу ничего не находит. Ищете слово, которое точно видите на экране, — ноль результатов.
  3. Страница слегка перекошена, есть тени и серый фон. Следы съёмки или сканера.
  4. Файл неожиданно тяжёлый. Двадцать страниц текста весят мегабайты — значит, внутри изображения, а не символы.

Отдельный, самый коварный случай — «гибрид»: скан, поверх которого уже прогнали распознавание, но плохо. Текст выделяется, поиск что-то находит, а в извлечённом виде вместо «отчёт» стоит «отчёг». Такой файл обработается без ошибки, и мусор попадёт в выжимку молча. Поэтому после любого распознавания есть смысл выделить пару абзацев и посмотреть, что реально скопировалось.

Что сделать со сканом

Распознавание в том, чем вы уже пользуетесь. Штатные средства операционной системы, приложение сканера, офисный пакет — почти в каждом есть режим «распознать текст» или «сохранить как PDF с возможностью поиска». Отдельный сервис для этого обычно не нужен.

Проверьте результат до отправки. Откройте распознанный файл, найдите поиском слово с середины документа и выделите абзац. Если копируется читаемый текст — файл готов.

Простой запасной путь: скопировать текст руками. Для двух-трёх страниц это быстрее любых манипуляций с форматами: вставленный в чат текст обрабатывается напрямую.

Проверьте качество исходника. Кривая съёмка при плохом свете распознаётся плохо в любом инструменте. Переснять страницу ровно и при дневном свете — дешевле, чем чинить последствия.

Чего ещё не будет

Фотография страницы, скриншот и присланное изображение не читаются: нужен текст либо PDF с текстовым слоем. Защищённый паролем файл не откроется. Ограничения на PDF: до 15 МБ, до 50 страниц, до 5000 слов извлечённого текста — длинный документ разумно делить по главам.

Почему честный отказ лучше догадки

Инструмент, который на пустом входе выдаёт правдоподобный текст, опаснее инструмента, который отказывается. Выжимка по договору, которого никто не прочитал, выглядит убедительно и ровно поэтому попадает в переписку и в решение.

Отказ стоит вам минуты на распознавание. Выдуманная выжимка стоит доверия к документу, и обнаруживается это обычно позже, чем хотелось бы.

Когда текстовый слой появился

Дальше работает обычный разбор PDF: до 15 МБ, до 50 страниц, извлечение с сохранением границ страниц.

Отдельно полезное: у загруженного файлом документа появляется возможность задать по нему уточняющие вопросы — короткий диалог по PDF. Для PDF, открытого по ссылке, такой кнопки не будет: диалог работает только с файлом, который вы прислали в чат.

И то же, что на остальных страницах: выжимка приходит на языке вашего интерфейса Telegram. Англоязычный отчёт даёт русский конспект без отдельного перевода.

Сколько это стоит

Три коротких выжимки в день бесплатно. Дальше короткий текст — $0.05, длинный — $0.10. Списание происходит после того, как выжимка готова: за отказ по сканированному файлу денег не берут — неудачный разбор не оплачивается.