Русский

Документы · PDF Инструментарий

Что на самом деле означает преобразование PDF: растеризация или перекодирование

· Фон

PDF преобразование изображений растеризация

Векторная страница PDF становится пикселями, а изображения — страницами PDF.
Оригинальная векторная иллюстрация ToolAcre

«Конвертировать» охватывает самые разные операции: рисование страницы в пикселях, перенос изображения на страницу или восстановление редактируемого текста. В этом посте объясняется, что включает в себя каждый из них и почему некоторые преобразования являются точными, а другие — приблизительными.

«Конвертированный» файл потерял текст — почему страницу, превратившуюся в изображение, больше невозможно найти или выбрать

Преобразованная страница может выглядеть идентично, но при этом потерять свое самое полезное свойство. PDF-to-image преобразует каждую страницу в пиксели, поэтому слова больше нельзя выбирать, искать или читать как текстовый слой. ZIP содержит изображения страниц, а не файлы PDF меньшего размера или редактируемое содержимое документа.

Эта потеря уместна, когда для слайда, чата, каталога или предварительного просмотра требуется изображение. Это вредно, когда важны доступность, поиск, копирование или последующее редактирование. Выбирайте преобразование, основываясь на требуемом представлении, а не на обнадеживающем сходстве первого визуального осмотра.

Растеризация — преобразование векторных инструкций страницы в растровое изображение с выбранным разрешением, а также то, что получается и теряется.

При растеризации pdf.js интерпретирует инструкции векторного рисования, шрифты и изображения, а затем рисует холст в выбранном масштабе. ToolAcre предлагает PNG для четких краев документа и JPEG для печати фотографий меньшего размера. Каждая страница становится изображением с отдельным именем внутри одного ZIP.

Средство визуализации проверяет бюджет пикселей для каждого устройства перед распределением и может уменьшить слишком большие страницы ниже запрошенного масштаба. PNG и JPEG сохраняют внешний вид этой пиксельной сетки, а не исходные векторы или семантику текста. Увеличение масштаба за пределы выбранного разрешения в конечном итоге обнажает конечный растр.

Обертывание — размещение изображения на новой странице так, чтобы оно стало PDF, и почему это не приводит к потерям для самого изображения.

Images-to-PDF перемещается в другом направлении, помещая одно подготовленное изображение на каждую новую страницу PDF. Сопоставьте размеры каждого изображения на странице с изображением плюс поля; Пресеты A4 и US Letter содержат и центрируют все изображение без обрезки. В результате получается неподвижное изображение, а не реконструированный текст.

Байты JPEG и PNG по возможности встраиваются напрямую. WebP, AVIF, GIF, BMP, HEIC и HEIF зависят от декодирования браузера и перекодируются как PNG; анимированный GIF добавляет только первый кадр. Большие изображения могут быть уменьшены в соответствии с бюджетом пикселей устройства, а каждое входное изображение ограничено значением 30 MB.

Реконструкция — почему для превращения PDF в редактируемый документ нужно угадывать абзацы, столбцы и таблицы

Реконструкция редактируемого текстового документа потребует определения порядка чтения, абзацев, столбцов, таблиц и стилей на основе внешнего вида страницы. ToolAcre не предлагает эту операцию или OCR. PDF-to-image намеренно отбрасывает семантическую структуру, а images-to-PDF намеренно помещает изображения в страницы.

Отсутствие редактируемого преобразования является важной областью, а не отсутствующим переключателем. Сканирование не содержит текста, если его не распознает другая система, а распознавание все равно не позволяет полностью восстановить исходную авторскую модель. Используйте специальный рабочий процесс OCR или процесс преобразования документов, когда редактируемая структура является фактическим требованием.

Разрешение, цвет и размер — настройки, которые определяют, будет ли растровая страница печататься чисто или выглядеть мягкой.

Разрешение контролирует размеры выходных пикселей и использование памяти. Экран, «Хорошо», «Высокий» и «Очень высокий» соответствуют увеличению масштаба интерфейса, в то время как средство визуализации может уменьшить масштаб страницы, превышающей его бюджет. JPEG использует фиксированное качество около 92 процентов; нет слайдера качества.

PNG подходит для работы с небольшим текстом и линиями, поскольку позволяет избежать артефактов по краям JPEG, хотя его размер может быть больше. JPEG подходит для страниц с фотографиями, когда важен небольшой объем. Исходные страницы смешанного размера создают изображения смешанного размера в одном масштабе, а ZIP использует сохраненные записи, а не повторно сжимает уже сжатые данные изображения.

Для анализа PDF используется рабочий процесс, а для кодирования холста и подготовки изображения требуются API-интерфейсы браузера основного потока.

Локальное преобразование не означает, что каждый шаг выполняется в одном рабочем процессе. pdf.js анализирует свой собственный связанный рабочий процесс с отключенной оценкой документа JavaScript, в то время как кодирование холста должно оставаться в основном потоке. Цикл переключается между страницами, поэтому прогресс и элементы управления продолжают рисоваться.

Для изображений в PDF подготовка изображений браузера может декодировать и рисовать неподдерживаемые форматы в основном потоке, затем pdf-lib собирает подготовленные данные PNG или JPEG в рабочем инструменте набора инструментов. Эти границы точно объясняют реализацию и заменяют более широкое утверждение о том, что рендеринг и перекодирование просто происходят в Web Worker.

Набор инструментов, в частности, предлагает PDF в PNG/JPEG и изображения в PDF.

Отправленные преобразования специфичны. PDF в Image принимает от одного незашифрованного PDF до 50 MB и возвращает страницы PNG или JPEG в ZIP. Изображения в PDF принимает поддерживаемые форматы изображений браузера до 30 MB каждый и возвращает один `images.pdf` с одним изображением на странице.

Инструментарий не конвертирует PDF в редактируемые офисные форматы, не запускает OCR, не сшивает все страницы в одно длинное изображение и не сохраняет текст с помощью PDF-image-PDF туда и обратно. В разделах поддерживаемых входных данных и элементах управления операциями указаны эти точные пути, поэтому нет необходимости оставлять возможности неоднозначными.

Вывод: перед началом работы узнайте, какой тип преобразования вам нужен, а затем используйте набор инструментов PDF для тех, которые он поддерживает.

«Преобразование» может означать преобразование структурированных страниц в пиксели или размещение пикселей внутри вновь структурированных страниц. Эти направления могут выглядеть обратимыми, но это не так: как только текст страницы становится растром, помещение этого растра в другой PDF не воссоздает выбираемые символы или инструкции векторного рисования.

Используйте PDF-to-image, когда требуемый артефакт действительно является изображением, и images-to-PDF, когда требуемый контейнер действительно является страничным PDF. Оба выполняются локально с явными обязанностями рабочего и основного потока, жесткими ограничениями ввода и защитой памяти. Выбор правильного представления перед началом работы предотвращает визуально успешный, но функционально неправильный результат. Проверьте примечание к результату на предмет автоматического уменьшения или преобразования формата, поскольку указанные изменения могут повлиять на пригодность для печати, даже если предварительный просмотр кажется приемлемым. Сохраняйте структурированный PDF всякий раз, когда будущий поиск, доступность или редактирование могут иметь значение, и создавайте производные растра в качестве одноразовых ресурсов доставки, а не замены источника. Назовите эти производные, указав их формат и масштаб, чтобы никто не принял пакет изображений с разрешением экрана за документ, предназначенный для использования в печати или архивировании.