Русский

Документы · PDF Инструментарий

Разделение PDF по диапазону страниц в браузере: как это работает

· Как это работает

PDF диапазоны страниц обработка браузера

Структура объекта PDF, разделяющаяся на несколько документов диапазона страниц.
Оригинальная векторная иллюстрация ToolAcre

Диапазон страниц, например 3-7, представляет собой небольшую инструкцию с множеством последствий. В этом посте объясняется, как инструмент браузера превращает этот диапазон в новый, автономный PDF и почему выходные данные часто оказываются больше или меньше, чем вы ожидаете.

Одно долгое сканирование, пять экспонатов — обычная ситуация, когда один PDF должен превратиться в несколько файлов, не покидая компьютер.

Отсканированное соглашение часто доставляется в виде одного длинного файла, даже если его экземпляры должны быть отправлены разным рецензентам. Разделитель принимает от одного PDF до 50 MB, считывает его в текущую вкладку и позволяет каждому диапазону, разделенному запятыми, стать отдельным результатом без отправки контракта в службу загрузки.

Этот рабочий процесс подходит помощнику юриста, которому нужны страницы 1-18 в качестве основного соглашения, 19-25 в качестве расписания и 26-40 в качестве подписей. Источник остается нетронутым. В ходе операции создаются новые документы из выбранных страниц, поэтому проверка каждого вывода имеет значение перед архивированием или распространением исходного отсканированного изображения.

Как интерпретируются диапазоны страниц — физические позиции страниц, включающие диапазоны и почему первой страницей является страница 1, даже если она помечена как «i».

Диапазоны используют физические позиции и основаны на единице: первая страница в файле — это страница 1, даже если в ее нижнем колонтитуле написано «i» или нет номера. Простое число выбирает одну страницу, включены оба конца `2-6`, `8-` достигает конца, а `-3` начинается со страницы 1.

Анализатор отклоняет некорректные токены, перевернутые диапазоны, такие как `7-2`, и позиции, выходящие за рамки фактического количества страниц. Запятые определяют выходные данные, а не просто объединяют выборки. Таким образом, `1-3, 4-6` создает два файла, а `1-6` создает один; перекрывающиеся диапазоны намеренно копируют общие страницы в несколько частей.

Извлечение подмножества дерева страниц — как инструмент создает новый документ, содержащий только те страницы, которые вы запрашивали.

Прежде чем что-либо перезаписать, анализатор диапазона преобразует каждую запрошенную группу в индексы страниц, отсчитываемые от нуля. Затем рабочий создает новый PDF для этой группы, копирует именованные страницы с помощью pdf-lib и сериализует результат. Безымянные страницы не распространяются где-либо еще; пробел — это действительная инструкция опустить материал.

При копировании страниц сохраняется видимое содержимое страницы, размеры, существующее вращение, выбираемый текст и встроенные изображения, используемые на этих страницах. Он не восстанавливает закладки, вложения на уровне документа или определения форм. Каждая часть представляет собой новый файл, и входная цифровая подпись больше не подтверждает подлинность этих вновь записанных байтов.

Почему размер вывода меняется, когда каждый диапазон становится новым документом

Книга приписывает различия в размерах именно дублированным общим ресурсам, но реализация не раскрывает этот учет. Обоснованным наблюдением является то, что каждый диапазон сохраняется как новый PDF, и размер вывода не нужно делить пропорционально количеству страниц. Отсканированные страницы и векторные страницы содержат очень разные объемы данных.

Несколько частей помещаются в ZIP с сохраненными несжатыми записями, поскольку PDF-файлы уже содержат сжатые потоки. Архив упрощает доставку; это не проход сжатия. Ожидайте, что объединенные записи останутся в своих сохраненных размерах, и не обещайте, что разделение существенно уменьшит большой документ.

Разделение или извлечение — разделение файла на части по сравнению с объединением выбранных страниц в один новый файл, и когда каждая из них подходит.

Разделение и извлечение отвечают на различные вопросы доставки. Split рассматривает каждую группу, разделенную запятыми, как отдельный документ. Extract принимает список страниц и записывает все названные страницы в одну новую PDF. Используйте разделение на несколько экспонатов или глав; используйте экстракт, когда получатель должен получить один краткий пакет, собранный из разрозненных позиций.

Это различие также контролирует форму загрузки. Один разделенный диапазон возвращает PDF с суффиксом `-part-1`. Два или более диапазонов возвращают архив `-split.zip`. Извлечение всегда возвращает один `-pages.pdf`. Сознательный выбор операции предотвращает появление неожиданного пакета незадолго до крайнего срока подачи заявок.

Рабочий пример — разделение сорокастраничного отсканированного соглашения на страницы для подписей, графики и основную часть.

Для соглашения объемом в сорок страниц практическая спецификация может быть `1-24, 25-34, 35-40`. Инструмент проверяет все три группы на сорока страницах, создает три новых PDF-файла в указанном порядке и упаковывает их в один ZIP. Номера деталей соответствуют порядку диапазона, а не исходным номерам страниц, напечатанным на листах.

Откройте каждую часть после загрузки. Убедитесь, что основная часть заканчивается там, где предполагалось, расписания начинаются с заголовков, а страницы с подписями сохраняют правильную ориентацию. Если напечатанные этикетки отличаются от физических позиций, определите смещение перед выполнением разделения; инструмент работает в том порядке дерева страниц, который он действительно может прочитать.

Чего это не касается — разделение по закладкам или по обнаруженному содержимому, что требует структуры, которой нет у многих сканируемых файлов.

Этот разделитель не разделяет закладки, заголовки, обнаруженный текст или визуальные разделители. Эти запросы требуют надежного распознавания структуры или контента, в то время как многие исходные сканы содержат только изображения страниц. Он также отказывается от зашифрованных или защищенных паролем PDF-файлов, вместо того, чтобы обходить контроль доступа; сначала разблокируйте авторизованную копию в исходном приложении.

Нет OCR, классификации контента или истории на стороне сервера. Принятый максимум — 50 MB для входа PDF, при этом практическая работа дополнительно ограничивается памятью устройства. Сложные требования к архивированию или доступности должны быть проверены в специальном программном обеспечении после завершения выбора на уровне страницы.

Разделение перестраивает каждый выбранный диапазон локально и исключает структуры уровня документа.

Разделение — это последовательность контролируемых перестроек: анализ включающих диапазонов, копирование каждой группы в новый документ, ее сериализация и упаковка нескольких выходных данных при необходимости. Это объясняет, почему качество страниц остается неизменным, а навигация и подписи на уровне документа — нет. Это также объясняет, почему запятые имеют структурные последствия.

Набор инструментов PDF выполняет эти преобразования в веб-работнике на устройстве. Его код не отправляет запросы, передающие байты документа, хотя согласованная аналитика может загружаться на канонический рабочий хост и исключает имена файлов и содержимое из событий ToolAcre. После этого очистите файлы, чтобы освободить буферы и завершить работу работника. Сохраняйте ZIP до тех пор, пока не будет открыт каждый диапазон, поскольку на вкладке не сохраняется копия для восстановления выходных данных, которые никогда не загружались. Также проверьте имена файлов.