Tài liệu · PDF Bộ công cụ
Ý nghĩa thực sự của việc chuyển đổi PDF: Rasterising và Re-encoding
· Lý lịch
pdf image-conversion sự raster hóa
'Chuyển đổi' bao gồm các hoạt động rất khác nhau: vẽ một trang thành pixel, gói hình ảnh trong một trang hoặc xây dựng lại văn bản có thể chỉnh sửa. Bài đăng này giải thích nội dung của từng chuyển đổi và lý do tại sao một số chuyển đổi là chính xác trong khi các chuyển đổi khác chỉ là xấp xỉ.
Tệp 'đã chuyển đổi' bị mất văn bản — tại sao một trang đã chuyển thành hình ảnh không thể tìm kiếm hoặc chọn được nữa
Một trang được chuyển đổi có thể trông giống hệt nhau nhưng vẫn mất đi thuộc tính hữu ích nhất của nó. PDF-to-image hiển thị mỗi trang thành pixel, do đó, các từ không thể được chọn, tìm kiếm hoặc đọc dưới dạng lớp văn bản nữa. ZIP chứa hình ảnh của các trang chứ không phải các tệp PDF nhỏ hơn hoặc nội dung tài liệu có thể chỉnh sửa.
Sự mất mát đó là phù hợp khi một slide, cuộc trò chuyện, danh mục hoặc bản xem trước cần có hình ảnh. Điều này có hại khi khả năng truy cập, tìm kiếm, sao chép hoặc chỉnh sửa sau này trở nên quan trọng. Chọn chuyển đổi dựa trên sự thể hiện được yêu cầu thay vì sự tương đồng mang tính trấn an của lần kiểm tra trực quan đầu tiên.
Rasterising - hiển thị các hướng dẫn vectơ của trang thành bitmap ở độ phân giải đã chọn và những gì được và mất
Việc tạo điểm ảnh yêu cầu pdf.js diễn giải các hướng dẫn, phông chữ và hình ảnh vẽ vector, sau đó vẽ canvas theo tỷ lệ đã chọn. ToolAcre cung cấp PNG cho các cạnh tài liệu sắc nét và JPEG cho đầu ra ảnh nhỏ hơn. Mỗi trang sẽ trở thành một hình ảnh được đặt tên riêng bên trong một ZIP.
Trình kết xuất sẽ kiểm tra ngân sách pixel trên mỗi thiết bị trước khi phân bổ và có thể giảm các trang có kích thước quá lớn xuống dưới tỷ lệ được yêu cầu. PNG và JPEG giữ nguyên giao diện được hiển thị ở lưới pixel đó chứ không phải vectơ nguồn hoặc ngữ nghĩa văn bản. Việc phóng to vượt quá độ phân giải đã chọn cuối cùng sẽ hiển thị raster hữu hạn.
Gói — đặt một hình ảnh bên trong một trang mới để nó trở thành PDF và tại sao điều này không gây mất mát cho chính hình ảnh đó
Hình ảnh đếnPDF đi theo hướng khác bằng cách đặt một hình ảnh đã chuẩn bị sẵn trên mỗi trang PDF mới. Ghép từng hình ảnh có kích thước trang phù hợp với hình ảnh cộng với lề; Các cài đặt trước của A4 và US Letter chứa và căn giữa toàn bộ hình ảnh mà không cần cắt xén. Kết quả vẫn là nội dung hình ảnh chứ không phải văn bản được xây dựng lại.
JPEG và PNG byte được nhúng trực tiếp khi có thể. WebP, AVIF, GIF, BMP, HEIC và HEIF phụ thuộc vào giải mã trình duyệt và được mã hóa lại thành PNG; hoạt ảnh GIF chỉ đóng góp khung hình đầu tiên. Hình ảnh lớn có thể được giảm bớt để phù hợp với ngân sách pixel của thiết bị và mỗi hình ảnh đầu vào được giới hạn ở 30 MB.
Tái tạo — tại sao việc biến PDF thành tài liệu có thể chỉnh sửa lại yêu cầu phải đoán các đoạn văn, cột và bảng
Việc xây dựng lại một tài liệu soạn thảo văn bản có thể chỉnh sửa sẽ yêu cầu suy ra thứ tự đọc, đoạn văn, cột, bảng và kiểu từ giao diện trang. ToolAcre không cung cấp thao tác đó hoặc OCR. PDF-to-image cố tình loại bỏ cấu trúc ngữ nghĩa, trong khi hình ảnh-to-PDF cố tình bao bọc hình ảnh trong các trang.
Việc thiếu chuyển đổi có thể chỉnh sửa là phạm vi quan trọng chứ không phải là thiếu chuyển đổi. Bản quét không có văn bản trừ khi hệ thống khác nhận ra nó và việc nhận dạng vẫn không khôi phục hoàn hảo mô hình soạn thảo ban đầu. Sử dụng quy trình làm việc OCR hoặc chuyển đổi tài liệu chuyên dụng khi cấu trúc có thể chỉnh sửa là yêu cầu thực tế.
Độ phân giải, màu sắc và kích thước — các cài đặt quyết định xem trang được tạo raster sẽ in rõ ràng hay trông mềm mại
Độ phân giải kiểm soát kích thước pixel đầu ra và việc sử dụng bộ nhớ. Màn hình, Tốt, Cao và Rất cao tương ứng với việc tăng tỷ lệ trong giao diện, trong khi trình kết xuất có thể hạ tỷ lệ một trang vượt quá ngân sách của nó. JPEG sử dụng chất lượng cố định gần 92 phần trăm; không có thanh trượt chất lượng.
PNG phù hợp với văn bản và dòng văn bản nhỏ vì nó tránh được JPEG tạo phẩm ở cạnh, mặc dù nó có thể lớn hơn. JPEG phù hợp với các trang ảnh khi việc phân phối nhỏ hơn có ý nghĩa quan trọng. Các trang nguồn có kích thước hỗn hợp tạo ra hình ảnh có kích thước hỗn hợp ở một tỷ lệ và ZIP sử dụng các mục được lưu trữ thay vì giải nén dữ liệu hình ảnh đã được nén.
Phân tích cú pháp PDF sử dụng một trình xử lý, trong khi mã hóa canvas và chuẩn bị hình ảnh yêu cầu API trình duyệt luồng chính
Chuyển đổi cục bộ không có nghĩa là mọi bước đều được thực hiện trong một công nhân. pdf.js phân tích cú pháp thông qua gói riêng của nó với tính năng đánh giá tài liệu JavaScript bị vô hiệu hóa, trong khi mã hóa canvas phải nằm trên luồng chính. Vòng lặp tạo ra giữa các trang để tiến trình và điều khiển tiếp tục vẽ.
Đối với hình ảnh-to-PDF, quá trình chuẩn bị hình ảnh của trình duyệt có thể giải mã và vẽ các định dạng không được hỗ trợ trên chuỗi chính, sau đó pdf-lib tập hợp dữ liệu PNG hoặc JPEG đã chuẩn bị sẵn trong bộ công cụ. Các ranh giới này giải thích việc triển khai một cách chính xác và thay thế tuyên bố rộng hơn của phác thảo rằng việc hiển thị và mã hóa lại chỉ diễn ra trong Web Worker.
Bộ công cụ đặc biệt cung cấp PDF-to-PNG/JPEG và hình ảnh-to-PDF
Các chuyển đổi được vận chuyển là cụ thể. PDF đối với Hình ảnh chấp nhận một PDF không được mã hóa tối đa 50 MB và trả về các trang PNG hoặc JPEG trong ZIP. Hình ảnh tới PDF chấp nhận các định dạng hình ảnh trình duyệt được hỗ trợ tối đa 30 MB mỗi định dạng và trả về một `images.pdf` với một hình ảnh trên mỗi trang.
Bộ công cụ không chuyển đổi PDF thành các định dạng văn phòng có thể chỉnh sửa, chạy OCR, ghép tất cả các trang thành một hình ảnh dài hoặc giữ nguyên văn bản thông qua một chuyến đi khứ hồi PDF-image-PDF. Các phần đầu vào được hỗ trợ và điều khiển vận hành nêu rõ các đường dẫn chính xác này, do đó không cần phải mơ hồ về khả năng.
Bài học rút ra — biết loại chuyển đổi nào bạn cần trước khi bắt đầu, sau đó sử dụng Bộ công cụ PDF cho những loại chuyển đổi mà nó hỗ trợ
“Chuyển đổi” có thể có nghĩa là hiển thị các trang có cấu trúc thành pixel hoặc gói pixel bên trong các trang có cấu trúc mới. Các hướng đó có thể trông như có thể đảo ngược nhưng thực tế không phải vậy: khi văn bản trang trở thành raster, việc đặt raster đó vào một PDF khác sẽ không tạo lại các ký tự có thể chọn hoặc hướng dẫn vẽ vector.
Sử dụng PDF-to-image khi tạo phẩm được yêu cầu thực sự là một hình ảnh và sử dụng image-to-PDF khi vùng chứa được yêu cầu thực sự là một PDF được phân trang. Cả hai đều chạy cục bộ với trách nhiệm rõ ràng của nhân viên và luồng chính, giới hạn đầu vào cứng và bảo vệ bộ nhớ. Việc chọn cách trình bày chính xác trước khi bắt đầu sẽ ngăn cản kết quả thành công về mặt hình ảnh nhưng lại sai về mặt chức năng. Kiểm tra ghi chú kết quả để tự động giảm hoặc chuyển đổi định dạng, vì những thay đổi được báo cáo đó có thể ảnh hưởng đến tính phù hợp của bản in ngay cả khi bản xem trước có vẻ chấp nhận được. Giữ nguyên PDF có cấu trúc bất cứ khi nào việc tìm kiếm, khả năng truy cập hoặc chỉnh sửa trong tương lai có thể quan trọng và tạo các dẫn xuất raster dưới dạng nội dung phân phối dùng một lần thay vì thay thế cho nguồn. Đặt tên cho các dẫn xuất đó cùng với định dạng và tỷ lệ của chúng để không ai nhầm gói hình ảnh có độ phân giải màn hình với tài liệu dành cho mục đích in ấn hoặc lưu trữ.