Documentos · PDF Kit de ferramentas
O que realmente significa converter um PDF: rasterização versus recodificação
· Fundo
pdf conversão de imagem rasterização
'Converter' abrange operações muito diferentes: desenhar uma página em pixels, agrupar uma imagem em uma página ou reconstruir texto editável. Esta postagem explica o que cada uma envolve e por que algumas conversões são exatas enquanto outras são aproximações.
O arquivo ‘convertido’ que perdeu seu texto – por que uma página transformada em imagem não pode mais ser pesquisada ou selecionada
Uma página convertida pode parecer idêntica e ainda assim perder sua propriedade mais útil. PDF-to-image renderiza cada página em pixels, para que as palavras não possam mais ser selecionadas, pesquisadas ou lidas como uma camada de texto. O ZIP contém imagens de páginas, não PDFs menores ou conteúdo de documento editável.
Essa perda é apropriada quando um slide, bate-papo, catálogo ou visualização precisa de uma imagem. É prejudicial quando a acessibilidade, a pesquisa, a cópia ou a edição posterior são importantes. Escolha a conversão com base na representação necessária, em vez da semelhança tranquilizadora da primeira inspeção visual.
Rasterização — renderização das instruções vetoriais de uma página em um bitmap em uma resolução escolhida e o que é ganho e perdido
A rasterização pede que pdf.js interprete instruções de desenho vetorial, fontes e imagens e, em seguida, pinte uma tela na escala selecionada. ToolAcre oferece PNG para bordas nítidas de documentos e JPEG para saída fotográfica menor. Cada página se torna uma imagem nomeada separadamente dentro de um ZIP.
O renderizador verifica um orçamento de pixels por dispositivo antes da alocação e pode reduzir páginas superdimensionadas abaixo da escala solicitada. PNG e JPEG preservam a aparência renderizada nessa grade de pixels, não os vetores de origem ou a semântica do texto. Ampliar além da resolução escolhida eventualmente revela o raster finito.
Wrapping — colocar uma imagem dentro de uma nova página para que ela se torne PDF e por que isso não tem perdas para a própria imagem
Images-to-PDF viaja na outra direção, colocando uma imagem preparada em cada nova página PDF. Combine o tamanho de cada imagem da página com a imagem mais as margens; As predefinições A4 e US Letter contêm e centralizam a imagem inteira sem cortes. O resultado é conteúdo de imagem estática, não texto reconstruído.
Os bytes JPEG e PNG são incorporados diretamente quando possível. WebP, AVIF, GIF, BMP, HEIC e HEIF dependem da decodificação do navegador e são recodificados como PNG; animado GIF contribui apenas com seu primeiro quadro. Imagens grandes podem ser reduzidas para caber no orçamento de pixels do dispositivo, e cada imagem de entrada é limitada a 30 MB.
Reconstruindo — por que transformar um PDF em um documento editável requer adivinhação de parágrafos, colunas e tabelas
A reconstrução de um documento editável de processamento de texto exigiria inferir a ordem de leitura, parágrafos, colunas, tabelas e estilos a partir da aparência da página. ToolAcre não oferece essa operação ou OCR. PDF-to-image descarta deliberadamente a estrutura semântica, enquanto images-to-PDF envolve deliberadamente imagens em páginas.
A ausência de uma conversão editável é um escopo importante, e não uma alternância ausente. Uma varredura não contém texto, a menos que outro sistema o reconheça, e o reconhecimento ainda não recupera perfeitamente o modelo de autoria original. Use um fluxo de trabalho OCR dedicado ou de conversão de documentos quando a estrutura editável for o requisito real.
Resolução, cor e tamanho — as configurações que decidem se uma página rasterizada será impressa de forma limpa ou suave
A resolução controla as dimensões dos pixels de saída e o uso da memória. Tela, Bom, Alto e Muito alto correspondem a escalas crescentes na interface, enquanto o renderizador pode reduzir a escala de uma página que excede seu orçamento. JPEG usa qualidade fixa próxima de 92 por cento; não há controle deslizante de qualidade.
PNG é adequado para textos e linhas pequenas porque evita artefatos de borda JPEG, embora possa ser maior. JPEG é adequado para páginas fotográficas quando uma entrega menor é importante. Páginas de origem de tamanhos mistos produzem imagens de tamanhos mistos em uma escala, e um ZIP usa entradas armazenadas em vez de recompactar dados de imagem já compactados.
A análise PDF usa um trabalhador, enquanto a codificação da tela e a preparação da imagem exigem APIs do navegador de thread principal
A conversão local não significa que cada etapa seja executada em um trabalhador. pdf.js analisa por meio de seu próprio trabalho empacotado com a avaliação do documento JavaScript desativada, enquanto a codificação da tela deve permanecer no thread principal. O loop cede entre as páginas para que o progresso e os controles continuem a ser pintados.
Para imagens para PDF, a preparação da imagem do navegador pode decodificar e desenhar formatos não suportados no thread principal e, em seguida, pdf-lib monta dados PNG ou JPEG preparados no trabalhador do kit de ferramentas. Esses limites explicam a implementação com precisão e substituem a afirmação mais ampla do esboço de que a renderização e a recodificação simplesmente ocorrem em um Web Worker.
O kit de ferramentas oferece especificamente PDF-to-PNG/JPEG e images-to-PDF
As conversões enviadas são específicas. PDF to Image aceita uma página PDF não criptografada até 50 MB e retorna PNG ou JPEG páginas em ZIP. Imagens para PDF aceita formatos de imagem de navegador suportados de até 30 MB cada e retorna um `images.pdf` com uma imagem por página.
O kit de ferramentas não converte PDF em formatos editáveis de escritório, não executa OCR, junta todas as páginas em uma imagem longa ou preserva o texto por meio de uma viagem de ida e volta PDF-image-PDF. As seções de entrada suportadas e os controles de operação indicam esses caminhos exatos, portanto, não há necessidade de deixar a capacidade ambígua.
Conclusão - saiba que tipo de conversão você precisa antes de começar e, em seguida, use o kit de ferramentas PDF para aqueles que ele suporta
“Converter” pode significar renderizar páginas estruturadas em pixels ou agrupar pixels dentro de páginas recém-estruturadas. Essas direções podem parecer reversíveis, mas não são: uma vez que o texto da página se torna um raster, colocar esse raster em outro PDF não recria caracteres selecionáveis ou instruções de desenho vetorial.
Use PDF-to-image quando o artefato necessário for genuinamente uma imagem e images-to-PDF quando o contêiner necessário for genuinamente um PDF paginado. Ambos são executados localmente com responsabilidades explícitas de trabalhador e thread principal, limites rígidos de entrada e protetores de memória. Escolher a representação correta antes de começar evita um resultado visualmente bem-sucedido, mas funcionalmente errado. Verifique a nota de resultado para redução automática ou conversão de formato, pois essas alterações relatadas podem afetar a adequação da impressão mesmo quando a visualização parece aceitável. Preserve o PDF estruturado sempre que pesquisa, acessibilidade ou edição futura possam ser importantes e crie derivados raster como ativos de entrega descartáveis, em vez de substitutos para a fonte. Nomeie esses derivados com seu formato e escala para que ninguém confunda um pacote de imagens com resolução de tela com o documento destinado à impressão ou uso em arquivamento.