Português (Brasil)

Vídeo e legendas · Downloader de miniaturas do YouTube e visualizador de metadados

Como um ID de vídeo do YouTube é extraído de links de exibição, Shorts e links incorporados

· Como funciona

YouTube urls análise

Vários formatos de link do YouTube convergindo em um identificador de vídeo
Ilustração vetorial original ToolAcre

O mesmo vídeo pode ser vinculado de diversas maneiras. Esta postagem explica os formatos que um link do YouTube pode assumir, como uma ferramenta encontra o ID de onze caracteres dentro de cada um e o que fazer com parâmetros de rastreamento e carimbos de data/hora.

O mesmo vídeo, cinco links diferentes: páginas de exibição, links curtos, Shorts, incorporações e endereços móveis

Um vídeo pode chegar como um relógio URL, compartilhamento youtu.be, caminho de Shorts, endereço incorporado, link ao vivo ou link de host móvel. ToolAcre reduz cada forma suportada para o mesmo ID de onze caracteres antes de considerar qualquer trabalho de rede. Conseqüentemente, uma importação mista pode usar esse ID como chave de desduplicação, em vez de tratar seis links para um vídeo como seis registros.

Essa ordem é útil para editores que limpam uma lista mista: a análise é uma string determinística e URL funciona na página, portanto, domínios ruins e links somente de playlist podem ser relatados sem vazar o valor colado para um resolvedor remoto. Uma coleção URL fica sem solução porque nem sua presença nem sua ordem identificam qual membro o editor pretendia citar.

O próprio ID - onze caracteres de um alfabeto de símbolos 64 e por que parece aleatório

O formato de ID aceito tem exatamente onze caracteres extraídos de letras maiúsculas e minúsculas, dígitos, hífen e sublinhado. Esta é apenas uma verificação de formato; passar não prova que existe um vídeo nem revela o que os personagens significam. Aplicar a regra ao valor v analisado ou segmento de caminho evita a eliminação de uma substring semelhante a ID de algum parâmetro codificado não relacionado.

Um ID correspondente simples é aceito imediatamente. Identificadores de playlist mais longos usam um padrão conservador separado, evitando que um token de playlist seja tratado silenciosamente como a chave de um vídeo. Um horário de início permanece acompanhando os dados de citação: alterar 30 segundos para 90 segundos ainda aponta para o mesmo registro de vídeo de onze caracteres.

Analisando com URL API - lendo host, caminho e consulta sem adivinhar apenas com expressões regulares

O construtor URL separa protocolo, host normalizado, segmentos de caminho e parâmetros de consulta. Isso evita uma expressão regular gigante que pode acidentalmente aceitar um domínio semelhante ou confundir um valor de consulta com um ID de caminho. Rejeitar um host enganoso é mais seguro do que produzir uma miniatura confiável para um identificador incorporado em um URL não confiável.

Apenas HTTP e HTTPS são aceitos, e um www inicial é normalizado. A lista de permissões abrange hosts do YouTube, dispositivos móveis, música, jogos, nocookie e youtu.be, em vez de confiar em qualquer nome de host que contenha a palavra youtube. O sucesso remoto não pode validar a origem de um link mal analisado, porque um invasor pode incluir deliberadamente um ID público real em um domínio não relacionado.

Onde o ID se esconde em cada forma - o parâmetro v, o caminho em youtu.be, /shorts/, /embed/ e /live/

As páginas de observação usam o parâmetro de consulta v, youtu.be usa seu primeiro segmento de caminho e os formulários curtos, incorporados e ativos usam o segmento após seu prefixo. Os caminhos /v/ e /e/ legados também são reconhecidos pela mesma verificação de formato estrita. Um identificador correspondente permite apenas o processamento local, e não uma reivindicação sobre conteúdo ou propriedade.

O analisador lê adicionalmente um ID de lista de reprodução válido e um deslocamento inicial de t ou início. Ele os retorna como fatos separados para que possam informar os links gerados sem contaminar o próprio identificador do vídeo. O limite da rede começa somente após a conclusão dessa distinção, portanto, um teste do analisador pode ser executado offline.

Ignorando o resto – parâmetros da playlist, horários de início e valores de rastreamento de compartilhamento que não identificam o vídeo

Valores de rastreamento de compartilhamento, parâmetros de consulta não relacionados e carimbos de data/hora não identificam o vídeo. ToolAcre os ignora após extrair o ID, enquanto os formulários de tempo suportados são normalizados para segundos inteiros para links que preservam deliberadamente um ponto inicial. Assim, dois links com tags de campanha diferentes podem ser resolvidos para um registro de ativo sem transportar esses parâmetros de marketing para URLs gerados.

As páginas somente de lista de reprodução, canal e pesquisa recebem uma recusa acionável porque não nomeiam um único vídeo. Adivinhar um ID dessas páginas geraria certeza e poderia buscar recursos para o registro errado. Um curador deve primeiro selecionar um item individual; o analisador não escolherá silenciosamente o primeiro resultado de uma coleção cuja ordem poderá mudar posteriormente.

Exemplo resolvido: normalização de dez links colados em seus IDs – incluindo dois que não são links do YouTube

Um lote prático de dez pastas pode incluir formulários de exibição, curtos, Shorts, incorporados, ao vivo, móveis e de identificação simples, além de dois domínios não relacionados. Os primeiros oito convergem para IDs; os hosts não relacionados falham localmente com a lista de hosts aceitos. A saída pode, portanto, ser desduplicada por ID mesmo quando os colaboradores copiaram links de diversas interfaces diferentes do YouTube.

Nenhuma investigação de existência ocorre durante essa normalização. Um ID de forma válida, mas inexistente, atinge o estágio de busca posterior, onde as respostas de miniatura e oEmbed fornecem evidências independentes em vez de alterar retroativamente o resultado do analisador. Isso preserva uma distinção clara entre “o texto é um identificador válido” e “o Google atualmente fornece material público para ele”.

O que isso não cobre: ​​canal, playlist e URLs de pesquisa, que não contêm um único ID de vídeo

O analisador não resolve canais, listas de reprodução ou resultados de pesquisa em um vídeo escolhido. Também não pode ignorar o acesso privado, eliminado ou com restrição de idade, porque extrair um identificador público não é autorização para recuperar material protegido. Recusar uma coleção ambígua URL protege um catálogo de ser preenchido com qualquer item que apareça primeiro na tela de uma pessoa.

Depois que Fetch é pressionado, as sondagens de imagem podem encontrar 404, outros erros HTTP, um espaço reservado 200 ou bytes não decodificáveis. Os metadados separadamente podem falhar por meio de transporte, recusa de HTTP ou JSON inválido, inclusive quando bloqueadores, proxies ou estado offline interferem. Esses resultados pertencem ao relatório de disponibilidade; eles não devem levar o analisador a reinterpretar o link original como um vídeo diferente.

Conclusão: encontre o ID e tudo se segue – como o YouTube Thumbnail Downloader aceita um link do YouTube e documentos com os formatos que ele suporta

Após a análise local, o navegador solicita diretamente uma miniatura por candidato JPEG de i.ytimg.com e um registro oEmbed JSON de www.youtube.com. O oEmbed URL envolve o relógio canônico URL e format=json. Ver essas chamadas no painel Rede confirma que a normalização foi concluída e que o mesmo ID extraído está conduzindo solicitações de ativos e metadados.

Esses GETs anônimos omitem credenciais e referenciadores, não usam armazenamento, seguem redirecionamentos e ignoram qualquer servidor ou proxy ToolAcre. O Google vê as solicitações e o cabeçalho Origin; os limites de usuário desconectado ainda se aplicam a vídeos privados, excluídos e com restrição de idade. Antes de clicar no botão, o comportamento do analisador pode ser testado offline com formas URL representativas porque nenhuma pesquisa é necessária para identificar seus componentes.