Español

Vídeo y subtítulos · Descargador de miniaturas y visor de metadatos de YouTube

Cómo se extrae una identificación de video de YouTube de los enlaces de visualización, cortos e inserción

· Cómo funciona

youtube URL análisis

Varias formas de enlaces de YouTube que convergen en un identificador de video
Ilustración de vector original de ToolAcre

El mismo vídeo se puede vincular de docenas de maneras. Esta publicación explica las formas que puede adoptar un enlace de YouTube, cómo una herramienta encuentra el ID de once caracteres dentro de cada uno y qué hacer con los parámetros de seguimiento y las marcas de tiempo.

El mismo vídeo, cinco enlaces diferentes: páginas de visualización, enlaces cortos, cortos, incrustaciones y direcciones móviles

Un video puede llegar como una URL de visualización, un recurso compartido en youtu.be, una ruta de Shorts, una dirección para insertar, un enlace en vivo o un enlace de host móvil. ToolAcre reduce cada forma admitida al mismo ID de once caracteres antes de considerar cualquier trabajo en red. En consecuencia, una importación mixta puede utilizar ese ID como clave de deduplicación en lugar de tratar seis enlaces a un vídeo como seis registros.

Ese orden es útil para los editores que limpian una lista mixta: el análisis es un trabajo determinista de cadenas y URL en la página, por lo que se pueden informar dominios defectuosos y enlaces de solo listas de reproducción sin filtrar el valor pegado a un solucionador remoto. La URL de una colección queda sin resolver porque ni su presencia ni su orden identifican qué miembro pretendía citar el editor.

El ID en sí: once caracteres de un alfabeto de símbolos 64 y por qué parece aleatorio

La forma de identificación aceptada es exactamente once caracteres extraídos de letras mayúsculas y minúsculas, dígitos, guiones y guiones bajos. Esta es sólo una verificación de formato; pasarlo no prueba que exista un video ni revela lo que quieren decir los personajes. La aplicación de la regla al valor v analizado o al segmento de ruta evita eliminar una subcadena similar a una ID de algún parámetro codificado no relacionado.

Se acepta inmediatamente una identificación coincidente simple. Los identificadores de listas de reproducción más largos utilizan un patrón conservador independiente, lo que evita que un token de lista de reproducción se trate silenciosamente como la clave de un vídeo. Una hora de inicio permanece acompañando a los datos de la cita: cambiar 30 segundos a 90 segundos todavía apunta al mismo registro de video de once caracteres.

Análisis con la API de URL: lectura del host, la ruta y la consulta sin adivinar solo con expresiones regulares

El constructor de URL separa el protocolo, el host normalizado, los segmentos de ruta y los parámetros de consulta. Esto evita una expresión regular gigante que podría aceptar accidentalmente un dominio similar o confundir un valor de consulta con una ID de ruta. Rechazar un host engañoso es más seguro que generar una miniatura creíble para un identificador incrustado en una URL que no es de confianza.

Solo se aceptan HTTP y HTTPS, y el www inicial se normaliza. La lista de permitidos cubre hosts de YouTube, dispositivos móviles, música, juegos, nocookie y youtu.be, en lugar de confiar en cualquier nombre de host que contenga la palabra youtube. El éxito remoto no puede validar la procedencia de un enlace mal analizado, porque un atacante podría incluir deliberadamente una identificación pública real en un dominio no relacionado.

Dónde se esconde el ID en cada forma: el parámetro v, la ruta en youtu.be, /shorts/, /embed/ y /live/

Las páginas de visualización usan el parámetro de consulta v, youtu.be usa su primer segmento de ruta y los formularios cortos, incrustados y en vivo usan el segmento después de su prefijo. Las rutas heredadas /v/ y /e/ también se reconocen mediante la misma verificación estricta de forma. Un identificador coincidente solo permite el procesamiento local, no un reclamo sobre el contenido o la propiedad.

El analizador lee además un ID de lista de reproducción válido y un desplazamiento de inicio desde t o inicio. Los devuelve como hechos separados para que puedan informar los enlaces generados sin contaminar el identificador del vídeo. El límite de la red comienza solo después de que se completa esta distinción, por lo que una prueba del analizador se puede ejecutar sin conexión.

Ignorando el resto: parámetros de la lista de reproducción, horas de inicio y valores de seguimiento compartido que no identifican el video.

Los valores de seguimiento compartido, los parámetros de consulta no relacionados y las marcas de tiempo no identifican el video. ToolAcre los ignora después de extraer el ID, mientras que los formularios de tiempo admitidos se normalizan a segundos completos para enlaces que preservan deliberadamente un punto de inicio. Por lo tanto, dos enlaces con diferentes etiquetas de campaña pueden resolverse en un registro de activos sin incluir esos parámetros de marketing en las URL generadas.

Las páginas de búsqueda, canales y listas de reproducción reciben un rechazo procesable porque no nombran un video. Adivinar una identificación de esas páginas generaría certeza y podría recuperar recursos para el registro incorrecto. Un curador debe seleccionar primero un elemento individual; el analizador no elegirá silenciosamente el primer resultado de una colección cuyo orden puede cambiar más adelante.

Ejemplo resuelto: normalizar diez enlaces pegados a sus ID, incluidos dos que no son enlaces de YouTube en absoluto

Un lote práctico de diez pegados puede incluir formularios de visualización, cortos, cortos, incrustados, en vivo, móviles y de identificación básica, además de dos dominios no relacionados. Los primeros ocho convergen en las identificaciones; los hosts no relacionados fallan localmente con la lista de hosts aceptados. Por lo tanto, la salida se puede deduplicar por ID incluso cuando los contribuyentes copiaron enlaces de varias interfaces diferentes de YouTube.

No se produce ninguna prueba de existencia durante esa normalización. Una identificación con forma válida pero inexistente llega a la última etapa de búsqueda, donde las respuestas en miniatura y oIncrustar proporcionan evidencia independiente en lugar de cambiar retroactivamente el resultado del analizador. Esto preserva una clara distinción entre "el texto es un identificador válido" y "Google actualmente ofrece material público para él".

Lo que esto no cubre: canal, lista de reproducción y URL de búsqueda, que no contienen una identificación única del video.

El analizador no resuelve canales, listas de reproducción o resultados de búsqueda en un video elegido. Tampoco puede eludir el acceso privado, eliminado o restringido por edad, porque extraer un identificador público no constituye autorización para recuperar material protegido. Rechazar una URL de colección ambigua protege un catálogo para que no se complete con el elemento que apareció primero en la pantalla de una persona.

Una vez que se presiona Recuperar, las sondas de imagen pueden encontrar 404, otros errores HTTP, un marcador de posición 200 o bytes no decodificables. Los metadatos por separado pueden fallar debido al transporte, rechazo HTTP o JSON no válido, incluso cuando interfieren bloqueadores, servidores proxy o estados fuera de línea. Esos resultados pertenecen al informe de disponibilidad; no deberían llevar al analizador a reinterpretar el enlace original como un vídeo diferente.

Conclusión: busque el ID y luego todo sigue: cómo el Descargador de miniaturas de YouTube acepta un enlace de YouTube y documenta las formas que admite.

Después del análisis local, el navegador solicita directamente una miniatura por cada candidato JPEG de i.ytimg.com y un registro oEmbed JSON de www.youtube.com. La URL oEmbed envuelve la URL de visualización canónica y format=json. Ver esas llamadas en el panel Red confirma que la normalización ha finalizado y que la misma ID extraída está impulsando solicitudes de activos y metadatos.

Esos GET anónimos omiten las credenciales y la referencia, no utilizan almacenamiento, siguen redireccionamientos y omiten cualquier servidor o proxy de ToolAcre. Google ve las solicitudes y el encabezado de Origen; Los límites de cierre de sesión aún se aplican a videos privados, eliminados y con restricción de edad. Antes de hacer clic en el botón, el comportamiento del analizador se puede probar fuera de línea con formas de URL representativas porque no es necesario realizar una búsqueda para identificar sus componentes.