Video e sottotitoli · Downloader di miniature di YouTube e visualizzatore di metadati
Come viene estratto un ID video di YouTube dai link di visualizzazione, Short e incorporamento
· Come funziona
youtube URL analisi
Lo stesso video può essere collegato in una dozzina di modi. Questo post spiega le forme che può assumere un collegamento YouTube, come uno strumento trova l'ID di undici caratteri all'interno di ciascuno e cosa fare con i parametri di monitoraggio e i timestamp.
Stesso video, cinque link diversi: pagine di visualizzazione, link brevi, Short, incorporamenti e indirizzi mobili
Un video può arrivare come visualizzazione URL, condivisione youtu.be, percorso Shorts, indirizzo di incorporamento, collegamento live o collegamento host mobile. ToolAcre riduce ogni forma supportata allo stesso ID di undici caratteri prima di considerare qualsiasi lavoro di rete. Di conseguenza, un'importazione mista può utilizzare tale ID come chiave di deduplicazione anziché trattare sei collegamenti a un video come sei record.
Questo ordinamento è utile per gli editor che puliscono un elenco misto: l'analisi è una stringa deterministica e URL funziona nella pagina, quindi è possibile segnalare domini errati e collegamenti solo playlist senza far trapelare il valore incollato a un risolutore remoto. Una raccolta URL viene lasciata irrisolta perché né la sua presenza né il suo ordinamento identificano quale membro l'editor intendeva citare.
L'ID stesso: undici caratteri di un alfabeto di simboli 64 e perché sembra casuale
La forma dell'ID accettata è composta esattamente da undici caratteri composti da lettere maiuscole e minuscole, cifre, trattini e trattini bassi. Questo è solo un controllo del formato; superarlo non prova l'esistenza di un video né rivela il significato dei personaggi. L'applicazione della regola al valore v analizzato o al segmento del percorso evita di recuperare una sottostringa simile a ID da alcuni parametri codificati non correlati.
Un ID semplice e corrispondente viene accettato immediatamente. Gli identificatori di playlist più lunghi utilizzano un modello conservativo separato, impedendo che un token di playlist venga trattato silenziosamente come chiave per un video. Un'ora di inizio rimane associata ai dati della citazione: la modifica di 30 secondi in 90 secondi punta ancora alla stessa registrazione video di undici caratteri.
Analisi con URL API: lettura di host, percorso e query senza indovinare con le sole espressioni regolari
Il costruttore URL separa protocollo, host normalizzato, segmenti di percorso e parametri di query. Ciò evita un'espressione regolare gigante che potrebbe accettare accidentalmente un dominio simile o confondere un valore di query con un ID di percorso. Rifiutare un host ingannevole è più sicuro che produrre una miniatura credibile per un identificatore incorporato in un URL non attendibile.
Sono accettati solo HTTP e HTTPS e il www iniziale viene normalizzato. La lista consentita copre gli host di YouTube, dispositivi mobili, musica, giochi, nocookie e youtu.be anziché fidarsi di qualsiasi nome host contenente la parola youtube. Il successo remoto non può convalidare la provenienza di un collegamento analizzato in modo errato, poiché un utente malintenzionato potrebbe includere deliberatamente un ID pubblico reale in un dominio non correlato.
Dove l'ID si nasconde in ogni forma: il parametro v, il percorso su youtu.be, /shorts/, /embed/ e /live/
Le pagine di visualizzazione utilizzano il parametro di query v, youtu.be utilizza il primo segmento di percorso e gli shorts, i moduli incorporati e quelli attivi utilizzano il segmento dopo il prefisso. Anche i percorsi legacy /v/ e /e/ sono riconosciuti dallo stesso rigoroso controllo della forma. Un identificatore corrispondente consente solo l'elaborazione locale, non una rivendicazione sul contenuto o sulla proprietà.
Il parser legge inoltre un ID playlist valido e un offset iniziale da t o start. Li restituisce come fatti separati in modo che possano informare i collegamenti generati senza contaminare l'identificatore video stesso. Il confine della rete inizia solo dopo che questa distinzione è stata completata, quindi un test del parser può essere eseguito offline.
Ignorando il resto: parametri della playlist, orari di inizio e valori di monitoraggio delle condivisioni che non identificano il video
I valori di tracciamento della condivisione, i parametri di query non correlati e i timestamp non identificano il video. ToolAcre li ignora dopo aver estratto l'ID, mentre i formati orari supportati vengono normalizzati in secondi interi per i collegamenti che preservano deliberatamente un punto iniziale. Pertanto, due collegamenti con tag di campagna diversi possono risolversi in un record di risorsa senza trasferire tali parametri di marketing negli URL generati.
Le pagine solo playlist, canali e di ricerca ricevono un rifiuto perseguibile perché non nominano un video. Indovinare un ID da quelle pagine creerebbe certezza e potrebbe recuperare risorse per il record sbagliato. Un curatore deve prima selezionare un singolo elemento; il parser non sceglierà tranquillamente il primo risultato da una raccolta il cui ordinamento potrebbe successivamente cambiare.
Esempio funzionante: normalizzazione di dieci collegamenti incollati nei loro ID, inclusi due che non sono affatto collegamenti YouTube
Un pratico lotto di dieci incolla può includere moduli watch, short, shorts, incorporati, live, mobili e bare-ID più due domini non correlati. I primi otto convergono sugli ID; gli host non correlati falliscono localmente con l'elenco degli host accettati. L'output può quindi essere deduplicato per ID anche quando i contributori hanno copiato collegamenti da diverse interfacce YouTube.
Durante tale normalizzazione non si verifica alcuna sonda di esistenza. Un ID con forma valida ma inesistente raggiunge la fase di recupero successiva, in cui le risposte in miniatura e oEmbed forniscono prove indipendenti anziché modificare retroattivamente il risultato del parser. Ciò preserva una chiara distinzione tra “il testo è un identificatore valido” e “Google attualmente fornisce materiale pubblico per esso”.
Ciò non copre: canali, playlist e URL di ricerca, che non contengono un singolo ID video
Il parser non risolve canali, playlist o risultati di ricerca in un video scelto. Inoltre, non può ignorare l'accesso privato, cancellato o limitato in base all'età, poiché l'estrazione di un identificatore pubblico non costituisce un'autorizzazione a recuperare materiale protetto. Rifiutare una raccolta ambigua URL impedisce che un catalogo venga popolato con qualunque elemento sia apparso per primo sullo schermo di una persona.
Una volta premuto Recupera, le sonde immagine potrebbero rilevare 404, altri errori HTTP, un segnaposto 200 o byte non decodificabili. I metadati separati possono fallire a causa del trasporto, del rifiuto HTTP o del JSON non valido, anche quando interferiscono bloccanti, proxy o stato offline. Tali risultati appartengono al rapporto sulla disponibilità; non dovrebbero indurre il parser a reinterpretare il collegamento originale come un video diverso.
Conclusione: trova l'ID, poi segue tutto: come YouTube Thumbnail Downloader accetta un collegamento YouTube e documenta quali forme supporta
Dopo l'analisi locale, il browser richiede direttamente una miniatura per candidato JPEG da i.ytimg.com e un record oEmbed JSON da www.youtube.com. oEmbed URL avvolge l'orologio canonico URL e format=json. La visualizzazione di tali chiamate nel pannello Rete conferma che la normalizzazione è terminata e che lo stesso ID estratto sta guidando sia le richieste di risorse che di metadati.
Questi GET anonimi omettono credenziali e referrer, utilizzano no-store, seguono reindirizzamenti e ignorano qualsiasi server o proxy ToolAcre. Google vede le richieste e l'intestazione Origin; i limiti di disconnessione si applicano ancora ai video privati, eliminati e soggetti a limiti di età. Prima di fare clic sul pulsante, il comportamento del parser può essere testato offline con forme URL rappresentative perché non è necessaria alcuna ricerca per identificarne i componenti.