Video & subtitle · Pengunduh Gambar Kecil YouTube & Penampil Metadata
Bagaimana ID video YouTube diekstraksi dari tautan tontonan, Shorts, dan semat
· Cara kerjanya
youtube url penguraian
Video yang sama dapat dihubungkan dengan berbagai cara. Postingan ini menjelaskan bentuk tautan YouTube, bagaimana alat menemukan ID sebelas karakter di dalamnya, dan apa yang harus dilakukan dengan parameter pelacakan dan stempel waktu.
Video yang sama, lima tautan berbeda — laman tontonan, tautan pendek, video pendek, sematan, dan alamat seluler
Satu video dapat hadir sebagai tontonan URL, youtu.be berbagi, jalur Shorts, alamat penyematan, tautan langsung, atau tautan host seluler. ToolAcre mengurangi setiap bentuk yang didukung menjadi sebelas karakter ID yang sama sebelum mempertimbangkan pekerjaan jaringan apa pun. Konsekuensinya, impor campuran dapat menggunakan ID tersebut sebagai kunci deduplikasinya daripada memperlakukan enam tautan ke satu video sebagai enam rekaman.
Pengurutan tersebut berguna bagi editor untuk membersihkan daftar campuran: penguraian adalah string deterministik dan URL berfungsi di laman, sehingga domain buruk dan tautan hanya daftar putar dapat dilaporkan tanpa membocorkan nilai yang ditempelkan ke penyelesai jarak jauh. Koleksi URL tidak terselesaikan karena baik keberadaan maupun urutannya tidak dapat mengidentifikasi anggota mana yang ingin dikutip oleh editor.
ID itu sendiri — sebelas karakter dari alfabet simbol 64 dan mengapa terlihat acak
Bentuk ID yang diterima persis sebelas karakter yang diambil dari huruf besar dan kecil, angka, tanda hubung dan garis bawah. Ini hanya pemeriksaan format; melewatkannya tidak membuktikan bahwa video itu ada atau mengungkapkan maksud dari karakternya. Menerapkan aturan ke nilai v yang diurai atau segmen jalur akan menghindari pengambilan substring mirip ID dari beberapa parameter enkode yang tidak terkait.
ID yang cocok langsung diterima. Pengidentifikasi playlist yang lebih panjang menggunakan pola konservatif yang terpisah, sehingga mencegah token playlist diperlakukan secara diam-diam sebagai kunci untuk satu video. Waktu mulai tetap menyertai data kutipan: mengubah 30 detik menjadi 90 detik masih menunjuk pada rekaman video sebelas karakter yang sama.
Parsing dengan URL API — membaca host, jalur, dan kueri tanpa menebak-nebak hanya dengan ekspresi reguler
Konstruktor URL memisahkan protokol, host yang dinormalisasi, segmen jalur, dan parameter kueri. Hal ini untuk menghindari satu ekspresi reguler raksasa yang mungkin secara tidak sengaja menerima domain serupa atau mengacaukan nilai kueri dengan ID jalur. Menolak host yang menipu lebih aman daripada membuat thumbnail yang kredibel untuk pengenal yang tertanam di URL yang tidak tepercaya.
Hanya HTTP dan HTTPS yang diterima, dan www di depan dinormalisasi. Daftar yang diizinkan mencakup host YouTube, seluler, musik, game, nocookie, dan youtu.be daripada memercayai nama host mana pun yang mengandung kata youtube. Keberhasilan jarak jauh tidak dapat memvalidasi asal tautan yang diurai dengan buruk, karena penyerang dapat dengan sengaja memasukkan ID publik asli ke dalam domain yang tidak terkait.
Tempat ID bersembunyi di setiap bentuk — parameter v, jalur di youtu.be, /shorts/, /embed/ dan /live/
Laman tontonan menggunakan parameter kueri v, youtu.be menggunakan segmen jalur pertamanya, dan formulir pendek, penyematan, dan langsung menggunakan segmen setelah awalannya. Jalur lama /v/ dan /e/ juga dikenali melalui pemeriksaan bentuk ketat yang sama. Pengidentifikasi yang cocok hanya mengizinkan pemrosesan lokal, bukan klaim tentang konten atau kepemilikan.
Parser juga membaca ID playlist yang valid dan offset awal dari t atau start. Ini mengembalikan ini sebagai fakta terpisah sehingga mereka dapat menginformasikan tautan yang dihasilkan tanpa mencemari pengidentifikasi video itu sendiri. Batas jaringan dimulai hanya setelah pembedaan ini selesai, sehingga pengujian parser dapat dijalankan secara offline.
Mengabaikan sisanya — parameter daftar putar, waktu mulai, dan berbagi nilai pelacakan yang tidak mengidentifikasi video
Bagikan nilai pelacakan, parameter kueri yang tidak terkait, dan stempel waktu tidak mengidentifikasi video. ToolAcre mengabaikannya setelah mengekstraksi ID, sementara formulir waktu yang didukung dinormalisasi menjadi seluruh detik untuk tautan yang dengan sengaja mempertahankan titik awal. Jadi, dua tautan dengan tag kampanye berbeda dapat menghasilkan satu catatan aset tanpa membawa parameter pemasaran tersebut ke dalam URL yang dihasilkan.
Halaman khusus daftar putar, saluran, dan pencarian menerima penolakan yang dapat ditindaklanjuti karena tidak menyebutkan satu video. Menebak ID dari halaman tersebut akan menghasilkan kepastian dan dapat mengambil aset untuk catatan yang salah. Seorang kurator harus memilih satu item terlebih dahulu; parser tidak akan diam-diam memilih hasil pertama dari koleksi yang urutannya mungkin berubah nanti.
Contoh praktis: menormalisasi sepuluh tautan yang ditempelkan ke ID mereka — termasuk dua yang bukan tautan YouTube sama sekali
Kumpulan praktis yang terdiri dari sepuluh tempel dapat mencakup formulir tontonan, video pendek, video Shorts, penyematan, siaran langsung, seluler, dan ID telanjang, ditambah dua domain yang tidak terkait. Delapan yang pertama berkumpul pada ID; host yang tidak terkait gagal secara lokal dengan daftar host yang diterima. Oleh karena itu, keluarannya dapat dihapus duplikatnya berdasarkan ID bahkan ketika kontributor menyalin tautan dari beberapa antarmuka YouTube yang berbeda.
Tidak ada pemeriksaan keberadaan yang terjadi selama normalisasi tersebut. ID yang valid bentuk tetapi tidak ada mencapai tahap pengambilan berikutnya, di mana respons thumbnail dan oEmbed memberikan bukti independen daripada mengubah hasil parser secara surut. Hal ini menjaga perbedaan yang jelas antara “teks adalah pengenal yang valid” dan “Google saat ini menyajikan materi publik untuk itu.”
Yang tidak tercakup dalam hal ini — saluran, daftar putar, dan URL penelusuran, yang tidak berisi satu pun ID video
Parser tidak menyelesaikan saluran, daftar putar, atau hasil pencarian ke dalam video yang dipilih. Itu juga tidak dapat melewati akses pribadi, yang dihapus, atau dibatasi usia, karena mengekstraksi pengenal publik bukanlah otorisasi untuk mengambil materi yang dilindungi. Menolak koleksi yang ambigu URL melindungi katalog agar tidak diisi dengan item apa pun yang muncul pertama kali di layar seseorang.
Setelah Ambil ditekan, pemeriksaan gambar mungkin menemukan 404, kesalahan HTTP lainnya, placeholder 200, atau byte yang tidak dapat didekodekan. Metadata secara terpisah dapat gagal karena pengangkutan, HTTP penolakan, atau JSON tidak valid, termasuk ketika pemblokir, proxy, atau keadaan offline mengganggu. Hasil tersebut termasuk dalam laporan ketersediaan; mereka tidak boleh mengarahkan parser untuk menafsirkan ulang tautan asli sebagai video yang berbeda.
Kesimpulan: temukan ID-nya, lalu semuanya mengikuti — bagaimana Pengunduh Gambar Mini YouTube menerima tautan YouTube dan dokumen yang mendukung bentuknya
Setelah penguraian lokal, browser secara langsung meminta satu thumbnail per JPEG kandidat dari i.ytimg.com dan satu catatan oEmbed JSON dari www.youtube.com. oEmbed URL membungkus jam tangan kanonik URL dan format=json. Melihat panggilan tersebut di panel Jaringan mengonfirmasi bahwa normalisasi telah selesai dan ID yang diekstraksi sama mendorong permintaan aset dan metadata.
GET anonim tersebut menghilangkan kredensial dan perujuk, tidak menggunakan penyimpanan, mengikuti pengalihan, dan melewati server atau proxy ToolAcre apa pun. Google melihat permintaan dan header Asal; batas keluar tetap berlaku untuk video pribadi, yang dihapus, dan dikenai pembatasan usia. Sebelum tombol diklik, perilaku parser dapat diuji secara offline dengan bentuk URL yang representatif karena tidak diperlukan pencarian untuk mengidentifikasi komponennya.