वीडियो और उपशीर्षक · YouTube थंबनेल डाउनलोडर और मेटाडेटा व्यूअर
वॉच, शॉर्ट्स और एंबेड लिंक से YouTube वीडियो ID कैसे निकाली जाती है
· यह काम किस प्रकार करता है
YouTube URL पदच्छेद
एक ही वीडियो को एक दर्जन तरीकों से जोड़ा जा सकता है। यह पोस्ट बताती है कि एक YouTube लिंक किस प्रकार का आकार ले सकता है, कैसे एक टूल प्रत्येक के अंदर ग्यारह-वर्ण ID ढूंढता है और ट्रैकिंग पैरामीटर और टाइमस्टैम्प के साथ क्या करना है।
एक ही वीडियो, पांच अलग-अलग लिंक - दृश्य पेज, लघु लिंक, शॉर्ट्स, एंबेड और मोबाइल पते
एक वीडियो देखने के लिए URL, youtu.be शेयर, शॉर्ट्स पथ, एम्बेड पता, लाइव लिंक या मोबाइल-होस्ट लिंक के रूप में आ सकता है। ToolAcre किसी भी नेटवर्क कार्य पर विचार करने से पहले प्रत्येक समर्थित आकार को समान ग्यारह-वर्ण ID में कम कर देता है। एक मिश्रित आयात परिणामस्वरूप एक वीडियो के छह लिंक को छह रिकॉर्ड के रूप में मानने के बजाय उस ID को अपनी डिडुप्लीकेशन कुंजी के रूप में उपयोग कर सकता है।
मिश्रित सूची को साफ़ करने वाले एडिटर के लिए वह क्रम उपयोगी है: पार्सिंग नियतात्मक स्ट्रिंग है और URL पेज में काम करती है, इसलिए खराब डोमेन और केवल-प्लेलिस्ट लिंक को दूरस्थ रिज़ॉल्वर में चिपकाए गए मान को लीक किए बिना रिपोर्ट किया जा सकता है। एक संग्रह URL को अनसुलझा छोड़ दिया गया है क्योंकि न तो इसकी उपस्थिति और न ही इसका क्रम यह पहचानता है कि एडिटर किस सदस्य को उद्धृत करना चाहता है।
ID स्वयं - 64-प्रतीक वर्णमाला से ग्यारह अक्षर और यह यादृच्छिक क्यों दिखता है
स्वीकृत ID आकार बिल्कुल ग्यारह अक्षरों का है जो अपरकेस और लोअरकेस अक्षरों, अंकों, हाइफ़न और अंडरस्कोर से लिया गया है। यह केवल प्रारूप जांच है; इसे पारित करने से यह साबित नहीं होता कि कोEVडियो मौजूद है या यह नहीं पता चलता कि पात्रों का क्या मतलब है। नियम को पार्स किए गए वी मान या पथ खंड पर लागू करने से कुछ असंबंधित एन्कोडेड पैरामीटर से ID-जैसे सबस्ट्रिंग को हटाने से बचा जाता है।
एक मात्र मिलान ID तुरंत स्वीकार कर ली जाती है। लंबी प्लेलिस्ट पहचानकर्ता एक अलग रूढ़िवादी पैटर्न का उपयोग करते हैं, जिससे प्लेलिस्ट टोकन को चुपचाप एक वीडियो के लिए कुंजी के रूप में व्यवहार करने से रोका जाता है। उद्धरण डेटा के साथ एक प्रारंभ समय भी रहता है: 30 सेकंड को 90 सेकंड में बदलना अभी भी उसी ग्यारह-वर्ण वाले वीडियो रिकॉर्ड की ओर इशारा करता है।
URL API के साथ पार्सिंग - केवल नियमित अभिव्यक्तियों के साथ अनुमान लगाए बिना होस्ट, पथ और क्वेरी को पढ़ना
URL कंस्ट्रक्टर प्रोटोकॉल, सामान्यीकृत होस्ट, पथ खंड और क्वेरी पैरामीटर को अलग करता है। यह एक विशाल नियमित अभिव्यक्ति से बचता है जो गलती से एक समान दिखने वाले डोमेन को स्वीकार कर सकता है या पथ ID के साथ एक क्वेरी मान को भ्रमित कर सकता है। एक भ्रामक होस्ट को अस्वीकार करना एक अविश्वसनीय URL में एम्बेडेड पहचानकर्ता के लिए एक विश्वसनीय थंबनेल बनाने से अधिक सुरक्षित है।
केवल HTTP और HTTPS स्वीकार किए जाते हैं, और अग्रणी www को सामान्यीकृत कर दिया जाता है। अनुमति सूची में YouTube शब्द वाले किसी भी होस्टनाम पर भरोसा करने के बजाय YouTube, मोबाइल, संगीत, गेमिंग, नोकुकी और youtu.be होस्ट शामिल हैं। दूरस्थ सफलता एक बुरी तरह से पार्स किए गए लिंक की उत्पत्ति को मान्य नहीं कर सकती है, क्योंकि एक हमलावर जानबूझकर एक असंबंधित डोमेन में एक वास्तविक सार्वजनिक ID शामिल कर सकता है।
जहां ID प्रत्येक आकार में छिपी होती है - v पैरामीटर, youtu.be, /shorts/, /embed/ और /live/ पर पथ
वॉच पेज v क्वेरी पैरामीटर का उपयोग करते हैं, youtu.be अपने पहले पथ खंड का उपयोग करते हैं, और शॉर्ट्स, एंबेड और लाइव फॉर्म अपने उपसर्ग के बाद खंड का उपयोग करते हैं। लीगेसी /v/ और /e/ पथ भी समान सख्त आकार जांच द्वारा पहचाने जाते हैं। एक मेल खाने वाला पहचानकर्ता केवल स्थानीय प्रसंस्करण की अनुमति देता है, सामग्री या स्वामित्व के बारे में दावे की नहीं।
पार्सर अतिरिक्त रूप से एक वैध प्लेलिस्ट ID और टी या स्टार्ट से स्टार्ट ऑफसेट पढ़ता है। यह इन्हें अलग-अलग तथ्यों के रूप में लौटाता है ताकि वे वीडियो पहचानकर्ता को दूषित किए बिना उत्पन्न लिंक को सूचित कर सकें। इस भेद के पूरा होने के बाद ही नेटवर्क सीमा शुरू होती है, इसलिए पार्सर परीक्षण ऑफ़लाइन चल सकता है।
बाकी को अनदेखा करना - प्लेलिस्ट पैरामीटर, प्रारंभ समय और शेयर ट्रैकिंग मान जो वीडियो की पहचान नहीं करते हैं
शेयर ट्रैकिंग मान, असंबंधित क्वेरी पैरामीटर और टाइमस्टैम्प वीडियो की पहचान नहीं करते हैं। ToolAcre ID निकालने के बाद उन्हें अनदेखा कर देता है, जबकि समर्थित समय फॉर्म को उन लिंक के लिए पूरे सेकंड के लिए सामान्यीकृत किया जाता है जो जानबूझकर एक प्रारंभ बिंदु को संरक्षित करते हैं। इस प्रकार अलग-अलग अभियान टैग वाले दो लिंक उन मार्केटिंग मापदंडों को जेनरेट किए गए URL में ले जाए बिना एक परिसंपत्ति रिकॉर्ड को हल कर सकते हैं।
केवल-प्लेलिस्ट, चैनल और खोज पेजों पर कार्रवाई योग्य अस्वीकृति प्राप्त होती है क्योंकि उनमें एक वीडियो का नाम नहीं होता है। उन पेजों से एक ID का अनुमान लगाने से निश्चितता पैदा होगी और गलत रिकॉर्ड के लिए संपत्ति प्राप्त हो सकती है। क्यूरेटर को पहले एक व्यक्तिगत आइटम का चयन करना होगा; पार्सर चुपचाप संग्रह से पहला परिणाम नहीं चुनेगा जिसका क्रम बाद में बदल सकता है।
कारगर उदाहरण: दस चिपकाए गए लिंक को उनकी ID पर सामान्य बनाना - जिनमें दो ऐसे भी हैं जो बिल्कुल भी YouTube लिंक नहीं हैं
दस पेस्ट के एक व्यावहारिक बैच में वॉच, शॉर्ट, शॉर्ट्स, एंबेड, लाइव, मोबाइल और बेयर-ID फॉर्म और दो असंबंधित डोमेन शामिल हो सकते हैं। पहले आठ ID पर अभिसरण होते हैं; असंबंधित होस्ट स्वीकृत-होस्ट सूची के साथ स्थानीय रूप से विफल हो जाते हैं। इसलिए आउटपुट को ID द्वारा डुप्लिकेट किया जा सकता है, भले ही योगदानकर्ताओं ने कई अलग-अलग YouTube इंटरफेस से लिंक कॉपी किए हों।
उस सामान्यीकरण के दौरान कोई अस्तित्व जांच नहीं होती है। एक आकार-मान्य लेकिन अस्तित्वहीन ID बाद में लाने के चरण में पहुंचती है, जहां थंबनेल और ओएम्बेड प्रतिक्रियाएं पार्सर परिणाम को पूर्वव्यापी रूप से बदलने के बजाय स्वतंत्र साक्ष्य प्रदान करती हैं। यह "पाठ एक वैध पहचानकर्ता है" और "Google वर्तमान में इसके लिए सार्वजनिक सामग्री परोसता है" के बीच एक स्पष्ट अंतर रखता है।
इसमें क्या शामिल नहीं है - चैनल, प्लेलिस्ट और खोज URL, जिसमें एक भी वीडियो ID नहीं है
पार्सर किसी चुने हुए वीडियो में चैनल, प्लेलिस्ट या खोज परिणामों का समाधान नहीं करता है। यह निजी, हटाई गई या आयु-प्रतिबंधित पहुंच को भी बायपास नहीं कर सकता है, क्योंकि सार्वजनिक पहचानकर्ता को निकालना संरक्षित सामग्री को पुनः प्राप्त करने का प्राधिकरण नहीं है। किसी अस्पष्ट संग्रह URL को अस्वीकार करने से कैटलॉग को उस आइटम से पॉप्युलेट होने से बचाया जाता है जो किसी व्यक्ति की स्क्रीन पर सबसे पहले दिखाई देता है।
एक बार फ़ेच दबाए जाने पर, छवि जांच में 404, अन्य HTTP त्रुटियाँ, एक 200 प्लेसहोल्डर या अनडिकोडेबल बाइट्स का सामना करना पड़ सकता है। मेटाडेटा अलग से परिवहन, HTTP इनकार या अमान्य JSON के माध्यम से विफल हो सकता है, जिसमें अवरोधक, प्रॉक्सी या ऑफ़लाइन स्थिति भी शामिल है। वे परिणाम उपलब्धता रिपोर्ट में हैं; उन्हें पार्सर को मूल लिंक को किसी भिन्न वीडियो के रूप में दोबारा व्याख्या करने के लिए प्रेरित नहीं करना चाहिए।
टेकअवे: ID ढूंढें, फिर सब कुछ इस प्रकार है - YouTube थंबनेल डाउनलोडर YouTube लिंक और दस्तावेज़ों को कैसे स्वीकार करता है जो इसे समर्थित आकार देता है
स्थानीय पार्सिंग के बाद, ब्राउज़र सीधे i.ytimg.com से प्रति JPEG उम्मीदवार के लिए एक थंबनेल और www.youtube.com से एक oEmbed JSON रिकॉर्ड का अनुरोध करता है। oEmbed URL कैनोनिकल घड़ी URL और format=json को लपेटता है। नेटवर्क पैनल में उन कॉलों को देखने से पुष्टि होती है कि सामान्यीकरण समाप्त हो गया है और वही निकाली गई ID परिसंपत्ति और मेटाडेटा अनुरोध दोनों चला रही है।
वे अनाम GET क्रेडेंशियल्स और रेफरर को छोड़ देते हैं, नो-स्टोर का उपयोग करते हैं, रीडायरेक्ट का पालन करते हैं और किसी भी ToolAcre सर्वर या प्रॉक्सी को बायपास करते हैं। Google अनुरोध और मूल शीर्षलेख देखता है; साइन-आउट सीमाएँ अभी भी निजी, हटाए गए और आयु-प्रतिबंधित वीडियो पर लागू होती हैं। बटन क्लिक करने से पहले, पार्सर व्यवहार को प्रतिनिधि URL आकृतियों के साथ ऑफ़लाइन परीक्षण किया जा सकता है क्योंकि उनके घटकों की पहचान करने के लिए किसी लुकअप की आवश्यकता नहीं होती है।