ไทย

วิดีโอและคำบรรยาย · โปรแกรมดาวน์โหลดภาพขนาดย่อของ YouTube และโปรแกรมดูข้อมูลเมตา

วิธีแยกรหัสวิดีโอ YouTube จากการดู วิดีโอสั้น และลิงก์แบบฝัง

· มันทำงานอย่างไร

youtube URL การแยกวิเคราะห์

รูปร่างลิงก์ YouTube หลายรูปแบบมาบรรจบกันในตัวระบุวิดีโอตัวเดียว
ภาพประกอบเวกเตอร์ต้นฉบับ ToolAcre

วิดีโอเดียวกันสามารถเชื่อมโยงได้หลายวิธี โพสต์นี้จะอธิบายรูปร่างที่ลิงก์ YouTube สามารถใช้ได้ วิธีที่เครื่องมือค้นหา ID 11 อักขระภายในแต่ละรายการ และจะทำอย่างไรกับพารามิเตอร์การติดตามและการประทับเวลา

วิดีโอเดียวกัน ลิงก์ที่แตกต่างกันห้าลิงก์ - หน้าสำหรับดู ลิงก์แบบสั้น กางเกงขาสั้น การฝัง และที่อยู่บนมือถือ

วิดีโอหนึ่งรายการสามารถเข้ามาในรูปแบบการดู URL, การแชร์ youtu.be, เส้นทางสั้น, ที่อยู่แบบฝัง, ลิงก์สด หรือลิงก์โฮสต์บนมือถือ ToolAcre ลดแต่ละรูปร่างที่รองรับให้มีรหัสสิบเอ็ดอักขระเดียวกันก่อนที่จะพิจารณาการทำงานของเครือข่าย การนำเข้าแบบผสมจึงสามารถใช้ ID นั้นเป็นคีย์การขจัดข้อมูลซ้ำซ้อน แทนที่จะถือว่าหกลิงก์ไปยังวิดีโอหนึ่งรายการเป็นหกบันทึก

การจัดลำดับดังกล่าวมีประโยชน์สำหรับผู้แก้ไขที่ล้างรายการแบบผสม: การแยกวิเคราะห์เป็นสตริงที่กำหนดและ URL ทำงานในเพจ ดังนั้นจึงสามารถรายงานโดเมนที่ไม่ดีและลิงก์เฉพาะเพลย์ลิสต์เท่านั้นได้ โดยไม่ทำให้ค่าที่วางรั่วไหลไปยังรีโซลเวอร์ระยะไกล คอลเลกชัน URL ไม่ได้รับการแก้ไข เนื่องจากไม่มีการระบุตัวตนหรือลำดับของคอลเลกชันนั้น ระบุว่าบรรณาธิการตั้งใจจะอ้างอิงถึงสมาชิกคนใด

รหัสนั้น — อักขระสิบเอ็ดตัวจากตัวอักษรสัญลักษณ์ 64 และเหตุใดจึงดูสุ่ม

รูปร่าง ID ที่ยอมรับคืออักขระสิบเอ็ดตัวที่วาดจากตัวอักษรตัวพิมพ์ใหญ่และตัวพิมพ์เล็ก ตัวเลข ยัติภังค์ และขีดล่าง นี่เป็นการตรวจสอบรูปแบบเท่านั้น การผ่านนั้นไม่ได้พิสูจน์ว่ามีวิดีโออยู่หรือเปิดเผยว่าตัวละครหมายถึงอะไร การใช้กฎกับค่า v ที่แยกวิเคราะห์หรือส่วนของเส้นทางจะหลีกเลี่ยงการกำจัดสตริงย่อยที่คล้ายกับ ID จากพารามิเตอร์ที่เข้ารหัสบางตัวที่ไม่เกี่ยวข้อง

รหัสการจับคู่เปล่าจะได้รับการยอมรับทันที ตัวระบุเพลย์ลิสต์ที่ยาวกว่าจะใช้รูปแบบอนุรักษ์นิยมแยกต่างหาก ป้องกันไม่ให้โทเค็นเพลย์ลิสต์ถือเป็นคีย์สำหรับวิดีโอหนึ่งๆ เวลาเริ่มต้นยังคงอยู่พร้อมกับข้อมูลการอ้างอิง: การเปลี่ยน 30 วินาทีเป็น 90 วินาทียังคงชี้ไปที่บันทึกวิดีโอสิบเอ็ดอักขระเหมือนเดิม

แยกวิเคราะห์ด้วย URL API — อ่านโฮสต์ เส้นทาง และแบบสอบถามโดยไม่ต้องเดาด้วยนิพจน์ทั่วไปเพียงอย่างเดียว

ตัวสร้าง URL แยกโปรโตคอล โฮสต์มาตรฐาน ส่วนเส้นทาง และพารามิเตอร์การสืบค้น วิธีนี้จะหลีกเลี่ยงนิพจน์ทั่วไปขนาดใหญ่ที่อาจยอมรับโดเมนที่คล้ายคลึงกันโดยไม่ตั้งใจหรือสร้างความสับสนให้กับค่าการสืบค้นด้วยรหัสเส้นทาง การปฏิเสธโฮสต์ที่หลอกลวงนั้นปลอดภัยกว่าการสร้างภาพขนาดย่อที่น่าเชื่อถือสำหรับตัวระบุที่ฝังอยู่ใน URL ที่ไม่น่าเชื่อถือ

ยอมรับเฉพาะ HTTP และ HTTPS เท่านั้น และ www ชั้นนำจะถูกทำให้เป็นมาตรฐาน รายการที่อนุญาตครอบคลุมถึง YouTube, อุปกรณ์เคลื่อนที่, เพลง, เกม, nocookie และโฮสต์ youtu.be แทนที่จะเชื่อถือชื่อโฮสต์ใดๆ ที่มีคำว่า youtube ความสำเร็จจากระยะไกลไม่สามารถตรวจสอบแหล่งที่มาของลิงก์ที่แยกวิเคราะห์ได้ไม่ดี เนื่องจากผู้โจมตีอาจจงใจรวม ID สาธารณะจริงในโดเมนที่ไม่เกี่ยวข้อง

โดยที่ ID ซ่อนอยู่ในแต่ละรูปร่าง — พารามิเตอร์ v, เส้นทางบน youtu.be, /shorts/, /embed/ และ /live/

หน้าสำหรับดูใช้พารามิเตอร์การค้นหา v, youtu.be ใช้ส่วนเส้นทางแรก ส่วนรูปแบบสั้น แบบฝัง และแบบสดใช้ส่วนหลังคำนำหน้า เส้นทาง /v/ และ /e/ แบบเดิมยังได้รับการยอมรับจากการตรวจสอบรูปร่างที่เข้มงวดเช่นเดียวกัน ตัวระบุที่ตรงกันอนุญาตเฉพาะการประมวลผลในท้องถิ่นเท่านั้น ไม่ใช่การอ้างสิทธิ์เกี่ยวกับเนื้อหาหรือการเป็นเจ้าของ

โปรแกรมแยกวิเคราะห์ยังอ่าน ID เพลย์ลิสต์ที่ถูกต้องและออฟเซ็ตเริ่มต้นจาก t หรือ start โดยส่งคืนข้อมูลเหล่านี้เป็นข้อเท็จจริงแยกต่างหากเพื่อให้สามารถแจ้งลิงก์ที่สร้างขึ้นได้โดยไม่ทำให้ตัวระบุวิดีโอเสียหาย ขอบเขตเครือข่ายจะเริ่มต้นหลังจากความแตกต่างนี้เสร็จสมบูรณ์เท่านั้น ดังนั้นการทดสอบแยกวิเคราะห์จึงสามารถทำงานแบบออฟไลน์ได้

ละเว้นส่วนที่เหลือ — พารามิเตอร์เพลย์ลิสต์ เวลาเริ่มต้น และแบ่งปันค่าการติดตามที่ไม่ได้ระบุวิดีโอ

การแชร์ค่าการติดตาม พารามิเตอร์การค้นหาและการประทับเวลาที่ไม่เกี่ยวข้องไม่สามารถระบุวิดีโอได้ ToolAcre ละเว้นพวกเขาหลังจากแยก ID ในขณะที่รูปแบบเวลาที่รองรับจะถูกทำให้เป็นมาตรฐานเป็นวินาทีทั้งหมดสำหรับลิงก์ที่จงใจรักษาจุดเริ่มต้นไว้ ดังนั้น ลิงก์สองลิงก์ที่มีแท็กแคมเปญต่างกันจึงสามารถรวมเป็นบันทึกสินทรัพย์เดียวได้โดยไม่ต้องนำพารามิเตอร์ทางการตลาดเหล่านั้นไปไว้ใน URL ที่สร้างขึ้น

หน้าเพลย์ลิสต์ ช่อง และการค้นหาเท่านั้น ได้รับการปฏิเสธที่สามารถดำเนินการได้ เนื่องจากไม่ได้ตั้งชื่อวิดีโอใดวิดีโอหนึ่ง การเดารหัสจากหน้าเหล่านั้นจะทำให้เกิดความแน่นอนและอาจดึงข้อมูลเนื้อหาจากบันทึกที่ไม่ถูกต้อง ผู้ดูแลจะต้องเลือกแต่ละรายการก่อน parser จะไม่เลือกผลลัพธ์แรกอย่างเงียบๆ จากคอลเลกชันที่อาจมีการเปลี่ยนแปลงลำดับในภายหลัง

ตัวอย่างการทำงาน: การทำให้ลิงก์ที่วางสิบรายการเป็นมาตรฐาน รวมถึงสองรายการที่ไม่ใช่ลิงก์ YouTube เลย

ชุดเพสต์ที่ใช้งานได้จริงจำนวน 10 รายการอาจรวมถึงแบบฟอร์มการดู แบบสั้น กางเกงขาสั้น แบบฝัง การถ่ายทอดสด แบบเคลื่อนที่ และแบบ Bare-ID รวมถึงโดเมนอีกสองโดเมนที่ไม่เกี่ยวข้องกัน แปดรายการแรกมาบรรจบกันที่ ID; โฮสต์ที่ไม่เกี่ยวข้องจะล้มเหลวภายในเครื่องด้วยรายการโฮสต์ที่ยอมรับ ดังนั้นเอาต์พุตจึงสามารถกรองข้อมูลที่ซ้ำกันได้ด้วย ID แม้ว่าผู้ร่วมให้ข้อมูลจะคัดลอกลิงก์จากอินเทอร์เฟซต่างๆ ของ YouTube ก็ตาม

ไม่มีการสอบสวนการดำรงอยู่เกิดขึ้นระหว่างการทำให้เป็นมาตรฐานนั้น ID รูปร่างที่ถูกต้องแต่ไม่มีอยู่จะไปถึงขั้นตอนการดึงข้อมูลในภายหลัง โดยที่ภาพขนาดย่อและการตอบกลับ oEmbed จะให้หลักฐานที่เป็นอิสระ แทนที่จะเปลี่ยนแปลงผลลัพธ์ของ parser ย้อนหลัง วิธีนี้จะรักษาความแตกต่างที่ชัดเจนระหว่าง “ข้อความเป็นตัวระบุที่ถูกต้อง” และ “ปัจจุบัน Google ให้บริการเนื้อหาสาธารณะสำหรับข้อความนั้น”

สิ่งนี้ไม่ครอบคลุมถึงช่อง เพลย์ลิสต์ และ URL การค้นหา ซึ่งไม่มีรหัสวิดีโอเดียว

โปรแกรมแยกวิเคราะห์ไม่ได้แก้ไขช่อง เพลย์ลิสต์ หรือผลการค้นหาในวิดีโอที่เลือก นอกจากนี้ยังไม่สามารถเลี่ยงการเข้าถึงแบบส่วนตัว ถูกลบ หรือจำกัดอายุได้ เนื่องจากการแยกตัวระบุสาธารณะไม่ถือเป็นการอนุญาตให้ดึงข้อมูลที่มีการป้องกัน การปฏิเสธคอลเล็กชันที่ไม่ชัดเจน URL จะช่วยป้องกันแค็ตตาล็อกจากการเติมรายการใดก็ตามที่ปรากฏเป็นอันดับแรกบนหน้าจอของบุคคลหนึ่งคน

เมื่อกด Fetch แล้ว โปรแกรมตรวจสอบรูปภาพอาจพบข้อผิดพลาด 404 ข้อผิดพลาด HTTP อื่นๆ ตัวยึดตำแหน่ง 200 หรือไบต์ที่ไม่สามารถถอดรหัสได้ ข้อมูลเมตาที่แยกจากกันอาจล้มเหลวผ่านการขนส่ง HTTP ปฏิเสธหรือไม่ถูกต้อง JSON รวมถึงเมื่อตัวบล็อก พร็อกซี หรือสถานะออฟไลน์รบกวน ผลลัพธ์เหล่านั้นอยู่ในรายงานความพร้อมใช้งาน พวกเขาไม่ควรทำให้ parser ตีความลิงก์ต้นฉบับใหม่ว่าเป็นวิดีโออื่น

ประเด็นสำคัญ: ค้นหา ID จากนั้นทุกอย่างจะตามมา - วิธีที่ YouTube Thumbnail Downloader ยอมรับลิงก์ YouTube และเอกสารที่รูปร่างรองรับ

หลังจากการแยกวิเคราะห์ในเครื่อง เบราว์เซอร์จะขอภาพขนาดย่อหนึ่งภาพโดยตรงต่อผู้สมัคร JPEG จาก i.ytimg.com และหนึ่งบันทึก oEmbed JSON จาก www.youtube.com oEmbed URL ล้อมรอบนาฬิกาตามรูปแบบบัญญัติ URL และ format=json การเห็นการโทรเหล่านั้นในแผงเครือข่ายช่วยยืนยันว่าการทำให้เป็นมาตรฐานเสร็จสิ้นแล้ว และ ID ที่แยกออกมาเดียวกันนั้นขับเคลื่อนทั้งคำขอเนื้อหาและข้อมูลเมตา

GET ที่ไม่ระบุชื่อเหล่านั้นละเว้นข้อมูลประจำตัวและผู้อ้างอิง ใช้ no-store ติดตามการเปลี่ยนเส้นทาง และข้ามเซิร์ฟเวอร์หรือพร็อกซี ToolAcre ใดๆ Google เห็นคำขอและส่วนหัวของ Origin การจำกัดการออกจากระบบยังคงมีผลกับวิดีโอส่วนตัวที่ถูกลบและจำกัดอายุ ก่อนที่จะคลิกปุ่ม คุณสามารถทดสอบพฤติกรรมของตัวแยกวิเคราะห์แบบออฟไลน์ด้วยรูปร่าง URL ที่เป็นตัวแทนได้ เนื่องจากไม่จำเป็นต้องค้นหาเพื่อระบุส่วนประกอบต่างๆ