digilib@itb.ac.id +62 812 2508 8800

Reaction video merupakan format konten video yang menampilkan reaksi seseorang atau sekelompok orang (reactor) terhadap suatu video lain (original content), umumnya menggunakan layout picture-in-picture (PiP). Kehadiran PiP menjadi tantangan bagi sistem partial video copy detection (PVCD) karena informasi visual tambahan pada layout ini menurunkan kinerja feature extractor dalam menangkap kemiripan antar-frame. Tugas akhir ini mengembangkan dataset reaction video asli dengan anotasi PiP dan timestamp original content, serta model deteksi PiP berbasis YOLOv12 yang mengembangkan pendekatan deteksi PiP berbasis deep learning pada gambar statis sintetis (Gómez-Molina dkk., 2024) agar dapat diterapkan pada reaction video asli. Pada data uji sintetis, model menghasilkan PiP average IoU sebesar 0.8738 dan video average IoU sebesar 0.8605. Pada reaction video asli, rata-rata F1-Score deteksi tertinggi sebesar 0.8420 diperoleh pada confidence threshold 0.2. Isolasi PiP menggunakan hasil prediksi model meningkatkan F1-Score PVCD pada kombinasi ISC21+SPD dari 0.8499 menjadi 0.9108, dan peningkatan dibandingkan tanpa cropping signifikan secara statistik.