digilib@itb.ac.id +62 812 2508 8800

Kanker payudara menduduki peringkat kedua kasus kanker tertinggi secara global dengan peningkatan kasus setiap tahunnya. Kanker payudara sendiri berkembang bertahap dari jaringan normal menuju early neoplasia (EN), lalu ductal carcinoma in situ (DCIS), hingga invasive ductal carcinoma (IDC). Histopatologi konvensional hanya menilai keadaan lesi pada saat biopsi diambil dan belum dapat memperkirakan lesi mana yang akan menjadi invasif, sehingga biomarker yang mengambarkan level ekspresi gen berpeluang menjadi penanda tahap awal. Namun, prediksi biomarker umumnya memakai satu metode pipeline differentially expressed genes (DEG) dan penggunaan model klasifikasi machine learning (ML) yang terpisah, padahal pipeline berbeda dapat memberi output daftar gen berbeda juga pada data yang sama. Penelitian ini bertujuan membandingkan empat pipeline gabungan DEG yaitu edgeR serta DESeq2 dan ML yaitu Random Forest (RF) serta Support Vector Machine (SVM) dalam memisahkan keempat tahap lesi sekaligus menyaring gen yang konsisten terpilih dari keempat pipeline tersebut. Dataset yang digunakan adalah GSE47462 berupa matriks raw counts dari 72 sampel jaringan formalin-fixed paraffin-embedded (FFPE) milik 25 pasien kanker payudara yang dianalisis melalui dua cabang pipeline terpisah, DESeq2 dan edgeR yang merupakan dua pipeline DEG yang paling umum dipakai untuk data bulk RNAsequencing. Gen yang lolos threshold (False Discovery Rate (FDR) < 0,01 dan log2 Fold Change (|log2FC|) > |2|) menjadi fitur atau data untuk pelatihan ML Random Forest (RF) dan Support Vector Machine (SVM), lalu keempat pipeline dinilai dengan validasi Grouped LOOCV 25 putaran. Jumlah gen dengan ekspresi diferensial bertambah mengikuti progresi kanker, dari 12 gen (DESeq2) dan 17 gen (edgeR) pada EN menjadi 409 dan 416 gen pada IDC, dengan indeks Jaccard 0,706 vi (EN), 0,691 (DCIS), dan 0,797 (IDC) yang tidak meningkat berurutan mengikuti tahapnya. Kedua pipeline berbasis RF mencapai akurasi 0,861, Kappa 0,803, dan Macro F1 0,835, sedikit di atas pipeline SVM (0,833; 0,767 sampai 0,769; 0,784 sampai 0,794), sementara hasil kedua pipeline DEG nyaris setara pada seluruh parameter. Perbedaan performa antar-algoritma ML ini tidak signifikan secara statistik dan semua algoritma bisa dianggap sama baiknya. Hal Ini dilihat dari dua uji, yaitu selang kepercayaan bootstrap 95% (dihitung per pasien) untuk selisih performa masih terdapat nilai nol, dan nilai p dari uji DeLong semuanya jauh di atas 0,05, sehingga tidak ada bukti kuat bahwa satu algoritma lebih unggul dari yang lain. IDC paling mudah dikenali (AUC 0,974 sampai 0,993) dan EN paling sulit dipisahkan dari jaringan normal. Enam gen yang selalu signifikan di keempat pipeline, yaitu INHBA yang ekspresinya naik serta LAMC3, TNNI2, SYT8, NDRG2, dan S100B yang turun, dengan INHBA, NDRG2, dan LAMC3 bertahan sampai threshold Top-N sebesar 10. Pada dataset ini pemilihan kedua metode DEG tidak memengaruhi performa analisis, sedangkan kedua algoritma ML menghasilkan selisih performa antar-algoritma yang konsisten meski belum signifikan secara statistik. Atas dasar itu, Random Forest diajukan sebagai kandidat algoritma terbaik di antara kedua algoritma yang dibandingkan untuk diuji lebih lanjut pada dataset lain yang sejenis. Keenam gen yang teridentifikasi berstatus sebagai kandidat biomarker, dan uji laboratorium lanjutan perlu dilakukan sebelum keenamnya dapat diklaim sebagai biomarker fungsional.