Kanker payudara menduduki peringkat kedua kasus kanker tertinggi secara global
dengan peningkatan kasus setiap tahunnya. Kanker payudara sendiri berkembang
bertahap dari jaringan normal menuju early neoplasia (EN), lalu ductal carcinoma
in situ (DCIS), hingga invasive ductal carcinoma (IDC). Histopatologi
konvensional hanya menilai keadaan lesi pada saat biopsi diambil dan belum dapat
memperkirakan lesi mana yang akan menjadi invasif, sehingga biomarker yang
mengambarkan level ekspresi gen berpeluang menjadi penanda tahap awal. Namun,
prediksi biomarker umumnya memakai satu metode pipeline differentially
expressed genes (DEG) dan penggunaan model klasifikasi machine learning (ML)
yang terpisah, padahal pipeline berbeda dapat memberi output daftar gen berbeda
juga pada data yang sama. Penelitian ini bertujuan membandingkan empat pipeline
gabungan DEG yaitu edgeR serta DESeq2 dan ML yaitu Random Forest (RF) serta
Support Vector Machine (SVM) dalam memisahkan keempat tahap lesi sekaligus
menyaring gen yang konsisten terpilih dari keempat pipeline tersebut. Dataset yang
digunakan adalah GSE47462 berupa matriks raw counts dari 72 sampel jaringan
formalin-fixed paraffin-embedded (FFPE) milik 25 pasien kanker payudara yang
dianalisis melalui dua cabang pipeline terpisah, DESeq2 dan edgeR yang
merupakan dua pipeline DEG yang paling umum dipakai untuk data bulk RNAsequencing.
Gen yang lolos threshold (False Discovery Rate (FDR) < 0,01 dan
log2 Fold Change (|log2FC|) > |2|) menjadi fitur atau data untuk pelatihan ML
Random Forest (RF) dan Support Vector Machine (SVM), lalu keempat pipeline
dinilai dengan validasi Grouped LOOCV 25 putaran. Jumlah gen dengan ekspresi
diferensial bertambah mengikuti progresi kanker, dari 12 gen (DESeq2) dan 17 gen
(edgeR) pada EN menjadi 409 dan 416 gen pada IDC, dengan indeks Jaccard 0,706
vi
(EN), 0,691 (DCIS), dan 0,797 (IDC) yang tidak meningkat berurutan mengikuti
tahapnya. Kedua pipeline berbasis RF mencapai akurasi 0,861, Kappa 0,803, dan
Macro F1 0,835, sedikit di atas pipeline SVM (0,833; 0,767 sampai 0,769; 0,784
sampai 0,794), sementara hasil kedua pipeline DEG nyaris setara pada seluruh
parameter. Perbedaan performa antar-algoritma ML ini tidak signifikan secara
statistik dan semua algoritma bisa dianggap sama baiknya. Hal Ini dilihat dari dua
uji, yaitu selang kepercayaan bootstrap 95% (dihitung per pasien) untuk selisih
performa masih terdapat nilai nol, dan nilai p dari uji DeLong semuanya jauh di
atas 0,05, sehingga tidak ada bukti kuat bahwa satu algoritma lebih unggul dari
yang lain. IDC paling mudah dikenali (AUC 0,974 sampai 0,993) dan EN paling
sulit dipisahkan dari jaringan normal. Enam gen yang selalu signifikan di keempat
pipeline, yaitu INHBA yang ekspresinya naik serta LAMC3, TNNI2, SYT8, NDRG2,
dan S100B yang turun, dengan INHBA, NDRG2, dan LAMC3 bertahan sampai
threshold Top-N sebesar 10. Pada dataset ini pemilihan kedua metode DEG tidak
memengaruhi performa analisis, sedangkan kedua algoritma ML menghasilkan
selisih performa antar-algoritma yang konsisten meski belum signifikan secara
statistik. Atas dasar itu, Random Forest diajukan sebagai kandidat algoritma terbaik
di antara kedua algoritma yang dibandingkan untuk diuji lebih lanjut pada dataset
lain yang sejenis. Keenam gen yang teridentifikasi berstatus sebagai kandidat
biomarker, dan uji laboratorium lanjutan perlu dilakukan sebelum keenamnya dapat
diklaim sebagai biomarker fungsional.
Perpustakaan Digital ITB