digilib@itb.ac.id +62 812 2508 8800

ABSTRAK Abdullah Mubarak
PUBLIC Open In Flipbook Esha Mustika Dewi

FlexLLM merupakan sistem pertama yang dapat menjalankan inferensi dan finetuning Large Language Model (LLM) secara bersamaan pada satu GPU dengan memprioritaskan kualitas layanan inferensi dan memanfaatkan kapasitas tersisa untuk finetuning. Dampak konfigurasi internal dan pembatasan daya pada berbagai tingkat beban belum terkarakterisasi. Penelitian ini mengkarakterisasi FlexLLM pada satu GPU NVIDIA A100- 80GB menggunakan Llama-3.1-8B-Instruct. Evaluasi memvariasikan request inferensi per detik (QPS), kapasitas KV-cache, anggaran token per batch, jumlah lapisan backward per langkah finetuning, dan power cap. Evaluasi menggunakan SLO attainment, latensi inferensi, throughput inferensi dan finetuning, konsumsi energi, profiling internal, serta telemetri GPU. Hasil menunjukkan bahwa keterbatasan KV-cache terutama meningkatkan TTFT melalui waktu tunggu sebelum admisi dan melandai setelah kapasitas mencukupi. Pengurangan anggaran token per batch meningkatkan TTFT dan menurunkan throughput finetuning, terutama pada beban tinggi. Peningkatan jumlah lapisan backward per langkah menghasilkan potongan backward yang lebih besar tetapi lebih jarang serta meningkatkan TBT pada interval backward. Pembatasan daya menurunkan frekuensi dan performa GPU, dengan TTFT lebih sensitif daripada TPOT dan throughput finetuning lebih terdampak daripada throughput inferensi. Sepanjang tingkat beban yang dievaluasi, batas daya minimum yang mempertahankan SLO ? 95% berkisar 175–225 W dan mengurangi energi GPU 23,27–40,05% dibandingkan 300 W, dengan penurunan throughput inferensi 0,76– 8,54% dan finetuning 14,35–27,79%. Secara keseluruhan, dampak konfigurasi dan pembatasan daya bergantung pada sumber pembatas dan kedekatan beban terhadap kapasitas sistem.