FlexLLM merupakan sistem pertama yang dapat menjalankan inferensi dan finetuning
Large Language Model (LLM) secara bersamaan pada satu GPU dengan memprioritaskan
kualitas layanan inferensi dan memanfaatkan kapasitas tersisa untuk finetuning. Dampak
konfigurasi internal dan pembatasan daya pada berbagai tingkat beban belum
terkarakterisasi. Penelitian ini mengkarakterisasi FlexLLM pada satu GPU NVIDIA A100-
80GB menggunakan Llama-3.1-8B-Instruct. Evaluasi memvariasikan request inferensi per
detik (QPS), kapasitas KV-cache, anggaran token per batch, jumlah lapisan backward per
langkah finetuning, dan power cap. Evaluasi menggunakan SLO attainment, latensi
inferensi, throughput inferensi dan finetuning, konsumsi energi, profiling internal, serta
telemetri GPU. Hasil menunjukkan bahwa keterbatasan KV-cache terutama meningkatkan
TTFT melalui waktu tunggu sebelum admisi dan melandai setelah kapasitas mencukupi.
Pengurangan anggaran token per batch meningkatkan TTFT dan menurunkan throughput
finetuning, terutama pada beban tinggi. Peningkatan jumlah lapisan backward per langkah
menghasilkan potongan backward yang lebih besar tetapi lebih jarang serta meningkatkan
TBT pada interval backward. Pembatasan daya menurunkan frekuensi dan performa GPU,
dengan TTFT lebih sensitif daripada TPOT dan throughput finetuning lebih terdampak
daripada throughput inferensi. Sepanjang tingkat beban yang dievaluasi, batas daya
minimum yang mempertahankan SLO ? 95% berkisar 175–225 W dan mengurangi energi
GPU 23,27–40,05% dibandingkan 300 W, dengan penurunan throughput inferensi 0,76–
8,54% dan finetuning 14,35–27,79%. Secara keseluruhan, dampak konfigurasi dan
pembatasan daya bergantung pada sumber pembatas dan kedekatan beban terhadap
kapasitas sistem.
Perpustakaan Digital ITB