digilib@itb.ac.id +62 812 2508 8800

Sistem Agentic AI umumnya mengandalkan Large Language Model atau LLM yang mahal secara komputasi. Akan tetapi, sebagian besar tugas Agentic AI sebenarnya bersifat repetitif dan berlingkup sempit. Penggunaan Small Language Model atau SLM merupakan alternatif solusi tetapi memiliki keterbatasan kemampuan sehingga diperlukan dekomposisi tugas ke beberapa agen SLM terspesialisasi. Pelatihan agen tersebut melalui distilasi trajectory LLM terkendala pada kelangkaan data skenario latih yang valid. Sementara itu, pendekatan distilasi iteratif dengan penam bahan data latih secara terarah berbasis metrik agregat tidak dapat melacak kegagalan yang bersifat kaskade pada sistem Agentic AI. Penelitian ini mengembangkan alur kerja distilasi iteratif dengan koreksi trajectory menggunakan LLM untuk melatih agen-agen SLM terspesialisasi yang menggunakan LoRA Adapter dengan satu SLM backbone. LLM guru akan digunakan untuk menilai dan mengoreksi trajectory agen-agen SLM, dan menghasilkan data pelatihan untuk pelatihan berikutnya. Pengujian pada benchmark TravelPlanner menunjukkan bahwa distilasi dengan koreksi trajectory berhasil meningkatkan task success rate dibandingkan dengan distilasi trajectory LLM secara langsung. Selain itu, sistem Agentic AI dengan delapan agen SLM terspesialisasi yang menggunakan LoRA Adapter membutuhkan memori lebih kecil dibandingkan dengan kebutuhan memori LLM guru. Penelitian ini menyimpulkan bahwa distilasi dengan koreksi trajectory pada agen-agen SLM dapat meningkatkan kinerja sistem Agentic AI dan mempertahankan efisiensi sumber daya.