CNeRG- I.I.T. Kharagpur
|Research Intern
Summary
Investigated cultural sensitivity in small-parameter large language models (LLMs), focusing on mitigating harmful cultural outputs. Fine-tuned LLMs, including Mistral-v0.2 (7B), Llama-2 (7B, 13B), Vicuna (13B), and Phi (4B), using advanced alignment techniques such as Direct Preference Optimization (DPO) and Offline Reward-based Preference Optimization (ORPO), achieving up to a 70% reduction in harmful outputs. Utilized Captum, an explainability library, to interpret model decisions and understand attention distributions influencing harmful responses.