DPO fine-tuning of Phi-3-mini for safety alignment using QLoRA, runnable end-to-end on a single 16GB T4 GPU. Includes training health monitoring, data validation, and a toxicity/reasoning eval harness.
pytorch ai-safety fine-tuning preference-learning dpo huggingface-transformers rlhf qlora llm-fine-tuning phi-3 preference-optimization llm-alignment 4bit-quantization
-
Updated
Jul 16, 2026 - Python