SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models

Open in new window