Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories

Open in new window