QPO: Query-dependent Prompt Optimization via Multi-Loop Offline Reinforcement Learning

Open in new window