Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models

Open in new window