InverseScope: Scalable Activation Inversion for Interpreting Large Language Models

Open in new window