Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders

Open in new window