Linear Transformers with Learnable Kernel Functions are Better In-Context Models

Open in new window