On the rate of convergence of an over-parametrized Transformer classifier learned by gradient descent

Open in new window