Do Larger Language Models Generalize Better? A Scaling Law for Implicit Reasoning at Pretraining Time

Open in new window