Accelerating Inference in Large Language Models with a Unified Layer Skipping Strategy

Open in new window