Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores

Open in new window