ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers

Open in new window