Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models

Open in new window