Do Video Language Models Really Know Where to Look? Diagnosing Attention Failures in Video Language Models

Open in new window