Skip to main navigation Skip to search Skip to main content

Can Argus Judge Them All? Comparing VLMs across domains

Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Niharika Jain, Sarthak Jain, Jiechao Gao, Usman Naseem

Research output: Working paperPreprint

Abstract

Vision-Language Models (VLMs) are advancing multimodal AI, yet their performance consistency across tasks is underexamined. We benchmark CLIP, BLIP, and LXMERT across diverse datasets spanning retrieval, captioning, and reasoning. Our evaluation includes task accuracy, generation quality, efficiency, and a novel Cross-Dataset Consistency (CDC) metric. CLIP shows strongest generalization (CDC: 0.92), BLIP excels on curated data, and LXMERT leads in structured reasoning. These results expose trade-offs between generalization and specialization, informing industrial deployment of VLMs and guiding development toward robust, task-flexible architectures.
Original languageEnglish
Number of pages8
DOIs
Publication statusSubmitted - 23 Jun 2025

Publication series

NamearXiv
PublisherarXiv.org

Fingerprint

Dive into the research topics of 'Can Argus Judge Them All? Comparing VLMs across domains'. Together they form a unique fingerprint.

Cite this