Skip to main navigation Skip to search Skip to main content

Gate-ViT: gated vision transformer for Fine-Grained Visual Classification

Xiaowei Lu, Kanqi Wang, Peiyu Wang, Qin Zhang, Yang Zhao, Gang Liu, Xiaohan Yu*

*Corresponding author for this work

Research output: Chapter in Book/Report/Conference proceedingConference proceeding contributionpeer-review

Abstract

Fine-Grained Visual Classification (FGVC) aims to distinguish images with subtle differences and limited inter-class variation. This study addresses the lack of understanding of dataset intricacies by analyzing the CUB-200-2011 (CUB) dataset. We identify four ultra-fine-grained subsets that significantly impact accuracy. While local visual cues can often distinguish samples, some fine-grained cases require global context for accurate classification. To address this, we propose a novel LSTM Decision Module (LSTM-DM) that combines local and global information flexibly. Additionally, a Region Selection Module (RSM) selects discriminative regions of fine-grained samples. These modules are integrated into the ViT architecture, enhancing its performance on FGVC tasks. A contrastive loss further improves feature representation by increasing the distance between confusing classes. Extensive evaluations show that our Gate-ViT outperforms existing state-of-the-art methods on four benchmark datasets.

Original languageEnglish
Title of host publicationAdvances in Knowledge Discovery and Data Mining
Subtitle of host publication29th Pacific-Asia Conference on Knowledge Discovery and Data Mining, PAKDD 2025, Sydney, NSW, Australia, June 10-13, 2025, proceedings, part III
EditorsXintao Wu, Myra Spiliopoulou, Can Wang, Vipin Kumar, Longbing Cao, Yanqiu Wu, Yu Yao, Zhangkai Wu
Place of PublicationSingapore
PublisherSpringer, Springer Nature
Pages468-479
Number of pages12
ISBN (Electronic)9789819681808
ISBN (Print)9789819681792
DOIs
Publication statusPublished - 2025
Event29th Pacific-Asia Conference on Knowledge Discovery and Data Mining, PAKDD 2025 - Sydney, Australia
Duration: 10 Jun 202513 Jun 2025

Publication series

NameLecture Notes in Computer Science
PublisherSpringer
Volume15872
ISSN (Print)0302-9743
ISSN (Electronic)1611-3349

Conference

Conference29th Pacific-Asia Conference on Knowledge Discovery and Data Mining, PAKDD 2025
Country/TerritoryAustralia
CitySydney
Period10/06/2513/06/25

Keywords

  • Fine-Grained Visual Classification
  • Vision Transformer
  • LSTM

Fingerprint

Dive into the research topics of 'Gate-ViT: gated vision transformer for Fine-Grained Visual Classification'. Together they form a unique fingerprint.

Cite this