طبقه بندی ریزدانه دیداری با استفاده از اتوانکدرکانولوشنال تنک

نوع مقاله : مقاله پژوهشی

نویسندگان

1 گروه مخابرات سیستم دانشکده مهندسی برق و کامپیوتر دانشگاه آزاد اسلامی واحد علوم و تحقیقات، تهران، ایران

2 گروه مخابرات سیستم دانشکده مهندسی برق و کامپیوتر دانشگاه آزاد اسلامی واحد علوم و تحقیقات

3 گروه مخابرات، دانشکده مهندسی برق، دانشگاه صنعتی شریف، تهران، ایران

چکیده
ما در این تحقیق یک معماری متفاوت چند لایه بنام شبکۀ کدگذاری تنک را جهت ارتقاء دقت طبقه بندی ریزدانه کرده ایم که بر مبنای یادگیری لغت نامه و کدگذاری کانولوشن تنک شکل گرفته است. طبقه بندی ریزدانه به دلیل تنوع درون کلاسی و شباهت های ظریف بین کلاسی یکی از چالش برانگیزترین مأموریت های این حوزه محسوب شده و نیازمند ویژگی های تفکیک کننده می باشد. برای رسیدن به نتایج مطلوب در این نوع طبقه بندی، مدل های مبتنی بر شبکه های عصبی عمیق به گونه ای طراحی می شوند که بتوانند با مکان یابی بخش های حاوی اطلاعات مهم در سطح تصویر و در سطح ناحیه، ویژگی های تفکیک کننده را استخراج و در طبقه بندی استفاده نمایند. مدل پیشنهادی قابلیت استخراج ویژگی های سطح بالا را همچون مدلهای CNN دارد و از طرفی همزمان از افزونگی اطلاعات در عمق لایه ها جلوگیری می کند. این دو عامل منجر به نوعی مکانیابی ضمنی می شود که استخراج ویزگی های تفکیک کننده از این نواحی می تواند در مأموریت ریزدانه موثرباشد. ما در این پژوهش بر مبنای معماری یاد شده، یک اتوانکدر تنک معرفی کرده ایم که ترکیب آن با یک شبکۀ عصبی از پیش آموزش داده شده استاندارد، دقت طبقه بندی در مجموعه داده های ریزدانه را بهبود بخشید. نتایج آزمایشات نشان دادند که مدل پیشنهادی دقت طبقه بندی را به میزان 5/3 درصد در مجموعه دادۀ CUB-200 نسبت به مدل پایۀ مورد استفاده در این معماری افزایش می دهد و نرخ خطای تشخیص کلاس های نادرست را در این مجموعه داده به میزان 28 درصد کاهش میدهد.

کلیدواژه‌ها


عنوان مقاله English

Fine-Grained Visual Classification Using a Convolutional Sparse Auto-Encoder

نویسندگان English

Farhad Sadeghi Almalou 1
Farbod Razzazi 2
Arash Amini 3
1 Department of Mechanical, Electrical and Computer Engineering, SR.C, Islamic Azad University, Tehran, Iran
2 Department of Mechanical, Electrical and Computer Engineering, SR.C, Islamic Azad University, Tehran, Iran
3 Department of Electrical Engineering, Sharif University of Technology, Tehran, Iran.
چکیده English

In this study, we propose a novel multi-layer architecture, termed the Convolutional Sparse Network (CSN), designed to enhance fine-grained classification accuracy. This architecture is founded upon Dictionary Learning (DL) and Convolutional Sparse Coding (CSC). Fine-grained classification is considered one of the most challenging tasks in this domain due to significant intra-class variance and subtle inter-class similarities, necessitating the extraction of highly discriminative features. To achieve optimal performance, deep neural network-based models are typically engineered to localize informative regions at both the image and part levels, thereby extracting the discriminative features essential for precise classification. The proposed model maintains the capacity for high-level feature extraction, analogous to deep convolutional neural networks, while simultaneously mitigating information redundancy across the layer depth. These dual mechanisms facilitate a form of implicit localization, enabling the extraction of discriminative features that are highly effective for fine-grained tasks. Within this framework, we introduce a Sparse Autoencoder (SAE) which, when integrated with a standard pre-trained deep neural network, improves classification accuracy on fine-grained datasets. Experimental results demonstrate that the proposed hybrid model increases classification accuracy on the CUB-200 dataset by 3.5% compared to the base model and achieves a 28% reduction in the misclassification error rate.

کلیدواژه‌ها English

Convolutional sparse network
Multi-layer dictionary learning
Feature extraction
Fine-grained visual classification
Sparse auto encoder
دوره 5، شماره 2
تابستان 1405

  • تاریخ دریافت 05 تیر 1405
  • تاریخ بازنگری 01 مرداد 1405
  • تاریخ پذیرش 05 مرداد 1405