Open access
Aug 2026
A Hybrid Vision Transformer and EfficientNet-B3 Framework for Facial Expression Recognition
A hybrid architecture that combines Vision Transformers (ViTs) to capture global context with EfficientNet-B3 for multi-scale feature extraction and highlights the promise of hybrid deep learning architectures in tackling real-world facial expression recognition challenges.
Sasan Karamizadeh, Saman Shojae Chaeikar, Mazdak Zamani
· Journal of Imaging · 0 citations