CNN-ViT Hybrid Architecture With Time-Color Coding for Classifying Behavioral Events in Video Sequences
Classifying behavioral events in video sequences requires modeling morphology and motion under severe data constraints. This paper presents a hybrid two-stream CNN-ViT architecture combining EfficientNetB4 for local spatial features with a Vision Transformer branch for global context. Time-color coding (TCC) transforms...