Towards Streaming Referring Video Segmentation via Large Language Model
This paper proposes a simple but efficient MLLM-based framework StreamingRVOS, which can extend image-level segmentation to video-level via a streaming pipeline without introducing extra parameters and achieves excellent performance in referring video segmentation.
Wenkang Zhang, Kaicheng Yang, Xiang An et al.
· 0 citations