Towards Streaming Referring Video Segmentation via Large Language Model
This paper proposes a simple but efficient MLLM-based framework StreamingRVOS, which can extend image-level segmentation to video-level via a streaming pipeline without introducing extra parameters and achieves excellent performance in referring video segmentation.