ViSTA: A Simple Bridge Extends Visual Alignment to Clinical Time-Series Understanding in Multimodal LLMs
ViSTA is introduced, a compact adapter that incorporates irregular numerical measurements into a pretrained vision-language model's chart representations and extends pretrained language models to numerical prediction and temporal questions.