Preprint
Aug 2026
Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement
FISA is proposed, a framework for MLLM self-improvement that constructs augmented images from the model's own failure cases that generates visually challenging yet answer-preserving image complications, verifies their utility through self-examination, and applies dual fidelity filtering to avoid semantic distortion.
Chunyang Jiang, Pingping Zhang, Yuzhi Zhao et al.
· 0 citations