Modality-Inconsistent Continual Learning of Multimodal Large Language Models
📰 ArXiv cs.AI
arXiv:2412.13050v2 Announce Type: replace-cross Abstract: In this paper, we introduce Modality-Inconsistent Continual Learning (MICL), a new continual learning scenario for Multimodal Large Language Models (MLLMs) that involves tasks with inconsistent modalities (image, audio, or video) and varying task types (captioning or question-answering). Unlike existing vision-only or modality-incremental settings, MICL combines modality and task type shifts, both of which drive catastrophic forgetting. T
DeepCamp AI