MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

📰 ArXiv cs.AI

arXiv:2604.14198v1 Announce Type: cross Abstract: Domain reweighting can improve sample efficiency and downstream generalization, but data-mixture optimization for multimodal midtraining remains largely unexplored. Current multimodal training recipes tune mixtures along a single dimension, typically data format or task type. We introduce MixAtlas, a method that produces benchmark-targeted data recipes that can be inspected, adapted, and transferred to new corpora. MixAtlas decomposes the trainin

Published 17 Apr 2026
Read full paper → ← Back to Reads