Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning Paper • 2606.24133 • Published Jun 23 • 11
CausalMix: Data Mixture as Causal Inference for Language Model Training Paper • 2607.01104 • Published 27 days ago • 21