Robuta

https://arxiv.org/abs/2603.17541 [2603.17541] Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large... Abstract page for arXiv paper 2603.17541: Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models