Robuta

https://openreview.net/forum?id=ydH8nU5csJ&referrer=%5Bthe%20profile%20of%20Xuchen%20Li%5D(%2Fprofile%3Fid%3D~Xuchen_Li1) DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM | OpenReview Visual language tracking (VLT) has emerged as a cutting-edge research area, harnessing linguistic data to enhance algorithms with multi-modal inputs and...