Robuta

https://papers.nips.cc/paper_files/paper/2025/hash/0ac5ec73577646c2a5b3dded72b9ecfd-Abstract-Datasets_and_Benchmarks_Track.html IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering vision languagemodel scene