Robuta

https://huggingface.co/papers/2401.12168 Paper page - SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities Join the discussion on this paper page vision language modelspaper pagespatial reasoning