https://ojh6404.github.io/vlaff/
VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances
VLAff is a vision-language-affordance foundation model that jointly predicts visual, grasp, and trajectory affordances, trained on EgoAffordance: 204K episodes...
visionlanguageaffordancemodelunified