Robuta

https://openreview.net/forum?id=2Oiee202rd PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts | OpenReview Vision-language models like CLIP are widely used in zero-shot image classification due to their ability to understand various visual concepts and natural... visualclassificationinferringconditioningcontexts