https://openreview.net/forum?id=2Oiee202rd
PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts | OpenReview
Vision-language models like CLIP are widely used in zero-shot image classification due to their ability to understand various visual concepts and natural...
visualclassificationinferringconditioningcontexts