https://arxiv.org/abs/2506.06537
[2506.06537] Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained...
Abstract page for arXiv paper 2506.06537: Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models