Robuta

https://arxiv.org/abs/2506.06537 [2506.06537] Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained... Abstract page for arXiv paper 2506.06537: Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models