Robuta

https://arxiv.org/abs/2302.11254v1 [2302.11254v1] Cross-modal Audio-visual Co-learning for Text-independent Speaker Verification Abstract page for arXiv paper 2302.11254v1: Cross-modal Audio-visual Co-learning for Text-independent Speaker Verification