https://arxiv.org/abs/2302.11254v1
[2302.11254v1] Cross-modal Audio-visual Co-learning for Text-independent Speaker Verification
Abstract page for arXiv paper 2302.11254v1: Cross-modal Audio-visual Co-learning for Text-independent Speaker Verification