https://openreview.net/forum?id=Em2oaXd8Dc
HashAttention: Semantic Sparsity for Faster Inference | OpenReview
Leveraging long contexts is crucial for advanced AI systems, but attention computation poses a scalability challenge. While scaled dot-product attention (SDPA)...
semanticsparsityfasterinferenceopenreview