https://openreview.net/forum?id=VUn1js1BmK
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding | OpenReview
As large language models (LLMs) become increasingly integrated into real-world applications, extensive efforts have been made to align LLM behavior with human...
defendingjailbreakattacksviasafety