Robuta

https://0xword.com/es/libros/251-hacking-ia-jailbreak-prompt-injection-hallucinations-unalignment.html Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment prompt injectionhackingiajailbreakhallucinations https://huggingface.co/papers/2312.00027 Paper page - Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections Join the discussion on this paper page large language models https://openreview.net/forum?id=uaMSBJDnRv Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization | OpenReview Direct Preference Optimization (DPO) and its variants are increasingly used for aligning language models with human preferences. Although these methods are... preference optimizationunintentionallikelihooddisplacementdirect