Contact
Privacy
DMCA
Robuta
https://0xword.com/es/libros/251-hacking-ia-jailbreak-prompt-injection-hallucinations-unalignment.html
Hacking IA: Jailbreak, Prompt Injection, Hallucinations & Unalignment
prompt injection
hacking
ia
jailbreak
hallucinations
https://huggingface.co/papers/2312.00027
Paper page - Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
Join the discussion on this paper page
large language models
https://openreview.net/forum?id=uaMSBJDnRv
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization | OpenReview
Direct Preference Optimization (DPO) and its variants are increasingly used for aligning language models with human preferences. Although these methods are...
preference optimization
unintentional
likelihood
displacement
direct