Read the original at HF Daily Papers
Researchers introduce PersistBD, a method that strengthens backdoors in large language models to survive benign post-training, raising attack success rates from 20% to 76% on Qwen2.5-Coder-7B.
Carried by: HF Daily Papers. First seen: .