THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
📰 ArXiv cs.AI
Learn to defend Large Language Models against multi-turn jailbreak attacks using THRD, a training-free framework
Action Steps
- Analyze the trajectory-dependent safety behavior in multi-turn interactions
- Apply THRD framework to detect and prevent jailbreak attacks
- Configure the framework to capture risk accumulation along interaction trajectories
- Test the framework's effectiveness in defending against multi-turn attacks
- Compare the results with existing single-turn analysis defenses
Who Needs to Know This
AI engineers and researchers working on LLMs can benefit from this framework to improve model safety and security
Key Insight
💡 Trajectory-dependent safety behavior is crucial in defending against multi-turn jailbreak attacks
Share This
🚨 Introducing THRD: a training-free defense framework for LLMs against multi-turn jailbreak attacks 🚨
Key Takeaways
Learn to defend Large Language Models against multi-turn jailbreak attacks using THRD, a training-free framework
Full Article
Title: THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
Abstract:
arXiv:2606.01738v1 Announce Type: cross Abstract: Multi-turn jailbreak attacks pose a growing threat to LLMs by exploiting conversational dynamics such as gradual escalation and cross-turn coordination. Existing defenses either rely on costly retraining -- often degrading model utility -- or apply single-turn analysis independently at each turn, failing to capture how risk accumulates along interaction trajectories. We observe that safety behavior in multi-turn interaction is trajectory-dependen
Abstract:
arXiv:2606.01738v1 Announce Type: cross Abstract: Multi-turn jailbreak attacks pose a growing threat to LLMs by exploiting conversational dynamics such as gradual escalation and cross-turn coordination. Existing defenses either rely on costly retraining -- often degrading model utility -- or apply single-turn analysis independently at each turn, failing to capture how risk accumulates along interaction trajectories. We observe that safety behavior in multi-turn interaction is trajectory-dependen
DeepCamp AI