Adversarial Prompt Optimization in LLMs: HijackNet’s Approach to Robustness and Defense Evasion
At a glance
- Citations
- 0
- References
- 9
- Comments
- 0
Öz
This paper introduces HijackNet, an adversarial prompt hijacking framework designed to improve hijacking success rates and generalization in multi-lingual tasks. Combining Neural Architecture Search (NAS), Reinforcement Learning (RL), and Multi-Objective Optimization (MOO), HijackNet generates adversarial prompts that adapt to target tasks while bypassing model defense mechanisms. This framework optimizes hijacking success, defense evasion, and task completion through a combination of a prompt generator and adversarial optimizer. We introduce a Defense Robustness Score (DRS) to evaluate the stability of prompts in adversarial settings. HijackNet improves adversarial prompt generation, advancing the security and robustness of large language models in adversarial environments.
Publication details
- DOI
- 10.1109/iscait64916.2025.11010431
- OpenAlex
- W4410987182
- Document type
- conference-paper
- Language
- EN
- Source
- Preprints.org
- Last metadata update
Comments
Oturum Açın to join the discussion.