conference-paper Open access

Adversarial Prompt Optimization in LLMs: HijackNet’s Approach to Robustness and Defense Evasion

  • Preprints.org
Research footprint

At a glance

Citations
0
References
9
Comments
0
Paper overview

Öz

This paper introduces HijackNet, an adversarial prompt hijacking framework designed to improve hijacking success rates and generalization in multi-lingual tasks. Combining Neural Architecture Search (NAS), Reinforcement Learning (RL), and Multi-Objective Optimization (MOO), HijackNet generates adversarial prompts that adapt to target tasks while bypassing model defense mechanisms. This framework optimizes hijacking success, defense evasion, and task completion through a combination of a prompt generator and adversarial optimizer. We introduce a Defense Robustness Score (DRS) to evaluate the stability of prompts in adversarial settings. HijackNet improves adversarial prompt generation, advancing the security and robustness of large language models in adversarial environments.

Record transparency

Publication details

DOI
10.1109/iscait64916.2025.11010431
OpenAlex
W4410987182
Document type
conference-paper
Language
EN
Source
Preprints.org
Last metadata update
Community

Comments

Oturum Açın to join the discussion.

  1. No comments yet. Start the discussion.