conference-paper وصول مفتوح

Adversarial Prompt Optimization in LLMs: HijackNet’s Approach to Robustness and Defense Evasion

  • Preprints.org
Research footprint

At a glance

الاستشهادات
0
المراجع
9
Comments
0
Paper overview

Abstract

This paper introduces HijackNet, an adversarial prompt hijacking framework designed to improve hijacking success rates and generalization in multi-lingual tasks. Combining Neural Architecture Search (NAS), Reinforcement Learning (RL), and Multi-Objective Optimization (MOO), HijackNet generates adversarial prompts that adapt to target tasks while bypassing model defense mechanisms. This framework optimizes hijacking success, defense evasion, and task completion through a combination of a prompt generator and adversarial optimizer. We introduce a Defense Robustness Score (DRS) to evaluate the stability of prompts in adversarial settings. HijackNet improves adversarial prompt generation, advancing the security and robustness of large language models in adversarial environments.

Record transparency

Publication details

DOI
10.1109/iscait64916.2025.11010431
OpenAlex
W4410987182
Document type
conference-paper
Language
EN
Source
Preprints.org
Last metadata update
المجتمع

Comments

تسجيل الدخول للانضمام إلى النقاش.

  1. لا توجد تعليقات بعد. ابدأ النقاش.