Presentation Information

[2M1-GS-11g-04]NON-MONOTONICITY AND CATASTROPHIC RISK OF PROMPT INTERVENTIONS IN ADVERSARIAL LLM CONTROL

Koki Inoue1, Naoya Takashima1, 〇Hayato Fujihara1, Shuya Higuchi1, Kota Shimomura1,2, Ryuta Shimogauchi1, Takayoshi Yamashita2 (1. Elith Inc., 2. Chubu University)

Keywords:

Large Language Model (LLM),Prompt Engineering,Adversarial Control,Non-Monotonicity,Tail Risk

LLMプロンプトにルールを追加しても安全性は向上せず、むしろ悪化することが多い。長いプロンプトが標準ベンチマークでLLM性能を低下させることは知られているが、敵対者が弱点を積極的に突いてくる敵対的状況下での効果は未解明であった。本研究では、競技型レッドチーミングコンテスト(29,084 試合、247 参加者)における1,000 件超のプロンプト拡張イベントを分析し、テキスト追加によるスコア変化の中央値がゼロであることを明らかにした。さらに10–17%の事例で深刻な性能低下が発生し、最悪ケースでは獲得可能スコアの半分以上を失った。この効果は非単調であり、攻撃では中規模拡張で悪化率が低下するが大規模拡張で急増し、防御では中規模の基準長からの拡張が最も脆弱であった。これらの知見は、LLM安全性の実務で広く採用されている「制約を増やせば安全になる」という経験則の危うさを示している。