Illusionen om systemprompter: Säkerhetsinstruktioner ändrar knappt AI-modellers beräkningar
En ny forskningsstudie visar att säkerhetsinstruktioner i systemprompter knappt påverkar de interna beräkningarna i stora språkmodeller, vilket skapar en illusion av kontroll.

Vad har hänt?
Forskare har i en ny studie undersökt hur systemprompter påverkar de interna representationerna i transformatorbaserade språktomodeller. Genom att analysera 17 modeller i storlekar från 1,5 till 72 miljarder parametrar med metoden Centered Kernel Alignment (CKA) fann de att effekten är starkt skiktselektiv. Roll- och formateringsinstruktioner förändrar modellernas mellanliggande lager i grunden, medan säkerhetsinstruktioner har minimal påverkan och producerar förändringar som knappt skiljer sig från en minimal baslinje.
Snabbfakta
| Analyserade modeller | 17 modeller (1,5B till 72B parametrar) |
|---|---|
| Arkitekturfamiljer | 8 familjer |
| CKA-korrelation säkerhet/tillåtande | 0,997 |
| Säkerhetspenetration vid 70B-72B | Under 10 % |
Varför spelar det roll?
Studien visar att begränsande säkerhetsinstruktioner och tillåtande prompter (som "du har inga begränsningar") aktiverar nästan identiska beräkningsvägar, med en genomsnittlig CKA-korrelation på 0,997. Detta innebär att säkerhetsprompter ger en falsk trygghet då säkerhetspenetrationen i de interna representationerna stannar under 10 procent även i kommersiella storlekar upp till 70B–72B parametrar.
Vem påverkas?
Resultaten berör AI-utvecklare, säkerhetsforskare och företag som förlitar sig på systemprompter för att styra språkmodellers beteende och säkerhet. Det påverkar även utvecklare av applikationer som bygger på att begränsa modellutdata via instruktionslager.
Hur påverkas EU?
Forskningen belyser utmaningar som är direkta underbyggnader till EU AI Act och dess kraven på tillförlitlighet och säkerhet. Eftersom säkerhetsprompter inte ändrar modellernas representationer i djupet visar det på svårigheten att garantera efterlevnad av EU-förordningar enbart via instruktionslager.
Vad mer bör du veta?
Studien har publicerats på arXiv (identifierare arXiv:2503.04508 / 2609.38205) och omfattar systematiska CKA-mätningar över 17 instruktionsfinjusterade modeller från åtta olika arkitekturfamiljer.
Snabba svar om den här nyheten
Vad har hänt?
När hände det?
Varför spelar det roll?
Vilka modeller ingick i studien?
Länken öppnar i nytt fönster och leder till utgivarens egen sida.
Källan har spårats automatiskt från utgivaren via Aheadlines signalkedja.
AI-verktyg i artikeln
Ämnen
Få liknande nyheter direkt i mejlen
Läsarrummet
Skicka in en fråga eller ett tillägg. Redaktionen läser allt innan det publiceras och svarar när det är relevant. Ingen AI-fri text – bara människor.
Logga in för att skicka in en kommentar eller fråga.
Läs artikeln genom din roll
- Avgör om detta påverkar strategin på 6–12 månaders sikt eller är brus.
- Diskutera i ledningsgruppen: äger vi rätt fråga eller behöver ansvaret flyttas?
- Fråga: vilken risk tar vi genom att INTE agera på det här den här kvartalet?
Genererad vinkling — inte redaktionell analys av "Illusionen om systemprompter: Säkerhetsinstruktioner ändrar "