Ny metod döljer vägrar-signaler för att stoppa hackning av AI-säkerhet
En ny forskningsmetod kallad AMRA gör det svårare att ta bort säkerhetsspärrar från öppna språkmodeller. Genom att dölja modellens interna vägrar-signaler med slumpmässiga alias behålls skyddet utan att den generella förmågan försämras.

Vad har hänt?
Forskare har publicerat en ny skyddsmetod kallad AMRA (Abliteration Mitigation via Refusal Aliases) som ska förhindra att AI-modellers säkerhetsspärrar stängs av. Abliterering sker vanligtvis genom att identifiera och filtrera bort modellens interna vägrar-signal i aktiveringslagren med hjälp av ett fåtal instruktioner. AMRA motverkar detta genom att dölja vägrar-signalen via lågrangs-uppdateringar av skrivarmatriser i residualströmmen, ersätta aktiveringarna med slumpmässiga alias och korrigera läsarmatriserna så att originalbeteendet behålls.
Snabbfakta
| Forskningsrapport | arXiv:2608.18093 |
|---|---|
| Förbättring vägrar-poäng (Llama-3-8B) | +2,16 poäng |
| MMLU-degradering | < 0,5 procentenheter |
| Testade modeller | Llama-3-8B, Gemma-2-9B |
Varför spelar det roll?
Abliterering har blivit ett stort säkerhetsproblem eftersom vem som helst med grundläggande hårdvara hittills har kunnat plocka bort säkerhetsfilter från öppna modeller. Genom AMRA förbättrades modellernas förmåga att behålla sina vägrar-svar efter abliterering med 2,16 poäng på Llama-3-8B, medan den generella prestandan på MMLU-testet minskade med mindre än 0,5 procentenheter.
Vem påverkas?
Säkerhetsforskare, AI-utvecklare och företag som publicerar öppna modeller berörs direkt, då metoden ger ett verktyg för att förhindra oönskad avlägsning av säkerhetsspärrar. Slutanvändare får tillgång till säkrare öppna modeller där skyddsmekanismerna inte lika enkelt kan kringgås.
Hur påverkas EU?
Eftersom AMRA är en öppen forskningsmetod för modellskydd och viktredigering påverkas inte distributionen av EU-specifika regler, men tekniken kan bli viktig för forskare och bolag som måste följa kraven på säkerhet och riskhantering i EU AI Act.
Vad mer bör du veta?
Studien utvärderades på Llama-3-8B och Gemma-2-9B, där metoden visade att det går att försvåra abliterering utan att försämra modellernas generella förmåga. Framtida forskning väntas undersöka om säkerhetsspärrarna står emot mer avancerade eller anpassade extraktionsmetoder.
Snabba svar om den här nyheten
Vad har hänt?
När hände det?
Varför spelar det roll?
Vilka modeller har testats?
Länken öppnar i nytt fönster och leder till utgivarens egen sida.
Källan har spårats automatiskt från utgivaren via Aheadlines signalkedja.
AI-verktyg i artikeln
Ämnen
Få liknande nyheter direkt i mejlen
Läsarrummet
Skicka in en fråga eller ett tillägg. Redaktionen läser allt innan det publiceras och svarar när det är relevant. Ingen AI-fri text – bara människor.
Logga in för att skicka in en kommentar eller fråga.
Läs artikeln genom din roll
- Avgör om detta påverkar strategin på 6–12 månaders sikt eller är brus.
- Diskutera i ledningsgruppen: äger vi rätt fråga eller behöver ansvaret flyttas?
- Fråga: vilken risk tar vi genom att INTE agera på det här den här kvartalet?
Genererad vinkling — inte redaktionell analys av "Ny metod döljer vägrar-signaler för att stoppa hackning av A"