Ny metod stoppar prompt injection genom att styra språkmodeller vid inferens
Forskare introducerar V-Steer, en ny träningsfri metod som stoppar prompt injection genom att redigera värde-vektorer direkt under inferens.

Vad har hänt?
Forskare har publicerat studien 'Steering Instruction Hierarchies at Inference Time' som introducerar V-Steer, en ny träningsfri metod för att upprätthålla instruktionshierarkier i stora språkmodeller. Metoden identifierar uppmärksamhetshuvuden där lägre prioriterade indata, såsom användarprompter, dominerar över högre prioriterade systeminstruktioner. Genom att göra multiplikativa redigeringar direkt i cachat värde-vektorer (V-tensorer) förstärks systeminstruktionernas påverkan och förhindrar att modellen bryter mot sina säkerhetsregler.
Snabbfakta
| Metodnamn | V-Steer |
|---|---|
| Ökning av träffsäkerhet | Från under 18% till 92% |
| Testade modellstorlekar | 7B till 70B parametrar |
Varför spelar det roll?
Säkerheten i dagens AI-system bygger på att systeminstruktioner alltid ska ha högre prioritet än användarindata eller externa verktyg. Trots detta misslyckas ledande språkmodeller ofta med att hålla denna hierarki, vilket öppnar för säkerhetsbrister som prompt injections. V-Steer löser detta utan kostsam omträning och ökar träffsäkerheten för primära instruktioner från under 18 procent upp till 92 procent med minimal overhead vid förfiltrering.
Vem påverkas?
Metoden berör AI-forskare, systemarkitekter och utvecklare som bygger applikationer baserade på språkmodeller från 7 till 70 miljarder parametrar. Den är särskilt relevant för organisationer som utvecklar AI-agenter eller integrerar externa verktyg och användardata där risken för prompt injection och instruktionskonflikter är hög.
Hur påverkas EU?
Metoden V-Steer är en mjukvarubaserad inferensmetod och begränsas inte av geografiska restriktioner, vilket gör den omedelbart tillgänglig för EU-utvecklare. Den kan hjälpa europeiska företag att uppfylla de stränga säkerhets- och efterlevnadskrav som ställs i EU AI Act gällande kontroll och tillförlitlighet hos AI-system.
Vad mer bör du veta?
Metoden V-Steer demonstrerar hur direkt logit-attribution kan användas för att genomföra kirurgiska ingrepp i modellen under inferens. Genom att enbart modifiera sparade V-tensorer i kvantskapade nyckel-värde-cacheminnen bevaras kompatibiliteten med optimerade beräkningsbibliotek och fused attention-backends.
Snabba svar om den här nyheten
Vad har hänt?
När hände det?
Varför spelar det roll?
Påverkar det EU?
Länken öppnar i nytt fönster och leder till utgivarens egen sida.
Källan har spårats automatiskt från utgivaren via Aheadlines signalkedja.
AI-verktyg i artikeln
Ämnen
Få liknande nyheter direkt i mejlen
Läsarrummet
Skicka in en fråga eller ett tillägg. Redaktionen läser allt innan det publiceras och svarar när det är relevant. Ingen AI-fri text – bara människor.
Logga in för att skicka in en kommentar eller fråga.
Läs artikeln genom din roll
- Bedöm teknisk risk: modellval, leverantörsberoende, dataflöde och driftskostnad.
- Uppdatera arkitekturdokumentet om nya API:er eller regelkrav berör produktionen.
- Säkerställ observability + rollback-plan innan ni rullar ut i skarpt.
Genererad vinkling — inte redaktionell analys av "Ny metod stoppar prompt injection genom att styra språkmodel"