Ny AI-metod låser säkerhetskretsar under självförbättrande evolution
Ny forskning introducerar Circuit-Anchored Evolution, en metod inspirerad av biologisk evolution som säkrar AI-modellers säkerhetskretsar under självförbättrande träning.

Vad har hänt?
Forskare har introducerat en metod kallad Circuit-Anchored Evolution (CAE) för att förhindra att AI-modeller förlorar sina säkerhetsspärrar under självförbättrande evolutionsprocesser. Genom att använda mekanistisk tolkningsbarhet identifieras en säkerhetskrets som utgör mindre än två procent av modellens funktioner. Denna specifika del låses fast under optimeringen medan resterande delar av modellen tillåts anpassa sig och utveckla nya förmågor.
Snabbfakta
| Säkerhetskretsens storlek | Mindre än 2% av modellens funktioner |
|---|---|
| Metodens namn | Circuit-Anchored Evolution (CAE) |
| Publiceringsdatum | 10 augusti 2026 |
Varför spelar det roll?
När språkmodeller tränas genom själv-evolution finns en risk att optimeringen enbart prioriterar förmåga och att säkerhetsfunktioner degraderas. Genom att hämta inspiration från biologisk evolution och så kallade utvecklingsbegränsningar visar forskningen hur kärnfunktioner kan förankras matematiskt. Detta gör det möjligt att kontinuerligt höja en modells kapacitet utan att avsiktligt eller oavsiktligt manipulera dess grundläggande säkerhetsstrukturer.
Vem påverkas?
Metoden berör AI-forskare och utvecklare som arbetar med självförbättrande språkmodeller och automatisk modelloptimering. Den är särskilt relevant för aktörer som utvecklar avancerade system där säkerhetsmekanismer behöver bibehållas automatiskt över tid.
Hur påverkas EU?
Metoden berör grundläggande säkerhetsmekanismer i stora språkmodeller och är direkt relevant för krav på riskhantering och AI-säkerhet enligt EU AI Act, även om forskningsartikeln i sig inte behandlar specifik EU-lagstiftning.
Vad mer bör du veta?
Metoden bygger på mekanistisk tolkningsbarhet för att isolera och skydda de specifika funktioner i modellens arkitektur som styr säkerhetsbeteenden. Forskarna drar en direkt parallell till utvecklingsbiologi, där bevarade genstrukturer tillåter organismers anpassning utan att de förlorar sina livsnödvändiga funktioner.
Snabba svar om den här nyheten
Vad har hänt?
När hände det?
Varför spelar det roll?
Hur kopplar metoden till biologisk evolution?
Länken öppnar i nytt fönster och leder till utgivarens egen sida.
Källan har spårats automatiskt från utgivaren via Aheadlines signalkedja.
AI-verktyg i artikeln
Ämnen
Få liknande nyheter direkt i mejlen
Läsarrummet
Skicka in en fråga eller ett tillägg. Redaktionen läser allt innan det publiceras och svarar när det är relevant. Ingen AI-fri text – bara människor.
Logga in för att skicka in en kommentar eller fråga.
Läs artikeln genom din roll
- Avgör om detta påverkar strategin på 6–12 månaders sikt eller är brus.
- Diskutera i ledningsgruppen: äger vi rätt fråga eller behöver ansvaret flyttas?
- Fråga: vilken risk tar vi genom att INTE agera på det här den här kvartalet?
Genererad vinkling — inte redaktionell analys av "Ny AI-metod låser säkerhetskretsar under självförbättrande e"