DeepSeek-V4-Flash når 12,5 tokens per sekund på RTX 3090 med DDR5
Nye prestandatester visar att den kvantiserade modellen DeepSeek-V4-Flash-0731 uppnår 12,5 tokens per sekund på ett Nvidia RTX 3090 kombinerat med 128 GB DDR5-ramminne.

Vad har hänt?
Användare i forumet r/LocalLLaMA har rapporterat prestandaresultat för en kvantiserad version av DeepSeek-V4-Flash-0731 (UD-IQ3_S). Modellen uppnår en genereringshastighet på 12,5 tokens per sekund på ett system utrustat med ett Nvidia RTX 3090-grafikkort och 128 GB DDR5-systemminne.
Snabbfakta
| Hastighet | 12,5 tokens/s |
|---|---|
| Grafikkort | Nvidia RTX 3090 |
| Systemminne | 128 GB DDR5 |
| Kvantisering | UD-IQ3_S |
Varför spelar det roll?
Resultaten visar hur avancerade kvantiseringsmetoder som Unsloth/GGUF (IQ3_S) gör det möjligt att köra extremt stora modeller på privat hårdvara. Det demonstrerar de faktiska prestandagränserna när man kombinerar GPU-VRAM med DDR5-RAM för lokala AI-körningar.
Vem påverkas?
Nyheten är relevant för utvecklare, AI-forskare och hobbyanvändare som kör stora språkmodeller lokalt på egen hårdvara. Den berör särskilt dem som optimerar prestanda på konsumentgrafikkort i kombination med stort systemminne.
Hur påverkas EU?
Modellen körs lokalt på användarens egen hårdvara och berörs därmed inte direkt av EU-restriktioner eller geoblockeringar. Användning av öppen källkod och lokala modeller ger europeiska användare full kontroll över sin egen data.
Vad mer bör du veta?
Tester visar att den kvantiserade versionen kräver betydande minnesresurser i form av 128 GB DDR5 RAM utöver grafikkortets VRAM. Kvantiseringstekniken IQ3_S gör det möjligt att komprimera stora modeller för att passa konsumenthårdvara, men hastigheten påverkas av flaskhalsar i systemminnets bandbredd.
Snabba svar om den här nyheten
Vad har hänt?
När hände det?
Varför spelar det roll?
Vilka berörs av detta?
Länken öppnar i nytt fönster och leder till utgivarens egen sida.
Källan har spårats automatiskt från utgivaren via Aheadlines signalkedja.
AI-verktyg i artikeln
Ämnen
Få liknande nyheter direkt i mejlen
Läsarrummet
Skicka in en fråga eller ett tillägg. Redaktionen läser allt innan det publiceras och svarar när det är relevant. Ingen AI-fri text – bara människor.
Logga in för att skicka in en kommentar eller fråga.
Läs artikeln genom din roll
- Avgör om detta påverkar strategin på 6–12 månaders sikt eller är brus.
- Diskutera i ledningsgruppen: äger vi rätt fråga eller behöver ansvaret flyttas?
- Fråga: vilken risk tar vi genom att INTE agera på det här den här kvartalet?
Genererad vinkling — inte redaktionell analys av "DeepSeek-V4-Flash når 12,5 tokens per sekund på RTX 3090 med"