ZAYA1-8B: Ny MoE-modell tränad för resonemang med 700M aktiva parametrar
Zyphra har introducerat ZAYA1-8B, en Mixture-of-Experts (MoE) modell med 700 miljoner aktiva och 8 miljarder totala parametrar, optimerad för resonemangsuppgifter.

Vad har hänt?
ZAYA1-8B är en ny MoE-modell från Zyphra, baserad på deras MoE++-arkitektur. Modellen har 700 miljoner aktiva parametrar och totalt 8 miljarder parametrar. Utvecklingen av ZAYA1-8B, från företräningen till den övervakade finjusteringen (SFT), genomfördes helt på en AMD-plattform för beräkning, nätverk och mjukvara. Modellen uppvisar stark prestanda på matematik- och kodningsbenchmarks.
Snabbfakta
| Modellnamn | ZAYA1-8B |
|---|---|
| Arkitektur | Mixture-of-Experts (MoE) på MoE++ |
| Aktiva parametrar | 700 miljoner |
| Totala parametrar | 8 miljarder |
| Träningsplattform | Full-stack AMD |
| Fokusområden | Resonemang, matematik, kodning |
”We present ZAYA1-8B, a reasoning-focused mixture-of-experts (MoE) model with 700M active and 8B total parameters, built on Zyphra's MoE++ architecture.”
”With under 1B active parameters, ZAYA1-8B matches or exceeds DeepSeek-R1-0528 on several challenging mathematics and coding benchmarks, and remains competitive with substantially larger open-weight reasoning models.”
”ZAYA1-8B was trained from scratch for reasoning, with reasoning data included from pretraining onward using an answer-preserving trimming scheme.”
Varför spelar det roll?
Utvecklingen av ZAYA1-8B signalerar en trend mot mer specialiserade och effektiva språkmodeller. Genom att fokusera på resonemang från träningsstarten, inklusive en unik metod för att bevara svar under datatrimning och en fyrstegs RL-kaskad, strävar Zyphra efter att skapa kapabla modeller med färre aktiva parametrar. Detta kan potentiellt sänka beräkningskostnaderna och öka tillgängligheten för avancerade AI-modeller för specifika uppgifter.
Vem påverkas?
Utvecklare och forskare inom AI, särskilt de som arbetar med små och medelstora språkmodeller (SLMs) eller fokusområden som matematik och programmering, påverkas av denna lansering. Företag som söker kostnadseffektiva lösningar för komplexa resonemangsuppgifter kan dra nytta av modeller som ZAYA1-8B. Modellen riktar sig primärt till de som gynnas av hög prestanda med relativt lågt resurskrav.
Vad mer bör du veta?
Träningen av ZAYA1-8B inkluderade en fyrstegs förstärkningsinlärningskaskad (RL cascade) med steg som fokuserade på matematik- och pusseluppgifter, ett 400-uppgifts RLVE-Gym-curriculum, samt matematisk och kodmässig RL i syntetiska kodmiljöer.
Snabba svar om den här nyheten
Vad har hänt?
När hände det?
Varför spelar det roll?
Vilka områden har modellen specialiserats inom?
Länken öppnar i nytt fönster och leder till utgivarens egen sida.
Källan har spårats automatiskt från utgivaren via Aheadlines signalkedja.
AI-verktyg i artikeln
Ämnen
Få liknande nyheter direkt i mejlen
Läsarrummet
Skicka in en fråga eller ett tillägg. Redaktionen läser allt innan det publiceras och svarar när det är relevant. Ingen AI-fri text – bara människor.
Logga in för att skicka in en kommentar eller fråga.
Läs artikeln genom din roll
- Avgör om detta påverkar strategin på 6–12 månaders sikt eller är brus.
- Diskutera i ledningsgruppen: äger vi rätt fråga eller behöver ansvaret flyttas?
- Fråga: vilken risk tar vi genom att INTE agera på det här den här kvartalet?
Genererad vinkling — inte redaktionell analys av "ZAYA1-8B: Ny MoE-modell tränad för resonemang med 700M aktiv"