Teknologi

DeepSeek V4.1 Flash: 552 mrd. parametere, 8 mrd. aktive, cache 60% billigere — og matcher Opus 5

Adrian Kessler

DeepSeek V4.1 Flash kjører på en ny arkitektur selskapet kaller Causal Encoder-Decoder. De 552 milliarder parameterne spenner over en 20-lags koder og 20-lags dekoder, men bare 8 milliarder aktiveres på input-tokens og 16 milliarder på output. Det gjør den strukturelt slankere enn modeller som aktiverer større parameterutvalg for hver operasjon – et designvalg som lønner seg direkte i inferenskostnad og minneeffektivitet.

Minnegevinstene er spesifikke. V4.1 Flashs KV-cache ligger på 890 byte per token, omtrent en fjerdedel av V4-Flash. FP4-caching og Compressed Sparse Attention 2 presser det vedvarende cache-fotavtrykket til en åttendedel av forrige generasjon. Cachet input koster nå $0,003 per million tokens i lavtrafikk – ned 60 % fra V4-Flash. Ucachet input falt 33 %, output 11 %.

På benchmarkene utviklere følger mest, holder modellen stand. DeepSWE v1.1 – den autonome programvareutviklingstesten – gir den 74,2, så vidt foran Anthropics Opus 5 på 74,0 og over GPT-5.6 Sol på 73,0. GPQA Diamond scorer 90,9. Gapet som skiller seg ut er Terminal-Bench 3.0: 30,0 mot Opus 5s 43,3 – en reell forskjell på oppgaver som krever utvidet interaktiv feilsøking.

Syn er innebygd fra før-trening. Tidligere delte V4 syn inn i en egen Vision-Exp-variant. V4.1 Flash erstatter begge med en enkelt modell bygget rundt DeepSeek-ViT, en formålstrent koder utviklet sammen med språkmodellen fra starten. Det multimodale nivået er borte – hvert kall får syn som standard.

Kontekstvinduet er 1 million tokens med output begrenset til 384 000, nok til langdokumentanalyse og utvidede agentiske arbeidsflyter uten oppdeling. Eksisterende API-brukere som bruker de gamle deepseek-v4-flash og deepseek-v4-flash-vision-exp-ID-ene, blir allerede rutet til V4.1 Flash. Den 14. september bytter også DeepSeek V4 Pro-trafikk over – til Flash-priser.

DeepSeek beskrev V4.1 Flash som «den minste modellen i vår nye arkitekturfamilie». En større V4.1 Pro på samme Causal Encoder-Decoder-design er antydet. Hvis den opprettholder effektivitetssporet til Flash, vil den utvide denne arkitekturens ytelse-per-dollar videre oppover benchmark-kurven – inn i territorium som i dag holdes av modeller som koster betydelig mer per million tokens.

Det arkitektoniske poenget betyr noe utover pristabellen. KV-cache-vekst er en primær begrensning for å kjøre store modeller med lang kontekst, og den skalerer med hvert token som behandles. V4.1 Flashs tilnærming – færre aktive parametre, komprimert cache – adresserer den begrensningen direkte. Det er en brukbar mal for langkontekst-distribusjoner, ikke en hjørnekasse-optimalisering.

Tagger: , , , , ,

Diskusjon

Det er 0 kommentarer.