Teknologi

AMD kjøper Taalas og satser på kisel-AI som slår Nvidia 48 ganger

Susan Hill

AMD kjøper Taalas, en oppstartsbedrift fra Toronto som bygger brikker der AI-modellens vekter er permanent etset inn i silisium, i stedet for å lastes inn fra minne under inferens. Selskapets HC1-brikke genererer 16 960 tokens per sekund på Metas Llama 3.1 8B – et tall AMD hevder er 48 ganger raskere enn Nvidias GPUer og 8,5 ganger raskere enn Cerebras, spesialisten på inferensbrikker.

Teknologien bak Taalas utnytter en strukturell ineffektivitet i dagens AI-inferens. Standard GPUer er fleksible: de kan kjøre hvilken som helst modell, bytte mellom oppgaver på forespørsel, og omprogrammeres når en modell oppdateres. Den fleksibiliteten er også flaskehalsen. Å laste inn milliarder av modellvekter fra høyhastighetsminne til regneenheter ved hver inferensforespørsel skaper latens som ikke kan elimineres ved å legge til flere GPUer.

Taalas setter disse vektene direkte inn i brikkens silisium under produksjonen. Modellen lever i maskinvaren, ikke i minne som hentes per forespørsel. Gjennomstrømningstallene AMD reklamerer med gjenspeiler det arkitektoniske valget – men til en pris selskapet ikke bagatelliserer: når en brikke først er produsert med en spesifikk modell innebygd, krever en oppdatering en ny silisium-tape-out. Taalas sier at bare to metallag må endres for en modelloppdatering, noe som forkorter syklusen, men disse brikkene kan ikke tilpasse seg en nyere modellversjon på sparket.

Under AMDs integreringsplan vil Taalas-brikker håndtere token-generering – den mest tidkrevende fasen av inferens – mens AMDs Instinct GPUer håndterer prefill og attention-beregning i starten av hver forespørsel. Det kombinerte systemet kjører på AMDs Helios rack-skala-plattform. For skyleverandører som kjører faste modellarbeidsbelastninger – kundeserviceboter, dokumentbehandlingspipelines, sanntidsoversettelse – er løftet gjennomstrømning per rack-watt som fleksible GPU-klynger ikke kan matche til tilsvarende kostnad.

Om den kalkylen overlever bransjens tempo for modelloppdateringer er det sentrale spørsmålet. Store laboratorier oppdaterer nå produksjonsmodellene sine omtrent hvert halvår. En brikke låst til Llama 3.1 8B i dag må kanskje pensjoneres når en etterfølger blir standard distribusjonsmål. Taalas’ påstand om to-metallagsoppdatering hjelper, men en silisium-tape-out tar fortsatt måneder å fullføre – en betydelig etterslep når modeller skiftes ut raskere enn maskinvaresykluser.

Oppkjøpet kommer sju måneder etter at Nvidia kjøpte Groq – en annen tilnærming til samme inferenshastighetsproblem – for angivelig 20 milliarder dollar. Groqs tensor-strømningsprosessorer optimaliserer også for gjennomstrømning, men beholder muligheten til å laste inn ulike modeller. AMD betaler et ikke offentliggjort, men antagelig mindre beløp for en oppstartsbedrift som satset motsatt.

For kjøpere hører Taalas-oppkjøpet til veikartet snarere enn katalogen. HC2-brikken, som er rettet mot modeller med opptil 20 milliarder parametere, er fortsatt under utvikling. 48x-referansen gjelder HC1 under spesifikke forhold – virkelige distribusjoner med blandet trafikk og varierende batchstørrelser vil gi andre resultater. Avtalen forventes sluttført i fjerde kvartal 2026, avhengig av regulatorisk godkjenning. HC1 ble sendt i februar på 6nm; HC2s leveringsdato og målprosessnode er fortsatt ubekreftet.

Tagger: , , , ,

Diskusjon

Det er 0 kommentarer.