Teknologi

OpenAIs Jalapeño-brikke kjorer inferens med 1,9 ganger hoyere effektivitet enn Nvidia Blackwell per watt

Adrian Kessler
Legg oss til på Google

OpenAI har bygget sin egen brikke. Selskapet presenterte Jalapeño på Hot Chips-konferansen 25. august, en silisiumdesign utviklet i samarbeid med Broadcom, som behandler inferensforespørsler med 85 448 tokens per sekund per kilowatt. Nvidias Blackwell-arkitektur, dagens markedsstandard, når 44 960 på samme måleenhet. Forholdet er 1,9 ganger.

Måleenheten er viktig fordi inferens er hvordan AI-systemer kjører i produksjon. Trening skjer én gang; inferens skjer hver gang noen sender en forespørsel til ChatGPT, bruker et API, eller interagerer med en applikasjon som kjører en språkmodell. Kostnaden for inferens i stor skala er den primære drivkraften bak AI-tjenesters økonomi. En brikke som omtrent halverer energiforbruket til inferens, endrer, hvis den tas i bruk i stor skala, kostnaden per forespørsel for å kjøre modeller.

På interaktive arbeidslaster, hvor responstid er den begrensende faktoren, er Jalapeños fordel enda større. SemiAnalysis-rapporten om Hot Chips-presentasjonen anslo intervallet til 2,1 til 4,1 ganger bedre enn Blackwell på disse benchmarkene. Spredningen gjenspeiler variasjon på tvers av spesifikke oppgavetyper; den nedre grensen er den mest konservative sammenligningen.

Brikken håndterer kun inferens. Den kjører ikke treningsarbeidslastene som produserte modellene Jalapeño er designet for å kjøre. De krever fortsatt Nvidia-maskinvare. Broadcom produserte brikken under en tilpasset designavtale med OpenAI, i stedet for å selge den som et kommersielt produkt. Ordningen gir OpenAI et skreddersydd inferenslag uten at selskapet må konkurrere i det kommersielle brikkemarkedet.

OpenAIs utrullingsplan er begrenset. Småskala utrulling er planlagt før utgangen av 2026; bredere utrulling er et mål for 2027. Brikken er fortsatt i den tekniske prøvefasen, noe som betyr at produksjonsversjonen ennå ikke er sendt ut i stor skala. Benchmarkene på Hot Chips representerer designmålet, ikke en verifisert produksjonsserie. Gapet mellom konferanseannonsering og operasjonell utrulling for tilpasset silisium måles typisk i år.

Kunngjøringen passer inn i en bredere trend blant store AI-selskaper mot tilpasset silisium. Google har drevet sine egne Tensor Processing Units i produksjon i et tiår. Amazon kjører Trainium og Inferentia i AWS. Meta opererer sine egne inferensbrikker internt. OpenAIs inntreden bekrefter at i skalaen av hundrevis av millioner aktive brukere, blir økonomien ved å stole utelukkende på eksterne GPU-leverandører vanskelig nok til å rettferdiggjøre kostnaden ved et tilpasset designprogram.

Tagger: , , , , ,

Legg oss til på Google

Diskusjon

Det er 0 kommentarer.