Teknologi

OpenAIs Jalapeño-brikke kjorer inferens med 1,9 ganger hoyere effektivitet enn Nvidia Blackwell per watt

Adrian Kessler

OpenAI har bygget sin egen brikke. Selskapet presenterte Jalapeño på Hot Chips-konferansen 25. august, en silisiumdesign utviklet i samarbeid med Broadcom, som behandler inferensforespørsler med 85 448 tokens per sekund per kilowatt. Nvidias Blackwell-arkitektur, dagens markedsstandard, når 44 960 på samme måleenhet. Forholdet er 1,9 ganger.

Måleenheten er viktig fordi inferens er hvordan AI-systemer kjører i produksjon. Trening skjer én gang; inferens skjer hver gang noen sender en forespørsel til ChatGPT, bruker et API, eller interagerer med en applikasjon som kjører en språkmodell. Kostnaden for inferens i stor skala er den primære drivkraften bak AI-tjenesters økonomi. En brikke som omtrent halverer energiforbruket til inferens, endrer, hvis den tas i bruk i stor skala, kostnaden per forespørsel for å kjøre modeller.

På interaktive arbeidslaster, hvor responstid er den begrensende faktoren, er Jalapeños fordel enda større. SemiAnalysis-rapporten om Hot Chips-presentasjonen anslo intervallet til 2,1 til 4,1 ganger bedre enn Blackwell på disse benchmarkene. Spredningen gjenspeiler variasjon på tvers av spesifikke oppgavetyper; den nedre grensen er den mest konservative sammenligningen.

Brikken håndterer kun inferens. Den kjører ikke treningsarbeidslastene som produserte modellene Jalapeño er designet for å kjøre. De krever fortsatt Nvidia-maskinvare. Broadcom produserte brikken under en tilpasset designavtale med OpenAI, i stedet for å selge den som et kommersielt produkt. Ordningen gir OpenAI et skreddersydd inferenslag uten at selskapet må konkurrere i det kommersielle brikkemarkedet.

OpenAIs utrullingsplan er begrenset. Småskala utrulling er planlagt før utgangen av 2026; bredere utrulling er et mål for 2027. Brikken er fortsatt i den tekniske prøvefasen, noe som betyr at produksjonsversjonen ennå ikke er sendt ut i stor skala. Benchmarkene på Hot Chips representerer designmålet, ikke en verifisert produksjonsserie. Gapet mellom konferanseannonsering og operasjonell utrulling for tilpasset silisium måles typisk i år.

Kunngjøringen passer inn i en bredere trend blant store AI-selskaper mot tilpasset silisium. Google har drevet sine egne Tensor Processing Units i produksjon i et tiår. Amazon kjører Trainium og Inferentia i AWS. Meta opererer sine egne inferensbrikker internt. OpenAIs inntreden bekrefter at i skalaen av hundrevis av millioner aktive brukere, blir økonomien ved å stole utelukkende på eksterne GPU-leverandører vanskelig nok til å rettferdiggjøre kostnaden ved et tilpasset designprogram.

Tagger: , , , , ,

Diskusjon

Det er 0 kommentarer.