Teknologi

OpenAI erklærer AGI oppnådd. Benchmark viser scoren 37 poeng lavere

Adrian Kessler

Jensen Huangs innlegg på X var på én setning og en gratulasjon: «From ChatGPT to o1 to Astra in 4 years, AGI has arrived. Congratulations @OpenAI team.» Han sendte det 6. september. Tre dager tidligere hadde Greg Brockman, OpenAIs president, brukt nesten identisk formulering overfor pressen: «Welcome to the AGI era.» Uttalelsene kom tett på hverandre, fra to menn med komplementære interesser, og ble i stor grad mottatt som en bekreftelse.

Referanseindeksen som lå til grunn for påstanden var ARC-AGI-3. OpenAI sa at Astra, deres nye frontlinjemodell lansert under betegnelsen GPT-6, oppnådde 99,9 % på ARC-AGI-3 og 98 % på FrontierMath Tier 4. Skårer på dette nivået, under standardforhold, ville representere et reelt sprang – en modell som ikke bare presterer godt, men befinner seg i et territorium som tidligere referanseindekser behandlet som ambisiøst. Organisasjonen som utviklet ARC-AGI-3 publiserte en skår fra sin standard evalueringsplattform: 62,7 %.

Trettisju prosentpoeng skiller disse to tallene. Begge stammer fra reelle evalueringer. OpenAIs interne plattform og referanseplattformen til benchmark-skaperne er ikke samme protokoll, og den samme modellen gir ulike skårer under hver. Det ARC-AGI-3-organisasjonen bruker som sin referansebetingelse – den den anser som gyldig for å sammenligne modeller på tvers av feltet – ga 62,7 %. OpenAIs interne oppsett ga 99,9 %. Forskjellen mellom disse tallene er forskjellen mellom et sterkt benchmark-resultat og en erklæring om ankomst.

Brikkesalget bak AGI-gratulasjonen

Astra ble trent på NVIDIA-brikker. Huang selger NVIDIA-brikker. Når en administrerende direktør offentlig gratulerer en kunde med å ha passert en historisk terskel – en terskel som gjør maskinvaren som ble brukt til å bygge produktet til den definerende infrastrukturen for det som kommer – er kunngjøringen, strukturelt sett, en kommersiell påstand. Ikke en konspirasjon. En strukturell realitet: interessekonflikten var synlig, innrammingen handlet om ankomst snarere enn ytelse, og det meste av dekningen tok imot begge deler uten kommentar.

Brikkemarkedet for AI-infrastruktur drives av narrativ. Hvis Astra er AGI, blir det som trente Astra maskinvaren i den post-AGI-verdenen – og selskapene som kjøper brikker for neste treningsrunde, vil kjøpe mot den referanseindeksen. Huangs gratulasjoner var, i den spesifikke forstand, også en produktuttalelse. Uttalelsen var avhengig av et tall som benchmark-organisasjonen selv målte annerledes.

Hva uavhengig verifisering viser – og hva den ikke viser

Per publiseringstidspunkt finnes ikke Astra i Artificial Analysis Intelligence Index eller i Arena.ais rangeringer – de to mest overvåkede uavhengige evalueringssystemene for frontlinjemodeller. Uavhengig verifisering for større frontlinjelanseringer kommer vanligvis innen dager. Fraværet her er ikke bevis på dårlig ytelse. Det betyr at den eksterne valideringen som normalt ville følge en påstand av denne størrelsen, ennå ikke har materialisert seg.

De 62,7 % fra benchmark-skaperne er ikke en tilbakevisning. En skår på det nivået på ARC-AGI-3 – en test designet for å motstå optimaliseringstriksene som blåste opp tidligere referanseindekser – er virkelig sterk. Forgjengerne til ARC-AGI-3 var mettede: modeller absorberte treningsdata som lignet testspørsmålene og presset tallene opp uten å bli bedre på ny resonnering. ARC-AGI-3 endret spørsmålsdesignet for å kreve abstraksjon fremfor mønsterhenting. Sekstito komma syv prosent på den testen, under referanseplattformen, er langt over alt som eksisterte for to år siden.

Forskerne som reiste innvendinger, var presise på dette. Modellens evne var ikke deres mål. Hoppet fra ytelse til erklæring var det. «Skårer godt på disse referanseindeksene» og «AGI har ankommet» krever et steg imellom: en stabil, omforent definisjon av AGI som ankomst kan måles mot. Ingen slik definisjon eksisterer på tvers av feltet. OpenAI har en intern definisjon. Etter OpenAIs egen definisjon kan Astra kvalifisere. Men et selskap som måler produktet sitt mot en definisjon det selv har skrevet, er en annen type resultat enn ett målt mot en ekstern standard.

Setningen som ikke kom med en definisjon

Huangs innlegg hadde ingen forbehold. «AGI har ankommet» er en erklæring – ikke «etter noen mål» eller «under visse definisjoner», men en ren ankomst. Fireårsprogresjonen han nevnte – ChatGPT, o1, Astra – er reell som en bane av evne. Hver modell i sekvensen utvidet det som var mulig. Å ramme inn sekvensen som en reise med et endepunkt, og kunngjøre endepunktet, gjør en annen påstand: den sier at ankomst kan skilles fra reisen, at det er en linje snarere enn en helning, og at Astra krysset den.

Referansetallene bak den påstanden var 62,7 %. Folket som bygde testen, publiserte det. Spørsmålet det reiser – om AGI-erklæringen er en måling eller et markedsgrep – var der 6. september. Dekningen svarte stort sett på det uten å spørre.

Tagger: , , , , ,

Diskusjon

Det er 0 kommentarer.