+86-571-85858685

Hvilken slags chip har ChatGPT brug for?

Feb 16, 2023

For nylig er ChatGPT blevet det nye hot spot for kunstig intelligens, hvor Microsoft og Google i Silicon Valley investerer kraftigt i sådan teknologi (Microsoft har en ejerandel på 10 milliarder dollars i OpenAI, virksomheden bag ChatGPT, og Google har for nylig udgivet sin egen BARD-model). mens internetteknologivirksomheder i Kina, repræsenteret ved Baidu og andre, også har indikeret, at de udvikler sådan teknologi og vil gå live i den nærmeste fremtid. I Kina har Baidu og andre internetteknologivirksomheder også indikeret, at de udvikler sådanne teknologier og vil gå live i den nærmeste fremtid.

De generative modeller repræsenteret af ChatGPT har et fællestræk, det vil sige, at de bruger massive data til fortræning og er ofte parret med en mere kraftfuld sprogmodel. Sprogmodellens hovedfunktion er at lære af det massive eksisterende korpus, og efter indlæring kan den forstå brugerens sproglige instruktioner, eller ydermere generere relevant tekstoutput efter brugerens instruktioner.

Generative modeller kan bredt klassificeres i to kategorier, den ene er sprogbaserede generative modeller og den anden er billedbaserede generative modeller. De sprogbaserede generative modeller er repræsenteret af ChatGPT, hvis sprogmodel ikke kun kan lære at forstå betydningen af ​​brugerkommandoer (f.eks. "skriv et digt, i stil med Li Bai"), men også generere relevant tekst baseret på bruger kommandoer efter træning med massive data (i ovenstående eksempel, at skrive et digt i stil med Li Bai). digt). Det betyder, at ChatGPT skal have en stor sprogmodel (LLM), der forstår brugerens sprog og kan producere et sprog af høj kvalitet - for eksempel skal modellen forstå, hvordan man genererer digte, hvordan man genererer digte i stil med Li Bai , og så videre. Det betyder også, at store sprogmodeller i sprogbaseret generativ AI kræver et meget stort antal parametre for at kunne udføre denne form for kompleks læring og huske så meget information. ChatGPT har for eksempel 175 milliarder parametre (700 GB lagerplads, hvis der bruges standard flydende decimaltal), hvilket viser hvor "stor" dens sprogmodel er.

En anden klasse af generative modeller er billedgenereringsmodellen repræsenteret af Diffusion, typisk Dalle fra OpenAI, ImaGen fra Google og i øjeblikket den mest populære Stable Diffusion fra Runway AI. Disse billedlignende generationsmodeller bruger også en sprogmodel til at forstå brugerens sproglige kommandoer og genererer derefter billeder af høj kvalitet baseret på disse kommandoer. I modsætning til sprogbaserede generative modeller, bruger den sprogmodel, der anvendes her, hovedsageligt sprog til at forstå brugerinput uden at generere sprogoutput, så antallet af parametre kan være ret lille (i størrelsesordenen nogle få hundrede millioner), mens antallet af parametre vedr. billedbaserede diffusionsmodeller er relativt små, i størrelsesordenen et par milliarder samlet, men den beregningsmæssige indsats er ikke lille, fordi opløsningen af ​​de genererede billeder eller videoer kan være meget høj.

Generative modeller kan producere output af hidtil uset høj kvalitet gennem massiv datatræning, og der er allerede en række klare applikationsmarkeder, herunder søgning, dialogbots, billedgenerering og redigering osv. Der forventes flere applikationer i fremtiden, hvilket også stiller krav til relaterede chips.

Behovet for chips til generering af klassemodeller

Som tidligere nævnt repræsenterer ChatGPT en generativ model, der skal lære af store mængder træningsdata for at opnå generativt output af høj kvalitet. For at understøtte effektiv træning og inferens har generative modeller deres egne krav til relaterede chips.

Den første er behovet for distribueret beregning; antallet af parametre for sproggenerative modeller som ChatGPT er i hundredvis af milliarder, og det er næsten umuligt at bruge single-computer træning og inferens, men der skal bruges en masse distribueret beregning. I distribueret databehandling har datasammenkoblingsbåndbredden mellem maskiner og computerchippen til sådan distribueret databehandling (såsom RDMA) stor efterspørgsel, fordi flaskehalsen i opgaven ofte ikke er i databehandling, men i datasammenkoblingen ovenfor, især i denne form for distribueret databehandling i stor skala er chippen til effektiv understøttelse af distribueret databehandling blevet mere kritisk.

Dernæst er hukommelseskapaciteten og båndbredden. Selvom distribueret træning og inferens er uundgåelig for sprogbaserede generative modeller, vil den lokale hukommelse og båndbredden for hver chip i høj grad bestemme udførelseseffektiviteten af ​​en enkelt chip (fordi hver chips hukommelse er brugt til dets grænser). For billedbaserede generative modeller er det muligt at placere modellerne (omkring 20 GB) alle i chippens hukommelse, men i takt med at billedbaserede generative modeller udvikler sig yderligere i fremtiden, er det sandsynligt, at dets hukommelseskrav også vil stige yderligere . Fra dette perspektiv vil hukommelsesteknologi med ultrahøj båndbredde repræsenteret af HBM blive det uundgåelige valg for relaterede acceleratorchips, mens de generative klassemodeller også vil accelerere HBM-hukommelsen for yderligere at øge kapaciteten og båndbredden. Ud over HBM vil nye lagringsteknologier såsom CXL kombineret med softwareoptimeringer også have potentialet til at øge kapaciteten og ydeevnen af ​​lokal lagring i sådanne applikationer og anslås at få mere industriel adoption fra fremkomsten af ​​den generative klassemodel.

Endelig, beregning, både sprogbaserede og billedbaserede generative klassemodeller har en stor beregningsmæssig efterspørgsel, og billedbaserede generative modeller kan have en meget højere efterspørgsel efter aritmetisk kraft, da de genererer højere og højere opløsninger og bevæger sig mod videoapplikationer - nuværende almindelige billedgenerative modeller har en beregningsvolumen på omkring 20 TFlops, og hvad angår høj opløsning og billeder, er 100-1000 TFLOPS af aritmetisk efterspørgsel sandsynligvis normen.

For at opsummere, mener vi, at kravene til generative modeller for chips inkluderer distribueret databehandling, lagring og beregning, som kan siges at involvere alle aspekter af chipdesign, og endnu vigtigere, hvordan man kombinerer alle disse krav sammen på en rimelig måde at sikre, at et enkelt aspekt ikke bliver en flaskehals, hvilket også bliver et chipdesignsystemteknisk problem.

GPU og den nye AI-chip, hvem har en bedre chance

Generative modeller har en ny efterspørgsel efter chips. Hvem har en bedre chance for at fange denne nye efterspørgsel og marked for GPU'er (repræsenteret af Nvidia og AMD) og nye AI-chips (repræsenteret af Habana, GraphCore)?

For det første, set fra sprogbaserede generative modellers perspektiv, er GPU-leverandører, der i øjeblikket har et komplet layout i denne form for økologi, mere fordelagtige på grund af det enorme antal deltagere og behovet for god distribueret computerstøtte. Dette er et systemteknisk problem, der kræver en komplet software- og hardwareløsning, og i den forbindelse har Nvidia kombineret sine GPU'er for at lancere Triton-løsningen, som understøtter distribueret træning og distribueret inferens, hvilket gør det muligt at opdele en model i flere dele og bearbejde. på forskellige GPU'er, hvilket løser problemet med for mange parametre, der ikke kan rummes af hovedhukommelsen i en GPU. Dette løser problemet med for mange parametre til én GPU's hovedhukommelse. Uanset om du bruger Triton direkte eller laver videreudvikling på basis af Triton i fremtiden, er det mere bekvemt at have en komplet økologisk GPU. Fra et beregningsmæssigt synspunkt, da hovedberegningen af ​​den sprogbaserede generationsmodel er matrixberegning, som er styrken ved GPU'en, har den nye AI-chip ikke en åbenlys fordel i forhold til GPU'en fra dette synspunkt.

Fra et synspunkt af billedbaserede generationsmodeller er antallet af parametre for sådanne modeller også stort, men en til to størrelsesordener mindre end de sprogbaserede generationsmodeller, ud over dens beregning vil stadig blive brugt i en stor antal foldningsberegninger, så slutningsapplikationer, hvis du kan lave en meget god optimering, kan AI-chips have nogle muligheder. Her inkluderer optimeringen en stor mængde on-chip-lagring for at rumme parametre og mellemliggende beregningsresultater, for foldning og effektiv understøttelse af matrixoperationer.

Generelt er den nuværende generation af AI-chips designet til at målrette mod mindre modeller (antal parametre på milliardniveau, beregning på 1TOPS-niveau), mens efterspørgslen efter generative modeller stadig er relativt større end det oprindelige designmål. GPU'er er designet til at være mere fleksible på bekostning af effektivitet, mens AI-chips er designet til at gøre det modsatte og forfølge effektiviteten af ​​målapplikationen. Derfor tror vi, at GPU'er stadig vil dominere en sådan generativ modelacceleration i det næste år eller to, men efterhånden som generative modeldesigns bliver mere stabile, og AI-chipdesigns har tid til at indhente generative modeliterationer, har AI-chips mulighed for at overgå GPU'er i det generative modelrum ud fra et effektivitetsperspektiv.

ND2N9T12-full-automatic5

Send forespørgsel