Der größte Chip der Welt

Aug 23, 2021

Eine Nachricht hinterlassen

Im Wettlauf um die Beschleunigung der künstlichen Intelligenz verfolgt das Silicon Valley-Unternehmen Cerebras eine ungewöhnliche Strategie: Go big.


Während ein typischer Computerchip die Größe eines Fingernagels hat, ist Cerebras' Chip hat die Größe eines Esstellers.


Deep Learning, eine KI-Technologie, die Sprachassistenten, selbstfahrende Autos und Go-Champions antreibt, basiert auf einem komplexen"neuralen Netzwerk" Software in Schichten angeordnet. Deep-Learning-Systeme können auf einem einzigen Computer ausgeführt werden, aber die größten Systeme sind auf Tausende von verbundenen Computern verteilt, manchmal in großen Rechenzentren, wie sie von Google betrieben werden. In einem großen Cluster gleiten bis zu 48 Pizzakarton-große Server in ein-Mann-hohen Racks; Die Regale sind in Reihen aufgereiht und füllen ein Gebäude von der Größe einer Lagerhalle. Die neuronalen Netze in diesen Systemen können gewaltige Probleme lösen, stehen aber auch vor offensichtlichen Herausforderungen. Ein Netzwerk, das sich in einem Cluster vermehrt, ist wie ein Gehirn, das über einen Raum verstreut und miteinander verbunden ist. Elektronen bewegen sich schnell, aber trotzdem ist die Kommunikation zwischen den Chips langsam und verbraucht viel Energie.


Eric Vishria, General Partner der Risikokapitalgesellschaft Benchmark in San Francisco, erkannte das Problem zum ersten Mal, als er im Frühjahr 2016 Cerebras Systems, ein neues Computerchip-Unternehmen, sprechen hörte. Benchmark ist bekannt dafür, ein früher Investor in Unternehmen wie Twitter, Uber und ebay – also in Software, nicht in Hardware. Das Unternehmen schaut sich jährlich rund 200 Start-ups an und investiert in eines."Wir spielten dieses Spiel, tausend Frösche zu küssen," Vishria hat es mir erzählt. Zu Beginn seiner Rede beschloss er, den Frosch zurückzuwerfen."Ich dachte, warum habe ich dem zugestimmt?&Zitat; Wir'werden nicht in Hardware investieren,&“, erinnerte er sich."Es'ist dumm.&Zitat;


Cerebras-Mitbegründer Andrew Feldman begann mit der Folienabdeckung seiner Teamrutsche und erregte die Aufmerksamkeit von Vishria &: Sein Talent war beeindruckend. Feldman verglich dann die beiden Arten von Computerchips. Zuerst betrachtete er Grafikprozessoren oder Gpus – Chips, die speziell für die Erstellung von 3D-Bildern entwickelt wurden. Die heutigen maschinellen Lernsysteme&verlassen sich aus verschiedenen Gründen auf diese Grafikchips. Als nächstes betrachtete er die Zentraleinheiten oder CPUs, die Allzweckchips, die die meiste Arbeit in einem typischen Computer erledigen."Die dritte Folie handelte von'Gpus,' die eigentlich schlecht für Deep Learning sind - sie sind einfach hundertmal besser als CPU.&Zitat; Cerebras hat einen neuen Chiptyp entwickelt, der nicht für Grafiken, sondern speziell für künstliche Intelligenz entwickelt wurde.


Vishria ist es gewohnt, Pitches von Unternehmen zu hören, die Deep Learning in den Bereichen Cybersicherheit, medizinische Bildgebung, Chatbots und andere Anwendungen einsetzen möchten. Nach dem Vortrag von Cerebras&sprach er mit Ingenieuren von Unternehmen, die von Benchmark finanziert wurden, darunter Zillow, Uber und Stitch Fix; Sie sagten ihm, dass sie Probleme mit der KI hätten, weil es zu lange gedauert habe,"& quot zu trainieren; das neuronale Netz. Google hat begonnen, superschnelle"Tensor Processing Units," oder Tpus, spezielle Chips für KÜNSTLICHE Intelligenz. Vishria wusste, dass ein Goldrausch im Gange war und jemand die Hacken und Schaufeln machen musste.


In diesem Jahr führten Benchmark und Foundation Capital, eine weitere Risikokapitalgesellschaft, eine Finanzierungsrunde in Höhe von 27 Millionen US-Dollar für Cerebras an, die fast 500 Millionen US-Dollar aufgebracht hat. Auch andere Unternehmen stellen sogenannte Beschleuniger für künstliche Intelligenz her; Großhirn' die Konkurrenten groq, Graphcore und Sambanova haben zusammen mehr als 2 Milliarden US-Dollar an Kapital aufgebracht. Aber Großhirn' Ansatz ist einzigartig. Anstatt Dutzende von Wafern auf ein großes Stück Silizium zu drucken, sie abzuschneiden und miteinander zu verbinden, hat das Unternehmen ein riesiges"Wafer Level" Chip. Während ein typischer Computerchip die Größe eines Fingernagels hat, hat Cerebras etwa die Größe eines Tellers und ist der größte Computerchip der Welt.


Sogar Konkurrenten fanden die Leistung beeindruckend."Das ist neue Wissenschaft," Nigel Toon, CEO und Mitbegründer von Graphcore &, sagte mir."Es'ist ein unglaubliches Stück Technik. Es'ein Meisterwerk.&Zitat; In der Zwischenzeit beschrieb ein anderer Ingenieur, mit dem ich gesprochen habe, es als ein wissenschaftliches Projekt – groß um der großen Sache willen. In der Vergangenheit hat das Unternehmen versucht, riesige Chips herzustellen, und es ist ihnen gescheitert; Großhirn' Plan ist eine Wette, dass die Bewältigung der technischen Herausforderungen möglich ist und sich lohnt."Um ehrlich zu sein, für mich ist Unwissenheit ein Vorteil," Vishria sagte."Ich weiß'nicht, wenn ich wüsste, wie schwer es ist, das zu tun, was sie tun, hätte ich den Mut zu investieren.&Zitat;


Es ist leicht anzunehmen, dass Computer immer schneller werden. Dies wird oft mit Moores Gesetz erklärt: dem 1965 vom Halbleiterpionier Gordon Moore aufgestellten Muster, nach dem sich die Anzahl der Transistoren auf einem Chip jedes Jahr oder alle zwei Jahre verdoppelt. Natürlich ist Moores Gesetz'nicht wirklich ein Gesetz, und Ingenieure arbeiten unermüdlich daran, Transistoren zu verkleinern und gleichzeitig die"Architektur" jedes Chips, um effizientere und leistungsfähigere Designs zu erstellen.


Chip-Architekten haben sich lange gefragt, ob ein einzelner, großer Computerchip effizienter sein könnte als ein Haufen kleinerer Chips, genauso wie eine Stadt mit konzentrierten Ressourcen und dichten Blöcken effizienter ist als ein Vorort. Die Idee wurde erstmals in den 1960er Jahren ausprobiert, als Texas Instruments die Produktion von Chips mit einer Breite von wenigen Zentimetern einschränkte. Aber die Ingenieure des Unternehmens&gerieten in Ertragsprobleme. Auf einem Siliziumwafer gefährden Herstellungsfehler zwangsläufig eine bestimmte Anzahl von Schaltkreisen. Enthält ein Wafer 50 Chips, kann das Unternehmen die schlechten wegwerfen und die guten verkaufen. Aber wenn jeder erfolgreiche Chip von der funktionierenden Schaltung eines einzelnen Wafers abhängen würde, würden viele teure Wafer weggeworfen. Texas Instruments fand eine Lösung, aber die Technologie und der Bedarf waren noch nicht da.


In den 1980er Jahren versuchte ein Ingenieur namens Gene Amdahl erneut, das Problem mit einer von ihm gegründeten Firma namens Trilogy Systems zu lösen. Es wurde das größte Startup in der Geschichte des Silicon Valley&mit einer Finanzierung von etwa 250 Millionen US-Dollar. Um das Ertragsproblem anzugehen, druckte Trilogy redundante Komponenten auf den Chip. Dieses Verfahren erhöht die Produktion, verringert jedoch die Geschwindigkeit des Chips. Unterdessen kämpft Trilogy auf andere Weise. Amdahl überfuhr mit seinem Rolls Royce einen Motorradfahrer und verursachte rechtliche Schwierigkeiten; Sein Präsident starb an einem Gehirntumor; Starke Regenfälle haben den Bau von Fabriken verzögert, Klimaanlagen rosten lassen und Späne verstauben. 1984 gab Trilogy auf."Ich habe'nicht realisiert, wie schwer es sein würde," Amdahl's Sohn sagte der Times.


Wenn die Technologie von Trilogy&erfolgreich ist, könnte sie jetzt für Deep Learning verwendet werden. Stattdessen lösen GPUs (Chips, die in Videospielen verwendet werden) wissenschaftliche Probleme in nationalen Labors. Die Wiederverwendung von GPU für KI hängt von der Tatsache ab, dass neuronale Netze zwar sehr komplex sind, aber auf viel Multiplikation und Addition angewiesen sind. Wenn die"Neuronen" im Netzwerk feuern sie sich gegenseitig ab, sie verstärken oder reduzieren die Signale des anderen's und multiplizieren sie mit Koeffizienten, die als Verbindungsgewichte bezeichnet werden. Ein effizienter KI-Prozessor berechnet viele Aktivierungen parallel; Es kombiniert sie zu einer Reihe von Zahlen, die als Vektoren bezeichnet werden, oder zu Zahlengittern, die als Matrizen bezeichnet werden, oder zu höherdimensionalen Blöcken, die als Tensoren bezeichnet werden. Idealerweise möchten Sie eine Matrix oder einen Tensor gleichzeitig mit einem anderen multiplizieren. GPUs wurden entwickelt, um etwas Ähnliches zu tun:


& quot;Der Schatten der Trilogie ist so groß," Feldman sagte mir kürzlich,"dass die Leute aufhören zu denken und anfangen zu sagen:'Es'ist unmöglich.'&Zitat; GPU-Unternehmen, darunter Nvidia, nutzten die Gelegenheit, ihre Chips für Deep Learning anzupassen. Im Jahr 2015 begannen Feldman und eine Gruppe von Computerarchitekten, die Idee größerer Chips zu diskutieren, nachdem sie den Computerserverhersteller Seamicro mitbegründet hatten, den sie für 334 Millionen US-Dollar an den Chiphersteller AMD verkauften. Vier Monate lang arbeiteten sie in einem von einer Risikokapitalgesellschaft geliehenen Büro an dem Thema. Als sie einen Entwurf einer praktikablen Lösung hatten, sprachen sie mit acht Unternehmen; Erhielt Finanzierung von Benchmark, Foundation Capital und Eclipse und begann mit der Einstellung.


Großhirn' Die erste Aufgabe besteht darin, die Herstellungsprobleme zu lösen, die große Chips plagen. Der Chip war ursprünglich ein zylindrischer Barren aus kristallinem Silizium mit einem Durchmesser von etwa einem Fuß, und der Stahlbarren wurde in Wafer mit einer Dicke von weniger als einem Millimeter geschnitten. Die Schaltung wird dann"gedruckt" auf den Wafer durch einen Prozess namens Lithographie. UV-empfindliche Chemikalien werden sorgfältig auf der Oberfläche abgeschieden, und dann wird ein UV-Lichtstrahl durch eine detaillierte Schablone, die als Maske bezeichnet wird, projiziert. Diese Chemikalien reagieren, um Schaltkreise zu bilden.


Normalerweise wird der Bereich, der von durch die Maske projiziertem Licht abgedeckt wird, zu einem Chip. Dann bewegt sich der Chip und das Licht wird erneut projiziert. Nachdem Dutzende oder Hunderte von Chips gedruckt wurden, werden sie aus dem Wafer lasergeschnitten."Am einfachsten geht das, wenn deine Mutter einen runden Keksteig herausnimmt," sagte Feldmann."Sie hat eine Keksform und schneidet die Kekse sorgfältig.&Zitat; Die Gesetze der Physik und Optik machen es unmöglich, einen größeren Ausstecher herzustellen. Als Ergebnis"entwickelten wir eine Technologie, mit der Sie durch ein wenig Teig zwischen zwei Keksen kommunizieren können.&Zitat;


Bei dem in Zusammenarbeit mit TSMC, dem Hersteller des Chips, entwickelten Drucksystem Cerebras überlappen sich die Ränder der Kekse, sodass ihre Drähte verbunden sind. Das Ergebnis ist eine einzelne"Wafergröße" Waffel, kupferfarbenes Quadrat und 21cm auf jeder Seite. (Die größten GPUs haben einen Durchmesser von etwas weniger als 3 cm.) Cerebras produzierte 2019 seinen ersten Chip, Wafer-Scale Engine 1. , oder"Kerne". (Top-Gpus haben nur ein paar tausend Kerne, während die meisten CPUs weniger als 10 haben.)


& quot;2,6 Billionen Transistoren sind erstaunlich," sagte Aart de Geus, Vorsitzender und Co-CEO von Synopsys. Synopsys bietet einige Software an, die Cerebras und andere Chiphersteller verwenden, um ihre Chipdesigns zu erstellen und zu validieren. De Geus sagt, dass Ingenieure beim Design von Chips zunächst zwei Kernfragen berücksichtigen müssen:"Woher kommen die Daten?&Zitat; Wo wird gehandhabt?&Zitat; Als Chips einfacher waren, konnten Designer diese Fragen mit einem Bleistift auf einem Zeichentisch beantworten; Wenn Sie mit den komplexeren Chips von heute arbeiten, geben Sie Code ein, der die Architektur beschreibt, die Sie erstellen möchten, und fahren Sie dann mit Visualisierungs- und Codierungstools fort."Denken Sie darüber nach, wie das Haus vom Dach aus aussieht," de Geus sagte."Ist die Garage in der Nähe der Küche? Oder ist es in der Nähe des Schlafzimmers? Du willst es in der Nähe der Küche – sonst musst du Lebensmittel durch jede Ecke des Hauses tragen.&Zitat; Nachdem er den Grundriss entworfen hatte, erklärte er:"Sie können Gleichungen verwenden, um zu beschreiben, was im Raum passiert.&Zitat;


Die Designkomplexität von Chips ist überwältigend."Hier gibt es viele Schichten," sagte de Geus, mit überkreuzten und übereinander geschichteten Strecken, wie eine große Autobahnüberführung. Für die Cerebras-Ingenieure, die im Maßstab eines Wafers arbeiten, wird die Komplexität erhöht. Inhaltsangabe' Software hilft in Form von künstlicher Intelligenz: Mustererkennungsalgorithmen identifizieren häufige Probleme und schlagen Lösungen vor; Das Optimierungsprogramm bewegt den Raum in eine schnellere und effizientere Anordnung. Wenn zu viele Fahrspuren versuchen, sich in ein Gebäude mit zwei Blöcken zu quetschen, ermöglicht die Software den Ingenieuren, Robert Moses zu spielen und den Block zu verschieben.


Letztendlich, sagt Feldman, haben übergroße Chip-Designs mehrere Vorteile. Wenn sich die Kerne auf demselben Chip befinden, kommunizieren sie schneller: Das Gehirn des Computers ist jetzt in einem einzigen Schädel konzentriert und nicht über einen Raum verstreut. Größere Chips handhaben auch den Speicher besser. Typischerweise muss ein kleiner Chip, der bereit ist, eine Datei zu verarbeiten, zuerst die Datei von einem gemeinsam genutzten Speicherchip erhalten, der sich an anderer Stelle auf der Leiterplatte befindet; Nur die am häufigsten verwendeten Daten werden näher am Wohnort zwischengespeichert. Bei der Beschreibung der Effizienz von Wafer-Level-Chips bot Feldman eine Analogie: Er bat mich, mir eine Gruppe von Mitbewohnern (Core) vorzustellen, die in einem Wohnheim (Chip) leben und sich ein Fußballspiel ansehen (Computerarbeit machen). Um das Spiel zu sehen, sagt Feldman, müssen Mitbewohner Bier im Kühlschrank aufbewahren (Daten werden im Speicher gespeichert); Cerebras hat einen Kühlschrank in jedem Zimmer, damit Mitbewohner nicht riskieren müssen, in die Gemeinschaftsküche oder den Safeway des Wohnheims zu gehen. Dies hat den zusätzlichen Vorteil, dass jeder Kern unterschiedliche Daten schneller verarbeiten kann."Damit ich Bud in meinem Schlafsaal haben kann," sagte Feldmann."In deinem Wohnheim kannst du Schlitz haben.&Zitat;


Schließlich müssen Cerebras Ertragsprobleme überwinden. Die Ingenieure des Unternehmens&verwenden den Trick von Trilogy &: Redundanz. Aber hier haben sie einen Vorteil gegenüber ihren Vorgängern. Trilogy versucht, generische Chips mit vielen verschiedenen Komponenten herzustellen, sodass die Verkabelung um eine einzelne ausgefallene Komponente möglicherweise den Anschluss an einen entfernten Ersatz erfordert. Auf Großhirn' Chip, alle Kerne sind identisch. Wenn ein Keks falsch ist, sind die anderen genauso gut.